21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

הרמֶס דסקטופ מקבל התקנה בלחיצה אחת למודלים מקומיים

הרמֶס דסקטופ מקבל התקנה בלחיצה אחת למודלים מקומיים

הבעיה בהרצת מודל במשקלים פתוחים מקומית אף פעם לא הייתה המודל עצמו, היא הייתה כל מה שקדם לו: לקרוא מפרטי VRAM, לנחש איזה קוונטיזציה (quantization) מתאימה, לקבוע אורך קונטקסט (context window) ומספר שכבות GPU, ואז לגלות בזמן טעינה שהקובץ גדול בשלושה ג׳יגה מהזיכרון הזמין. נואה ריסרץ׳ (Nous Research) דחסה את הרצף הזה לקליק בודד בתוך הרמֶס דסקטופ (Hermes Desktop): הזרימה החדשה קוראת את החומרה, בוחרת מודל שמתאים לה, מורידה את המשקולות ומגדירה את סביבת ההרצה (inference runtime) אוטומטית.

מה בדיוק נשלח

ההכרזה צרה וקונקרטית: הרמֶס דסקטופ, בנייה חופשית ברישיון MIT של הסוכן הפתוח הרמֶס, שרצה על macOS 12 ומעלה, חלונות 10/11 וכל הפצת לינוקס, בלי צורך בחשבון, מציגה כעת זרימת התקנה אוטומטית בעלייה ראשונה ובהמשך תחת Settings Providers Local Models. מתחת למכסה המנוע, הרמֶס מנהל את מנוע ההרצה בעצמו: הוא מוריד בנייה רשמית של llama.cpp שמותאמת לחומרה (כמה מאות מגה), מאמת אותה ומשאיר אותה מעודכנת. הבקאנדים (backends) הנתמכים מכסים CUDA, Metal, Vulkan, HIP ו-CPU. תג הגרסה המקובע (pinned release tag) נשמר בבלוק local_runtime של config.yaml, שה-UI כותב עבור המשתמש ושמשתמשי headless יכולים לערוך ידנית.

איך הקטלוג מדורג מול המכונה שלך

כל מודל בקטלוג נבדק מול המכונה הספציפית לפני הורדה. כל שורה מקבלת פסק-דין זיכרון: ירוק, רץ כולו ב-VRAM; כתום, גולש ל-RAM מערכת ואיטי יותר; אדום, גדול מדי למכונה הזו. השורות מציגות גם חלון קונטקסט התחלתי ומקסימלי, וגודל הורדה של הבנייה שנבחרה עבור החומרה. כלל בחירת הקוונטיזציה יחיד: הרמֶס בוחר את הבנייה האיכותית ביותר שרצה כולה על ה-GPU, ומכונות עם פחות זיכרון מקבלות בנייה דחוסה יותר של אותו מודל. יש רצפה קשיחה ב-4-ביט, מתחת לזה נואה מחשיבה את אובדן האיכות חמור מדי, אז מכונה שלא מריצה את בניית ה-4-ביט בלי גלישה פשוט לא יכולה להריץ את המודל. מודלים שלא מתאימים נשארים גלויים עם הסיבה, כדי שתראה בדיוק כמה VRAM נוסף היה קונה לך.

חוקי הזיכרון שמחזיקים את הכול יחד

הרצה מקומית חיה או מתה על מיקום זיכרון, והרמֶס לא חושפת כפתורים לכוונון. מודלים מתחילים בחלון קונטקסט שנכנס במלואו ל-GPU וגדלים לכיוון המקסימום הטבעי ככל שהשיחה דורשת מקום, כל מודל מומלץ מובטח בחלון של 64K טוקנים לפחות. סדר ה-offload הוא הבחירה המעניינת: כשמודל חורג מה-VRAM, הרמֶס דוחפת את העודף ל-RAM בסדר שפוגע הכי פחות, משקולות המומחים (expert weights) ראשונות, ולעולם לא מטמון הקשב (attention cache). היא מקריבה תפוקה (throughput) כדי לשמור על ערובת הקונטקסט. דחיסת שיחה (conversation compression) נכנסת לפעולה רק כשהמודל מגיע לחלון המקסימלי, כך שגדילה תמיד קודמת לסיכום. מודלים במצב סרק נפרקים אחרי 15 דקות ונטענים מחדש בהודעה הבאה.

שורה תחתונה

ההתקנה בלחיצה אחת פותרת את צוואר הבקבוק האמיתי, לא הורדת המשקולות אלא התאמתן לחומרה, בלי להסתיר מהמשתמש את המגבלות. הקטלוג השקוף, הרצפה ב-4-ביט, והעדפת ערובת קונטקסט על מהירות הן החלטות מוצר ברורות, לא קסם. מי שרץ מקומית כבר יודע: החצי הראשון של העבודה היה תמיד הנדסת מערכת, והרמֶס פשוט לקחה אותו על עצמה.

מקור: marktechpost.com