6 באוקטובר 2026 האקדמיה ארכיון
מבזקים
לאמה 0.6.0 מוסיפה תמיכה בקלף ובקוון, ומאיצה דרמטית על מטאל רדהאט משחררת צ'קפוינט NVFP4 של Qwen3.8-Flash-Next: מומחי MoE ב-4 ביט, השאר ב-BF16 MIT Technology Review פותח את EmTech Future 2026 לצפייה ישירה; מטיאס, נוון ודוקטורו בראש הרשימה OpenAI מתחילה לסמן טקסטים של צ'אטג'יפט באירופה כדי לעמוד בחוק ה-AI Reflection AI חושפת את Beam, מודל פתוח שמתחרה בסינים בפחות חומרה
מוצרים

לאמה 0.6.0 מוסיפה תמיכה בקלף ובקוון, ומאיצה דרמטית על מטאל

לאמה 0.6.0 מוסיפה תמיכה בקלף ובקוון, ומאיצה דרמטית על מטאל

הגרסה החדשה של לאמה, אפליקציית שורת התפריטים שמריצה מודלים פתוחים מקומית על מק וווינדוס, נוחתת עם ארבעה עדכוני ליבה: תמיכה במודל Clef לטקסט וראייה, תמיכה איכותית ב-Qwen3.8-Flash-Next, קפיצת ביצועים גדולה על Metal באפל סיליקון, ו-API אצווה חדש בשם `llama_batch_ext`. במקביל שודרג האתר עם דגש על המסר "הבינה שלך, על המחשב שלך", הורדה של 1 מגה-בייט, קוד פתוח, עובד אופליין.

מה זה בעצם לאמה

לאמה יושבת במגש המערכת (menu bar במק, system tray בווינדוס) ומציעה שני ממשקים במקביל: צ'אט מקומי בסגנון ChatGPT שנפתח בלחיצה, ו-API תואם OpenAI שרץ על `localhost:9931/v1`. כל אפליקציה שיודעת לדבר עם OpenAI, עורכי קוד, סוכני קידוד, סקריפטים, מצביעה על הכתובת הזו ועובדת בלי מפתחות, בלי חשבוניות, בלי ענן. המודלים יורדים פעם אחת, נשמרים במטמון של Hugging Face ומשותפים לכל הכלים שמשתמשים ב-llama.cpp.

המנוע מתחת למכסה

השדרוג המשמעותי בגרסה 0.6.0 הוא התמיכה ב-Clef, מודל מולטי-מודאלי שמבין טקסט ותמונות, ובגרסה החדשה של Qwen3.8-Flash-Next שמקבלת טיפול איכותי ייעודי. על מקים עם אפל סיליקון מדווחים המפתחים על "שיפור ביצועים מסיבי" בזכות אופטימיזציות Metal, וה-API החדש `llama_batch_ext` מאפשר עיבוד אצווה יעיל יותר למשימות כבדות. כל הגדרה של llama.cpp עדיין זמינה בקובץ טקסט פשוט למי שרוצה לשלוט בקוונטיזציה, גודל קונטקסט, פענוח ספקולטיבי וגודל אצווה, שגדל אוטומטית במקים עם 32 ג'יגה-בייט זיכרון ומעלה.

ניהול מודלים בלי כאב ראש

האפליקציה שוקלת 4 מגה-בייט במק (הורדה של 1 מגה-בייט), לא טוענת כלום בזמן סרק, ופורקת מודל אחרי 5 דקות חוסר פעילות. בפתיחה ראשונה היא סורקת את החומרה ומציעה מודל שמתאים, דיוק מרבי שנכנס בזיכרון, קונטקסט מקסימלי שנכנס, תמיכה בתמונות אם המודל יודע. מודלים שכבר הורדת דרך llama.cpp או כלים אחרים מופיעים אוטומטית, בלי כפילויות על הדיסק.

למפתחים: API, CLI ו-Tailscale

הקצה החשוף תואם גם ל-OpenAI וגם ל-Anthropic, סטרימינג, קריאות כלים, פלט מובנה, ראייה. שורת הפקודה מגיעה עם `llama cli`, `llama serve` ועוד, וניתן להגיע ל-API ממכשירים אחרים דרך Tailscale. אפליקציות שבונות על לאמה לא צריכות לארוז מנוע או ג'יגות של משקלים: הן מדברות עם ה-API, ולינק התקנה בודד מוריד את המודל הנדרש למשתמש הקצה. המשתמש שומר עותק אחד לכל האפליקציות.