NVIDIA מרכזת החודש את מיטב המודלים הפתוחים להרצה מקומית, ומסמנת את אוגוסט כחודש של סוכנים

הכרזות מרוכזות של שבעה מודלים חדשים וכלי דסקטופ אחד מציבות את אוגוסט כחודש שבו האקוסיסטם הפתוח עובר מדיבורים על "הרצה מקומית" למימוש בפרודקשן. NVIDIA מנצלת את סדרת הבלוגים Local AI כדי לדחוף את כל השרשרת: ממודלי עולם לרובוטיקה, דרך וידאו עם אודיו מסונכרן, ועד סוכני קוד שמחזיקים קונטקסט של מיליון טוקן, כולם עם צ'קפוינטים מכוונים ל-Blackwell ומוכנים להרצה על DGX Spark, DGX Station או כרטיסי RTX 5090.
רובוטיקה וראייה: Cosmos 3 Edge מכווץ לגודל של 4 מיליארד פרמטרים
Cosmos 3 Edge הוא מודל עולם (world model) פתוח בגודל רבע מ-Cosmos 3 Nano, שפותח לרובוטיקה, רכב אוטונומי וראייה ממוחשבת. היתרון המעשי: הוא רץ על-התקן (on-device) גם על Jetson וגם על DGX Spark, מה שמאפשר למפתחי רובוטיקה לבחון סימולציות וסגירת לולאה בלי תלות בענן. עבור צוותים שמפתחים אוטונומיה בקצה, זה הבדל בין איטרציה של שעות לאיטרציה של דקות.
וידאו עם אודיו: MiniMax-H3, LTX 2.5 ו-Wan-Animate-2 מכסים את כל הזוויות
MiniMax-H3 מביא 33 מיליארד פרמטרים של open weights שיודעים לייצר וידאו ואודיו סטריאו מסונכרן מטקסט, תמונה, וידאו או אודיו, או שילוב של הארבעה. הגישה דרך ComfyUI והצ'קפוינטים המותאמים ל-GPU של NVIDIA הופכים אותו לנגיש ליוצרים בלי לכתוב קוד תשתית. LTX 2.5 מוסיף תמיכה ב-multishot, רצף חיתוכים ששומר על עקביות דמויות, סצנות וקולות, ודקודר דיפוזיה משופר שמוריד ארטיפקטים. מהצד הסיני, Wan-Animate-2 של Alibaba (14 מיליארד פרמטרים) מעביר תנועה והבעות מווידאו דוחף לדמות סטטית, אדם, דמות מצוירת, רובוט או חיה, עם תמיכת day-zero ב-ComfyUI. המספרים ש-NVIDIA מצטטת: פי 16 מהיר יותר על RTX PRO 5000 Blackwell (48GB) ופי 26 על RTX 5090 לעומת Apple M3 Ultra.
סוכני קוד: Poolside, DeepSeek ו-Thinking Machines Lab דוחפים קונטקסט ארוך והפעלה דלילה
Poolside משיקה את Laguna S 2.1, 118 מיליארד פרמטרים של מודל קוד סוכנים (agentic) שמחזיק משימות של שעות. צ'קפוינט NVFP4 מאפשר הרצה על DGX Spark בודד בלי לפגוע בדיוק. DeepSeek מרעננת את V4-Flash: מודל MoE של 284 מיליארד פרמטרים עם 13 מיליארד פעילים בלבד וחלון קונטקסט של מיליון טוקן, רץ מקומית על DGX Station דרך GGUF שפותח על ידי הקהילה. Thinking Machines Lab מציגה את Inkling-Small: 276 מיליארד פרמטרים מולטימודליים עם חשיבה מובנית (native reasoning) ומאמץ חשיבה מתכוונן, שמפעיל רק 12 מיליארד פרמטרים לטוקן ורץ על DGX Station בודד או זוג DGX Spark. הצ'קפוינט NVFP4 ל-Blackwell כבר ב-Hugging Face.
Unsloth Desktop: לראשונה, אימון והרצה באפליקציית דסקטופ פתוחה אחת
Unsloth משיקה השבוע את Unsloth Desktop, אפליקציית דסקטופ open source שמאחדת אינפרנס מקומי, דיפוזיה לתמונה ווידאו, fine-tuning, אינטגרציות סוכנים, חיפוש רשת והרצת קוד. לטענת החברה, זו האפליקציה השולחנית הראשונה שמאמנת ומריצה מודלים מקומית בלי להזדקק לשרת חיצוני. עבור חוקרים ומפתחים שרגילים להרכיב פייפליין מכמה כלים, זה חיסכון משמעותי בזמן הגדרה (setup) ובתחזוקת סביבות.
בשורה התחתונה: התשתית הבשילה, נשאר רק לבנות
הגל הנוכחי מראה שהצוואר בקבוק עבר מזמינות מודלים וצ'קפוינטים מותאמים, ליכולת של צוותים לשלב אותם במוצר אמיתי. עם DGX Spark במחיר נגיש יחסית, RTX 5090 בתחנות עבודה, וכיסוי day-zero ב-ComfyUI וב-Hugging Face, התירוץ "זה לא רץ אצלי" כבר לא מחזיק מים. עבור הסטארטאפים הישראליים שבונים על קצה (edge) או על פרטיות נתונים, החודש הזה מספק ארגז כלים שמוכן לעבודה מיידית.