3 באוקטובר 2026 האקדמיה ארכיון
מבזקים
פריים אינטלק משיקה את פריים אינפרנס: הגשת מודלים פתוחים על בלאקוול דוט של OpenAI: תוכנה ארגונית שגם יודעת להזמין בוריטו מיקרוסופט משיקה את MAI-Transcribe-2-Streaming, מודל דיבור-לטקסט בזמן אמת שמדורג ראשון בדיוק קליי דוחפת את מהנדס ה-GTM לקדמת הבמה בדיסראפט 2026 מטא, אופן-איי ואובר דוחפות סוכנים שיוזמים שיחה, הבעיה הקשה עברה ל"מתי לשתוק"
מודלים

פריים אינטלק משיקה את פריים אינפרנס: הגשת מודלים פתוחים על בלאקוול

פריים אינטלק משיקה את פריים אינפרנס: הגשת מודלים פתוחים על בלאקוול

מה זה בעצם פריים אינפרנס

פריים אינטלק (Prime Intellect) מוציאה לשוק את פריים אינפרנס (Prime Inference), שכבת הגשה (serving) למודלים פתוחים בחזית הטכנולוגיה, שרצה על ערכת GPU משלה במספר דאטה-סנטרים. עוד לפני ההשקה הציבורית המערכת עיבדה כמעט טריליון טוקנים ביום לצרכים פנימיים: גלגולי חיזוק (RL rollouts), יצירת נתונים סינתטיים, הערכות וסוכני קוד ארוכי-טווח. השכבה הזו סוגרת את הלולאה של סט אימון פתוח שכבר כולל את prime-rl, וריפיירז (verifiers) וסנדבוקסז (sandboxes): מודלים פרוסים מייצרים עקבות ייצור שחוזרים לאימון. לדברי החברה, נקודת הקצה של GLM-5.3 מדורגת בין המהירות ב-OpenRouter, עם שיעור שגיאות קריאות-כלים קרוב לאפס וזמינות של 100% מאז העלייה לאוויר.

ארכיטקטורה: שני מצבים ותאימות פתוחה

הפלטפורמה מציעה שני מצבי הפעלה: נקודות קצה ללא-שרת (serverless) לביקוש משתנה, וקיבולת שמורה (reserved) לעומסים מתמשכים. הממשק תואם OpenAI SDK, כלומר אפשר להפנות כל קוד שכבר מדבר עם OpenAI לכתובת התיעוד של פריים בלי לשכתב לקוח. זמינות מושגת דרך מעבר אוטומטי בין דאטה-סנטרים כשהתקנה מסוימת נופלת. החומרה הנוכחית היא NVIDIA Blackwell, עם Vera Rubin רשומה כ"בקרוב". החיוב מאוחד עם מעקב שימוש ברמת צוות; תמחור פר-מודל עדיין לא פורסם במלואו במסמכים.

מתחת למכסה: דינמו, וילאם ומונקייק

המימוש משלב NVIDIA Dynamo, vLLM, Mooncake ו-FlashInfer, ונבנה בשיתוף Inferact ו-NVIDIA כשהתיקונים מוזרמים בחזרה למעלה (upstream). עומס היעד הוא סוכני (agentic): תור סוכן טיפוסי מוסיף כ-6,000 טוקנים לפרומפט של 140,000 טוקנים, והבנצ'מרק נעשה עם SemiAnalysis AgentX בתוספת הגעות קרות מלאכותיות. ההפרדה בין פריפיל (prefill) לדיקוד (decode) רצה על קבוצות GPU נפרדות, Dynamo מנתב, vLLM מריץ את המודל בכל קבוצה, והדיקודרים מושכים את מטמון KV דרך NIXL. לטענת פריים, זה הניב כ-40% פחות חביון p90 בין טוקנים בבדיקות שלהם. הניתוב מודע-מטמון שוקל חפיפת קידומת במטמון מול עבודה בתור, ומשאיר סשנים על אותו דיקודר בין תורים; Mooncake מוסיף שכבת KV שנייה ב-DRAM של המארח.

המספרים של GLM-5.3 על GB200

היעד לאינטראקטיביות נקבע על 100 טוקנים מקצה-לקצה לשנייה למשתמש. ביחס 1:4 בין פריפיל לדיקוד התקבלה התפוקה הגבוהה ביותר: 66 סשנים לקבוצת פריפיל ב-101 טוק'/שנייה למשתמש ו-100 טוק'/שנייה פלט ל-GPU. טופולוגיית DEP8 לפריפיל סיפקה פי 5 יותר קיבולת מטמון-קידומת שמישה מ-TEP8 על אותו ברזל. קיצוץ תקציב הטוקנים לצעד מ-8K ל-4K ל-GPU חתך המתנה חציונית בתור מ-550 מילישניות ל-110 מילישניות, וזמן חציוני לטוקן ראשון ירד בכ-20%. דחיסת KV ב-NVFP4 הקטינה שורת מטמון MLA מ-576 ל-352 בייט, והעלתה טוקנים במטמון לדיקודר מ-1.09 מיליון ל-1.63 מיליון. קרנל MLA דליל-טבעי עמד על כ-12.0 מיקרו-שניות ב-15 טוקני שאילתה, לעומת 17.7 מיקרו-שניות בגישה מדורגת ו-13.7 מיקרו-שניות ב-FP8, החברה מציינת שזה תלוי עומס. פריסת KV מסוג BLHNC הפילה תיאורי העברה מ-19,559 לכ-1,940, וזמן העברה ממוצע מ-146 מילישניות ל-78 מילישניות.

קריאות כלים בלי תקלות

סוכנים נופלים כשקריאות כלים מגיעות עם שמות שגויים או ארגומנטים שבורים. הצוות של פריים תרם בונה תגיות-מבנה (structural-tag builder) ל-Dynamo עבור פורמט הכלים של GLM; vLLM משתמש ב-xgrammar כדי למסך טוקנים שמפרים את סכמת הכלי. תוקנו גם באגי פירוס, כולל מקרה שבו `<` פוענח כ-`<` בתוך קוד.

תמחיר ומפת דרכים

מחירי המתחרים אומתו ב-2 באוקטובר 2026 מול ComputePrices, עוקב מחירים צד-שלישי. על המפה: הסקה באצוות (batch inference) ופריסות ייעודיות בלחיצה אחת (1-click dedicated deploys).

מקור: marktechpost.com