IBM משיקה את Granite 4.2: מודלי חשיבה פתוחים עם יכולות סוכניות לארגונים

חשיבה מפורשת כברירת מחדל
IBM שחררה את משפחת Granite 4.2, שלושה מודלי שפה בגדלים 3B, 8B ו-30B פרמטרים שבנויים סביב חשיבה מפורשת (Chain-of-Thought) ולא רק מעקב הוראות. כל מודל מסוגל לפלוט שרשרת חשיבה לפני התשובה, וכולם חושפים מתג בין מצב חשיבה למצב רגיל בתוספת מצב "מאמץ נמוך" שמקצה תקציב חשיבה קצר לשאלות פשוטות. המודלים הם טרנספורמרים צפופים (dense) מסוג decoder-only, לא ארכיטקטורת MoE או היברידית, והם פותחו מאפס על כ-15 טריליון טוקנים.
רישיון פתוח ופריסה גמישה
שלושת המודלים מופצים תחת רישיון Apache 2.0, כך שהורדה, כוונון עדין (fine-tuning) ושימוש מסחרי בפרודקשן אינם כפופים למגבלות רישוי. גרסת ה-3B מתאימה למפתחים יחידים וסטארט-אפים שמריצים על לפטופ דרך Ollama או LM Studio, במיוחד עם קוואנטיזציות GGUF שירדו עד Q4_K_M. ה-8B מכוון לצוותי מיד-מרקט על GPU מודרני בודד, וה-30B מיועד לארגונים עם קיבולת A100/H100 או הגשה ב-FP8/NVFP4 על vLLM. ארגונים מפוקחים מרוויחים גם את האפשרות להריץ את המשקלים On-prem.
צינור אימון רב-שלבי עם בלוק RL סוכני
הסיפור האמיתי נמצא בצינור הפוסט-אימון. כוונון מפוקח (SFT) השתמש בכ-7.2 מיליון דגימות, כ-100 מיליארד טוקנים עם כ-65 מיליארד פרמטרים ברי-אימון. התמהיל כלל 31.6% דגימות סוכניות (agentic) ו-68.4% לא-סוכניות, כשהנדסת תוכנה מהווה 69% מהחלק הסוכני. מסלולי פעולה (trajectories) נוצרו על גבי סביבות הכוללות OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex ו-Goose. בקרת איכות בוצעה על ידי GPT-OSS-120B ו-Gemma 4 כשופטים, בתוספת דה-דופליקציית SHA-256 על שדות הכלים וההודעות.
למידת חיזוק אסינכרונית בשלבים
הפוסט-אימון הוא שרשרת RL רב-שלבית וסביבתית, לא מעבר יחיד. כל שלב הוא ריצת GRPO אסינכרונית נפרדת שמתחילה מהצ'קפוינט הקודם, עם קו בסיס leave-one-out במקום רשת ערך (value network) ודגימת חשיבות קטומה (truncated importance sampling) להגבלת סטייה מחוץ למדיניות. הסדר: RLVR, אחר כך מאיצי מיומנות (skill boosters), אחר כך SWE, טרמינל, חיפוש, ולבסוף RLHF. בלוק ה-RL הסוכני רץ רק על ה-8B וה-30B; ה-3B מקבל רק RL בסיסי ויישור, החלטת עיצוב יחידה שמסבירה את רוב פער היכולות בין הגדלים. האימון רץ על NeMo-RL ו-NeMo-Gym מעל אשכול NVIDIA GB200 NVL72 שאירח CoreWeave.
רכיבים תומכים: קוד סינתטי והאצת הסקה
שני רכיבים משלימים משלימים את התמונה: טריליון טוקנים של קוד סינתטי מצינור CodeAlchemy של IBM, ושכבת הסקה ספקולטיבית (speculative decoding) להגשת מודל מהירה יותר. בצד הדיבור שוחררו שני מודלי Granite Speech 5.0 Turbo CTC בגודל 470 מיליון פרמטרים כל אחד, הם מוותרים לחלוטין על גב LLM ומשתמשים בארכיטקטורת CTC ישירה לתמלול בנפח גבוה. IBM פרסמה תוצאות בנצ'מרק לכל גודל, אך המדדים טרם עברו אימות עצמאי חיצוני.