24 בספטמבר 2026 האקדמיה ארכיון
מבזקים
בינה מלאכותית לומדת להרכיב רהיטים, וזה משנה את כללי המשחק StrictlyVC חוזר ל-Disrupt עם פוקוס על חוקי המשחק החדשים בוונצ'ר פיירוורקס חותכת בחצי את גודל הדלתא ב-RL ומאפשרת אימון חוצה-אזורים מעשי אופן-איי משיקה בנצ'מרק פתוח לשיחות בריאות נפש, ומסתבכת עם הקטגוריות שלה עצמה ג'מיני 4 מתקרב להשקה, אומר ראש דיפמיינד החדש
מוצרים

פיירוורקס חותכת בחצי את גודל הדלתא ב-RL ומאפשרת אימון חוצה-אזורים מעשי

פיירוורקס חותכת בחצי את גודל הדלתא ב-RL ומאפשרת אימון חוצה-אזורים מעשי

הבעיה: צוואר בקבוק ברשת, לא ב-GPU

פיירוורקס (Fireworks) משיקה את ARCv3, דחסן חדש לעדכוני משקלים בלמידת חיזוק (RL), שמקטין את המטען בכמעט 50% לעומת הגרסה הקודמת. המהלך נועד לפתור את הבעיה הכי פחות מדוברת באימון מודלי חזית: לא המחסור ב-H100, אלא הצינורות שמעבירים את המודל המעודכן ממאמן (trainer) לצי המכונות שמייצרות רולאאוטים (rollouts). כשהצינורות לא עומדים בקצב, האילוץ היחיד שנשאר הוא אשכול ענק ומקומי (co-located), יקר, נדיר, וסוגר את השוק בפני שחקנים קטנים.

איך זה עובד היום: רק 2% משתנים, אז למה לשלוח הכול?

בפוסט קודם ("Frontier RL is cheaper than you think") חשפה החברה שבאימוני RL שבדקה, רק כ-2% ממשקלי BF16 משתנים בין צ'קפוינט עוקב. במקום לדחוף 1 טרה-בייט לכל מכונת רולאאוט בכל צעד, פיירוורקס שולחת דלתא דחוסה, תיאור קומפקטי של מה השתנה, ומשחזרת את המודל בצד המקבל. זה מה שמאפשר להריץ אימון מסונכרן על פני שלושה-ארבעה אזורים בלי רשת ייעודית בפס רחב. גודל הדלתא קובע אם הצי נשאר קרוב למדיניות הנוכחית או נסחף לאחור, והמאמן מתחיל "לברוח" קדימה.

ARCv3: 0.19% במקום 0.36%, ללא אובדן

הגרסה החדשה מורידה את המטען הממוצע ל-0.19% מגודל המשקלים המקורי, לעומת 0.36% בגרסה הקודמת (נמוך יותר = טוב יותר). הדחיסה חסרת-אובדן (lossless): המודל המשוחזר בצד הרולאאוט זהה ביט-לביט למה שהמאמן ייצר. המנגנון: כל שארד של המאמן מעלה את החלק שלו לדלתא הדחוסה לאחסון אובייקטים (S3) במקביל, ה-API של פיירוורקס מאותת לכל אזור שעדכון זמין, וכל אזור מושך את החלקים הרלוונטיים ומשחזר מקומית. המאמן לעולם לא מדבר ישירות עם צי הרולאאוטים, זה מה שמאפשר לאשכול הסקה מבוזר להישאר מסונכרן על גבי קישורי רשת רגילים.

האסימטריה שמאחורי השיפור: מנטיסה זזה, אקספוננט וסימן נשארים

השיפור נובע מתכונה סטטיסטית שפיירוורקס זיהתה בייצור: מתוך אותם ~2% משקלים שמשתנים בצעד נתון, הרוב המוחלט עובר רק הזזה של המנטיסה (mantissa), בעוד האקספוננט והסימן נשארים קבועים. עדכונים שנוגעים באקספוננט נדירים, וכאלה שהופכים סימן, נדירים עוד יותר. במילים אחרות, רוב העדכונים הם "דחיפות" קטנות, לא קפיצות. ARCv3 מקודד את האסימטריה הזו ישירות: ערכים שלא השתנו מושמטים מהמטען, ושינויים של מנטיסה בלבד תורמים רק את סיביות המנטיסה שלהם.

זמין עכשיו דרך fireworks-delta-compression

הדחסן זמין ב-Fireworks Training API באמצעות החבילה fireworks-delta-compression, עבור צוותים שמשתמשים במאמן משלהם עם רולאאוטים של פיירוורקס. עבור קבוצות ישראליות שדוחפות לאימון RL בקנה מידה של מודלי חזית, בין אם בסטארטאפים, במעבדות מחקר או בארגונים גדולים, המשמעות מעשית: אפשר לפרוס את צי ההסקה באזורים זמינים וזולים יותר, בלי להינעל על אשכול יחיד ויקר, ועדיין לשמור את הרולאאוטים מעודכנים בקצב שהמאמן מכתיב.