21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

האצת יכולות AI אמיתית, אבל רק במקומות שקל לבדוק בהם תשובה נכונה

האצת יכולות AI אמיתית, אבל רק במקומות שקל לבדוק בהם תשובה נכונה

שלושה מדדים מארבעה מראים קפיצה

ניתוח חדש של Epoch AI מאשר את מה שחשדו במעבדות כבר חודשים: קצב השיפור במודלים האיץ משמעותית מאז הופעת מודלי החשיבה (reasoning models) ב-2024. החוקרים בדקו ארבעה מדדי יכולת שונים, ECI של Epoch, אופק הזמן של METR בגרסה 1.1, מדד מתמטיקה משולב שבנו בעצמם, ותוצאות WeirdML V2, ומצאו האצה בשלושה מהם. המדד הרביעי נותר ליניארי.

המתודולוגיה: התאמת עקומות לנתונים היסטוריים

הצוות התאים כמה עקומות מועמדות, ליניארית פשוטה, היפרבולית, וזוג קווים ליניאריים נפרדים, לנתונים היסטוריים מ-2022 ואילך, ובחן איזו מהן חוזה הכי טוב נתונים שלא נראו קודם (cross-validation). המודל המנצח בשלושת המדדים המואצים היה בדיוק אותו זוג קווים נפרדים: אחד למודלי חשיבה, אחד לכל השאר. המשמעות: לא רק קפיצת מדרגה חד-פעמית עם יציאת הדור החדש, אלא קצב שיפור מהיר פי שניים עד שלושה בהשוואה למסלול הקודם.

מה השתנה בפועל בסוף 2023

החוקרים מציינים שההפרדה בין "חשיבה" ל"לא חשיבה" אינה דיכוטומיה נקייה. באותו חלון זמן של כמה חודשים קרו כמה דברים מתואמים: הגדלה דרמטית של חישוב בזמן הסקה (inference compute), שימוש כבד יותר בלמידת חיזוק (RL) בשלב הפוסט-טריינינג, ומודלים שמייצרים טוקני חשיבה גלויים. קשה לבודד איזה מהגורמים אחראי להאצה, אבל העיתוי חד-משמעי.

החריג: WeirdML V2 לא מראה האצה

המדד הרביעי, שנבנה מתוצאות WeirdML V2, מתאים הכי טוב לקו ליניארי יחיד, בלי שום סימן לשבירה. הסבר אפשרי: הבנצ'מארק מכניס מודלים לסביבה מוגבלת משאבים, חמישה ניסיונות בלבד להגיש קוד עובד, בלי גישה לכלים חיצוניים. זו לא הסביבה שעליה התאמנו מודלי החשיבה ב-RL האחרונים. מצד שני, יש רק כשנה של נתוני טרום-חשיבה למדד הזה, אז הכוח הסטטיסטי לזיהוי שבירה מוגבל מלכתחילה.

ההאצה מרוכזת בתכנות ומתמטיקה, לא מקרה

שלושת המדדים המואצים מתמקדים בתכנות ובמתמטיקה. אלה תחומים שמעבדות סימנו במפורש כיעד לשיפור, והם חולקים תכונה קריטית: נכונות קלה לאימות אוטומטי. זה הופך אותם למטרות טבעיות ל-RL. משימות שבהן קשה יותר לוודא נכונות, כתיבה פתוחה, ניתוח משפטי, תכנון מערכתי, אולי לא נהנו מאותה קפיצה. המספרים בכותרת עלולים להטעות אם מקבלים אותם ככלליים.

מגבלות ומבט קדימה

החוקרים מודים שהגורם המגביל הוא זמינות בנצ'מארקים שמכסים טווח רחב מספיק של גרסאות מודל. הם מעוניינים להרחיב את הניתוח לתחומים מחוץ לתכנות ומתמטיקה. עד אז, המסקנה הזהירה: יש האצה מדידה, היא מתוארכת לעליית מודלי החשיבה, והיא ממוקדת בדיוק איפה ש-RL יודע לעבוד הכי טוב. שאר המרחב, עדיין בקצב הישן.