21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

מאמר חדש של Meta: מודלים קטנים לא גרועים בחיזוי סקייל, הם פשוט לא מכוונים מספיק

מאמר חדש של Meta: מודלים קטנים לא גרועים בחיזוי סקייל, הם פשוט לא מכוונים מספיק

הבעיה עם ניסויים בקנה מידה קטן

מאמר חדש של Meta שפורסם ב-arXiv טוען שהקושי לחזות התנהגות של מודלים גדולים מתוך ניסויים קטנים לא נובע ממגבלה בסיסית של המודלים הקטנים, אלא מכך שהם רגישים במידה חריגה להיפרפרמטרים. החוקרים מצאו שחוקי סקיילינג (scaling laws) מתחילים להופיע סביב 4 מיליון פרמטרים, גודל שמאפשר אימון בפחות משעה על GPU בודד, אבל רק כשסורקים את מרחב ההיפרפרמטרים ברוחב מספיק.

כמה קונפיגורציות צריך באמת

הניסויים הראו תמונה ברורה: עם 4 או 16 קונפיגורציות לכל קנה מידה, חוק הסקיילינג כמעט בלתי נראה; ב-64 קונפיגורציות הוא מופיע אבל האקסטרפולציה גרועה; וב-256 קונפיגורציות הוא נעשה מדויק. במילים אחרות, מודלים קטנים דורשים חיפוש היפרפרמטרים רחב בהרבה כדי לחשוף את המגמה האמיתית. זו תובנה שמשנה את החשבון של חוקרים: במקום להגדיל את המודל בניסויים זולים, עדיף להשקיע את אותו תקציב מחשוב ברוחב כוונון (tuning breadth).

למה מודלים גדולים נראים "נקיים" יותר

הסיבה שחוקי סקיילינג נראים מסודרים יותר במודלים גדולים פשוטה: ככל שהמודל גדל, הגדרות טובות תופסות נפח גדול יותר ממרחב החיפוש, ומספר ההיפרפרמטרים האפקטיביים בסביבת האופטימום יורד לכיוון 1. במילים פשוטות, מודלים גדולים סלחניים יותר לכוונון לא מושלם. כבדיקת תיקוף (sanity check), הריצות בקנה מידה קטן שחזרו את הידוע: טרנספורמרים עם pre-norm מתסקללים טוב יותר מ-post-norm בטווח שנבדק.

המגבלה: לא לחרוג מהטווח שנמדד

יש גבול לכמה רחוק אפשר לאקסטרפולציה. כשמנסים לחזות הרבה מעבר לטווח הגדלים שנמדד בפועל, שגיאות סטטיסטיות מתחילות לשלוט והתחזית מתפרקת. המסקנה המעשית לחוקרי מודלים: ניסויים זולים יכולים לעבוד, אבל רק אם משקיעים בהם רוחב כוונון אמיתי, לא אם רק מקטינים את המודל ומקווים לטוב. המאמר, "Small-Scale Experiments: Are They There Yet?", זמין ב-arXiv:2608.11859.