21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

פוסט טכני חדש חושף כיצד פענוח ספקולטיבי מאיץ הסקת LLM בלי לפגוע בדיוק

פוסט טכני חדש חושף כיצד פענוח ספקולטיבי מאיץ הסקת LLM בלי לפגוע בדיוק

החוקרים מציגים את החלק השלישי בסדרת התכנון המשותף של מודלי AI, הפעם מתמקדים בפענוח ספקולטיבי (speculative decoding), טכניקה שמאיצה את שלב הפענוח האוטו-רגרסיבי באמצעות חיזוי מספר אסימונים (tokens) בכל איטרציה. מודל טיוטה (draft model) קטן מציע כמה אסימונים סבירים, ואלה נבדקים במקביל במעבר יחיד דרך מודל היעד (target model) הגדול יותר. הגישה מקטינה את מספר איטרציות הפענוח הכולל ומגבירה את העצימות האריתמטית של מודל היעד, בלי לדרוש מקביליות (concurrency) גבוהה יותר.

איך זה עובד בפועל

מודל היעד מקבל את האסימונים המוצעים ברצף עד שהוא נתקל באי-התאמה ראשונה, ואז מחזור החיזוי הבא מתחיל מאותה נקודה. מכיוון שרק אסימונים שאושרו על ידי מודל היעד נשמרים, הפענוח הספקולטיבי מייצר רצף פלט זהה לפענוח רגיל, אלא אם מקלים בכוונה את קריטריוני הקבלה. אורך הטיוטה (D) הוא מספר האסימונים המוצעים בכל איטרציית יעד, ואורך הקבלה (AL) הוא מספר האסימונים שמתקבלים בפועל, הוא נע בין 1 ל-(1+D), כי מודל היעד תמיד יכול לייצר אסימון אמת-קרקע אחד נוסף מעבר לאסימוני הטיוטה שהתקבלו.

הנוסחה שמאחורי ההאצה

ההאצה נמדדת כיחס בין הזמן שלוקח למודל היעד לייצר AL אסימונים ברצף, לבין הזמן לאמת D אסימונים במקביל בתוספת תקורת ההשהיה של יצירת הטיוטה. כשמתעלמים מהשהיית מודל הטיוטה, ספקולציה מספקת האצה כשזמן האימות של גודל אצווה (batch) כפול (1+D) קטן מ-AL. במהלך האימות, החישוב גדל עם (1+D) אבל גישת הזיכרון נשארת קבועה, לכן המטרה היא להגדיל את D עד שזמן האימות נשאר קבוע, כלומר עד שהאימות עובר ממצב מוגבל-זיכרון (memory bound) למצב מוגבל-חישוב (compute bound). הערך האופטימלי של D תלוי בגודל האצווה B ומשתנה לאורך חזית פארטו (Pareto frontier).

GEMM-M גדל, אצווה קטנה מספיקה

עם ספקולציה, ממד GEMM-M של כל שכבה ליניארית במודל היעד גדל מ-M ל-M כפול (1+D). הנתונים מראים שאורכי טיוטה גבוהים יותר מאפשרים ל-GEMMs להגיע לביצועי שיא בגדלי אצווה אפקטיביים נמוכים יותר. באופן בולט, עם D=7 נדרש רק שמינית מגודל האצווה כדי להפוך למוגבל-חישוב בהשוואה ל-D=0. ככל שמודלי תערובת-מומחים (Mixture-of-Experts, MoE) נעשים דלילים יותר ועומסי הקשר-ארוך (long-context) מגבירים את הלחץ על קיבולת KV, המקביליות האפקטיבית לכל מומחה יורדת, מה שהופך אורכי טיוטה גדולים יותר לאטרקטיביים.

חמש הנחיות לבחירה מעשית

הפוסט המלא מפרט חמש הנחיות לבחירת אורך טיוטה ומנגנון טיוטה לאורך חזית פארטו, תוך התחשבות במתח בין תפוקה (throughput) לאינטראקטיביות. הקוד בסדרה זמין במאגר הפתוח של הפרויקט, והחלקים הקודמים עסקו בתכנון ידידותי-חומרה של LLM צפוף ובתשומת לב (attention) מהירה להקשר ארוך.