26 בספטמבר 2026 האקדמיה ארכיון
מבזקים
מטא מנסה להפוך את מיוז למס זעיר על המסחר המקוון העולמי סמי-אנליסיס חושפת: כך נראית הזיכרון של DeepSeek V4.1 Flash סוכן AI עקף הגבלות רשת דרך שאילתות DNS והגיע לצ'אטבוט חיצוני ליקוויד AI משחררת דראפט ניסיוני להאצת פענוח במודל ראייה-שפה Runway מחברת את מודלי הווידאו שלה ישירות לקלאוד אופוס 5.5 דרך MCP
מודלים

סמי-אנליסיס חושפת: כך נראית הזיכרון של DeepSeek V4.1 Flash

סמי-אנליסיס חושפת: כך נראית הזיכרון של DeepSeek V4.1 Flash

חוקרי סמי-אנליסיס (SemiAnalysis) בדקו את שערי האנגרם (Engram) של מודל V4.1 Flash של DeepSeek וגילו שהזיכרון הפנימי שלו מאחסן הרבה יותר משמות ועובדות יבשות. האנגרם, מנגנון ששולף וקטורים שנלמדו עבור רצפי טוקנים קצרים, מאפשר למודל לעשות שימוש חוזר בדפוסים מוכרים במקום לבנות אותם מחדש בכל פעם, והסריקה מראה שהוא לומד לשמור בדיוק את מה שעוזר לחזות טקסט, לא את מה שבני אדם חושבים שראוי לזכור.

מה האנגרם באמת שומר

הבדיקה העלתה שמות כמו איאן גודפלו (Ian Goodfellow), קטעי קוד, הוראות משימה וטקסטים גנריים של אתרים, מה שמכונה בוילרפלייט (boilerplate). אפילו הודעות זכויות יוצרים, טקסטי רישוי והנחיות שיתוף מופיעים בזיכרון. המסקנה: המנגנון לא מסנן לפי חשיבות סמנטית אנושית, אלא לפי תועלת לחיזוי; אפילו טקסט משמים שחוזר על עצמו ברשת יכול לשמש קיצור דרך יעיל.

שכבות שונות, תפקידים שונים

כשהחוקרים הציצו לשכבות ספציפיות, התגלתה חלוקת עבודה ברורה. שכבה 1 מאחסנת ביטויים קונקרטיים כמו "pints of frozen yogurt", תיאור של אובייקטים. שכבה 14, לעומת זאת, שומרת יחסים לשוניים ניתנים לשימוש חוזר כמו "three times as many". המשמעות: שכבות נמוכות מתמקדות בזיהוי ישויות, בעוד שכבות גבוהות יותר לוכדות מבנים יחסיים שאפשר להחיל על הקשרים רבים.

השלכות על ניקוי נתוני אימון

העובדה שטקסטים "משעממים" ומשפטיים שורדים בזיכרון האנגרם מעלה שאלה לגבי תהליכי ניקוי נתונים (data cleanup). אם דווקא החומר הגנרי והחוזר על עצמו מספק קיצורי דרך חישוביים, הסרה אגרסיבית שלו עלולה לפגוע ביעילות המנגנון, ולהשפיע על הכדאיות של הגדלת זיכרון האנגרם בגרסאות עתידיות.

תוכנן להגשה (Serving) עם אופטימיזציית חומרה

מעבר לתוכן הזיכרון, הארכיטקטורה עצמה תוכננה עם מחשבה על אינפרנס (serving) בייצור. מכיוון שהשליפה מתבצעת לפי מזהי טוקנים (token IDs), ניתן לבצע אותה באופן אסינכרוני ובחפיפה (overlapped), מה שמאפשר להוריד את הגישה ל-DRAM מבלי לאבד ביצועים. במילים אחרות: הזיכרון לא רק חכם במה שהוא שומר, אלא גם יעיל באיך שהוא ניגש לברזל.