21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מודל שפה עם מוח של זבוב: הקונקטום המלא לא מנצח בקרה פשוטה

מודל שפה עם מוח של זבוב: הקונקטום המלא לא מנצח בקרה פשוטה

ארכיטקטורת מאגר עם 166 אלף צמתים

הפרויקט Fly Language Model (FLM) מחבר את הקונקטום המלא של זכר זבוב הפירות, גרסת MaleCNS v1.0 עם 166,700 צמתים שמורים ו-25.5 מיליון קשתות מכוונות, לשלד קפוא של LiquidAI LFM2.5-1.2B-Instruct. המפתח מכנה את הארכיטקטורה GPF (Generative Pre-trained Fly) אך נמנע מלהשתמש בתווית הזו בפומבי, ומצהיר במפורש שאין כאן טענה להיות מודל השפה הראשון מבוסס-קונקטום. כל הרכיבים קבועים: הגרף, השלד, ההקרנות האקראיות בכניסה וביציאה. רק שכבת קריאה (readout) בת 278,528 פרמטרים עוברת אימון, 0.0238% מגודל השלד.

איך זה עובד בפועל

בכל טוקן, הקרנה גאוסיאנית קבועה דוחסת את ההטמעה (embedding) מממד 2,048 ל-128 ערוצים. כל צומת במאגר מקבל ערוץ אחד עם סימן אקראי, והגרף כולו מתעדכן לפי x = tanh(W(0.6x + 0.4Bc)) כאשר W מכיל ספירות מגע אנטומיות מנורמלות בכניסה. המצבים נאספים ל-128 סלים, עוברים דרך שתי מטריצות מוטות-אפס מאומנות (U בגודל 128×128, V בגודל 2,048×128), ומוקרנים דרך ראש האוצר הקפוא כשארית מוגבלת שמתווספת ללוגיטים של השלד. הנורמה של השארית מוגבלת ל-RMS של 0.25 על פני צירי האוצר.

התוצאות: שיפור זניח, ובקרה בלי גרף מנצחת

על סט טרי של 32 דיאלוגי SmolTalk יומיומיים (1,236 טוקני מטרה), שלושה זרעי אימון הניבו שיפור של 0.0222 נייט לטוקן ב-NLL, פרפלקסיטי (perplexity) ירד מ-3.98 ל-3.90. אבל בקרת "כניסה ישירה", שמזינה את אותה הקרנת 128 ערוצים ישר לשכבת קריאה זהה בלי הגרף, השיגה תוצאה טובה יותר בכל שלושת הזרעים בפער של 0.000488 נייט לטוקן. רווח בר-סמך של bootstrap מזווג (+0.00000502 עד +0.00104) לא תומך ברווח ייחודי לקונקטום.

מה הבקרות הנוספות מוכיחות

שתי בקרות קריטיות משלימות את התמונה. איפוס המטריצה W לאפס מבטל את השארית בדיוק ומשחזר את הפסדי השלד, הוכחה שהגרף אכן משתתף בחישוב. ערבוב זהויות הצמתים בלי אימון מחדש מחזיר NLL קרוב לבסיס, מה שמראה ששכבת הקריאה תלויה ביישור הממשק שלמדה, לא בכך שהטופולוגיה של הזבוב עדיפה על חיווט אקראי. במילים אחרות: הגרף משתתף, הוא לא מנצח.

זיכרון לטווח ארוך? לא כאן

הדוח מוכיח שהרקורסיה מכווצת הבדלי מצב התחלתי במקדם 0.6 לכל טוקן. אחרי 10 טוקנים החסם עומד על 0.00605; אחרי 20 טוקנים, 0.0000366. ערימת 166,700 תאים לא קונה זיכרון ארוך-טווח; ההקשר עדיין מגיע מהשלד. זה ממצא מתודולוגי חשוב: מאגר (reservoir) בגודל מלא של קונקטום שלם עדיין שוכח מהר מדי בשביל לשאת הקשר משמעותי.

קוד פתוח, ארטיפקטים סגורים

הקוד זמין ברישיון MIT במאגר nftechie/flm, רץ מקומית על Python 3.12 (macOS או Linux, עם MPS, CUDA או CPU) בלי מפתח API. אבל ארטיפקטי המחקר, משקולות שכבת הקריאה המאומנת, זרעי האימון, נתוני ההערכה, נשארים פרטיים, כך שהתוצאות עדיין לא ניתנות לשחזור עצמאי. העבודה הקודמת שמצוטטת, ngxson/fly-hf, השתמשה בתת-קבוצה של 49,393 תאי מוח מרכזי כמאגר שאומן על TinyStories בלי שלד מאומן-מראש. ההבדל של FLM הוא קנה מידה (הגרף המלא השמור) ועיצוב השלד הקפוא ששומר על מקור כשירות השפה מזוהה.

מקור: marktechpost.com