24 בספטמבר 2026 האקדמיה ארכיון
מבזקים
בינה מלאכותית לומדת להרכיב רהיטים, וזה משנה את כללי המשחק StrictlyVC חוזר ל-Disrupt עם פוקוס על חוקי המשחק החדשים בוונצ'ר פיירוורקס חותכת בחצי את גודל הדלתא ב-RL ומאפשרת אימון חוצה-אזורים מעשי אופן-איי משיקה בנצ'מרק פתוח לשיחות בריאות נפש, ומסתבכת עם הקטגוריות שלה עצמה ג'מיני 4 מתקרב להשקה, אומר ראש דיפמיינד החדש
מחקר

בינה מלאכותית לומדת להרכיב רהיטים, וזה משנה את כללי המשחק

בינה מלאכותית לומדת להרכיב רהיטים, וזה משנה את כללי המשחק

הבנצ'מרק שבודק אם המודל רואה את הבורג החסר

חוקרים השיקו את Furniture Assembly Benchmark (FAB), מבחן שמבקש ממודלי ראייה לאתר טעויות בתמונות של רהיטי איקאה מורכבים חלקית. הרעיון פשוט: אם מודל מסוגל לזהות בורג שהוחמץ או לוח שהורכב הפוך בשלבים מוקדמים, סביר שהוא יצליח גם להנחות טכנאי בתיקון מכונת כביסה או מכונאי בהחלפת בלמים. המאגר כולל 60 תמונות משלושה דגמי רהיטים ברמות מורכבות שונות, מחושבות לפי מדד המורכבות של איקאה (מכפלת מספר השלבים במספר החלקים). לכל תמונה מצורפת חוברת ההוראות המקורית, כלי זום לבחינה מקרוב וסביבת הרצה עם אינטרפרטור פייתון.

קפיצה מ-28% ל-80% בעשרה חודשים

התוצאות מראות התקדמות חדה. בנובמבר 2025 הוביל Claude Opus 4.5 של Anthropic עם 28% הצלחה. בספטמבר 2026, עשרה חודשים מאוחר יותר, GPT-6 Astra של OpenAI מוביל עם 80%. הפער לא רק כמותי: המודל של OpenAI מספק תשובה בחציון של שלוש דקות לתמונה, מהיר פי שניים עד עשרה מהמודלים שהובילו קודם. המהירות קריטית ליישומי זמן-אמת; מודל שמתמהמה חצי שעה לא יתאים להנחיית טכנאי בשטח.

מודלים סגורים מובילים, קוד פתוח מפגר חודשים

ההובלה נשארה בידי מודלים סגורים (closed-weight) לאורך כל התקופה. מודלים פתוחי-משקולות מסין, Moonshot ו-Alibaba נבדקו, מפגרים אחרי החזית לפחות שבעה חודשים. הפער עקבי ולא מקרי: החברות הסיניות משחררות משקלים פתוחים רק אחרי שהגרסאות הסגורות שלהן כבר הוחלפו בדור הבא. מי שמסתמך על מודל פתוח לצורכי ייצור צריך לתכנן בהתאם.

מתודולוגיה: טעויות מכוונות, דירוג סלחני

החוקרים רכשו שלושה רהיטים, הרכיבו אותם ושתלו טעויות ריאליסטיות, בורג שלא הודק, לוח שהורכב הפוך, שלב שדולג, והמשיכו לבנות מעל הטעות כדי להקשות על הזיהוי. כל מודל קיבל תקציב של 80 צעדים בסביבה סוכנית (agentic sandbox); פחות מ-5% מהדגימות הגיעו למגבלה. הדירוג רב-שלבי: זיהוי נכון שאין טעות = נכון; יש טעות, המודל חייב לציין את השלב המדויק ולתאר את הבעיה. את התיאור בודק מודל שיפוט, GPT-5.6 Sol, שמונחה להיות סלחני: מספיק זיהוי שלב נכון ותיאור כללי כדי לקבל ניקוד.

מה חסר: בסיס אנושי והטיית שיפוט

החוקרים טרם מדדו ביצועי אנשים על FAB, והם מודים שרבות מהטעויות יקשו על מי שלא מכיר את ההרכבה. בנוסף, השימוש ב-GPT-5.6 Sol כשופט סלחני עלול לנפח ציונים, מודל ש"בערך" מזהה את הבעיה מקבל קרדיט מלא. בלי בסיס השוואה אנושי ובלי שיפוט מחמיר, ה-80% של GPT-6 Astra הוא אינדיקטור חזק אבל לא הוכחה סופית ליכולת מעשית בשטח.