21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מודל סוכני חינמי עם לולאת משוב חזותית

מודל סוכני חינמי עם לולאת משוב חזותית

Nex-N2.5-Pro הושק ב-8 בספטמבר 2026 כמודל סוכני (agentic) שמקבל טקסט ותמונה כקלט, ומריץ את לולאת המשוב החזותית ישירות דרך ה-API. בניגוד למודלים שרק מייצרים קוד, הוא נבנה להפוך יעדים לתוצאות מאומתות: הוא חוקר בסיסי קוד, מבצע שינויים מרובי-קבצים, מריץ פקודות, משיק יישומים, מתממשק לדפדפן ולשולחן עבודה, ובודק תוכנה מנקודת המבט של המשתמש. כשההתנהגות הנצפית לא תואמת את הכוונה, המודל מאבחן, מתקן ובודק שוב, מה שהופך אותו רלוונטי להנדסת תוכנה אוטונומית, QA מבוסס GUI, אוטומציית computer-use, ותהליכי מחקר שבהם ההצלחה נמדדת בסביבה ולא רק בקוד שנוצר.

מפרט טכני ומה שהוא אומר בפועל

המודל מוצע חינם עם חלון הקשר של 262 אלף טוקנים, מספיק כדי להכיל בסיסי קוד בינוניים שלמים בשיחה אחת. קצב התפוקה עומד על 32 טוקנים לשנייה (P50, הטוב ביותר בין הספקים), והשהיה חציונית של 1.72 שניות (P50, הספק הטוב ביותר). זמינות של 99.97% מדווחת, ומנגנון ניתוב מחדש מתאושש משגיאות ספק עליון ב-59.68% מהמקרים, בתנאי שהפילטרים של הבקשה מאפשרים זאת. נתוני זמינות פר-ספק נגישים דרך Endpoints API, עם אפשרויות איזון עומס והתאמה אישית.

לולאת המשוב החזותית, לא רק סיסמה

היכולת המרכזית היא אותו "visual feedback loop": המודל לא רק כותב קוד אלא רואה את התוצאה, צילומי מסך, מצב DOM, פלט טרמינל, ומשווה אותה לכוונה. כשהוא מזהה פער, הוא מתקן איטרטיבית. זה שונה מהותית מגישת "כתוב והרץ" קלאסית שבה המודל מייצר קוד פעם אחת ומקווה לטוב. כאן הלולאה סגורה: פעולה תצפית אבחון תיקון תצפית חוזרת. עבור מפתחים זה אומר פחות סבבי תיקון ידניים, אבל גם אומר שהמודל צריך גישה לסביבת הרצה, דפדפן, שולחן עבודה, טרמינל, ולא רק ל-API טקסטואלי.

ביצועים ומגבלות, מה נמדד ומה לא

המספרים שפורסמו הם מדדי תשתית (throughput, latency, uptime) ולא בנצ'מרקים של יכולת סוכנית, אין נתוני SWE-bench, אין מדדי הצלחה במשימות computer-use, אין השוואה ל-Claude 3.5 Sonnet או GPT-4o עם tool use. ה-59.68% התאוששות משגיאות ספק הוא נתון תשתיתי, לא מדד לאיכות התיקון שהמודל מבצע. מי שבונה על זה לפרודקשן צריך להריץ הערכות משלו על המשימות הספציפיות, ולבדוק האם המגבלות של חלון הקשר והפילטרים מאפשרות את הניתוב האוטומטי כשדברים משתבשים.

בשורה התחתונה

Nex-N2.5-Pro מציע חבילה מעניינת: מודל סוכני עם יכולות computer-use מובנות, תמחור חינמי, וחלון הקשר גדול, הכל ארוז ב-API אחד שמנהל גם את לולאת המשוב החזותית. החסרון הברור הוא היעדר שקיפות על איכות הסוכנות עצמה: אין בנצ'מרקים פומביים, אין פירוט ארכיטקטורה, ואין התחייבות SLA מעבר לנתוני התשתית. לצוותים שמנסים להחליף סקריפטי אוטומציה שבירים או להאיץ QA ידני, שווה לנסות. למי שצריך ערבויות מדידות, עדיין מוקדם מדי.