21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מודלים

מודל שצופה בזמן שהוא מדבר

מודל שצופה בזמן שהוא מדבר

OpenMOSS שחררה את MOSS-VL, מודל ראייה-שפה פתוח של 11 מיליארד פרמטרים, שמשנה את האופן שבו מודלים מעבדים וידאו בזמן אמת. במקום לעבור על כל הפריימים לפני שהתשובה מתחילה לצאת, הגישה המקובלת עד היום, המודל דוגם פריימים חיים תוך כדי יצירת הטקסט, משתיק את עצמו כשהוא צריך "להסתכל", ומתקן את הפלט כשהסצנה משתנה.

תפיסה ויצירה משולבות

הארכיטקטורה מבטלת את שלב ה-pre-pass המסורתי. MOSS-VL מקבל זרם וידאו חי, מתחיל לענות, וכשהמודל מזהה שהוא זקוק למידע חזותי נוסף, הוא עוצר את הגנרציה, דוגם פריימים חדשים, וממשיך מנקודת העצירה. המנגנון הזה, ש-OpenMOSS מכנה "שתיקה יזומה" (proactive silence), מאפשר למודל להגיב לשינויים בסצנה בזמן אמת במקום להסתמך על ייצוג סטטי שנקבע בתחילת האינטראקציה.

תיקון עצמי דינמי

החידוש המשלים הוא "תיקון עצמי דינמי" (dynamic self-correction). כשהפריימים החדשים סותרים את מה שהמודל כבר אמר, למשל, אובייקט שזז, אדם שנכנס לפריים, או שינוי תאורה, המודל מזהה את הפער ומתאים את ההמשך. זה לא תיקון בדיעבד אחרי שהתשובה הסתיימה, אלא התאמה תוך כדי דיבור, בדומה לאיך שבני אדם מתקנים את עצמם באמצע משפט כשהם רואים משהו חדש.

מודל פתוח בגודל בינוני

ב-11 מיליארד פרמטרים, MOSS-VL ממוקם בקטגוריית הגודל הבינוני, קטן משמעותית ממודלי החזית הסגורים, אבל גדול מספיק כדי להריץ לוגיקת ראייה-שפה מורכבת על חומרה נגישה יחסית. השקת המשקלים בפתיחות מלאה מאפשרת לחוקרים ומפתחים לבחון את המנגנון המשולב, להריץ אבלציות על רכיבי השתיקה והתיקון, ולשלב את הגישה בפרויקטים בלי תלות ב-API סגור.

שינוי פרדיגמה בווידאו בזמן אע

המשמעות המעשית היא ש"הבנת וידאו בזמן אמת" מפסיקה להיות משימת עיבוד מקדים והופכת לתהליך מתמשך שרץ במקביל לגנרציה. עבור יישומים כמו רובוטיקה, ניטור אבטחה, או סיוע חזותי חי, הפער בין תפיסה לפעולה מצטמצם משניות לחלקיקי שנייה. OpenMOSS לא פרסמה בנצ'מרקים השוואתיים מול מודלים קיימים, אז הביצועים בפועל עדיין טעונים אימות עצמאי.