30 בספטמבר 2026 האקדמיה ארכיון
מבזקים
ראנוויי משיקה סוכן עם תיוג נכסים ומציגה שלוש פלטפורמות על גבי מודל עולם כללי OpenAI משיקה את Dots, סוכנים אישיים שפועלים ברקע בלי השגחה מפגינים חוסמים את שערי DevDay של OpenAI GPT-6.1 סול מחליף את קודמו אחרי שבוע בלבד, ומתקרב לביצועי אסטרה ברבע מחיר חוקרי NVIDIA מציגים את Physis-Lang: שפה פיזיקלית שמקפיצה את Cosmos 3 מעל Veo 3.1
מודלים

חוקרי NVIDIA מציגים את Physis-Lang: שפה פיזיקלית שמקפיצה את Cosmos 3 מעל Veo 3.1

חוקרי NVIDIA מציגים את Physis-Lang: שפה פיזיקלית שמקפיצה את Cosmos 3 מעל Veo 3.1

הבעיה: מודלי וידאו לא מבינים פיזיקה

מודלי עולם לווידאו יודעים לייצר קליפים משכנעים ועדיין לשבור חוקי פיזיקה בסיסיים, חמאה נמרחת כמו צבע, כדורים חוצים קירות. צוות חוקרים של NVIDIA יחד עם MIT ואוניברסיטת אוקספורד טוען שהתיקון לא יגיע מאותות ויזואליים, לטנטיים או מספריים נוספים, אלא מהשפה עצמה. המסגרת שפיתחו, Physis-Lang, מתייחסת לשפה פיזיקלית כייצוג משותף ובר-אופטימיזציה: אותו טקסט מניע איסוף נתונים, אימון והסקה. בטבלת המובילים Physics-IQ Verified מתאריך 29 בספטמבר 2026, Physis-Lang על גבי Cosmos3-Super תופס את המקום הראשון עם 48.2 ± 1.4, וגרסת Nano מדורגת שנייה עם 43.3 ± 1.5.

איך Physis-Lang עובד: כיתוב שמתפתח בעצמו

כיתובים רגילים מתארים מה קורה, לא למה. "חמאה נמסה כשהטמפרטורה עולה" לא אומר דבר על העברת חום או כבידה. Physis-Lang מוסיף שדה physics_reasoning לכל כיתוב בסיסי, ישויות, סיבות, אינטראקציות, עקרונות שליטים, התפתחות זמנית ותוצאות. בנוסף, הצינור מייצר physics_negative_prompt ייעודי לסצנה, שמתאר תוצאות בלתי-סבירות (אבן צפה על מים) ומשמש כתנאי שלילי בזמן הסקה. לולאת הכיתוב המתפתחת משאירה את הכותב (GPT-5.5) קפוא ומעדכנת רק את ההנחיה שלו. Gemini-3.1-Pro משמש כמבקר מודע-פיזיקה ונותן ציון בשני ממדים: דיוק (כל טענה אטומית נבדקת מול הווידאו) ושליפות (כל קביעה אנושית מאומתת חייבת להופיע במפורש או להיגזר מהכיתוב). סוכן אבולוציה קורא את הציונים ואת הכשלים ברמת הטענה, וכותב מחדש את ההנחיה. התיקוף נעשה על PhysCapBench, בנצ'מרק חדש של 246 סרטונים ו-3,794 קביעות מאומתות. F1 של הכיתוב עלה מ-78.64 באיטרציה 1 ל-87.82 באיטרציה 9; הדרך לא הייתה חלקה, איטרציה 2 הפכה את הכיתובים לזהירים מדי והורידה F1 ל-76.28. באיטרציה 9 נדרש כל צעד סיבתי נראה לעין, ודגימת הפריימים עלתה מ-2 ל-4 fps.

איסוף נתונים מונחה שפה: לא רק מראה עיניים

סוכן אבחון מבוסס GPT-5.5 ממפה כשלי וידאו שנוצר לקטגוריות פיזיקליות, תנועת גוף קשיח, התנגשות, דינמיקת נוזלים. פרופיל החוסרים הזה מוצלב מול תגי פיזיקה בגלריית וידאו גדולה, כך שהאחזור מכוון לתוכן פיזיקלי ולא למראה ויזואלי. סט האימון הסופי מכיל 183 אלף סרטונים: 71 אלף שסוננו מ-WISA-80K ועוד 112 אלף שנאחזרו. האחזור לבדו הוסיף 3.01 נקודות בממוצע על פני שלושה בנצ'מרקים; ב-VideoPhy-2 תהליכים כימיים ותרמיים כל אחד הרוויח 8.00 נקודות.

תוצאות: ניצחון על Veo 3.1 ברוב המדדים

הכוונון העדין נעשה ב-LoRA על ההקרנות של מנגנון הקשב, בלי שינוי ארכיטקטורה או פונקציית מטרה. מול Veo 3.1 של גוגל, Cosmos3-Nano עם Physis-Lang משיג: PhyGenBench, 71.04 מול 65.63; Physics-IQ Verified, 43.41 מול 34.99; PhyGround, 69.90 מול 69.24; VideoPhy-2, 68.02 מול 68.87 בסט המלא, ו-62.36 מול 58.43 בפיצול הקשה. השיפורים חוזרים על עצמם בבקבונים שונים: +7.05 על Wan2.1-14B, +3.24 על Cosmos3-Edge-4B, +6.22 על Cosmos3-Nano-16B ו-+5.02 על Cosmos3-Super-64B. איכות כללית נשארה יציבה ב-VBench-I2V, שם Cosmos3-Nano זז מ-88.32 ל-88.69. גם הנחיה בלבד עוזרת: חשיבה פיזיקלית עם פרומפטים שליליים הקפיצה Cosmos3-Nano קפוא ב-PhyGenBench מ-61.67 ל-67.29.

ריצה מקומית: בלי חשבון API של עשרות אלפי דולרים

הצוות זיקק את הצינור המסחרי לשני מודלי Qwen3-VL-4B-Instruct: PhysThinker-C לכיתוב ו-PhysThinker-U להעשרת פרומפטים. על Wan2.1-14B, הצינור המסחרי נתן +7.05 בעלות API של כ-24,120 דולר (כ-89 אלף שקל). החלפה ב-PhysThinker-C שמרה +6.76 בעלות של כ-120 דולר (כ-440 שקל). סטאפ מקומי מלא עלה אפס דולר ועדיין הוסיף +4.76.

מקור: marktechpost.com