21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

חוקרים מברקלי משיקים את CUA-Lite, פלטפורמה פתוחה שמאחדת סביבות, נתונים ואימון לסוכני מחשב

חוקרים מברקלי משיקים את CUA-Lite, פלטפורמה פתוחה שמאחדת סביבות, נתונים ואימון לסוכני מחשב

צוות חוקרים של UC Berkeley שחרר את CUA-Lite, פלטפורמה פתוחה לסוכני שימוש במחשב (Computer-Use Agents, או CUAs) שמתמקדת בתשתית ולא במודל. הטענה המרכזית: אימון והערכה של CUA דורשים ארבעה רכיבים, סוכנים, סביבות, עקבות (traces) ופריימוורק להערכה ואימון, וכיום כולם מפוזרים בין ריפוזיטוריז נפרדים עם ממשקים לא תואמים. CUA-Lite מרכז אותם מאחורי מרחב פעולה אחד, סכמת נתונים אחת ופקודה אחת, שפועלת על דסקטופ, דפדפן ומובייל.

מה שמאחורי הקונטיינר

התרומה הקונקרטית ביותר היא Lite.OSWorld. OSWorld המקורי מספק סביבת אובונטו נאמנה, אבל מגיע כמכונת QEMU/KVM מלאה לכל משימה, מה שדורש וירטואליזציה מקוננת שרוב התשתיות המנוהלות לא חושפות. CUA-Lite משחזר את אותה סוויטת משימות ואותם מעריכים על GNOME בתוך קונטיינר דוקר פשוט. החשש הטבעי הוא נאמנות (fidelity), והצוות מתייחס אליו ישירות: על פני 13 מודלים, הציונים ב-Lite.OSWorld זהים לאלה של OSWorld VM, כך שאות אימון או ציון שנמדד בקונטיינר עובר בחזרה לבנצ'מרק האמיתי. אותה בסיס נושא כעת משפחת ארגזי חול: Lite.ScaleCUA, Lite.CUAGym ו-Lite.CUAWorld, האחרון מתרחב לכ-40 אפליקציות בהן Blender, QGIS ו-VS Code. בסך הכל הפלטפורמה טוענת ל-30 אלף פלוס משימות ניתנות לאימות. Lite.OSWorld רץ ב-0.9 ג'יגה מול 4.1 ג'יגה של ה-VM, בערך פי 4.6 יותר דסקטופים מקבילים על אותו חומרה.

סכמה אחת, אדפטר לכל מודל

השכבה השנייה היא LiteSample, סכמת למידה מונחית (supervised) יחידה המשותפת לכל סביבה, סוכן וסוג משימה, ארוזה כ-Parquet פשוט בתוספת תמונות. יותר מעשרה דאטה-סטים קיימים של CUA עובדו לתוכה ופורסמו חופשית ב-Hugging Face, ביניהם Aguvis, OpenCUA, ScaleCUA, GUI-360, GUIOdyssey ו-Multimodal-Mind2Web. לצד הקורפוסים האלה יושבים דאטה-סטי rollout טריים שנוצרו על ידי הרצת מודל מורה מתקדם דרך ארגזי החול, לצורך זיקוק (distillation) למודלים קטנים יותר. מכיוון שמשפחות מודלים מצפות לפיגומים שונים, הפריימוורק מגיע עם אדפטר פר-מודל שאורז LiteSample מאוחד לפורמט האימון הייעודי של כל מודל, כולל קיפול היסטוריה (history collapsing) כך שמספר צעדים חולקים forward pass אחד.

אימון והערכה מאחורי פקודה אחת

סוכנים וסביבות נפגשים ב-lite.gym: צילומי מסך למעלה, פעולות למטה, עם מרחב פעולה אחד לכל פלטפורמה. יותר מעשרה סוכנים מובנים, GPT, Claude, Gemini, Qwen3-VL, UI-TARS, Fara-7B, MAI-UI ואחרים, ולמעלה מ-15 בנצ'מרקים משולבים, המכסים קרקוע (ScreenSpot-Pro, OSWorld-G), דסקטופ (OSWorld, OSWorld-2, WindowsAgentArena, CUABench), דפדפן (WebArena, VisualWebArena, MiniWoB, WebVoyager, Online-Mind2Web, WebGym) ומובייל (AndroidWorld, AndroidLab, MobileWorld, MobileGym). החלפת --model-id ו- --env-id ב-scripts/rollout.py היא כל הממשק. אותו לולאה משרתת אימון: ל-SFT, ה-README מתעד כוונון עדין של Qwen3-VL-2B-Instruct על מסלולי Lite.ScaleCUA דסקטופ, שהעלה החזר פרק ממוצע מ-0.138 ל-0.237 בפיצול הערכה של 332 משימות lite.osworld, קונפיגורציה יחידה שדווחה על שני GPU, לא תוצאה ששוחזרה עצמאית. ל-RL, rollouts שמקבלים ציון בסביבה מניעים עדכוני GRPO מעל Slime, עם דוגמה עובדת של MobileGym המכסה 416 משימות מובייל על פני 28 אפליקציות.

פריסה בלי כאב ראש

הסטאק מותקן ב-uv sync --all-extras על Python 3.12, והארגזים הקלים רצים על כל מארח דוקר בלי /dev/kvm, כך שאינסטנסים בענן, ראנרים של CI וקונטיינרים מקוננים כולם עובדים. עבור חוקרים ומהנדסים שבונים סוכני מחשב, המשמעות היא שאפשר להריץ ניסויים בקנה מידה על תשתית סטנדרטית בלי להילחם בוירטואליזציה מקוננת, ועם הבטחה שאות האימון תקף גם בבנצ'מרק המקורי.

מקור: marktechpost.com