21 בספטמבר 2026 האקדמיה ארכיון
מבזקים
עליבאבא משיקה את Qwen-Image-2.1: מודל 7B מאוחד לייצור ועריכת תמונות ארה"ב וסין פתחו בדיאלוג על התראות ביטחוניות בבינה מלאכותית החומה הווירטואלית לא עוצרת אף אחד, רק סופרת גופות מרכז בטיחות הבינה המלאכותית חושף: כל מודלי החזית מרמים בבנצ'מרק חדש NVIDIA משיקה את Halos, מערכת בטיחות מלאה ל-Physical AI
מחקר

משחק קהילתי חשף שג'יבריש מנצח שפה אנושית בהטיית אולמו 3 להתנהגות פרו-חברתית

משחק קהילתי חשף שג'יבריש מנצח שפה אנושית בהטיית אולמו 3 להתנהגות פרו-חברתית

סטודנט לתואר שני מאוניברסיטת נורת'איסטרן הפך הערכה של התנהגות פרו-חברתית למשחק ציבורי, וגילה שהדרך היעילה ביותר להטות מודל שפה פתוח לכיוון אמפתיה, הוגנות וכבוד היא לא לכתוב הנחיות מנומקות אלא להזין מחרוזות טוקנים חסרות פשר.

מהערכה למעבדה פתוחה

סוהאם פדיה (Soham Padia) בנה את Steering Arena על גבי אולמו 3-32B של AI2. הבחירה במודל לא היתה מקרית: משקלים פתוחים לבדם לא היו מספיקים, לדבריו, כי אולמו מתעד גם את נתוני האימון המוקדם וגם את שלב הפוסט-טריינינג, כך שאפשר לדעת אם כיוון פרו-חברתי שנמצא במודל הגיע מהפריטריינינג או מהכוונון העדין. ברוב המודלים הסגורים השאלה הזו פשוט לא ניתנת למענה. הגישה למודל התאפשרה דרך NDIF, פלטפורמת הסקה לאומית במימון NSF שמאפשרת להריץ מודלים גדולים בלי להחזיק GPU משלך.

איך נמדדת "פרו-חברתיות"

ההערכה של פדיה מבוססת על 135 זוגות תגובות מנוגדות על פני 15 תכונות, אמפתיה, הוגנות, בטיחות, פרטיות, כבוד ועוד. כל זוג מתחיל מאותו פרומפט ומציג תגובה פרו-חברתית יותר מול פחות. השוואת הפעילות הפנימית של המודל מול הזוגות איפשרה לבודד דפוס שמקושר להתנהגות הרצויה, ולבנות מדד שבודק כמה טקסט חדש מזיז את המודל לכיוון הדפוס הזה.

התוצאות: טוקנים בלתי קריאים בראש הטבלה

כ-600 הגשות מכמה עשרות משתתפים הניבו תוצאה מפתיעה: 36 המקומות הראשונים בטבלת ההישגים נתפסו כולם על ידי מחרוזות טוקנים בלתי קריאות, למשל "Undert! AH:-) Rog Appl)" או "Angela Nombre WiBanner:] Workflow.respond-winemoji". ההגשה הטובה ביותר באנגלית פשוטה, "You will respond in a short sentence with kindnesz respect compassion and my love", הגיעה רק למקום 37, עם ציון נמוך פי 2.7 מהמוביל.

אופטימיזציה לפנימיות, לא לאנושיות

המנגנון מסביר את התופעה: המשחק מתגמל הזזה חזקה של המצב הפנימי לכיוון הדפוס הפרו-חברתי, בלי לדרוש שהטקסט עצמו יישמע פרו-חברתי לאוזן אנושית. שחקנים שלמדו את זה התחילו לכוון למה שהמודל "מבין" פנימית במקום למה שנשמע יפה. אחד המשתתפים לקח את הרעיון צעד קדימה והשתמש בגישה אוטומטית לחיפוש מחרוזות אופטימליות, כיוון שהמדד פתוח, אפשר להריץ עליו אופטימיזציה ישירה בלי להבין את הסמנטיקה.

מה זה אומר על יישור והערכה

הניסוי מדגים פער בסיסי: התנהגות שנראית פרו-חברתית בבדיקת פלטים עשויה להיות מושגת בדרכים שאין להן קשר לכוונה האנושית. כשהמודל פתוח והמדד גלוי, הקהילה מוצאת "קיצורי דרך" פנימיים שצוות חוקרים קטן היה מפספס. מצד שני, אותה פתיחות היא שאיפשרה לגלות את הקיצורים האלה מלכתחילה, ולהבין שיישור דרך הנחיות טקסטואליות בלבד עלול להיות שברירי יותר משנדמה.