24 בספטמבר 2026 האקדמיה ארכיון
מבזקים
בינה מלאכותית לומדת להרכיב רהיטים, וזה משנה את כללי המשחק StrictlyVC חוזר ל-Disrupt עם פוקוס על חוקי המשחק החדשים בוונצ'ר פיירוורקס חותכת בחצי את גודל הדלתא ב-RL ומאפשרת אימון חוצה-אזורים מעשי אופן-איי משיקה בנצ'מרק פתוח לשיחות בריאות נפש, ומסתבכת עם הקטגוריות שלה עצמה ג'מיני 4 מתקרב להשקה, אומר ראש דיפמיינד החדש
מוצרים

אופן-איי משיקה בנצ'מרק פתוח לשיחות בריאות נפש, ומסתבכת עם הקטגוריות שלה עצמה

אופן-איי משיקה בנצ'מרק פתוח לשיחות בריאות נפש, ומסתבכת עם הקטגוריות שלה עצמה

אופן-איי (OpenAI) שחררה בסוף השבוע את MentalHealthBench, בנצ'מרק פתוח ראשון מסוגו שמנסה לכסות את מלוא הספקטרום של שיחות בריאות נפש שמשתמשים מנהלים עם מודלי שפה, מתמיכה יומיומית ועד תרחישי משבר חריפים. עד עכשיו, רוב המדדים בתחום התמקדו כמעט אך ורק במצבי חירום; הפער הזה השאיר חוקרים בלי דרך שיטתית להעריך איך מודל מתפקד בשיחה שגרתית יותר, שבה הסיכון נמוך אבל הניואנסים רבים.

מה כולל הבנצ'מרק ואיך נבנה

לפי החברה, הפיתוח נעשה בשיתוף יותר מ-80 קלינאים מתחום בריאות הנפש, שהגדירו תרחישים, קריטריוני הערכה וסיווגי סיכון. התוצאה היא סט מבחנים שמחולק לרמות חומרה שונות, ולא רק למקרי קצה אובדניים. אופן-איי מצהירה שהבנצ'מרק ישוחרר בקוד פתוח כדי שקבוצות מחקר אחרות יוכלו להריץ אותו על מודלים מתחרים ולהשוות תוצאות על אותה קרקע, צעד שנדיר לראות ממובילת שוק ששומרת בדרך כלל את מתודולוגיות ההערכה קרוב לחזה.

הביקורת: "תלות רגשית" אינה אבחנה

לא כולם קונים את המסגרת הקטגוריאלית. חוקרים ומטפלים שהגיבו לפרסום הצביעו על כך שהבנצ'מרק מכניס לאותה מקראת סיווג (legend) את הקטגוריה "תלות רגשית" (emotional reliance) לצד פסיכוזה ופגיעה עצמית, אף שאין אבחנה קלינית כזו ב-DSM או ב-ICD. הטענה המרכזית: אופן-איי המציאה מצב רפואי לכאורה שמתאר את המשתמשים שלה עצמה, ואז בנתה מדד שמודד אותו. במילים אחרות, החברה מגדירה את הבעיה ואז מודדת כמה המודל שלה "פותר" אותה, בלי תיקוף חיצוני של הקטגוריה עצמה.

ממצא נפרד: ניתוב מודלים נסתר בצ'אט-ג'יפיטי

במקביל, חוקר עצמאי פרסם ניתוח של קובץ HAR (HTTP Archive) מתוך שיחה בצ'אט-ג'יפיטי (ChatGPT) שבה נבחר GPT-5.6 Thinking כמודל ברירת מחדל. מתוך 70 תורות שיחה (turns) שנלכדו, 17 הכילו מטא-דאטה של ניתוב (routing metadata) שמצביע במפורש על GPT-5.4, גרסה קודמת יותר. המשמעות: המערכת החליפה מאחורי הקלעים בין גרסאות מודל שונות במהלך אותה שיחה, בלי ליידע את המשתמש. אופן-איי לא הגיבה רשמית על הממצא הזה נכון למועד הפרסום.

מה זה אומר למחקר ולשקיפות

שחרור בנצ'מרק פתוח עם מעורבות קלינית רחבה הוא צעד בכיוון הנכון, סוף סוף יש מסגרת השוואה שלא מסתפקת במקרי קצה. אבל הקטגוריה הבעייתית של "תלות רגשית" מעלה שאלות קשות על תוקף בנייה (construct validity): אם אתה מודד משהו שלא קיים קלינית, התוצאה לא אומרת הרבה על בריאות נפש. תוסיפו לזה את הניתוב הנסתר בין גרסאות מודל, ותקבלו תמונה שבה גם המדד וגם סביבת ההרצה פחות שקופים ממה שהכותרת מרמזת. חוקרים שירצו להשתמש ב-MentalHealthBench יצטרכו להחליט אם לאמץ את הסיווג כמו שהוא, או לפצל את הקטגוריה השנויה במחלוקת ולדווח בנפרד.