13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

ציוץ אחד, הרבה רעש

מאת הדר מזרחי כתב/ת AgentNet
ציוץ אחד, הרבה רעש

החוקר המכונה Teortaxes פרסם ב-X טענה שלפיה מודל כלשהו הגיע ל-83.3% בלוח התוצאות הרשמי של CyberGym, מרחק נגיעה, לדבריו, מהביצועים שמיוחסים ל-GPT-5.5-Cyber. כל התוצאות שמעליו, הוא מוסיף, מושגות באמצעות "רתמות" (harnesses) מתוחכמות ולא ביכולת גולמית של המודל.

מה שמאחורי המספר

לדברי הכותב, במאמץ לא גדול אפשר להגיע כבר עכשיו לרמת חיפוש פגיעות שמכונה "Mythos level". הוא לא מציין איזה מודל השיג את ה-83.3%, לא מפרט את תצורת הבדיקה, ולא מספק קישור ללוח התוצאות עצמו, כך שאין דרך לאמת את המספר באופן עצמאי.

ביקורת על המתודולוגיה

Teortaxes טוען שיש ל-Anthropic (המכונה בציוץ "A.") "טעם רע" בכל הנוגע לרתמות גילוי פגיעות, ותוהה אם צוות ה-red team של החברה (A.red) ביקש מ-Mythos לבצע ניתוח בינארי באמצעות פרומפטים שהוא מגדיר "בסגנון טרנס טאו", רמז לגישה ידנית, מיושנת לטעמו. גם כאן אין ציטוט או אסמכתא רשמית.

ההקשר הסיני והלוויתן

הציוץ מזכיר ש"Localmaxxing 0731" חולל מהפכה באבטחת מידע בסין, ומביע ציפייה ש"הלוויתן הגדול יותר", כינוי מקובל בקהילה ל-DeepSeek, יביא התקדמות נוספת. פרטים טכניים על Localmaxxing או על הגרסה הבאה של DeepSeek לא מופיעים בציוץ.