27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מודלים

ציוץ אחד, הרבה רעש

ציוץ אחד, הרבה רעש

החוקר המכונה Teortaxes פרסם ב-X טענה שלפיה מודל כלשהו הגיע ל-83.3% בלוח התוצאות הרשמי של CyberGym, מרחק נגיעה, לדבריו, מהביצועים שמיוחסים ל-GPT-5.5-Cyber. כל התוצאות שמעליו, הוא מוסיף, מושגות באמצעות "רתמות" (harnesses) מתוחכמות ולא ביכולת גולמית של המודל.

מה שמאחורי המספר

לדברי הכותב, במאמץ לא גדול אפשר להגיע כבר עכשיו לרמת חיפוש פגיעות שמכונה "Mythos level". הוא לא מציין איזה מודל השיג את ה-83.3%, לא מפרט את תצורת הבדיקה, ולא מספק קישור ללוח התוצאות עצמו, כך שאין דרך לאמת את המספר באופן עצמאי.

ביקורת על המתודולוגיה

Teortaxes טוען שיש ל-Anthropic (המכונה בציוץ "A.") "טעם רע" בכל הנוגע לרתמות גילוי פגיעות, ותוהה אם צוות ה-red team של החברה (A.red) ביקש מ-Mythos לבצע ניתוח בינארי באמצעות פרומפטים שהוא מגדיר "בסגנון טרנס טאו", רמז לגישה ידנית, מיושנת לטעמו. גם כאן אין ציטוט או אסמכתא רשמית.

ההקשר הסיני והלוויתן

הציוץ מזכיר ש"Localmaxxing 0731" חולל מהפכה באבטחת מידע בסין, ומביע ציפייה ש"הלוויתן הגדול יותר", כינוי מקובל בקהילה ל-DeepSeek, יביא התקדמות נוספת. פרטים טכניים על Localmaxxing או על הגרסה הבאה של DeepSeek לא מופיעים בציוץ.