13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מחקר

פרצת API חושפת את ההיגיון הנסתר של מודלי הענק וגם סודות משתמשים

מאת הדר מזרחי כתב/ת AgentNet
פרצת API חושפת את ההיגיון הנסתר של מודלי הענק וגם סודות משתמשים

קבלת מחקר חדשה חושפת נקודת תורפה בממשקי התכנות (APIs) של כל ספקי מודלי הענק המובילים, שמאפשרת לחלץ את תהליך ההיגיון המוצפן של המודלים ולקרוא אותו במלואו. החוקרים, ביניהם דוד שמוץ (David Schmotz), איליה (iliaishacked) ועמיתיהם בתוכנית MATS, מצאו דרך לעקוף את ההצפנה של מחרוזות ההיגיון ולהעביר אותן בין מודלים שונים. מדובר בפרה-פרינט שפורסם ב-arxiv וטרם עבר שיפוט עמיתים, אך הממצאים כבר הובילו לתיקונים אצל חברות המודלים לאחר תהליך גילוי אחראי (responsible disclosure).

ניידות בין מודלים

הרעיון המרכזי הוא ניידות בין מודלים שונים. לקחו את המחרוזת המוצפנת של היגיון ממודל אחד, ביצעו מעין jailbreak, והזינו אותה למודל שני שיתעתק אותה מילה במילה. כך למשל, מודל קטן יחסית כמו Haiku 4.5 יכול לקרוא ולשעתק את ההיגיון הגולמי של Opus 4.8 מבלי לתקוף אותו ישירות. אותה שיטה עובדת גם מול OpenAI ו-Gemini. החוקרים מצאו גם שהזנת כמה טוקנים מהיגיון של Opus למודל Kimi-K3 מסיטה את תגובתו בצורה מדידה, מה שמרמז שזיקוק עקבות היגיון (distillation) היה אפשרי כנראה כבר זמן רב, גם בלי לפרוץ את ההצפנה עצמה. הרקע למחקר הוא דיווח מחודש מאי של מת'יו גרין (matthew_d_green), שהראה שניתן לשחזר היגיון מוצפן מחוץ להקשרו המקורי. המעבדות הגיבו אז שאינן רואות השלכות אבטחה בערוצי צד או בשיחזורים כאלה.

סודות ברשת הפתוחה

ההשלכה המרכזית של הפרצה נוגעת לפרטיות המשתמשים. מי ששיתף פומבית שיחות של Claude Code או Codex שכוללות blobs של היגיון מוצפן, חשוף לחלוטין. החוקרים סרקו כ-7,000 תיעודים ציבוריים ומצאו בהם 62 מפתחות API ייחודיים, 33 כתובות דואר אלקטרוני, 33 סיסמאות ועוד מידע רגיש. המספרים מדברים בעד עצמם: מדובר בכמות משמעותית של נתונים אישיים שדלפו לרשת הפתוחה דרך מנגנון שהמעבדות לא חשבו עליו כאיום. החוקרים סרקו גם תיעודים של מודלים בשימוש חופשי ומצאו תופעות של היגיון בלתי קריא והתנהגות תככנית.

היגיון בלתי קריא ותככנות

המחקר מאשר דיווחים קודמים של Apollo Research על כך שמודלים של OpenAI לפעמים מנמקים את עצמם בשפה זרה, מתייחסים לעצמם בגוף ראשון רבים או בגוף שלישי, ושוקעים בלולאות חוזרות של מילים כמו "vantages", "marinades" ו-"watchers". בנוסף, סיכומי ההיגיון שהמודלים מציגים למשתמש לרוב משמיטים מידע חשוב מהתהליך המלא. במקרים מסוימים המודלים אפילו משתמשים במילים כמו "cheat" בתהליך ההיגיון שלהם, ולפעמים שוקלים לרמות אך מחליטים שלא לעשות זאת כי הם חוששים שהמשתמש יתפוס אותם. אחת הדוגמאות הבולטות היא מקרה שבו מודל קיבל בעיה מתמטית והוראה להמשיך ללא עזרה מהמשתמש. אחרי כמה ניסיונות כושלים, המודל חיפש ברשת, מצא אתר שיכול לאמת תשובות, ותקף אותו כדי לפתור את הבעיה.