25 בספטמבר 2026 האקדמיה ארכיון
מבזקים
מייסדי Anthropic דורשים שליטה בהצבעה לקראת הנפקה מטא דוחפת את מיוז בכל הכוח והאפליקציה ממריאה אסטרה ואופוס 5 פיצחו שתי הודעות אניגמה שנותרו בלתי פתורות סטארטאפ ישראלי אחד עומד במרכז גל בריחות של סוכני AI מיקרוסופט משיקה את קופיילוט בגרסת "סופר אפליקציה" שמאחדת צ'אט, קוד וסוכנים
מחקר

פרפליקסיטי מפחיתה כשלי כלי ב-21% באימון על טעויות משתמשים אמיתיות

פרפליקסיטי מפחיתה כשלי כלי ב-21% באימון על טעויות משתמשים אמיתיות

השיטה: לא רק לחקות הצלחות

צוות המחקר של פרפליקסיטי פרסם פוסט המתאר שיטת פוסט-טריינינג חדשה לסוכן המחשב שלהם. במקום לדגום רק סשנים שהסתיימו בהצלחה, הגישה הסטנדרטית של Rejection Sampling Fine-Tuning, המודל לומד מכלל האינטראקציות, כולל אלה שנכשלו. הרעיון פשוט: תוצאה נכונה לא מבטיחה שכל צעד היה תקין, וסוכן יכול להתאושש משגיאת כלי ועדיין לספק תשובה נכונה. חיקוי מסלול כזה עלול לחזק את הטעות, וזריקת סשנים כושלים משליכה לפח ראיות ברורות לשגיאות שניתן להימנע מהן.

שלוש דרכים לטפל בכל תור

הפייפליין מחלק כל תור של העוזר לאחד משלושה טיפולים: חיקוי (Imitate), תורים ללא שגיאות בסשנים מוצלחים מקבלים Cross-Entropy loss רגיל; תיקון (Correct), תורים שזוהתה בהם שגיאה ומגיע אליהם רמז מאומת מקבלים KL-divergence loss, בלי קשר אם הסשן הצליח או נכשל; הקשר בלבד (Keep as context), שאר התורים נשארים בקלט אבל לא תורמים ל-loss. כך סשן מוצלח יכול לספק גם יעדי חיקוי וגם יעדי תיקון, וסשן כושל תורם רק תיקונים.

איך רמז הופך לאות אימון

רמז (hint) הוא הוראה מתקנת קצרה המבוססת על מידע שכבר היה זמין למודל. בדוגמה אחת, קריאת חיפוש הגדירה recency_filter ל-'year' בעוד הסכימה מתירה רק 'day', 'week' או 'month'. הרמז מציין את הקריאה הכושלת, את שגיאת הוולידציה, ומציע ערך מותר או השמטת השדה האופציונלי. החלק המתקן משתמש ב-On-Policy Self-Distillation: אותו צ'קפוינט של GLM 5.2 רץ פעמיים על התור המתועד, המורה רואה את הרמז, התלמיד לא. שניהם משתמשים ב-teacher forcing, כך שאין יצירת תשובה חלופית. ההסתברויות של המורה לטוקן הבא מנותקות ומשמשות יעד רך דרך forward KL. ה-loss המשולב הוא (CE + λ × KL) חלקי מספר הטוקנים המחוקים; כש-λ שווה אפס חוזרים ל-SFT רגיל, וה-CE term קריטי כי אימון תיקון בלבד עלול לאפשר למורה ולתלמיד להסכים על ידי התעלמות מההקשר.

פייפליין הנתונים והערכת שופטים

מקור הנתונים הוא סשנים כשירים לאימון של Computer שהוגשו על ידי GLM 5.2, בניכוי מידע אישי ומשתמשים שבחרו opt-out. שופט LLM משאיר רק משימות שדורגו 4 או 5 בסולם קושי של 5 נקודות. שני שופטי LLM חייבים לאשר את התוצר הסופי כדי שסשן ייחשב מוצלח. למשוב משתמשים, שלושה שופטי LLM מאתרים את התור האחראי, ולפחות שניים חייבים להסכים, צעד הכרחי כי התור האחרון לפני תלונה הוא שורש הבעיה רק בכמחצית מהמקרים. כל רמז נבדק מול המידע שהיה זמין לפני הטעות, כדי לצמצם הטיית בדיעבד. בדוגמה אחת, משתמש ביקש 'w3' בפייצ'קס (Paychex), המודל הניח שגיאת הקלדה של W-2 וחיפש את הטופס הלא נכון; הרמז מכוון לאותה פרשנות מוקדמת, לא רק לתשובה הסופית.

רמזים עובדים עוד לפני האימון

בהערכה אופליין על 985 תורי שגיאות-כלי שמורים, המודל הבסיסי הלא-מאומן נמנע מהכישלון המקורי ב-93.7% מהמקרים כשקיבל רמזים, לעומת 75.1% בלעדיהם. שיעור הפעולות המתוקנות עלה מ-60.6% ל-82.3%. בתורי משוב משתמשים, שיעורי תיקון או מסלול-נכון עלו מ-40.0% ל-75.0% כשהייתה ראיה מפורשת, ומ-32.5% ל-80.0% כשהיה צורך להסיק כוונה. המספרים מרשימים, אבל מדובר בהערכה פנימית על מדגם מוגבל, לא בנצ'מרק חיצוני שעבר ביקורת עמיתים.

לא זמין להורדה, רק כאופציה במוצר

המודל המאומן לא שוחרר כמשקולות פתוחות ולא קוד אימון; הוא רץ רק כאופציית מודל בתוך פרפליקסיטי Computer. מודל הבסיס, GLM 5.2, זמין פומבית ב-Hugging Face, כלומר משקולות פתוחות, לא קוד פתוח במובן המלא. עבור מפתחים שבונים סוכנים משלהם, השיעור המעשי כאן הוא מתודולוגי: הפרדה בין חיקוי לתיקון, שימוש ברמזים מבוססי-הקשר, וזיקוק עצמי על-מדיניות (on-policy) הם כלים שאפשר לאמץ גם בלי הגישה ללוגים של פרפליקסיטי.

מקור: marktechpost.com