גוגל משחררת את ToolGrad: מסגרת "תשובה תחילה" מגיעה ל-99.8% הצלחה בייצור נתוני קריאות כלים

צוות חוקרים מגוגל, אוניברסיטת טוקיו, RIKEN AIP ואוניברסיטת טוהוקו פרסם את ToolGrad, מתודה שהופכת את הסדר המקובל בייצור דאטה לאימון מודלים לקריאות כלים (function calling). במקום להתחיל משאילתת משתמש ולחפש שרשרת כלים שתספק אותה, ToolGrad בונה קודם שרשרת מאומתת על ידי הרצה בפועל של ה-API, ורק אחר כך מצמיד לה שאילתה תואמת. התוצאה: מודלי Gemma-3 שעברו כוונון עדין על 500 דוגמאות בלבד (ToolGrad-500) מגיעים לציונים שמתיישרים עם מודלים קנייניים מובילים בבנצ'מרק BFCL.
הבעיה עם גישת "שאילתה תחילה"
צינורות קודמים דוגמת ToolBench ו-ToolACE פעלו בכיוון ההפוך: דגמו מאגר APIs, ביקשו מ-LLM להמציא הוראת משתמש סבירה, ואז הפעילו סוכן חיפוש לעומק (DFS) בניסיון למצוא נתיב כלים שימלא אותה. החיפוש לא מבטיח הצלחה; כשהוא נתקע במבוי סתום, משאבי החישוב שהושקעו בחקירה יורדים לטמיון והדוגמה נזרקת. המאמר מגדיר את התהליך כזיקוק מסלולים יקרים מסוכן מורכב שנכשל לעיתים קרובות, חוסר יעילות מובנה.
ארבעה מודולים בלולאה סגורה
ToolGrad הופך את הסדר. כל איטרציה מריצה ארבעה מודולים ברצף: API Proposer מצמצם קבוצה מדוגמת של APIs למועמדים בודדים שיכולים להאריך את זרימת העבודה; API Executors מריצים את המועמדים במקביל ומחזירים דוחות הרצה מפורטים; API Selector בוחן את הדוחות, בוחר את הקריאה המוצלחת ביותר ומוסיף אותה לשרשרת, המשוב הטקסטואלי שלו משמש כגרדיאנט מכוון; LLM Updater משכתב את השאילתה הסינתטית ואת תשובת המודל כך שיתאימו לקבוצת ה-API המעודכנת. ברירת המחדל במאגר רצה 10 איטרציות על 50 APIs מדוגמים לכל זרימת עבודה, ומפיקה דוגמה אחת שלמה: שאילתה, שרשרת כלים מאומתת, ותשובה סופית.
יעילות ייצור על ToolBench
החוקרים בחנו את ייצור הדאטה על מאגר ToolBench שמכיל מעל 16,000 APIs אמיתיים, והשוו את ToolGrad לגישת ה-DFS המקורית. לפי המאמר, שיעור ההצלחה (pass rate) קפץ מ-63.8% ל-99.8%; מספר הקריאות המאומתות לכל דוגמה עלה מ-2.1 ל-3.4, כלומר שרשראות ארוכות יותר; מספר צעדי הכלים (tool-use steps) ירד מ-34.3 ל-20.0; ומספר הקריאות ל-LLM לכל דוגמה ירד קלות מ-64.5 ל-63.9. 0.2% הנותרים נכשלו כשהסוכן לא הצליח לקבל תגובה מוצלחת משלושה APIs שנבחרו לאורך כל 10 האיטרציות, ונשמרה דוגמה ריקה.
תוצאות BFCL עם Gemma-3
את ToolGrad-500 ייצרו החוקרים באמצעות Gemini 2.5 Flash-Lite, והשתמשו בו לכוונון־המשך (post-training) של Gemma-3 בגדלים 1B, 4B ו-12B פרמטרים. ההערכה נעשתה על Berkeley Function Calling Leaderboard, שמשתמש בסט כלים שונה מ-ToolBench, מבחן out-of-distribution עם כלים בלתי מוכרים. הממצאים: כוונון על ToolGrad-500 שיפר את ציוני קריאות הכלים בכל הגדלים. ToolGrad-12B השיג 83.1, לעומת Gemini 2.5 Pro עם 83.2, Claude 4.5 Opus עם 82.8, ו-GPT-5 עם 74.4 (כפי שנמדדו במועד הפרסום). התלמיד בגודל 12B עקף את מודל המורה שיצר את נתוני האימון שלו, והוביל על מומחי קוד פתוח לקריאות כלים דוגמת ToolACE ו-Hammer-2.1-7B.
זמינות ושחזור
הקוד משוחרר ברישיון Apache-2.0, הדאטה סט ToolGrad-500 והמודלים (1B, 4B, 12B) זמינים ב-Hugging Face, ויש חבילת PyPI להתקנה מהירה. סקריפטי השחזור במאגר מכוונים ל-BFCL V1 ו-V2 דרך פורק מותאם, ומריצים אינפרנס בתוך קונטיינר vLLM Docker, מה שמאפשר להריץ את הפייפליין במלואו בלי תלות בשירותים חיצוניים.