10 באוקטובר 2026 האקדמיה ארכיון
מבזקים
סוכנים עקפו בני אדם בצריכת טוקנים ב-OpenRouter, והפער רק מתרחב סיכום COLM 2026: Ai2 מציגה יעילות ארכיטקטונית וכלים למדענים אינסטינקט הגיע לשוק בשקט ונאלץ להתמודד עם מיוז ודוטס של ענקיות הטק מתמטיקאים מאמצים כלי בינה מלאכותית בקצב שמפתיע אפילו את החוקרים שעוקבים אחר התחום קלאודפלייר משיקה את Clef-Omni: מודל MoE מולטי-מודאלי להחלטות מובנות
מודלים

סוכנים עקפו בני אדם בצריכת טוקנים ב-OpenRouter, והפער רק מתרחב

סוכנים עקפו בני אדם בצריכת טוקנים ב-OpenRouter, והפער רק מתרחב

ב-6 בפברואר 2026, בפעם הראשונה, מפתחות API שסווגו כסוכניים (agentic) צרכו יותר טוקנים ממפתחות אנושיים ב-OpenRouter. בשבוע האחרון של ספטמבר היחס כבר עמד על פי שבעה לטובת הסוכנים, והמגמה לא מראה סימני האטה. הסיווג החודשי מתבסס על איתותים כמו תדירות קריאות לכלים, מספר תורות בשיחה, ומהירות הבקשות העוקבות.

איך נראית עומס עבודה סוכני

סוכן לא שואל שאלה ומחכה לתשובה, הוא משגר מחדש את כל ההקשר בכל צעד: פרומפט מערכת, הגדרות כלים, קבצים שנקראו, והיסטוריית כל קריאות הכלים עד אותו רגע. כל צעד מוסיף מעט מידע חדשה ומבקש תשובה קצרה. התוצאה: בספטמבר כ-90% מהטוקנים הסוכניים היו טוקני פרומפט במטמון (cached), לעומת כ-60% בינואר. טוקנים חדשים (novel) היו רוב השאר, ופלט יחד עם חשיבה (reasoning) תפס פרוסה זעירה של כ-1%. אצל בני אדם בצ'אט התמונה הפוכה: טוקנים חדשים הם עדיין הרוב, ופלט עם חשיבה מגיע לכ-12%, כי אנשים רוצים לקרוא תשובות, וסוכנים רוצים לבצע פעולות.

המטמון משנה את החשבון

טוקנים במטמון זולים דרמטית. במודלי חזית עדכניים של Anthropic, OpenAI ו-Google, קריאת מטמון עולה עשירית מטוקן קלט טרי וחמישים מטוקן פלט. ב-Claude Sonnet 5 למשל: 2 דולר למיליון טוקני קלט (כ-7.3 שקל), 10 דולר למיליון טוקני פלט (כ-36.5 שקל), ו-0.20 דולר למיליון טוקנים במטמון (כ-73 אגורות). הדגמים החדשים מרחיבים את הפער: Opus 5.5 ו-GPT-6.1 Sol מתמחרים קריאת מטמון ב-1/20 מעלות קלט ו-1/100 מעלות פלט; Fable 5.1 כבר מגיע ל-1/200 מעלות פלט.

דוגמה מספרית

מיליון טוקנים סוכניים בתמהיל ספטמבר (87% מטמון, 12% פרומפט חדש, 1% פלט) עולים כ-0.51 דולר (כ-1.86 שקל) לפי תמחור Sonnet 5 הנוכחי. בלי מטמון אותו מיליון היה עולה כ-2.08 דולר (כ-7.6 שקל), פי ארבעה. טוקנים במטמון הם כמעט תשעה מתוך עשרה טוקנים סוכניים, אבל רק כשליש מהחשבון. החישוב לא כולל פרמיות כתיבת מטמון (cache-write premiums) שחלק מהספקים גובים בפעם הראשונה שקידומת פרומפט נשמרת.

התעשייה מיישרת קו למטמון

הכלכלה דחפה את כל השרשרת לשפר שיעורי מטמון. דגמים שהושקו ברבעון השלישי של 2026 השיגו ממוצע של 88.2% מטמון בעומסים סוכניים, לעומת 54.8% בדגמי רבעון שני 2025. כל שכבה, מהאלגוריתם של OpenRouter, דרך יצרני המודלים, ועד ספקי ההרצה (inference providers), ראויה לקרדיט חלקי על הקפיצה.

ספקי ההרצה: מהפך תוך חודשים

בינואר רק 2 מ-35 ספקים הגיעו למעל 90% מטמון בטראפיק סוכני, שניהם בנפח זניח. החציון עמד על 44%, ואפילו הגדולים, Google ו-Anthropic, נעו בין 65% ל-80%. בספטמבר החציון כבר ב-85%. 11 מ-54 ספקים עברו 90%, בהם OpenAI (הבועה הגדולה בגרף), Together, Z.ai ו-DeepSeek שהובילו עם כ-96%. רק קומץ ספקים קטנים עדיין מתחת ל-70%.

מה זה אומר בפועל

לבוני סוכנים, שיעור מטמון הפך לאחד המנופים הגדולים על עלות. ליצרני מודלים וספקי הרצה, מטמון כבר לא "נחמד שיהיה", כשכמעט תשעה מעשרה טוקנים סוכניים הם קריאות מטמון, מחיר הטוקן השמור ואמינות הפגיעה במטמון הם חלק משמעותי ממה שלקוחות משלמים בפועל. מחירי הקלט והפלט הכותרתיים מספרים פחות ופחות מהסיפור מדי חודש.