OpenAI משפרת את מנגנון ה-Prompt Caching ב-GPT-6, הנחות של עד 90% על טוקנים במטמון

OpenAI הכריזה על שדרוג למנגנון ה-Prompt Caching בממשק ה-API של GPT-6, שמבטיח להאיץ פעולת סוכנים (agents) ולהוזיל עלויות באמצעות שיעורי פגיעה במטמון (cache-hit rates) גבוהים יותר כברירת מחדל. לפי ההודעה, יותר טוקני קלט יזכו להנחת cached-input של עד 90%, מה שאמור להתבטא בחיסכון ישיר לכל קריאה שמשתמשת בקונטקסט חוזר.
דשבורד חדש ו-API לאבחון
לצד השיפור האוטומטי, החברה משיקה דשבורד ייעודי ב-platform.openai.com שמאפשר לראות בזמן אמת אילו חלקים של הפרומפט ממוחזרים ואילו מונעים פגיעה במטמון. נוסף על כך, נוספה אפשרות לשאול את ה-diagnostics API אילו שינויים בפרומפט חסמו שימוש חוזר, ולקבל הערכה של מספר הטוקנים שהושפעו, כלי שמיועד לקצר את לולאת הניסוי-וטעייה כשמנסים להבין למה המטמון לא עובד כמצופה.
שליטה מפורטת בהתנהגות המטמון
המפתחים מקבלים כעת שלוש ידיות כוונון מפורשות: הגדרת cache breakpoints שקובעות אילו קידומות פרומפט ימוחזרו, אפשרות לשנות את רמת המאמץ המחשבתי (reasoning effort) ואת זמינות הכלים בלי לאבד את הקונטקסט השמור, ומנגנון prewarm שטוען מראש קונטקסט משותף כדי שהתשובה הראשונה תצא מהר יותר. כל אחת מהיכולות האלה נועדה לאפשר התאמה עדינה יותר לארכיטקטורה של אפליקציות מרובות-סבבים (multi-turn) ולסוכנים שמחזיקים מצב לאורך זמן.
מה זה אומר למפתחים בפועל
בשורה התחתונה, השינוי מזיז את נטל האופטימיזציה מהקוד שלכם אל התשתית של OpenAI, במקום לבנות לוגיקת מטמון משלכם או לקצץ פרומפטים ידנית, אפשר לסמוך על שיעורי פגיעה גבוהים יותר כברירת מחדל ולהיעזר בדשבורד וב-API כדי לאתר צווארי בקבוק כשהם מופיעים. ההנחה של 90% על טוקנים במטמון נשארת בגדר תקרה תיאורטית; המימוש בפועל תלוי בדפוסי השימוש הספציפיים של כל אפליקציה, והכלים החדשים נועדו בדיוק כדי למדוד את הפער הזה.