פוקט FM מציגה מודל עולם נרטיבי ששומר על עקביות לאורך פרקים ארוכים

פוקט FM (Pocket FM) חושפת את שרפה (Sherpa), מערכת זיכרון נרטיבית שמתיימרת לפתור את אחת הבעיות הקשות בכתיבה אוטומטית של סיפורים ארוכים: שמירה על עקביות דמויות, יחסים וקווי עלילה לאורך עשרות פרקים. המערכת בנויה כ-Narrative World Model, מודל שעוקב אחרי מה שכל דמות יודעת, איך היחסים ביניהן משתנים, ואילו קווי עלילה נותרו פתוחים, ומזין את המידע הזה למודל שפה בעת הכתיבה.
איך זה עובד בפועל
במקום להסתמך על חלון הקשר (context window) או על אחזור וקטורי פשוט, שרפה בונה גרף ידע דינמי של העולם הבדיוני. כשהמודל צריך לכתוב פרק חדש, המערכת שולפת רק את העובדות הרלוונטיות לאותו רגע בסיפור, מה הגיבורה יודעת בשלב הזה, מי בגד במי, איזה אקדח הוצג במערכה הראשונה. ההפרדה בין מנוע האחזור למודל הכתיבה מאפשרת להחליף את מודל השפה בלי לאבד את הזיכרון הנרטיבי.
תוצאות הבנצ'מרק: יתרון ברור באחזור, לא בכתיבה
במבחן פנימי של 176 שאלות שדרשו שילוב מידע ממספר פרקים, שרפה השיגה 89.8% דיוק מול 57.4% של גרפיטי (Graphiti), מערכת זיכרון גרפית מתחרה. שתי המערכות השתמשו באותו מודל שפה לייצור התשובה; ההבדל נבע רק ממנגנון אספקת המידע. בסט ציבורי של 576 שאלות הפער הצטמצם, 62.5% מול 51.6%, אבל הכיוון נשמר. חשוב לציין: המבחנים מודדים אחזור פרטים (recall), לא איכות כתיבה. האם זיכרון טוב יותר מתרגם לפרוזה טובה יותר? עדיין לא נבדק.
המספרים שמאחורי ההכרזה, ומה חסר בהם
החברה מציינת נתונים מרשימים בדף המוצר: צמיחה מ-250 מיליון דולר (כ-925 מיליון שקל) ל-500 מיליון דולר (כ-1.85 מיליארד שקל) ב-ARR, גידול של 1,200% בייצור תוכן בשנה, אימון על 5.5 מיליארד שעות האזנה עם נתוני שימור דקה-בדקה, ו-550 אלף יוצרים פעילים. אלה נתוני יצרן (vendor claims) שלא עברו אימות חיצוני. לא פורסמו מדדי ביצועים על איכות הטקסט הנוצר, לא נמסר איזה מודל שפה משמש כ-backbone, ואין התייחסות לעלויות הסקה (inference cost) של המערכת המורכבת הזו.
מה הלאה
הכיוון שפוקט FM דוחפת, הפרדה בין זיכרון עולם נרטיבי למנוע יצירה, הגיוני ארכיטקטונית ומזכיר גישות של RAG מתקדם בסביבות ארגוניות. השאלה המעשית היא האם היתרון באחזור פרטים מתורגם לחוויית קריאה עדיפה, או שהוא רק מייצר סיפורים עקביים יותר אבל משעממים באותה מידה. בלי בנצ'מרק כתיבה פתוח (human eval על פרוזה מלאה, לא שאלות טריוויה) קשה להעריך את התועלת האמיתית ליוצרים ולקוראים.