מודל יסוד לטבלאות שמדלג על שלב האימון

חברת Synthefy שחררה את Nori V1, מודל יסוד (foundation model) במשקלים פתוחים שמיועד לחיזוי על נתונים טבלאיים, והטריק המרכזי שלו הוא שהוא לא דורש אימון בכלל. במקום להתאים מודל חדש לכל דאטהסט, מעבירים לקריאה אחת את שורות הבדיקה יחד עם קונטקסט מסומן (X_train, y_train) ומקבלים תחזיות מיידיות. הקוד והמשקלים משוחררים תחת רישיון Apache 2.0, חופשי לשימוש מסחרי.
איך זה עובד
הממשק מזכיר יותר Retrieval מאשר אימון קלאסי: `model.predict(X_test, X_train, y_train)` מחזיר תחזיות בלי שלב fitting נפרד. המודל רואה את דוגמאות האימון כקונטקסט בזמן אינפרנס, בדומה לאיך שמודלי שפה מטפלים ב-few-shot prompting, רק כאן על נתונים טבלאיים. הריצה מתבצעת על GPU בודד עם נפילה אוטומטית ל-CPU אם אין כרטיס זמין.
רישיון והתקנה
החבילה זמינה ב-pip תחת השם `synthefy-nori`. המשקלים יורדים פעם אחת ונשמרים במטמון מקומי, כך שהרצה חוזרת לא דורשת הורדה נוספת. רישיון Apache 2.0 אומר שאפשר להטמיע את זה במוצר מסחרי בלי לשאול אף אחד ובלי לשלם תמלוגים, נקודה משמעותית מול מודלים "פתוחים" שמגבילים שימוש מסחרי.
האם זה באמת מחליף את XGBoost
ההכרזה מצהירה בגדול "Replaces XGBoost", אבל המקור לא מפרסם בנצ'מרקים מול גרסאות נוכחיות של XGBoost, LightGBM או CatBoost על מדדים סטנדרטיים. מודל יסוד לטבלאות זה כיוון מעניין, במיוחד למשימות שבהן אין זמן או דאטה לאימון ייעודי, אבל בלי מספרים על דיוק, זמן אינפרנס וצריכת זיכרון מול הבסיסיות המקובלות, מדובר בטענה שצריך לבדוק בשטח.
מה חסר בתמונה
לא פורסמו פרטים על ארכיטקטורת המודל, גודל המשקלים, נתוני האימון המקוריים, או מגבלות ידועות (למשל מספר מקסימלי של עמודות, סוגי נתונים נתמכים, או התנהגות עם קטגוריות שלא נראו באימון). גם לא ברור איך המודל מתמודד עם דליפת מידע כשהקונטקסט כולל את כל סט האימון. עד שיגיעו בדיקות עצמאיות, Nori V1 נשאר הוכחת יכולת מסקרנת, לא תחליף מוכח לערימת הבוסטינג שעליה התעשייה נשענת כבר שנים.