קוהיר משיקה את North Small Translate: מודל תרגום MoE עם 25B פרמטרים פעילים ו-218B סך הכל

קוהיר (Cohere) וזרוע המחקר שלה קוהיר לאבס (Cohere Labs) שחררו השבוע את North-Small-Translate-1.0, מודל תרגום ייעודי בארכיטקטורת Mixture-of-Experts דלילה, עם 25 מיליארד פרמטרים פעילים מתוך 218 מיליארד בסך הכל. המודל מכוון לתרגום איכותי ב-50 שפות, ומופץ כמשקולות פתוחות (open weights) תחת רישיון CC BY-NC 4.0, שמגביל שימוש מסחרי ודורש עמידה במדיניות שימוש מקובלת של קוהיר לאבס. הגישה לקבצים ב-Hugging Face מותנית בהסכמה לשיתוף פרטי קשר וקבלת עדכונים במייל מהחברה.
ארכיטקטורה ופריסה בייצור
הבחירה ב-MoE דליל מאפשרת לקוהיר לשמור על עלות הסקה (inference) של מודל 25B תוך ניצול קיבולת ידע של מודל גדול בהרבה. אורך ההקשר עומד על 16 אלף טוקנים לכניסה וליציאה, מספיק למסמכים עסקיים ארוכים, אך לא חריג ביחס למודלים כלליים בני אותו דור. שלושת הקוונטיזציות (quantizations) הזמינות ב-Hugging Face הן אותן נקודות בדיקה (checkpoints) שקוהיר מריצה בייצור, והחברה ממליצה על דקודינג חמדני (greedy decoding) בלבד, אותה הגדרה שבשימוש אצלה. דרישת הזיכרון המינימלית מתחילה ב-8×H100 עם 70GiB לכרטיס, והטעינה דורשת הגדרת `max_memory` מפורשת כדי למנוע קריסה בזמן איחוי שכבות ה-MoE.
תבנית פלט וספריית פירסור ייעודית
המודל עוטף את התשובה בסמנים מבניים `<|START_TEXT|>` ו-`<|END_TEXT|>` שאינם רשומים כטוקנים מיוחדים, החלטה מכוונת כדי שמנתחי ההנמקה והקריאות-כלים של vLLM יראו אותם. המשמעות המעשית: `skip_special_tokens=True` לא מסיר אותם, והפלט הגולמי כולל גם את ההוראות המערכתיות. קוהיר מספקת את ספריית `cohere_melody` (אותו פארסר ש-vLLM משתמש בו) לחילוץ הטקסט הנקי, ומדגימה תבנית צ'אט ייעודית שמזינה הוראת תרגום ומחלצת רק את הטוקנים החדשים שנוצרו.
רישיון, גישה והבחנה חשובה
רישיון CC BY-NC 4.0 הופך את השחרור ל"משקולות פתוחות" ולא לקוד פתוח, הבחנה שקוהיר עצמה מקפידה עליה. המגבלה המסחרית וחובת ההרשמה המוקדמת מציבות את המודל בקטגוריה שונה ממודלים כמו NLLB של מטא (Meta) או מודלי התרגום של NVIDIA, שזמינים ברישיונות מתירניים יותר. מצד שני, העובדה שהקוונטיזציות זהות לאלה שבשימוש בייצור נותנת למפתחים נקודת ייחוס ריאליסטית לביצועים, בלי פער בין גרסת "קהילה" לגרסת "אנטרפרייז".