White Circle משיקה את Halo, פריימוורק אימון בקוד פתוח שמבטיח 2.8x תפוקה על B300

White Circle מוציאה גרסה 1.0 של Halo, פריימוורק אימון בקוד פתוח שרץ על מודלי Hugging Face בלי לשבור את הפורמט המקורי, ומדווחת על עד פי 2.8 תפוקה מול TRL סטנדרטי על 8 מאיצי B300. הקוד זמין בגיטהאב, והתמונות דוקר נמשכות אנונימית מ-ECR ציבורי, בלי חשבון, בלי הרשמה.
ארכיטקטורה: בלי רירצ'יט של המודל
הטריק המרכזי הוא ש-Halo לא מחליף את המודל. המאמנים (Trainers) יורשים מ-Trainer של Hugging Face או של TRL, הצ'קפוינטים נשארים SafeTensors תקניים, ו-from_pretrained ממשיך לעבוד כרגיל. הוספת משפחת מודל חדשה דורשת, לדברי החברה, פחות מ-140 שורות קוד אינטגרציה. המקביליות (Parallelism) מתלבשת על הבלוקים הקיימים: EP עוטף בלוקי MoE, CP עוטף Attention, ו-TP/ETP משבצים משקולות במקום, אין מימוש מבוזר נפרד של הארכיטקטורה.
מנוע מבוזר: PyTorch נטו, DeepEP לתקשורת מומחים
התשתית המבוזרת בנויה על פרימיטיבים של PyTorch, FSDP2, DTensor, DeviceMesh, כש-DeepEP מטפל ב-all-to-all עבור Expert Parallelism. EP, CP, TP ו-ETP ניתנים לקונפיגורציה עצמאית ומשתלבים על פני GPU וצמתים. כל שיטות האימון (פרה-טריינינג, SFT, העדפה, זיקוק, RL) חולקות אותה תשתית מקביליות וצ'קפוינטינג, כך ששיטה חדשה לא צריכה מימוש מבוזר משלה.
ביצועים: מה המספרים אומרים בפועל
על 8×B300 מדווחת החברה על עד ~2.8× תפוקת אימון מול TRL סטוק, וכששני הצדדים מריצים ZeRO-3, 2.7× תפוקה ב-25% פחות זיכרון שיא. הסט כולל אופטימיזציות משולבות: DeepEP V2, FlashAttention-4, Liger, Grouped GEMM, אריזה ללא פדינג, ואופטימייזר AdamWBF16, עם מימושים ו-fallbacks לבלקוול, הופר ו-GPU ישנים יותר. המספרים הם של היצרן; לא פורסמו מדדי ביצועים עצמאיים או ריצות על מודלים ספציפיים להשוואה.
RL אסינכרוני: בלי Megatron, בלי veRL
צד ה-RL רץ אסינכרוני עם הפרדה נקייה: אימון ב-Transformers רגיל, רולאאוטים מרובי-תור מול שרת vLLM או SGLang כשחקני Ray, עם תור פריפטש' שמחפה על האימון. המשקולות המעודכנות נדחפות לשרת ההסקה דרך NCCL נייטיבי. אין בקנד Megatron ואין תלות ב-veRL, סט המקביליות והצ'קפוינטינג נשאר זהה לצד האימון.
דוקר והפצה: תמונות נפרדות לארכיטקטורה
Halo מסופקת בשתי תמונות דוקר נפרדות, `blackwell` ל-B200/B300 (FA4 + FA2 + DeepEP) ו-`hopper` ל-H100/H200 (FA2 + FA3 + DeepEP). תגיות מגרסות (`:blackwell-1.0.0`) נועלות את הגרסה; אין תגית `latest` כי התמונות ספציפיות לארכיטקטורה. תמונות ההסקה ל-RL (`:vllm-0.26.0`, `:sglang-0.5.17`) מפורסמות לצידן. אפשר גם לבנות מקומית עם `make build-blackwell` או `build-hopper`, אין צורך בסביבת פייתון מארחת. ההפעלה מתבצעת דרך `halo launch` עם קונפיג YAML, מ-LoRA על GPU בודד עד EP על 8 GPU דרך torchrun.