22 בספטמבר 2026 האקדמיה ארכיון
מבזקים
White Circle משיקה את Halo, פריימוורק אימון בקוד פתוח שמבטיח 2.8x תפוקה על B300 vLLM מעבירה פענוח וידאו ל-NVDEC ומכפילה תפוקה ב-8×H100 מונשוט משיקה את קימי K3 על בדרוק עם חלון הקשר של מיליון טוקן מצרים עוברת משלב הפוטנציאל לייצור בפועל: אירוע אקוסיסטם במוזיאון המצרי הגדול סימן קפיצת מדרגה NVIDIA חותכת את תעבורת הטוקנים של סוכני קוד בחצי עם SoL-Pi
מודלים

White Circle משיקה את Halo, פריימוורק אימון בקוד פתוח שמבטיח 2.8x תפוקה על B300

White Circle משיקה את Halo, פריימוורק אימון בקוד פתוח שמבטיח 2.8x תפוקה על B300

White Circle מוציאה גרסה 1.0 של Halo, פריימוורק אימון בקוד פתוח שרץ על מודלי Hugging Face בלי לשבור את הפורמט המקורי, ומדווחת על עד פי 2.8 תפוקה מול TRL סטנדרטי על 8 מאיצי B300. הקוד זמין בגיטהאב, והתמונות דוקר נמשכות אנונימית מ-ECR ציבורי, בלי חשבון, בלי הרשמה.

ארכיטקטורה: בלי רירצ'יט של המודל

הטריק המרכזי הוא ש-Halo לא מחליף את המודל. המאמנים (Trainers) יורשים מ-Trainer של Hugging Face או של TRL, הצ'קפוינטים נשארים SafeTensors תקניים, ו-from_pretrained ממשיך לעבוד כרגיל. הוספת משפחת מודל חדשה דורשת, לדברי החברה, פחות מ-140 שורות קוד אינטגרציה. המקביליות (Parallelism) מתלבשת על הבלוקים הקיימים: EP עוטף בלוקי MoE, CP עוטף Attention, ו-TP/ETP משבצים משקולות במקום, אין מימוש מבוזר נפרד של הארכיטקטורה.

מנוע מבוזר: PyTorch נטו, DeepEP לתקשורת מומחים

התשתית המבוזרת בנויה על פרימיטיבים של PyTorch, FSDP2, DTensor, DeviceMesh, כש-DeepEP מטפל ב-all-to-all עבור Expert Parallelism. EP, CP, TP ו-ETP ניתנים לקונפיגורציה עצמאית ומשתלבים על פני GPU וצמתים. כל שיטות האימון (פרה-טריינינג, SFT, העדפה, זיקוק, RL) חולקות אותה תשתית מקביליות וצ'קפוינטינג, כך ששיטה חדשה לא צריכה מימוש מבוזר משלה.

ביצועים: מה המספרים אומרים בפועל

על 8×B300 מדווחת החברה על עד ~2.8× תפוקת אימון מול TRL סטוק, וכששני הצדדים מריצים ZeRO-3, 2.7× תפוקה ב-25% פחות זיכרון שיא. הסט כולל אופטימיזציות משולבות: DeepEP V2, FlashAttention-4, Liger, Grouped GEMM, אריזה ללא פדינג, ואופטימייזר AdamWBF16, עם מימושים ו-fallbacks לבלקוול, הופר ו-GPU ישנים יותר. המספרים הם של היצרן; לא פורסמו מדדי ביצועים עצמאיים או ריצות על מודלים ספציפיים להשוואה.

RL אסינכרוני: בלי Megatron, בלי veRL

צד ה-RL רץ אסינכרוני עם הפרדה נקייה: אימון ב-Transformers רגיל, רולאאוטים מרובי-תור מול שרת vLLM או SGLang כשחקני Ray, עם תור פריפטש' שמחפה על האימון. המשקולות המעודכנות נדחפות לשרת ההסקה דרך NCCL נייטיבי. אין בקנד Megatron ואין תלות ב-veRL, סט המקביליות והצ'קפוינטינג נשאר זהה לצד האימון.

דוקר והפצה: תמונות נפרדות לארכיטקטורה

Halo מסופקת בשתי תמונות דוקר נפרדות, `blackwell` ל-B200/B300 (FA4 + FA2 + DeepEP) ו-`hopper` ל-H100/H200 (FA2 + FA3 + DeepEP). תגיות מגרסות (`:blackwell-1.0.0`) נועלות את הגרסה; אין תגית `latest` כי התמונות ספציפיות לארכיטקטורה. תמונות ההסקה ל-RL (`:vllm-0.26.0`, `:sglang-0.5.17`) מפורסמות לצידן. אפשר גם לבנות מקומית עם `make build-blackwell` או `build-hopper`, אין צורך בסביבת פייתון מארחת. ההפעלה מתבצעת דרך `halo launch` עם קונפיג YAML, מ-LoRA על GPU בודד עד EP על 8 GPU דרך torchrun.