25 בספטמבר 2026 האקדמיה ארכיון
מבזקים
בוטל־קאפ (BottleCap) משיקה את ThinkingCap-Qwen3.8-27B, כוונון עדין של Qwen3.8-27B שמטרתו היחידה: לקצר את שרשרת החשיבה ג'מיני 3.8 לייב עם אווטאר חי זמין כעת ללקוחות אנטרפרייז מודל אחד לומד מתיעוד צוותי ומשכתב את ספר המשחקים של הסוכנים גוגל משחררת את "Call for Me", ג'מיני מתחיל להתקשר לעסקים בשמכם מוזה צ'ארם של מטא נראה כמו טמאגוצ'י, אבל מכוון לטרנד שונה לגמרי
מוצרים

בוטל־קאפ (BottleCap) משיקה את ThinkingCap-Qwen3.8-27B, כוונון עדין של Qwen3.8-27B שמטרתו היחידה: לקצר את שרשרת החשיבה

בוטל־קאפ (BottleCap) משיקה את ThinkingCap-Qwen3.8-27B, כוונון עדין של Qwen3.8-27B שמטרתו היחידה: לקצר את שרשרת החשיבה

בממוצע על 12 בנצ'מרקים המודל חותך 37.2% מאסימוני החשיבה, כשהמחיר הוא ירידה של 0.86 נקודות אחוז בדיוק המקרו, מ־86.65% ל־85.79%. המודל נופל ישר לתוך vLLM או SGLang עם בילדים של FP8, NVFP4, GGUF ו־MLX, אבל הריפו מגודר ושימוש מסחרי מעבר לרישיון עסקים קטנים דורש הסכם נפרד מול בוטל־קאפ ## פחות אסימונים, אותה תוצאה

החיתוך הכי אגרסיבי מגיע במשימות ידע ורב־לשוניות: MMMLU צונח ב־65.5% (מ־1,656 אסימונים ל־571) ו־MMLU-Pro ב־57.3%. ב־GPQA-Diamond החשיבה יורדת מ־12,772 ל־7,267 אסימונים, קיצוץ של 43.1%. ב־IFBench הדיוק כמעט לא זז (79.75% ל־79.71%) בזמן שהחשיבה נחתכת ב־46.4%. דווקא בשליפת הקשר ארוך יש שיפור: AA-LCR עולה 2.25 נקודות אחוז ל־84% עם 38.6% פחות אסימונים, ו־LiveCodeBench v6 מוסיף 0.07 נקודות ב־20.3% פחות חשיבה. המשימות הסוכנותיות (agentic) שומרות על יציבות: τ²-bench מאבד 1.01 נקודות תמורת 30.9% חיסכון, ו־Terminal-Bench 2.1 יורד 0.56 נקודות, בתוך מרווח השגיאה של ±4.26, עם קיצוץ של 10.7% בלבד. המחיר הכי כואב הוא ב־AIME 2026: נפילה של 3.85 נקודות (מ־98.13% ל־94.27%) תמורת 30.2% פחות אסימונים. בממוצע משוקלל יורדים מ־15,735 אסימונים ל־12,144.

איך זה עובד עם דיאל המאמץ

Qwen3.8-27B חושף הגדרת reasoning-effort, והדחיסה של בוטל־קאפ נערמת מעליה. ב־medium הבסיס חותך 52.1% אסימונים ב־9.16 נקודות הפסד, בעוד ThinkingCap חותך 60.2% ב־9.90 נקודות. ב־low הבסיס ב־55.4% ו־9.71 נקודות, ThinkingCap ב־62.3% ו־10.79 נקודות. עם חשיבה כבויה לגמרי, ThinkingCap מפגר ב־5.7 נקודות אחרי הבסיס. הצוות ממליץ על xhigh לאיזון הכי טוב בין דיוק לאסימונים, ומציין שמצבי חשיבה בודדים יקבלו התייחסות בגרסה עתידית.

מתודולוגיית הבדיקה

שני המודלים רצו דרך אותו רתמה (harness) על H200 בודד עם vLLM 0.29.0. פרמטרי הדגימה זהים: טמפרטורה 1.0, top_p 0.95, top_k 20, min_p 0.0. הדיוק מדווח כממוצע רב־זרעים עם רווח בר־סמך 95%, מ־32 זרעים ב־AIME 2026 ועד זרע בודד ב־MMLU-Pro ו־MMMLU. האחרון משתמש במדגם קבוע של 10,000 שאלות; שאר 11 הבנצ'מרקים רצים בסט מלא. פענוח ספקולטיבי MTP (3 אסימוני טיוטה) נמצא נייטרלי לדיוק ב־AIME 2026, עם קבלה של 53% מהטיוטות, כ־2.6 אסימונים לצעד, זהה לבסיס.

פריסה ורישוי

הצ'קפוינט bf16 שוקל 28 מיליארד פרמטרים ומקבל קלט תמונה וטקסט. בוטל־קאפ מפרסמת חמישה בילדים מכומתים: FP8 ב־31 ג״ב ל־vLLM על הופר (Hopper) ובלקוול (Blackwell); NVFP4 משקולות בלבד ב־21 ג״ב ל־vLLM על הופר (גרעין מרלין) ובלקוול; NVFP4 W4A4 ב־AWQ ב־23 ג״ב לבלקוול בלבד; GGUF בטווח 16-55 ג״ב ל־llama.cpp, LM Studio ו־Ollama; ו־MLX 4-bit DWQ ב־21 ג״ב לסיליקון של אפל.

מקור: marktechpost.com