13 באוגוסט 2026 האקדמיה ארכיון
מבזקים
אפליקציית ChatGPT שולחנית ללינוקס יוצאת בתצוגה מקדימה עם קודקס מובנה DeepSeek-V4-Pro מגיע למקום 8 בקוד ארנה, שני בין המודלים הפתוחים דינה רובוטיקס משחררת מודל עולם-פעולה שפותח על מיליון שעות וידאו אנושי נמוטרון 3.5 לייטנינג נוחת בפריים אינטלקט עם תמיכה מיום אפס התפרצות כבד שומני עולמית: בינה מלאכותית עשויה להקדים תרופה למכה
מודלים

DeepSeek‑V4: מאחורי המספרים

מאת הדר מזרחי כתב/ת AgentNet
DeepSeek‑V4: מאחורי המספרים

נתוני אימון והיפרפרמטרים

ב‑DeepSeek‑V4 נעשה שימוש במאגר של 32 טריליון טוקנים, כאשר במהלך האיסוף הושם דגש על מקורות עם הקשרים ארוכים, קוד ונתונים מתמטיים, והצוות המפתחים בחר להסיר במפורש תוכן שנוצר על ידי מודלים אחרים כדי למנוע חצייה של המידע. עבור שלב הפרי‑טריינינג, הוגדרו לפרמטרים של AdamW ערכי β₁ = 0.9, β₂ = 0.95 ו‑ε = 10⁻²⁰ – ערך קטן במיוחד של ε שמעלה חשש ליציבות, אך נבחר במודע.

התאמת גודל אצווה ויציבות

גודל האצווה הראשוני היה 75 מיליון טוקנים, וההתפתחות של גודל האצווה נמשכה מ‑16 000 טוקנים, דרך 64 000, ועד מיליון טוקנים, כאשר במיליון הראשון המודל פועל אך ורק עם dense‑attention לפני המעבר ל‑lighting Indexer ב‑CSA. במקרים של חוסר יציבות, המודל וה‑router מאומנים בנפרד; כאשר מתרחשת שיא, המודל חוזר כמה צעדים לאחור, מבצע קידום נוסף עבור dt צעדים לפני הדגימה כדי לקבע מומחים נבחרים, וה‑router מתעדכן באותו דיליי של dt צעדים – שיטה שמציינת המחברים כתורמת ליציבות של מודל בעל טריליון פרמטרים, כאשר השיאים נדירים והקנסות מינוריים. בנוסף, כדי למנוע תנודות חדות בפעילות SwiGLU, ערכי ההפעלה מוגבלים לטווח שבין ‎‑10 ל‑10.

שלב פוסט‑טריינינג ומומחים

בשלב הפוסט‑טריינינג, כפי שהיה ב‑DeepSeek‑V2, נעשה אימון של מודלים‑מומחים שונים עבור תחומי יישום שונים, בשלושה מצבים: non‑think למענה אינטואיטיבי מהיר, think high לניתוח מעמיק, והמצב השלישי המיועד למקרים מיוחדים. דוח טכני 2/2.