27 בספטמבר 2026 האקדמיה ארכיון
מבזקים
סוכני OpenAI הריצו 16 אלף בקשות לאתר האו"ם בניסיון לעקוף מגבלות גישה סין התקינה יותר רובוטים תעשייתיים ב-2025 משאר העולם יחד מאמר חדש מציע מפת דרכים לשיפור עצמי רקורסיבי של בינה מלאכותית מודל 340 מיליון פרמטרים רץ על GPU של טלפון, עם זהות מספרית למודל הייחוס גוגל בודקת רכישה ישירה מפליפקארט דרך ג'מיני ו-AI Mode בהודו
מודלים

DeepSeek‑V4: מאחורי המספרים

DeepSeek‑V4: מאחורי המספרים

נתוני אימון והיפרפרמטרים

ב‑DeepSeek‑V4 נעשה שימוש במאגר של 32 טריליון טוקנים, כאשר במהלך האיסוף הושם דגש על מקורות עם הקשרים ארוכים, קוד ונתונים מתמטיים, והצוות המפתחים בחר להסיר במפורש תוכן שנוצר על ידי מודלים אחרים כדי למנוע חצייה של המידע. עבור שלב הפרי‑טריינינג, הוגדרו לפרמטרים של AdamW ערכי β₁ = 0.9, β₂ = 0.95 ו‑ε = 10⁻²⁰ – ערך קטן במיוחד של ε שמעלה חשש ליציבות, אך נבחר במודע.

התאמת גודל אצווה ויציבות

גודל האצווה הראשוני היה 75 מיליון טוקנים, וההתפתחות של גודל האצווה נמשכה מ‑16 000 טוקנים, דרך 64 000, ועד מיליון טוקנים, כאשר במיליון הראשון המודל פועל אך ורק עם dense‑attention לפני המעבר ל‑lighting Indexer ב‑CSA. במקרים של חוסר יציבות, המודל וה‑router מאומנים בנפרד; כאשר מתרחשת שיא, המודל חוזר כמה צעדים לאחור, מבצע קידום נוסף עבור dt צעדים לפני הדגימה כדי לקבע מומחים נבחרים, וה‑router מתעדכן באותו דיליי של dt צעדים – שיטה שמציינת המחברים כתורמת ליציבות של מודל בעל טריליון פרמטרים, כאשר השיאים נדירים והקנסות מינוריים. בנוסף, כדי למנוע תנודות חדות בפעילות SwiGLU, ערכי ההפעלה מוגבלים לטווח שבין ‎‑10 ל‑10.

שלב פוסט‑טריינינג ומומחים

בשלב הפוסט‑טריינינג, כפי שהיה ב‑DeepSeek‑V2, נעשה אימון של מודלים‑מומחים שונים עבור תחומי יישום שונים, בשלושה מצבים: non‑think למענה אינטואיטיבי מהיר, think high לניתוח מעמיק, והמצב השלישי המיועד למקרים מיוחדים. דוח טכני 2/2.