DeepSeek-V4 架构深度剖析
百万 Token 时代的全栈改造:从 mHC、CSA/HCA 混合注意力,到 Muon 优化器、FP4 量化感知训练、与 On-Policy Distillation。逐章拆解 V4 技术报告。
本书是对 DeepSeek-V4 技术报告的第三方深度剖析,由社区作者 igloos 编写,非 DeepSeek-AI 官方出版物。模型权重与论文版权归 DeepSeek-AI,本书文字与可视化在 MIT License 下发布。封面 Logo 仅作引用使用。
DeepSeek-V4 Preview 释出
2026 年 4 月 24 日,DeepSeek-AI 发布了 V4-Flash(284B 总参 / 13B 激活)与 V4-Pro(1.6T 总参 / 49B 激活)的预览版及 58 页技术报告。报告主要介绍以下五部分:
- 注意力:CSA(压缩 + Lightning Indexer top-k)与 HCA(m'=128 重压缩)交替使用,以降低 1M 上下文的计算与 KV cache 成本;
- 残差:mHC 把 Hyper-Connection 约束到 Birkhoff 多面体,谱范数 ≤ 1;
- 预训练:Flash 使用 32T tokens,Pro 使用 33T tokens;训练上下文从 4K 逐步扩展到 1M,并用 Anticipatory Routing 与 SwiGLU Clamping 改善稳定性;
- 后训练:先训练领域 specialist,再用多教师 OPD 整合到统一模型;DSec 为带工具和代码执行的任务提供沙箱;
- 评测:Pro-Max 的 Codeforces rating 为 3206;Frontier formal reasoning 设置下 DeepSeek-V4 为 120/120;内部 30 题 R&D Coding Benchmark 的通过率为 67%。
本书地图
把 58 页技术报告拆解为 20 章 + 两份附录,按"部分"组织,每个部分以学习目标开头、以小结收尾。每章独立可读,可按兴趣跳读。
mHC:把残差搬上 Birkhoff 多面体
用双随机矩阵约束 Hyper-Connection,谱范数 ≤ 1,让深度堆叠重新可控。
CSA:压缩 + 稀疏 的二重奏
先把 m 个 KV 压成一个,再用 Lightning Indexer 选 top-k。这是 V4 长上下文的命脉。
HCA:把 m'≫m 个 token 压成一格
更激进的压缩、不做稀疏选择,与 CSA 交替穿插使用。
Muon × Hybrid Newton-Schulz
10 步两段式迭代:前 8 步快收敛,后 2 步钉死奇异值。
MegaMoE:用流水隐藏通信
把专家切成 wave,给出 C/B ≤ 6144 FLOPs/Byte 的硬件协设建议。
OPD:从 RL 到反向 KL 蒸馏
10+ 个领域专家,全词表 logit 蒸馏到一个统一学生模型。
四大部分 + 附录
架构
百万 Token 之困、mHC、CSA/HCA、Muon —— V4 的"形"。
基础设施
MegaMoE、TileLang、批不变、FP4 QAT、训练/推理框架 —— V4 的"骨"。
预训练
32T / 33T 数据、Anticipatory Routing、SwiGLU 钳位与 Base 评测。
后训练
Specialist + GRM + Tool 接口 + OPD + DSec —— V4 的"魂"。
评测结果
标准 benchmark 与内部真实任务评测,并标明模型、推理预算和测试设置。
参数速查
L=61、d=7168、专家 384 / 激活 6 等核心符号一表查清。