DeepSeek-V4 架构深度剖析
独立深度剖析 · v0.2 (Revised) · 2026-07-24

DeepSeek-V4 架构深度剖析

百万 Token 时代的全栈改造:从 mHC、CSA/HCA 混合注意力,到 Muon 优化器、FP4 量化感知训练、与 On-Policy Distillation。逐章拆解 V4 技术报告。

关于本书

本书是对 DeepSeek-V4 技术报告的第三方深度剖析,由社区作者 igloos 编写,非 DeepSeek-AI 官方出版物。模型权重与论文版权归 DeepSeek-AI,本书文字与可视化在 MIT License 下发布。封面 Logo 仅作引用使用。

1.6TV4-Pro 总参数
49BPro 激活参数
1M原生上下文
10%vs V3.2 KV Cache
27%vs V3.2 单 Token FLOPs
32T / 33TFlash / Pro 预训练 Tokens
RELEASE · 2026-04-24

DeepSeek-V4 Preview 释出

2026 年 4 月 24 日,DeepSeek-AI 发布了 V4-Flash(284B 总参 / 13B 激活)与 V4-Pro(1.6T 总参 / 49B 激活)的预览版及 58 页技术报告。报告主要介绍以下五部分:

  • 注意力:CSA(压缩 + Lightning Indexer top-k)与 HCA(m'=128 重压缩)交替使用,以降低 1M 上下文的计算与 KV cache 成本;
  • 残差:mHC 把 Hyper-Connection 约束到 Birkhoff 多面体,谱范数 ≤ 1;
  • 预训练:Flash 使用 32T tokens,Pro 使用 33T tokens;训练上下文从 4K 逐步扩展到 1M,并用 Anticipatory Routing 与 SwiGLU Clamping 改善稳定性;
  • 后训练:先训练领域 specialist,再用多教师 OPD 整合到统一模型;DSec 为带工具和代码执行的任务提供沙箱;
  • 评测:Pro-Max 的 Codeforces rating 为 3206;Frontier formal reasoning 设置下 DeepSeek-V4 为 120/120;内部 30 题 R&D Coding Benchmark 的通过率为 67%。
HOW TO READ · 阅读地图

本书地图

把 58 页技术报告拆解为 20 章 + 两份附录,按"部分"组织,每个部分以学习目标开头、以小结收尾。每章独立可读,可按兴趣跳读。

四大部分 + 附录