第一部分 · 架构
V4 的"形" —— 注意力、残差、优化器三条主线。先看清问题(百万 Token 之困),再逐个看清 mHC / CSA / HCA / Muon 这四把刀是怎么递进出来的。
读完这部分,你将能够
- 说明 vanilla 全注意力在 1M 上下文下面临的 KV cache 与计算瓶颈,以及 V4 为什么选择改造架构。
- 区分 V3 → V4 在 MoE 路由打分、负载均衡、MTP 上的具体改动,并解释每一处改动想解决什么。
- 解释 mHC 把残差 mixing 矩阵约束在 Birkhoff 多面体上的几何意义,以及这一约束如何控制该混合路径的谱范数。
- 画出 CSA 的"压缩 → 索引 → top-k → MQA"四段流水线,并说明 Lightning Indexer 如何用多头 ReLU 分数完成选择。
- 说出 HCA 与 CSA 的"近视/远视"互补关系,理解为什么二者要交替穿插而不是择一。
- 读懂 Muon 的 Hybrid Newton–Schulz 两段系数,并理解报告为何先快速压缩奇异值、再切换到稳定收敛的迭代。
- 面对一个新的"长序列效率"问题,能判断:先压、还是先稀疏、还是先换优化器。
本部分章节路线图
百万 Token 之困
O(n²) 是怎么把推理时代逼到墙角的。三条改造主线浮出水面。
从 V3 继承的两件法宝
DeepSeekMoE 与 MTP —— 哪些保留、哪些微调。
mHC:流形约束的 Hyper-Connection
Birkhoff 多面体 + Sinkhorn-Knopp,把残差锁进非膨胀流形。
CSA:压缩稀疏注意力
Token-level 压缩 + Lightning Indexer + top-k + Shared-KV MQA。
HCA:重压缩注意力
m'=128 的极致压缩。和 CSA 互补穿插。
Muon 优化器
Hybrid Newton–Schulz 把更新矩阵正交化。
按顺序读最容易:Ch1 给问题,Ch2 给基线,Ch3–6 给四把刀。 如果只想看明星章节,Ch3 (mHC) 与 Ch4 (CSA) 是必读 —— V4 一切下游优化(FP4、确定性 kernel、长上下文 CP)都是为这两件事服务的。
本部分小结
核心要点回顾
- 问题(Ch1):1M 上下文下,vanilla attention 的二次计算量与线性增长的 KV cache 都变得昂贵;V4 选择从注意力架构同时削减两者。
- 继承(Ch2):DeepSeekMoE 与 MTP 保留,路由打分换成 Sqrt(Softplus)、加序列级 balance、首层换 Hash-MoE。
- 残差(Ch3 · mHC):把残差 mixing 矩阵投影到 Birkhoff 多面体,使该路径的谱范数不超过 1;这有助于控制信号传播,但不是对整个网络稳定性的单独证明。
- 近视刀(Ch4 · CSA):m=4 压缩 + Lightning Indexer + top-k=1024 ⇒ query 只为关心的块付计算。
- 远视刀(Ch5 · HCA):m'=128 极致压缩,dense 不稀疏,与 CSA 交替穿插提供全局粗概览。
- 优化器(Ch6 · Muon):Hybrid Newton–Schulz 用两组系数近似极分解,使更新矩阵的奇异值向 1 靠近。
关键公式速查
| 位置 | 公式 / 约束 | 含义 |
|---|---|---|
| mHC 残差 | X_{l+1} = B_l X_l + C_l F(A_l X_l), B_l ∈ Birkhoff |
$B_l$ mixing 路径谱范数 ≤ 1;不代表完整非线性 block 永不放大 |
| CSA 索引 | I_{t,s} = Σ_h w · ReLU(q · K^IComp) |
多头 ReLU 分数加权求和后选择 top-k;报告未单独解释 ReLU 的动机 |
| HCA 压缩 | C^Comp_i = Σ_j Softmax(Z+B) ⊙ C_j, m'=128 |
不做稀疏,dense 跑得起 |
| Muon NS 迭代 | M_k = a M + b MM^T M + c (MM^T)² M |
前 8 步 (3.4445,-4.775,2.0315) + 后 2 步 (2,-1.5,0.5) |
设计直觉地图
三条主线之间不是孤立的:
- mHC 让"更深的网"敢叠 ⇒ 给 CSA / HCA 提供"放进去也不炸"的载体。
- CSA + HCA 让"更长的序列"敢算 ⇒ 给 Muon 提供"一次梯度值得正交化"的高维更新。
- Muon 让"更猛的更新"敢用 ⇒ 给 mHC 静态偏置稳定的训练信号。
自检题
Q1. 为什么 mHC 选择把 B_l 约束到 Birkhoff 多面体而不是改 LayerNorm?
查看参考答案
LayerNorm 归一化每个位置的特征,而 mHC 直接约束多流残差 mixing 矩阵。Birkhoff 多面体使该矩阵的谱范数不超过 1,并在矩阵乘法下保持双随机性,因此能控制这条混合路径的放大;它有助于深层训练稳定,但不是对整个网络“绝不发散”的证明。
Q2. CSA 的 Lightning Indexer 如何从多头分数得到 top-k 选择?
查看参考答案
每个 indexer head 先计算 query-key 内积,对结果施加 ReLU,再乘该 head 的动态权重并跨 head 求和,最后选择最高的 k 个压缩 KV。报告给出了这一设计,但没有用“softmax 在长序列上数值塌陷”来解释选择 ReLU 的原因。
Q3. 给定 V4-Pro 配置(m=4, m'=128, k=1024, n=1M),CSA 和 HCA 各自要看多少个压缩 token?
查看参考答案
若按 $2^{20}$ 个 token 计算,CSA 会产生 262,144 个压缩条目;若把 1M 作为十进制近似,则约为 250K。Pro 的每个 query 从中选 top-1024。HCA 同理约产生 8K 个条目并全部参与核心注意力。两者分别提供较高分辨率的稀疏选择与低分辨率的全局覆盖。
Q4. Muon 的 Hybrid NS 为什么要分两段、不直接用同一组系数 10 步?
查看参考答案
(3.4445, -4.775, 2.0315) 在奇异值远离 1 时收敛极快,但接近 1 时会震荡;(2, -1.5, 0.5) 在 1 附近平稳但远处慢。两段式 = 先粗收敛 + 后精钉,10 步内得到接近正交的 UV^T。