Ch 15 · Base 评测
第三部分 · 预训练 · 15

Base 评测 — 出厂前的体检

V4-Flash-Base 以 284B 总参数在多数基准上超过 V3.2-Base;V4-Pro-Base 则进一步取得 FACTS Parametric 62.6。Base 评测用于观察架构、数据和预训练改动在后训练前的综合效果。

名词速通 · 一分钟看懂"Base 评测"

Base 评测 = 在 SFT、RL、OPD 等后训练之前,对预训练完成的 Base 模型做的体检;它能排除后训练影响,但不能单独拆分架构、数据与优化器各自的贡献

一句话:Base 分数观察的是后训练前的综合能力。V4 的 Table 1 在统一内部评测设置下比较 V3.2、V4-Flash 与 V4-Pro,说明 V4 的架构、数据和训练改动在进入后训练前已经带来总体提升;这张表本身不提供单因素消融。

Base Model(基座 / 预训练完成态)
完成预训练与 mid-training、尚未进入 SFT / RL / OPD 的模型。它适合观察后训练前的知识、推理和长上下文能力,但不能被视为后训练成绩的固定“物理上限”:后训练会改变行为分布,也能通过教师信号和工具使用提升任务表现。
FACTS Parametric(Google DeepMind 2024)
评估参数化事实知识的 benchmark。V4 报告用 25-shot、精确匹配口径评测,不引入外部检索。它能反映模型直接作答事实问题的表现,但论文没有证明该分数只由预训练数据决定,或对 SFT / RL 几乎不敏感。
Simple-QA Verified
经过核验的简短事实问答,V4 报告采用 25-shot、精确匹配口径。Pro-Base 从 28.3 提升到 55.2,说明该基准上的正确率提高;不能据此直接换算成开放式对话中的“幻觉率”。
MMLU-Pro / MMLU-Redux
MMLU-Pro:MMLU 升级版,更难的多学科考试题,含 STEM / 人文 / 法律 / 医学。MMLU-Redux:去除 MMLU 中已知错误的修正版。主流"综合智能"指标。MMLU-Pro 比 MMLU 更难,分数更低更分散,更能区分模型能力。
MultiLoKo(Multilingual Long-tail Knowledge)
多语言长尾知识 benchmark。Pro-Base 从 38.7 提升到 51.1,与报告中扩大多语言数据的做法方向一致;由于没有只改变数据配方的消融实验,不能把全部增益归因于某一项数据策略。
BBH(Big-Bench Hard, Suzgun 2022)
Big-Bench 中一组较难的任务集合,覆盖算法、逻辑与多步推理等能力。V4-Pro 为 87.5,V3.2 为 87.6;按论文“差距不超过 0.3 视为同档”的口径,两者相当。单个近饱和分数不足以证明通用推理已经达到上限。
LongBench-V2
长上下文理解基准。Pro 从 V3.2 的 40.2 提升到 51.5,说明 V4-Pro 在该统一评测设置下表现更好。结果与 CSA / HCA 和长上下文训练的设计目标一致,但不能仅凭这一行把增益全部归因于注意力架构。
知识密度(Knowledge Density / Tokens-per-Parameter)
“训练 tokens / 激活参数”只能作为粗略描述,不能直接等同于知识密度,更不能推出 FACTS 分数。Flash 的提升可能同时来自架构、数据质量、数据规模和训练策略;报告没有做因果拆分。
Ceiling(后训练上限)
“后训练上限”是便于讨论的直觉,不是报告给出的等式。OPD 的结果受学生容量、教师分布、训练数据、采样策略和优化过程共同影响,不能由某个 Base benchmark 分数直接计算。
一句话定位:Base 评测排除了 SFT、RL 与 OPD 的影响,呈现预训练体系的综合结果;它能说明 Flash 以更少总参数和激活参数在多数评测上超过 V3.2,却不能继续拆分架构、数据与优化器各贡献多少。

1. 三模型同框:V3.2 / V4-Flash / V4-Pro

V4 报告的核心对比表 Table 1 把三个 Base 模型放在一起:

  • V3.2-Base:671B 总参 / 37B 激活,14.8T tokens;
  • V4-Flash-Base:284B 总参 / 13B 激活(< V3.2 一半),32T tokens;
  • V4-Pro-Base:1.6T 总参 / 49B 激活,33T tokens。

这组对比能回答“在各自完整训练配方下,三种 Base 模型表现如何”:Flash 展示更紧凑参数预算下的总体效果,Pro 展示更大模型配置下的总体效果。由于模型规模、token 数和部分配置同时变化,不能把任一差值解释成纯粹的“规模红利”或单一架构收益。

2. 节选关键评测(Table 1)

类别Benchmark V3.2-Base
(671B / 37B)
V4-Flash-Base
(284B / 13B)
V4-Pro-Base
(1.6T / 49B)
World Knowl.MMLU-Pro65.568.373.5
MMLU-Redux87.589.490.8
C-Eval90.492.193.1
MultiLoKo38.742.251.1
Simple-QA Verified28.330.155.2
FACTS Parametric27.133.962.6
Lang. & Reas.BBH87.686.987.5
DROP88.288.688.7
HellaSwag86.485.788.0
Code & MathHumanEval62.869.576.8
GSM8K91.190.892.6
MATH60.557.464.5
Long CtxLongBench-V240.244.751.5
V4 论文 Table 1 — V3.2-Base / V4-Flash-Base / V4-Pro-Base 在 World Knowl. / Lang. & Reas. / Code & Math / Long Context 四类 benchmark 的全量对比
图 15-1 · V4 论文 Table 1 全量版。上方节选表保留了 13 项;论文原表共 24 项,另外还包括 AGIEval、MMLU、MMMLU、CMMLU、SuperGPQA、TriviaQA、WinoGrande、CLUEWSC、BigCodeBench、MGSM 与 CMath。原表最高分加粗、第二高下划线,并规定差距不超过 0.3 视为同档来源:DeepSeek-V4 技术报告 §4.3.2 Evaluation Results,Table 1,p. 28。
Demo · 三模型 Base benchmark 对比(按类别 / 按提升幅度切换)
交互
分数对比(横向条形 · 越长越高) V3.2-Base (671B) V4-Flash (284B) V4-Pro (1.6T)

读图法:每行一个 benchmark,三条横条分别对应 V3.2 / Flash / Pro。
切到 World Knowledge,可看到 Pro 在 FACTS Parametric、Simple-QA Verified 和 MultiLoKo 上提升较大。 切到 Lang & Reasoning,可看到 BBH 上 V3.2 与 V4-Pro 处于同档。 切到 Long Context,可看到 LongBench-V2 从 40.2 提升到 51.5;这是整套 V4 训练配置的结果,不能单独归因于 CSA / HCA。

3. 两条故事线

故事线 A:Flash 用更少参数在多数评测上超过 V3.2

V4-Flash-Base 总参 284B(低于 V3.2 的 671B),激活参数 13B(低于 V3.2 的 37B)。论文对完整 24 项评测的结论是:Flash 在多数评测上超过 V3.2,优势主要体现在世界知识与长上下文任务;它并非每项都领先。

  • Flash 与 V3.2 不只参数量不同:训练 token、数据配方、架构和优化方法都发生了变化。
  • 因此,较少的激活参数与较高的多数评测分数共同说明其完整训练体系具有更好的参数效率;报告没有给出各项改动的加法分解。
故事线 B:Pro 在绝大多数类别继续提升

Pro-Base 在世界知识、语言与推理、代码与数学、长上下文等多数项目上领先,但 BigCodeBench、MGSM、CMath 等项目并非最高。两个提升较大的数字尤其值得关注:

  • FACTS Parametric: V3.2 27.1、Flash 33.9、Pro 62.6。这显示 Pro-Base 在参数化事实知识基准上提升显著,但单个 benchmark 不能直接证明提升来自长文档或多语言数据。
  • Simple-QA Verified: 28.3 → 55.2(+26.9)。这一结果说明经过核验的简短事实问答准确率提高;它不能直接等同为所有场景中的“幻觉率下降”。

这两个数字说明 Pro-Base 为后训练提供了更强的事实问答起点。Ch18 的 OPD 会继续利用多个 specialist teacher 的完整输出分布,但最终效果不能由这两个 Base 分数直接推出。

4. 为什么 Base 评测最关键

很多读者会跳过 Base 直接看后训练成绩。Table 1 的价值在于:它先固定评测框架,观察后训练介入前的模型表现。

  1. 排除后训练变量:Base 模型尚未进行 SFT、RL 与 OPD,分数不会混入这些阶段的影响;
  2. 观察综合预训练结果:表格同时反映架构、数据、模型规模和训练优化的合成效果,不是单项消融;
  3. 检查效率取舍:Flash 以更少的总参数与激活参数在多数项目上超过 V3.2,但在 BBH、HellaSwag、BigCodeBench、GSM8K、MATH 等项目并不领先;
  4. 比较两个 V4 尺寸:Pro 在多数项目上进一步提高,但 Flash 仍在 MGSM 与 CMath 等少数项目上更高,后训练后的相对表现还需看对应评测。
数值演练 · 只看作训练强度的粗略比值
  • V3.2: 14.8T tokens / 37B 激活 ≈ 400 tokens/param
  • V4-Flash: 32T tokens / 13B 激活 ≈ 2461 tokens/param(V3.2 的 6.2×);
  • V4-Pro: 33T tokens / 49B 激活 ≈ 673 tokens/param(V3.2 的 1.7×)。
MoE 每个 token 只激活部分参数,因此“训练 token / 激活参数”可以描述一种计算侧的粗略训练强度;它不是稠密模型常用的 tokens-per-total-parameter 口径,也不是论文采用的“知识密度”指标。不能用这个比值预测 FACTS 分数或解释 Flash 与 Pro 的能力差。

5. 一句话总结

Base 评测排除了后训练影响,但没有把架构、数据质量、token 数和优化器贡献彼此分离。Flash-Base 在多数基准上超过 V3.2-Base,Pro-Base 又进一步提升,为后训练提供了更强起点;不能把某两个分数直接解释为 OPD 的数学 ceiling。