Ch 16 · Specialist
第四部分 · 后训练 · 16

Specialist — 多面手的炼成

V4 先训练领域 specialist,再以 OPD 合并到统一模型。Specialist 阶段沿用 SFT + GRPO,并以 GRM 覆盖难验证任务;三种 reasoning effort 使用不同的长度惩罚和 RL context window。

名词速通 · 一分钟看懂"Specialist 阶段"

Specialist 阶段 = V4 后训练的第一阶段:通过领域 prompt 与 reward 训练不同 specialist,并以十余个 teacher 为后续 OPD 提供监督。报告没有给出领域清单,也没有说每个领域都产生三份独立 checkpoint。

一句话:先用领域数据和奖励信号训练多个 specialist,再由 OPD 把这些能力整合进统一模型。 每个 specialist 依次经过 fine-tuning 与 GRPO;难验证任务使用 GRM,三种 reasoning effort 则采用不同的 RL 配置。

Specialist(领域专家模型)
从 Base 模型出发,经领域 fine-tuning 与 GRPO 得到 specialist。报告只说 OPD 使用十余个覆盖不同领域的 teacher,没有逐项列出数学、代码、安全等完整清单。
SFT(Supervised Fine-Tuning)
用领域数据对 Base 模型做初始 fine-tuning,为随后由领域 prompt 与 reward 驱动的 GRPO 提供起点。报告没有把它概括为只能学习“表层模式”,也没有披露完整数据模板。
GRPO(Group Relative Policy Optimization, DeepSeek 2024)
GRPO 使用同一 prompt 的一组 responses 计算相对优势,不需要单独训练 value model。V4 报告没有披露 group size,也没有量化为“显存省一半”或“N 倍”。
GRM(Generative Reward Model)
对难以用规则验证的任务,模型依据 rubric 生成式地分析 policy trajectory 并给出评价。V4 让 actor 网络同时承担 GRM 角色,并直接对其做 RL 优化;报告称这样能以较少的多样化人工标注获得更稳健的评分,但没有给出成本降幅。
Easy-to-Verify vs Hard-to-Verify
Easy:可由规则或测试用例验证的任务。Hard:需要依据 rubric 判断质量、缺少单一客观判据的任务。传统做法常用人工标注训练 scalar reward model;V4 改用经过 RL 优化的 GRM,并强调只需较少的多样化人工标注,未披露具体成本。
Reasoning Effort(推理强度)
V4 支持三档 reasoning effort:Non-thinkThink HighThink Max。训练时三档采用不同 length penalty 和 context window;评测时分别使用 8K、128K 和 384K context。报告没有披露 RL 训练窗口的具体数值。
Length Penalty(长度惩罚)
三种 reasoning effort 在 RL 阶段使用不同的 length penalty 与 context window,从而形成不同的输出 token 长度。报告没有披露惩罚函数的具体形式或三档数值。
Reward Hacking(奖励黑客)
策略利用奖励模型漏洞而获得高分、却没有真正完成任务的现象。GRM 的生成式评价可能提供更丰富的判断过程,但 V4 报告没有给出其相对 scalar RM 的 reward-hacking 消融,不能宣称已经解决这一问题。
一句话定位:Specialist 阶段通过领域 fine-tuning 与 GRPO 形成多种专长,GRM 覆盖难验证任务,三套 RL 配置形成不同 reasoning effort;这些模型随后作为 Ch18 OPD 的教师。

1. 两阶段流程:先专精,再整合

V4 先分别训练领域 specialist,再用多教师 OPD 将能力整合进统一模型。报告明确披露的流程是:

  • Stage 1(本章):每个 specialist 依次经过领域 fine-tuning 与 GRPO;
  • Reasoning effort:不同 RL 配置使用不同长度惩罚与 context window;
  • Stage 2(Ch18):十余个领域 teacher 通过 reverse-KL OPD 监督统一 student。

报告称,logits-level OPD 在实践中规避了传统权重合并或 mixed RL 常见的性能退化;它没有给出 reward 量纲、领域干扰幅度或调参复杂度的分项消融。

不同 specialist 可以独立训练,便于按领域调整数据和 reward。报告没有给出 10×3=30 个 checkpoint 的拓扑,也没有把并行能力归结为 GRPO 的唯一作用。

2. GRPO:用"组内 baseline"替掉 value head

PPO 通常需要 value function,而 GRPO 通过组内相对 reward 避免单独的 value model。具体显存差异取决于是否共享 backbone、参数切分和 rollout 配置,不能一概写成翻倍。

GRPO 的核心直觉是:baseline 不一定来自学习到的 value function,也可以由同一 prompt 的一组 responses 的相对 reward 构造。

$$ A_i \;=\; \frac{r_i - \mathrm{mean}\!\big(\{r_j\}_{j=1}^G\big)}{\mathrm{std}\!\big(\{r_j\}_{j=1}^G\big)} $$
📖 公式白话翻译

这条公式翻成大白话就是"同一个题让模型答 G 遍,谁的 reward 高于平均就鼓励谁、低于平均就惩罚谁"

  1. $\{r_j\}_{j=1}^G$:同一 prompt 采样 $G$ 条 responses,各自得到 reward;V4 报告没有披露 $G$;
  2. $\mathrm{mean}(\{r_j\})$:这一组 G 条的平均 reward —— 组内 baseline,替代了 PPO 的 $V(s)$;
  3. $\mathrm{std}(\{r_j\})$:归一化方差,让不同难度题的 advantage 量级可比;
  4. $A_i$:标准化后的"相对优势"。$A_i > 0$ → 这条比组内平均好 → 增加它的概率;$A_i < 0$ → 减少;
  5. 策略更新:实际 GRPO 还包含重要性比率、裁剪与正则等项;上式只展示组内标准化 advantage,不是完整损失。

关键点是无需另训 value model:相对优势由组内 reward 统计得到。V4 沿用 GRPO,并说明超参数与此前工作接近;报告没有把模型规模可行性单独归因于这一项。

数值演练 · GRPO 省的显存 示意说明:省去单独 value model 可以降低额外训练状态与计算,但 V4 报告没有公开单次训练 state 的显存账。
  • PPO:需要维护或计算 value function;
  • GRPO:用组内 reward 统计构造相对优势,不训练独立 value model;
  • 实际节省量依赖实现,报告没有给出 600GB、1400GB 或 2× 等数据。
同一 prompt 的多条 responses 可以共享 prefill,这是常见工程优化;V4 报告没有披露 $G=8$,也没有将其称为训练多个 specialist 的根本原因。

3. GRM:把"评分"也变成"生成"

GRPO 解决了"怎么 RL",但 reward 从哪来仍然是个问题。三种来源:

  • Rule-based:数学答案精确匹配、format 校验。最干净但只覆盖少数任务;
  • Unit-test:代码任务跑测试。覆盖代码全栈;
  • Scalar Reward Model:训练一个模型输出质量分数,常用于难以由规则直接验证的任务。传统 RLHF 通常需要较多人工标注;V4 报告没有给出固定样本量或成本。

V4 的关键一跳:把 RM 也变成 generative。给 GRM 一个 trajectory,让它先 think 再打分

<think>
这个回答的优点是 ... 但在 X 处明显犯了 Y 错误,因为 ...
</think>
score: 6/10
📖 GRM 为什么能 work

三件事一起作用:

  1. 把生成与评价放进同一 actor:报告称 actor network 原生承担 GRM 角色,使生成能力和 judging proficiency 可以联合优化;这不等于每次都由同一份在线 policy 给自己打分。
  2. 让 reasoning 参与评价:GRM 以生成方式分析 trajectory,再输出评分。报告将这种内部 reasoning 与更稳健的评分联系起来,但没有证明它能消除 reward hacking。
  3. 减少标注依赖:报告称 rubric-guided data 与 GRM 只需要少量多样化人工标注,但没有给出 1K、99% 或具体美元成本。

可以把 GRM 理解为“用生成式 reasoning 完成评价”,它与 scalar reward model 的主要区别在输出与训练方式,而不是与注意力或激活函数共享某种算法结构。

4. 三档 Reasoning Effort:让同一专家有三个推理 budget

同一个数学题,o1 / R1 这类模型可能 think 50 token 就答出来,也可能 think 5000 token 探索多条路。两者都是有价值的:日常对话不需要 5000 token thinking 的延迟,但奥数题需要。V4 把这件事做成三档训练

响应格式RL ctxlength penalty典型场景
Non-think</think> + summary8K未披露日常任务 / 低风险决策
Think High<think>…</think> + summary128K未披露复杂问题 / 规划 / 中风险决策
Think Max特殊 system prompt + thinking + summary384K未披露探索推理能力边界
Reasoning Mode 三档表:Non-think / Think High / Think Max 的特征、用例、响应格式
图 16-1 · 三档 Reasoning Mode 的官方定义(论文 Table 2)。 Non-think:无 <think> 段,直接出答案,对应"凭直觉、按习惯做事"的低风险日常任务(如简短问答、紧急反应)。 Think High:<think>…</think> 段做有意识的逻辑推理,慢但准,覆盖中等风险的复杂规划 / 问题求解。 Think Max:把推理推到极限 —— 除了正常 think 段,还在系统 prompt 最前面注入额外强约束(见图 16-2);用于探索模型推理能力的边界。响应格式列里给出了三档对应的输出模板。 来源:DeepSeek-V4 技术报告 §5.1.1 Specialist Training,Table 2,p. 30。
Think Max 模式注入的 Injected Instruction 全文
图 16-2 · Think Max 模式的强约束 prompt 全文(论文 Table 3)。 Table 3 的指令要求最大化推理强度、检查路径与边界情况,并记录中间步骤和被否决的假设。报告说明 Think Max 会在 system prompt 开头加入这段指令,但没有给出它把 thinking 长度提高 5–10× 的统计。 来源:DeepSeek-V4 技术报告 §5.1.1 Specialist Training,Table 3,p. 30。

Think Max 在 system prompt 开头加入一段提高推理强度的指令,并使用专门的 response format。报告还说明三档在 RL 中采用不同 length penalty 与 context window;384K 是评测设置中的 Max context,不能直接写成 RL 训练窗口。

Demo · 三档 reasoning effort 的 token budget vs benchmark accuracy(拖动看 budget 如何决定档位)
交互
40 55 70 85 100 100 1K 8K 128K 384K 推理 token 预算(log) benchmark 精度 % Non-think 8K Think High 128K Think Max 384K 日常对话(饱和早) 规划 / 中等推理 奥数 / 极限推理

读图法:三条曲线只是用来说明“不同任务对推理预算的收益曲线可能不同”,并非 V4 benchmark 拟合结果。8K、128K、384K 是报告的三档评测 context。
图中的 50%、85% 和曲线形状均为教学参数,不能当作论文成绩或“最优 budget 相差 100×”的证据。

5. 一个 Specialist 的训练 cookbook

  1. 起点:从 V4-Pro / Flash 的 Base 模型进入领域 fine-tuning;
  2. SFT:用领域内高质量 (prompt, gold answer) 对走 1-2 epoch SFT,让模型学到领域 schema 与基本回答格式;
  3. RL(GRPO):在领域 prompt 与 reward signals 下优化;报告没有披露每个 prompt 的 rollout 数。
  4. Reasoning effort:不同模式在 RL 中采用不同 length penalty 与 context window;三档的评测 context 为 8K / 128K / 384K。
  5. 交付:OPD 使用十余个领域 teacher 蒸馏统一 student;不能从报告推出约 30 个 checkpoint。
为什么这是"备料"而不是"成品"

specialist 在自己的领域内强但不全面:数学 specialist 不会处理 Agent 工具调用,代码 specialist 不会做长写作。直接把 N 个 checkpoint 部署也不可行 —— 用户不会按领域选模型。
最终 V4-Pro / Flash 通过 OPD 从十余个领域 teacher 学习并形成统一 student。报告没有公布每个 specialist checkpoint,也没有讨论它们是否会单独发布。

6. 一句话总结

Specialist 阶段先按领域进行 SFT 与 GRPO,再由 OPD 将十余个 teacher 的能力合入统一 student。GRM 用生成式评估覆盖难验证任务;三种 reasoning effort 则通过不同长度惩罚、context window 与 response format 控制推理强度。报告没有量化 N 倍并行、标注成本降幅或 100× budget。