Specialist — 多面手的炼成
V4 先训练领域 specialist,再以 OPD 合并到统一模型。Specialist 阶段沿用 SFT + GRPO,并以 GRM 覆盖难验证任务;三种 reasoning effort 使用不同的长度惩罚和 RL context window。
Specialist 阶段 = V4 后训练的第一阶段:通过领域 prompt 与 reward 训练不同 specialist,并以十余个 teacher 为后续 OPD 提供监督。报告没有给出领域清单,也没有说每个领域都产生三份独立 checkpoint。
一句话:先用领域数据和奖励信号训练多个 specialist,再由 OPD 把这些能力整合进统一模型。 每个 specialist 依次经过 fine-tuning 与 GRPO;难验证任务使用 GRM,三种 reasoning effort 则采用不同的 RL 配置。
- Specialist(领域专家模型)
- 从 Base 模型出发,经领域 fine-tuning 与 GRPO 得到 specialist。报告只说 OPD 使用十余个覆盖不同领域的 teacher,没有逐项列出数学、代码、安全等完整清单。
- SFT(Supervised Fine-Tuning)
- 用领域数据对 Base 模型做初始 fine-tuning,为随后由领域 prompt 与 reward 驱动的 GRPO 提供起点。报告没有把它概括为只能学习“表层模式”,也没有披露完整数据模板。
- GRPO(Group Relative Policy Optimization, DeepSeek 2024)
- GRPO 使用同一 prompt 的一组 responses 计算相对优势,不需要单独训练 value model。V4 报告没有披露 group size,也没有量化为“显存省一半”或“N 倍”。
- GRM(Generative Reward Model)
- 对难以用规则验证的任务,模型依据 rubric 生成式地分析 policy trajectory 并给出评价。V4 让 actor 网络同时承担 GRM 角色,并直接对其做 RL 优化;报告称这样能以较少的多样化人工标注获得更稳健的评分,但没有给出成本降幅。
- Easy-to-Verify vs Hard-to-Verify
- Easy:可由规则或测试用例验证的任务。Hard:需要依据 rubric 判断质量、缺少单一客观判据的任务。传统做法常用人工标注训练 scalar reward model;V4 改用经过 RL 优化的 GRM,并强调只需较少的多样化人工标注,未披露具体成本。
- Reasoning Effort(推理强度)
- V4 支持三档 reasoning effort:Non-think、Think High 与 Think Max。训练时三档采用不同 length penalty 和 context window;评测时分别使用 8K、128K 和 384K context。报告没有披露 RL 训练窗口的具体数值。
- Length Penalty(长度惩罚)
- 三种 reasoning effort 在 RL 阶段使用不同的 length penalty 与 context window,从而形成不同的输出 token 长度。报告没有披露惩罚函数的具体形式或三档数值。
- Reward Hacking(奖励黑客)
- 策略利用奖励模型漏洞而获得高分、却没有真正完成任务的现象。GRM 的生成式评价可能提供更丰富的判断过程,但 V4 报告没有给出其相对 scalar RM 的 reward-hacking 消融,不能宣称已经解决这一问题。
1. 两阶段流程:先专精,再整合
V4 先分别训练领域 specialist,再用多教师 OPD 将能力整合进统一模型。报告明确披露的流程是:
- Stage 1(本章):每个 specialist 依次经过领域 fine-tuning 与 GRPO;
- Reasoning effort:不同 RL 配置使用不同长度惩罚与 context window;
- Stage 2(Ch18):十余个领域 teacher 通过 reverse-KL OPD 监督统一 student。
报告称,logits-level OPD 在实践中规避了传统权重合并或 mixed RL 常见的性能退化;它没有给出 reward 量纲、领域干扰幅度或调参复杂度的分项消融。
不同 specialist 可以独立训练,便于按领域调整数据和 reward。报告没有给出 10×3=30 个 checkpoint 的拓扑,也没有把并行能力归结为 GRPO 的唯一作用。
2. GRPO:用"组内 baseline"替掉 value head
PPO 通常需要 value function,而 GRPO 通过组内相对 reward 避免单独的 value model。具体显存差异取决于是否共享 backbone、参数切分和 rollout 配置,不能一概写成翻倍。
GRPO 的核心直觉是:baseline 不一定来自学习到的 value function,也可以由同一 prompt 的一组 responses 的相对 reward 构造。
这条公式翻成大白话就是"同一个题让模型答 G 遍,谁的 reward 高于平均就鼓励谁、低于平均就惩罚谁":
- $\{r_j\}_{j=1}^G$:同一 prompt 采样 $G$ 条 responses,各自得到 reward;V4 报告没有披露 $G$;
- $\mathrm{mean}(\{r_j\})$:这一组 G 条的平均 reward —— 组内 baseline,替代了 PPO 的 $V(s)$;
- $\mathrm{std}(\{r_j\})$:归一化方差,让不同难度题的 advantage 量级可比;
- $A_i$:标准化后的"相对优势"。$A_i > 0$ → 这条比组内平均好 → 增加它的概率;$A_i < 0$ → 减少;
- 策略更新:实际 GRPO 还包含重要性比率、裁剪与正则等项;上式只展示组内标准化 advantage,不是完整损失。
关键点是无需另训 value model:相对优势由组内 reward 统计得到。V4 沿用 GRPO,并说明超参数与此前工作接近;报告没有把模型规模可行性单独归因于这一项。
- PPO:需要维护或计算 value function;
- GRPO:用组内 reward 统计构造相对优势,不训练独立 value model;
- 实际节省量依赖实现,报告没有给出 600GB、1400GB 或 2× 等数据。
3. GRM:把"评分"也变成"生成"
GRPO 解决了"怎么 RL",但 reward 从哪来仍然是个问题。三种来源:
- Rule-based:数学答案精确匹配、format 校验。最干净但只覆盖少数任务;
- Unit-test:代码任务跑测试。覆盖代码全栈;
- Scalar Reward Model:训练一个模型输出质量分数,常用于难以由规则直接验证的任务。传统 RLHF 通常需要较多人工标注;V4 报告没有给出固定样本量或成本。
V4 的关键一跳:把 RM 也变成 generative。给 GRM 一个 trajectory,让它先 think 再打分:
<think>
这个回答的优点是 ... 但在 X 处明显犯了 Y 错误,因为 ...
</think>
score: 6/10
三件事一起作用:
- 把生成与评价放进同一 actor:报告称 actor network 原生承担 GRM 角色,使生成能力和 judging proficiency 可以联合优化;这不等于每次都由同一份在线 policy 给自己打分。
- 让 reasoning 参与评价:GRM 以生成方式分析 trajectory,再输出评分。报告将这种内部 reasoning 与更稳健的评分联系起来,但没有证明它能消除 reward hacking。
- 减少标注依赖:报告称 rubric-guided data 与 GRM 只需要少量多样化人工标注,但没有给出 1K、99% 或具体美元成本。
可以把 GRM 理解为“用生成式 reasoning 完成评价”,它与 scalar reward model 的主要区别在输出与训练方式,而不是与注意力或激活函数共享某种算法结构。
4. 三档 Reasoning Effort:让同一专家有三个推理 budget
同一个数学题,o1 / R1 这类模型可能 think 50 token 就答出来,也可能 think 5000 token 探索多条路。两者都是有价值的:日常对话不需要 5000 token thinking 的延迟,但奥数题需要。V4 把这件事做成三档训练:
| 档 | 响应格式 | RL ctx | length penalty | 典型场景 |
|---|---|---|---|---|
| Non-think | </think> + summary | 8K | 未披露 | 日常任务 / 低风险决策 |
| Think High | <think>…</think> + summary | 128K | 未披露 | 复杂问题 / 规划 / 中风险决策 |
| Think Max | 特殊 system prompt + thinking + summary | 384K | 未披露 | 探索推理能力边界 |
Think Max 在 system prompt 开头加入一段提高推理强度的指令,并使用专门的 response format。报告还说明三档在 RL 中采用不同 length penalty 与 context window;384K 是评测设置中的 Max context,不能直接写成 RL 训练窗口。
读图法:三条曲线只是用来说明“不同任务对推理预算的收益曲线可能不同”,并非 V4 benchmark 拟合结果。8K、128K、384K 是报告的三档评测 context。
图中的 50%、85% 和曲线形状均为教学参数,不能当作论文成绩或“最优 budget 相差 100×”的证据。
5. 一个 Specialist 的训练 cookbook
- 起点:从 V4-Pro / Flash 的 Base 模型进入领域 fine-tuning;
- SFT:用领域内高质量 (prompt, gold answer) 对走 1-2 epoch SFT,让模型学到领域 schema 与基本回答格式;
- RL(GRPO):在领域 prompt 与 reward signals 下优化;报告没有披露每个 prompt 的 rollout 数。
- Reasoning effort:不同模式在 RL 中采用不同 length penalty 与 context window;三档的评测 context 为 8K / 128K / 384K。
- 交付:OPD 使用十余个领域 teacher 蒸馏统一 student;不能从报告推出约 30 个 checkpoint。
specialist 在自己的领域内强但不全面:数学 specialist 不会处理 Agent 工具调用,代码 specialist 不会做长写作。直接把 N 个 checkpoint 部署也不可行 —— 用户不会按领域选模型。
最终 V4-Pro / Flash 通过 OPD 从十余个领域 teacher 学习并形成统一 student。报告没有公布每个 specialist checkpoint,也没有讨论它们是否会单独发布。
6. 一句话总结
Specialist 阶段先按领域进行 SFT 与 GRPO,再由 OPD 将十余个 teacher 的能力合入统一 student。GRM 用生成式评估覆盖难验证任务;三种 reasoning effort 则通过不同长度惩罚、context window 与 response format 控制推理强度。报告没有量化 N 倍并行、标注成本降幅或 100× budget。