feat: publish alignment deep dive
This commit is contained in:
@@ -0,0 +1,601 @@
|
||||
# 指令微调与人类偏好研究账本
|
||||
|
||||
状态:正式一手证据账本,Chapter 10 首版研究中
|
||||
研究截止:2026-07-29
|
||||
本轮本地缓存:24 份新增一手 PDF / 文本,复用 PPO、DeepSeek、Kimi 与推理专题既有缓存
|
||||
线索发现:K3 references、论文引用网络、会议/作者页面、Grok CLI
|
||||
结论依据:原论文正文、会议论文页、官方技术报告;Grok 只用于扩大候选召回
|
||||
|
||||
## 0. 这一章真正要回答什么
|
||||
|
||||
“Alignment / 对齐”经常被说成一个模糊的终点,仿佛模型经过某种神秘训练后就“符合人类价值”。
|
||||
为了避免这种过度承诺,本章把问题限定为:
|
||||
|
||||
> 一个只会延续互联网文本分布的 base language model,
|
||||
> 如何学会理解用户接口、产生可协作行为、区分更好与更差的回答,
|
||||
> 并在代理目标、反馈偏差与能力退化之间保持可检查的边界?
|
||||
|
||||
至少要分开十二张账:
|
||||
|
||||
1. **行为目标账**:我们想改变 helpfulness、harmlessness、honesty、格式遵循、风格还是某项能力?
|
||||
2. **监督单位账**:标签作用于 Token、整段 demonstration、pairwise preference、标量、步骤还是环境结果?
|
||||
3. **数据来源账**:人类、AI teacher、constitution、规则 verifier、执行环境分别提供什么信息?
|
||||
4. **SFT 账**:teacher forcing 的条件似然学到了什么,又没有学到什么?
|
||||
5. **偏好测量账**:排序、评分、二元可取性与多人分歧怎样进入数据?
|
||||
6. **奖励模型账**:Bradley–Terry 类模型如何把比较变成标量代理?
|
||||
7. **策略优化账**:PPO、REINFORCE/RLOO、GRPO 分别怎样更新 policy?
|
||||
8. **直接偏好账**:DPO、IPO、KTO、ORPO、SimPO 消掉了哪些组件,保留了哪些假设?
|
||||
9. **分布账**:反馈来自当前 policy 还是旧 policy;online、offline、on-policy、off-policy 不能混写。
|
||||
10. **约束账**:reference KL、pretraining mix、长度/语言/安全约束怎样防止“为了高分走太远”?
|
||||
11. **失效账**:reward hacking、过优化、迎合、长度偏置、拒答过度与 alignment tax 怎样出现?
|
||||
12. **证据账**:训练 reward、RM accuracy、LLM judge、人工盲评、规则验证分别能证明到哪一步?
|
||||
|
||||
本章不声称给出“人类价值”的唯一数学定义。它讲的是可观测的 post-training 接口、训练信号和证据边界。
|
||||
|
||||
## 1. 四条因果链
|
||||
|
||||
### 1.1 从任务标签到自然语言接口
|
||||
|
||||
```text
|
||||
每个任务训练一个专用模型
|
||||
→ 多任务共享参数
|
||||
→ 用 prompt template 把不同数据集写成自然语言任务
|
||||
→ FLAN / T0:在许多 prompted tasks 上 instruction tuning
|
||||
→ Self-Instruct:让模型自举生成 instruction / input / output
|
||||
→ LIMA:检验少量高质量示范能把多大比例的预训练能力“叫出来”
|
||||
→ 当代 SFT:混合通用、推理、工具、代码、安全与多轮轨迹
|
||||
```
|
||||
|
||||
这里的核心变化不是“下一个 Token 目标消失”,而是训练条件从普通文本前缀变成了
|
||||
`system / instruction / context / response` 的交互接口。
|
||||
|
||||
### 1.2 从比较轨迹到通用助手 RLHF
|
||||
|
||||
```text
|
||||
Christiano et al. 2017:人比较两段行为轨迹
|
||||
→ reward predictor 拟合 pairwise preference
|
||||
→ Ziegler et al. 2019:把 RM + KL + PPO 接到语言模型
|
||||
→ Stiennon et al. 2020:摘要任务验证完整三段式管线
|
||||
→ InstructGPT 2022:SFT → RM → PPO-ptx 扩展到开放指令
|
||||
→ HH-RLHF / Llama 2:helpfulness、安全与多轮迭代被显式分账
|
||||
```
|
||||
|
||||
真正的桥梁是“比较比绝对打分更容易”,并通过 Bradley–Terry 风格的选择模型把比较拟合成可优化标量。
|
||||
|
||||
### 1.3 从显式奖励模型到直接偏好目标
|
||||
|
||||
```text
|
||||
RM + PPO:先拟合 scalar reward,再对当前 policy 做在线优化
|
||||
→ RRHF / SLiC-HF:用排序或似然校准直接作用到回答概率
|
||||
→ DPO:在 BT + KL-regularized optimum 假设下,把 reward 改写成 policy/reference log-ratio
|
||||
→ IPO:指出确定性偏好假设下的过拟合问题,改用回归式间隔
|
||||
→ KTO:允许 desirable / undesirable 非成对反馈
|
||||
→ ORPO:把 SFT 与 odds-ratio preference 合为单阶段
|
||||
→ SimPO:用长度归一平均 log-prob 和 margin 构造 reference-free reward
|
||||
```
|
||||
|
||||
“无需 reward model”不等于“无需偏好信号”,也不等于“自动 on-policy”。
|
||||
|
||||
### 1.4 从人类偏好到 AI、规则与环境反馈
|
||||
|
||||
```text
|
||||
Human demonstrations / rankings
|
||||
→ Constitutional AI:原则 → 自我批评/修订 → AI preference
|
||||
→ RLAIF / UltraFeedback:用 LLM 扩大标签量与维度
|
||||
→ rule-based verifier:数学答案、编译器、测试用例
|
||||
→ generative reward model:按 rubric 生成评价过程与分数
|
||||
→ DeepSeek:SFT + GRPO + rule/model/GRM,多阶段合并
|
||||
→ Kimi K3:SFT → 3 domains × 3 efforts RL teachers → MOPD
|
||||
```
|
||||
|
||||
这不是“AI 反馈取代人类”的单向历史。现代系统常把人工定义的目标、AI 扩标、可执行规则和环境结果组合起来。
|
||||
|
||||
## 2. 最小数学:四个不同对象
|
||||
|
||||
### 2.1 SFT:模仿一个给定回答
|
||||
|
||||
对 prompt `x` 与示范回答 `y = (y₁,…,y_T)`:
|
||||
|
||||
```text
|
||||
L_SFT = - Σ_t m_t log πθ(y_t | x, y_<t)
|
||||
```
|
||||
|
||||
`m_t` 通常只让 assistant response token 计入损失;system/user token 用作条件但不作为目标。
|
||||
|
||||
它在问:
|
||||
|
||||
> 在已经给定这个参考答案的条件下,模型是否提高了每个参考 Token 的概率?
|
||||
|
||||
它没有直接问“另一个回答是否更好”,也没有在自由 rollout 分布上训练纠错。
|
||||
|
||||
### 2.2 偏好模型:比较两个完整回答
|
||||
|
||||
对同一 prompt 的 chosen `y_w` 与 rejected `y_l`,Bradley–Terry 形式为:
|
||||
|
||||
```text
|
||||
P(y_w ≻ y_l | x)
|
||||
= σ(rφ(x,y_w) - rφ(x,y_l))
|
||||
```
|
||||
|
||||
reward model loss:
|
||||
|
||||
```text
|
||||
L_RM = -log σ(rφ(x,y_w) - rφ(x,y_l))
|
||||
```
|
||||
|
||||
只有 reward difference 可辨识:给同一 prompt 的全部奖励同时加一个常数,不改变偏好概率。
|
||||
|
||||
### 2.3 KL-regularized policy optimization
|
||||
|
||||
典型目标的抽象形式:
|
||||
|
||||
```text
|
||||
max_π E[rφ(x,y)] - β KL(π(·|x) || π_ref(·|x))
|
||||
```
|
||||
|
||||
`π_ref` 不是装饰:
|
||||
|
||||
- 把 policy 留在 reward model 见过的分布附近;
|
||||
- 保持语言质量与已有行为;
|
||||
- 让 reward 与偏离成本之间形成可调边界。
|
||||
|
||||
InstructGPT 还加入 pretraining mix:
|
||||
|
||||
```text
|
||||
reward - β log(π_RL / π_SFT) + γ log π_RL(x_pretrain)
|
||||
```
|
||||
|
||||
因此论文默认的 InstructGPT 是 PPO-ptx,不应把它简化成“纯 PPO”。
|
||||
|
||||
### 2.4 DPO:用 policy/reference 比值参数化隐式奖励
|
||||
|
||||
在论文的假设下:
|
||||
|
||||
```text
|
||||
rθ(x,y) = β log [πθ(y|x) / π_ref(y|x)]
|
||||
```
|
||||
|
||||
DPO loss:
|
||||
|
||||
```text
|
||||
L_DPO =
|
||||
-log σ( β[
|
||||
log πθ(y_w|x) - log π_ref(y_w|x)
|
||||
- log πθ(y_l|x) + log π_ref(y_l|x)
|
||||
])
|
||||
```
|
||||
|
||||
它训练的是“相对 reference,chosen 比 rejected 获得更大的 log-ratio 提升”。
|
||||
所以 DPO 仍依赖:
|
||||
|
||||
- preference pair 的质量;
|
||||
- pair 来自哪个行为分布;
|
||||
- reference policy;
|
||||
- `β`;
|
||||
- sequence log-prob 的求和、mask 与长度口径。
|
||||
|
||||
## 3. 十二张教学账
|
||||
|
||||
### 3.1 行为目标账:先说清“对齐什么”
|
||||
|
||||
至少区分:
|
||||
|
||||
| 目标 | 典型问题 | 不能替代的证据 |
|
||||
|---|---|---|
|
||||
| Instruction following | 是否遵守格式、约束和任务 | 仅看流畅度不够 |
|
||||
| Helpfulness | 是否解决用户真实问题 | RM 分数不是用户成功率 |
|
||||
| Harmlessness / safety | 是否拒绝或安全重定向 | “总是拒答”不是完整安全 |
|
||||
| Honesty / calibration | 是否承认不知道、避免编造 | 偏好者也可能奖励自信语气 |
|
||||
| Reasoning / coding | 是否得到可验证结果 | 长 CoT 或漂亮代码不等于通过 |
|
||||
| Agent execution | 是否在环境中完成长程任务 | 单轮 chat win-rate 不足 |
|
||||
| Style / personality | 是否符合表达规范 | 不应冒充能力增长 |
|
||||
|
||||
“能力学习”与“行为塑形”不是二选一。SFT 可注入新任务知识,RL 也可能重排甚至扩展可访问策略;
|
||||
但任何因果归因都需要控制 base、数据、预算和评测。
|
||||
|
||||
### 3.2 监督单位账:标签落在哪里
|
||||
|
||||
| 信号 | 单位 | 优点 | 盲点 |
|
||||
|---|---|---|---|
|
||||
| Demonstration | 整段目标回答的 Token | 稠密、稳定 | 只有一种参考路径 |
|
||||
| Pairwise preference | 两个完整回答 | 比绝对分数容易 | 只给相对次序 |
|
||||
| Likert / scalar | 单回答 | 可表达强弱 | 标尺跨人漂移 |
|
||||
| Outcome reward | 轨迹末端 | 便宜、客观 | credit assignment 稀疏 |
|
||||
| Process reward | 中间步骤 | 更细粒度 | 标注贵,可能不忠实 |
|
||||
| Token teacher signal | 每个 Token | 稠密整合能力 | teacher 偏差逐 Token 传递 |
|
||||
| Environment reward | 状态变化/测试 | 接近任务结果 | verifier 可能有漏洞 |
|
||||
|
||||
### 3.3 数据来源账:谁定义“更好”
|
||||
|
||||
1. 专业标注者;
|
||||
2. 目标用户或产品日志;
|
||||
3. 众包标注者;
|
||||
4. AI judge / teacher;
|
||||
5. 宪法或书面 rubric;
|
||||
6. ground truth / 单元测试 / 编译器;
|
||||
7. 沙箱环境的真实结果;
|
||||
8. 多来源混合。
|
||||
|
||||
来源决定偏差。把 “human preference” 聚合成单一标量,会隐藏群体分歧、标注者训练、文化背景和任务专长。
|
||||
|
||||
### 3.4 SFT 账:稳定冷启动,不是万能答案
|
||||
|
||||
SFT 的三个主要作用:
|
||||
|
||||
- 教交互协议、角色与输出格式;
|
||||
- 把 base model 的已有能力放到用户可调用的接口上;
|
||||
- 给 RL 提供足够可靠的 cold-start policy,避免 rollout 一开始全是无效样本。
|
||||
|
||||
主要代价:
|
||||
|
||||
- teacher forcing 与自由生成分布不一致;
|
||||
- 参考答案不是唯一正确策略;
|
||||
- 每个回答 Token 都被模仿,难表达“这部分好、那部分差”;
|
||||
- 低质量、重复或模板化示范会被直接学习;
|
||||
- 过强模仿可能缩小探索空间。
|
||||
|
||||
LIMA 的 1,000 高质量样本是“强 base + 指定评测 + 风格/接口”的实证结果,不是“小数据对齐普遍定律”。
|
||||
|
||||
### 3.5 偏好测量账:比较也不是客观真值
|
||||
|
||||
偏好数据必须记录:
|
||||
|
||||
- candidate 由哪些 policy、temperature、长度上限生成;
|
||||
- 是两两比较、K-way ranking 还是独立评分;
|
||||
- 是否允许 tie / both bad;
|
||||
- rubric 是总体质量还是多维评分;
|
||||
- 是否随机交换展示位置;
|
||||
- 每个样本有几名标注者、分歧如何保留;
|
||||
- chosen 是否只是“两者较好”,而不是真正高质量。
|
||||
|
||||
训练集若只有“一个差回答和一个明显好回答”,RM 可能只学会表面线索;
|
||||
部署时遇到两个都很强、差异很细的回答就会失准。
|
||||
|
||||
### 3.6 奖励模型账:代理目标的力量和危险来自同一处
|
||||
|
||||
reward model 把开放式判断压成一个可微标量,policy 因而能在没有唯一参考答案时继续优化。
|
||||
但 policy 会主动寻找 RM 的高分区域,而这些区域可能远离 RM 的训练分布。
|
||||
|
||||
重要检查:
|
||||
|
||||
- in-distribution pair accuracy;
|
||||
- hard / OOD / adversarial pairs;
|
||||
- 长度、格式、拒答等 shortcut;
|
||||
- calibration 与多人分歧;
|
||||
- gold human evaluation 随 KL / optimization strength 的曲线;
|
||||
- reward ensemble 或 uncertainty。
|
||||
|
||||
RewardBench 是对 RM 本身的测试入口,不是最终 assistant 质量的充分证明。
|
||||
|
||||
### 3.7 策略优化账:PPO 不是 RLHF 的同义词
|
||||
|
||||
PPO 的 clipped surrogate 限制单次 importance ratio:
|
||||
|
||||
```text
|
||||
min(
|
||||
ρ_t A_t,
|
||||
clip(ρ_t, 1-ε, 1+ε) A_t
|
||||
)
|
||||
```
|
||||
|
||||
LLM RLHF 的完整系统还常包含:
|
||||
|
||||
- actor / policy;
|
||||
- reference policy;
|
||||
- reward model;
|
||||
- critic / value;
|
||||
- rollout engine;
|
||||
- GAE / return;
|
||||
- token mask、长度处理、KL controller;
|
||||
- 可选 pretraining gradient。
|
||||
|
||||
RLOO、GRPO 等方法可省去 learned critic,但不因此自动解决 reward misspecification。
|
||||
|
||||
### 3.8 直接偏好账:算法名字先归到角色合同
|
||||
|
||||
| 方法 | 数据 | 显式 RM | Reference | 核心角色 |
|
||||
|---|---|---:|---:|---|
|
||||
| DPO | chosen/rejected pair | 否 | 是 | policy/reference log-ratio 分类 |
|
||||
| IPO | pair | 否 | 是 | 回归到有限偏好 margin |
|
||||
| KTO | desirable / undesirable 可非配对 | 否 | 通常是 | prospect-theoretic utility |
|
||||
| ORPO | pair + SFT | 否 | 否 | NLL + odds-ratio penalty |
|
||||
| SimPO | pair | 否 | 否 | 平均 log-prob reward + target margin |
|
||||
| RRHF | ranking / 多来源候选 | 否 | 否 | 序列得分排序 |
|
||||
| SLiC-HF | pair | 否 | 可选校准基线 | sequence likelihood calibration |
|
||||
|
||||
不能从“模型数更少”直接推出“效果更好”。2024 NeurIPS 的 DPO/PPO 解耦实验明确把
|
||||
preference data、learning algorithm、reward model 和 policy prompts 分成四个变量,并发现数据质量影响最大。
|
||||
|
||||
### 3.9 分布账:online/offline 与 on/off-policy 是两组词
|
||||
|
||||
- **offline preference optimization**:固定 pair 数据训练,不随着当前 policy 更新标签;
|
||||
- **online preference optimization**:当前 policy 生成新候选,再获取反馈;
|
||||
- **on-policy RL**:梯度主要使用当前 policy 的 rollout;
|
||||
- **off-policy / stale rollout**:行为 policy 与当前 policy 不同,需要 importance correction 或 clipping。
|
||||
|
||||
DPO 通常是 offline;PPO 通常需要近 on-policy rollout;K3 partial rollout 会让超长轨迹跨迭代变旧,
|
||||
因此必须显式做 off-policy 稳定化。这些词描述不同轴。
|
||||
|
||||
### 3.10 约束账:为什么不能只追 reward
|
||||
|
||||
常见防线:
|
||||
|
||||
1. reference KL;
|
||||
2. PPO ratio clipping;
|
||||
3. pretraining / SFT replay;
|
||||
4. response length / verbosity budget;
|
||||
5. language consistency;
|
||||
6. safety constraint reward;
|
||||
7. rule-based verifier 优先;
|
||||
8. reward ensemble / uncertainty;
|
||||
9. 在线补充 policy 当前分布上的偏好数据;
|
||||
10. hidden evaluator 与提交预算。
|
||||
|
||||
约束会产生真实 trade-off。例如语言一致性奖励可能轻微降低某些任务表现,却改善目标语言可读性;
|
||||
这不是“白送”的收益。
|
||||
|
||||
### 3.11 失效账:高 reward 不等于高真实效用
|
||||
|
||||
#### Reward overoptimization
|
||||
|
||||
Gao et al. 使用 proxy–gold synthetic setup 展示:
|
||||
|
||||
```text
|
||||
proxy reward 持续上升
|
||||
gold reward 先上升、后饱和甚至下降
|
||||
```
|
||||
|
||||
这是 Goodhart 风险的受控实证,不应外推成所有真实 RLHF 的统一数值曲线。
|
||||
|
||||
#### 长度与语气偏置
|
||||
|
||||
长回答更容易显得完整;礼貌、自信、分点也可能成为 shortcut。
|
||||
需要 length-controlled evaluation,而不是看到 win-rate 上升就断言事实性更好。
|
||||
|
||||
#### 迎合
|
||||
|
||||
如果人更喜欢被认同,模型可能学会顺着错误前提。helpfulness、honesty 和 user approval 必须分开评测。
|
||||
|
||||
#### 过度拒答
|
||||
|
||||
只奖励“不产生危险文本”会推动模型拒绝无害请求。安全评测必须同时测 should-refuse 和 should-respond。
|
||||
|
||||
#### Alignment tax
|
||||
|
||||
RL 或偏好优化可能让某些标准能力退化。DeepSeek-V2 报告明确观察到部分 benchmark 的 alignment tax,
|
||||
并通过训练策略缓解;不能只报 chat judge。
|
||||
|
||||
### 3.12 证据账:每个数字到底证明什么
|
||||
|
||||
| 证据 | 能证明 | 不能单独证明 |
|
||||
|---|---|---|
|
||||
| SFT loss | 模仿训练集 Token 的拟合 | 用户偏好、事实性 |
|
||||
| RM pair accuracy | 在该 pair 分布上的排序 | policy 优化后的 OOD 可靠性 |
|
||||
| training reward | 对当前 proxy 的优化 | 真实人类效用 |
|
||||
| KL | 与 reference 的分布距离 | 改变是好是坏 |
|
||||
| LLM judge win-rate | 该 judge/rubric 下的相对偏好 | 无偏人类共识 |
|
||||
| blind human eval | 特定人群/协议下偏好 | 普适价值 |
|
||||
| rule pass rate | verifier 定义的正确性 | 开放式质量与安全 |
|
||||
| downstream benchmark | 指定任务能力 | 完整助手行为 |
|
||||
|
||||
## 4. DeepSeek:从 SFT+DPO 到多源 GRPO / GRM
|
||||
|
||||
### 4.1 DeepSeek LLM
|
||||
|
||||
官方报告公开:
|
||||
|
||||
- 超过 100 万 SFT instances;
|
||||
- 7B 使用 4 epochs,67B 使用 2 epochs;
|
||||
- helpfulness 与 harmlessness preference data;
|
||||
- DPO 训练 1 epoch;
|
||||
- 数学 SFT 过多会提高重复率;
|
||||
- 报告把 reasoning 改善谨慎归因:SFT 可能主要注入了题型与知识,不能直接证明学会一般推理。
|
||||
|
||||
这是一条典型的 `base → SFT chat → DPO` 管线。
|
||||
|
||||
### 4.2 DeepSeek-V2
|
||||
|
||||
V2 把对齐管线改成:
|
||||
|
||||
```text
|
||||
base
|
||||
→ SFT
|
||||
→ reasoning alignment
|
||||
→ human preference alignment
|
||||
```
|
||||
|
||||
第二阶段采用 helpful、safety 与 rule-based 多奖励;RL 使用 GRPO。
|
||||
报告同时讨论:
|
||||
|
||||
- SFT 数量与质量;
|
||||
- alignment tax;
|
||||
- online RL 与 offline preference alignment 的差异;
|
||||
- code preference 来自 compiler feedback,数学来自 ground-truth labels。
|
||||
|
||||
### 4.3 DeepSeek-V3
|
||||
|
||||
V3 的 post-training 包括:
|
||||
|
||||
- 从 expert model / DeepSeek-R1 蒸馏 reasoning data;
|
||||
- 两个 epochs 的 SFT;
|
||||
- rule-based RM 与 model-based RM;
|
||||
- GRPO;
|
||||
- generative reward model 的探索;
|
||||
- 尽可能优先使用规则验证以降低 reward hacking。
|
||||
|
||||
官方报告给出 pretraining、context extension、post-training 的计算分账;不能把整套 V3 能力归因于 GRPO。
|
||||
|
||||
### 4.4 DeepSeek-R1
|
||||
|
||||
必须分开:
|
||||
|
||||
- **R1-Zero**:从 base 直接做 rule-based reasoning RL,没有初始 SFT;
|
||||
- **R1**:cold-start data → reasoning RL → rejection sampling / SFT → broader RL;
|
||||
- **distilled models**:只做 SFT,不等于复现 R1 的 RL 训练。
|
||||
|
||||
报告附录展示 helpful RM reward hacking:reward 上升而测试表现下降;也展示语言一致性 reward 的能力 trade-off。
|
||||
|
||||
### 4.5 DeepSeek-V3.2 / V4
|
||||
|
||||
V3.2 把 reasoning、agent 与 human alignment 合并进一个大规模 GRPO 阶段,
|
||||
通用任务采用 generative reward model,agent/reasoning 尽量使用规则结果。
|
||||
|
||||
V4 的两阶段主线:
|
||||
|
||||
```text
|
||||
SFT:高质量、多领域、能力冷启动
|
||||
→ GRPO:domain-aligned behavior
|
||||
```
|
||||
|
||||
对 hard-to-verify tasks,V4 报告明确说不再使用传统 scalar RM,而采用 rubric-guided data 与
|
||||
Generative Reward Model;easy-to-verify tasks 继续用规则或测试。
|
||||
|
||||
## 5. Kimi:从长轨迹 RL 到 K3 多教师整合
|
||||
|
||||
### 5.1 Kimi K2 / K2.5
|
||||
|
||||
K2 公开 post-training 覆盖:
|
||||
|
||||
- general RL;
|
||||
- self-critique rubric reward;
|
||||
- verifiable reward;
|
||||
- PTX 与 budget control。
|
||||
|
||||
K2.5 继续扩展 unified agentic RL、视觉与并行 agent,Rollout Manager 支持大规模并发任务。
|
||||
|
||||
这些工作已经超出“聊天回答偏好”:reward 来自执行环境、规则与生成式 rubric 的组合。
|
||||
|
||||
### 5.2 Kimi K3 的三阶段合同
|
||||
|
||||
K3 官方报告明确:
|
||||
|
||||
```text
|
||||
Stage 1 · SFT
|
||||
建立高质量 cold-start agent policy
|
||||
|
||||
Stage 2 · RL experts
|
||||
general / general-agent / coding
|
||||
× low / high / max reasoning effort
|
||||
= 9 个领域-强度专家
|
||||
|
||||
Stage 3 · MOPD
|
||||
student on-policy rollout
|
||||
+ 对应 teacher 的逐 Token log-ratio reward
|
||||
→ 把九个专家整合回一个统一模型
|
||||
```
|
||||
|
||||
MOPD 的逐 Token信号是:
|
||||
|
||||
```text
|
||||
r_opd(y_t)
|
||||
= clip(stopgrad(log π_teacher(y_t|prefix) / π_student(y_t|prefix)),
|
||||
-R_max, R_max)
|
||||
```
|
||||
|
||||
概念边界:
|
||||
|
||||
- K3 的 partial rollout 是长轨迹跨迭代产生的 off-policy 稳定性问题;
|
||||
- MOPD 则在当前 student 自己访问的状态上计算 teacher signal;
|
||||
- 两者可以在同一系统中共存,但不是同一种算法;
|
||||
- agentic GRM 仍需 verbosity budget,报告明确把它作为防 reward hacking 的约束;
|
||||
- MXFP4 QAT 从 SFT 起覆盖整个 post-training,是部署约束,不是偏好目标。
|
||||
|
||||
## 6. 正式一手论文链(44 个节点)
|
||||
|
||||
| # | 年份 | 节点 | 本章角色 | 核验入口 |
|
||||
|---:|---:|---|---|---|
|
||||
| 01 | 2017 | Deep RL from Human Preferences | pairwise trajectory → reward | `1706.03741` Eq.1 / Fig.1 |
|
||||
| 02 | 2017 | PPO | clipped on-policy update | `1707.06347` Eq.7 |
|
||||
| 03 | 2019 | Fine-Tuning LMs from Human Preferences | LM reward + KL + PPO | `1909.08593` Eq.1–2 |
|
||||
| 04 | 2020 | Learning to Summarize from Human Feedback | 完整生成式 RLHF | `2009.01325` Fig.2 / Fig.5 |
|
||||
| 05 | 2021 | Natural Instructions | declarative task interface | `2104.08773` |
|
||||
| 06 | 2021 | FLAN | instruction-tuned zero-shot | `2109.01652` Fig.6 |
|
||||
| 07 | 2021 | T0 | prompted multitask mixture | `2110.08207` Fig.2 |
|
||||
| 08 | 2021 | WebGPT | browser action + preference | `2112.09332` |
|
||||
| 09 | 2022 | InstructGPT | SFT → RM → PPO-ptx | `2203.02155` Fig.2 / Eq.1–2 |
|
||||
| 10 | 2022 | HH-RLHF | helpful / harmless assistant | `2204.05862` |
|
||||
| 11 | 2022 | Super-NaturalInstructions | 1,600+ task generalization | `2204.07705` |
|
||||
| 12 | 2022 | Scaling Instruction-Finetuned LMs | Flan collection scaling | `2210.11416` |
|
||||
| 13 | 2022 | Reward Model Overoptimization | proxy / gold Goodhart curve | `2210.10760` |
|
||||
| 14 | 2022 | Constitutional AI | self-critique + RLAIF | `2212.08073` Fig.1 |
|
||||
| 15 | 2022 | Self-Instruct | synthetic instruction bootstrap | `2212.10560` Fig.2 |
|
||||
| 16 | 2023 | OpenAssistant Conversations | open conversation / ranking tree | `2304.07327` |
|
||||
| 17 | 2023 | RRHF | response ranking objective | `2304.05302` |
|
||||
| 18 | 2023 | SLiC-HF | sequence likelihood calibration | `2305.10425` |
|
||||
| 19 | 2023 | LIMA | 1K curated SFT | `2305.11206` |
|
||||
| 20 | 2023 | AlpacaFarm | feedback simulator / baselines | `2305.14387` |
|
||||
| 21 | 2023 | DPO | implicit reward / direct objective | `2305.18290` Eq.5–7 |
|
||||
| 22 | 2023 | RLAIF vs RLHF | human/AI label comparison | `2309.00267` |
|
||||
| 23 | 2023 | UltraFeedback | scaled multi-aspect AI feedback | `2310.01377` |
|
||||
| 24 | 2023 | IPO theory | finite-margin preference regression | `2310.12036` |
|
||||
| 25 | 2023 | Zephyr | dSFT + AI preference dDPO | `2310.16944` Fig.2 |
|
||||
| 26 | 2024 | KTO | unpaired binary feedback | `2402.01306` |
|
||||
| 27 | 2024 | RLOO | critic-free REINFORCE baseline | `2402.14740` |
|
||||
| 28 | 2024 | ORPO | SFT + odds-ratio single stage | `2403.07691` |
|
||||
| 29 | 2024 | RewardBench | reward model evaluation | `2403.13787` Fig.1 |
|
||||
| 30 | 2024 | SimPO | reference-free mean log-prob | `2405.14734` |
|
||||
| 31 | 2024 | Unpacking DPO and PPO | data/algorithm/RM/prompt 四变量 | NeurIPS 2024 |
|
||||
| 32 | 2024 | Tülu 3 | open SFT → DPO → RLVR recipe | `2411.15124` |
|
||||
| 33 | 2024 | DeepSeek LLM | 1M+ SFT + DPO | `2401.02954` §4 |
|
||||
| 34 | 2024 | DeepSeekMath | GRPO | `2402.03300` |
|
||||
| 35 | 2024 | DeepSeek-V2 | SFT + two-stage GRPO alignment | `2405.04434` §4 |
|
||||
| 36 | 2024 | DeepSeek-V3 | SFT / RM / GRPO / GRM | `2412.19437` §5 |
|
||||
| 37 | 2025 | DeepSeek-R1 | Zero / cold-start / RL / SFT 分层 | `2501.12948` |
|
||||
| 38 | 2025 | DAPO | long-CoT GRPO stabilization | `2503.14476` |
|
||||
| 39 | 2025 | Kimi K2 | verifiable + generative rewards | `2507.20534` |
|
||||
| 40 | 2025 | DeepSeek-V3.2 | merged reasoning/agent/alignment RL | `2512.02556` §3 |
|
||||
| 41 | 2026 | Kimi K2.5 | unified multimodal/agentic RL | `2602.02276` |
|
||||
| 42 | 2026 | DeepSeek-V4 | SFT + GRPO + GRM | `2606.19348` §5 |
|
||||
| 43 | 2026 | MOPD | multi-teacher on-policy distillation | `2606.30406` |
|
||||
| 44 | 2026 | Kimi K3 | 9 experts → MOPD / 1M agentic RL | `2607.24653` §4 |
|
||||
|
||||
## 7. 常见误解清单
|
||||
|
||||
1. **“SFT 改了 next-token 目标”**:通常仍是 next-token cross-entropy,只是条件与训练分布变了。
|
||||
2. **“chosen 就是完美答案”**:pair 只保证 chosen 相对更受偏好,可能两者都差。
|
||||
3. **“reward model 学到了人类价值”**:它拟合特定标签者、rubric、候选分布下的比较。
|
||||
4. **“PPO 就是 RLHF”**:PPO 只是 policy optimizer;RLHF 还含反馈、RM、reference、rollout 和评测。
|
||||
5. **“DPO 不需要 reward”**:它不训练显式 RM,但偏好 pair 与隐式 reward 假设仍在。
|
||||
6. **“DPO 永远比 PPO 好”**:数据质量、online sampling、RM、prompt 分布和实现可改变结论。
|
||||
7. **“RLAIF 没有人类参与”**:原则、rubric、teacher 训练与最终评测仍来自人类选择。
|
||||
8. **“规则奖励不会被 hack”**:解析器、测试覆盖、沙箱和提交预算都可能有漏洞。
|
||||
9. **“训练 reward 上升就是模型更好”**:必须看 gold/human/environment outcome 与 KL。
|
||||
10. **“RLVR 与 RLHF 是两代技术”**:开放任务可用偏好,数学/代码可用 verifier,现代系统混合两者。
|
||||
11. **“R1-Zero 就是 DeepSeek-R1”**:正式 R1 还有 cold start、SFT、多阶段 RL 与蒸馏。
|
||||
12. **“K3 MOPD 是普通离线蒸馏”**:student 在自己的 rollout 状态上接收对应 teacher 的逐 Token 信号。
|
||||
|
||||
## 8. 页面与交互验收合同
|
||||
|
||||
### 8.1 正文
|
||||
|
||||
- 20–22 个正文区段;
|
||||
- 十二张账;
|
||||
- 至少 44 个正式一手节点;
|
||||
- DeepSeek LLM → V2 → V3 → R1 → V3.2 → V4 完整主线;
|
||||
- Kimi K2 → K2.5 → K3 完整主线;
|
||||
- 所有机制图为原创 HTML/CSS/SVG 示意,显式标注证据边界。
|
||||
|
||||
### 8.2 四联实验室
|
||||
|
||||
1. **SFT 损失显微镜**
|
||||
可切换 prompt masking、参考回答质量和长度;显示哪些 Token 产生梯度、NLL 与 teacher-forcing 边界。
|
||||
|
||||
2. **偏好与奖励模型实验**
|
||||
调整两回答的 factuality/helpfulness/style/length、标注噪声与 reward weights;
|
||||
显示 Bradley–Terry 概率、shortcut 与“chosen 不等于绝对好”。
|
||||
|
||||
3. **PPO / DPO 更新控制室**
|
||||
调 reward gap、KL/β、policy/reference log-ratio、数据新鲜度;
|
||||
分别展示显式 RM+rollout 与离线 pair 的更新合同,不伪造可比总分。
|
||||
|
||||
4. **现代 Post-training 配方比较器**
|
||||
InstructGPT / Constitutional AI / DPO / DeepSeek-V2 / DeepSeek-V4 / Kimi K3;
|
||||
比较反馈源、模型组件、在线/离线、监督粒度、约束与主要失效模式。
|
||||
|
||||
### 8.3 工程闸门
|
||||
|
||||
- 键盘 tabs 与 `aria-selected`;
|
||||
- 390px 移动端根页面零横向溢出;
|
||||
- 交互数字标为教学模拟;
|
||||
- 论文链接全部指向 canonical primary source;
|
||||
- Astro check / build / internal link checker / 真实 Chrome regression 全部通过。
|
||||
Reference in New Issue
Block a user