Files
llm-atlas/research/ALIGNMENT_RESEARCH.md
T
2026-07-29 06:07:42 +08:00

602 lines
25 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 指令微调与人类偏好研究账本
状态:正式一手证据账本,Chapter 10 首版研究中
研究截止:2026-07-29
本轮本地缓存:24 份新增一手 PDF / 文本,复用 PPO、DeepSeek、Kimi 与推理专题既有缓存
线索发现:K3 references、论文引用网络、会议/作者页面、Grok CLI
结论依据:原论文正文、会议论文页、官方技术报告;Grok 只用于扩大候选召回
## 0. 这一章真正要回答什么
“Alignment / 对齐”经常被说成一个模糊的终点,仿佛模型经过某种神秘训练后就“符合人类价值”。
为了避免这种过度承诺,本章把问题限定为:
> 一个只会延续互联网文本分布的 base language model
> 如何学会理解用户接口、产生可协作行为、区分更好与更差的回答,
> 并在代理目标、反馈偏差与能力退化之间保持可检查的边界?
至少要分开十二张账:
1. **行为目标账**:我们想改变 helpfulness、harmlessness、honesty、格式遵循、风格还是某项能力?
2. **监督单位账**:标签作用于 Token、整段 demonstration、pairwise preference、标量、步骤还是环境结果?
3. **数据来源账**:人类、AI teacher、constitution、规则 verifier、执行环境分别提供什么信息?
4. **SFT 账**teacher forcing 的条件似然学到了什么,又没有学到什么?
5. **偏好测量账**:排序、评分、二元可取性与多人分歧怎样进入数据?
6. **奖励模型账**Bradley–Terry 类模型如何把比较变成标量代理?
7. **策略优化账**PPO、REINFORCE/RLOO、GRPO 分别怎样更新 policy
8. **直接偏好账**DPO、IPO、KTO、ORPO、SimPO 消掉了哪些组件,保留了哪些假设?
9. **分布账**:反馈来自当前 policy 还是旧 policyonline、offline、on-policy、off-policy 不能混写。
10. **约束账**reference KL、pretraining mix、长度/语言/安全约束怎样防止“为了高分走太远”?
11. **失效账**reward hacking、过优化、迎合、长度偏置、拒答过度与 alignment tax 怎样出现?
12. **证据账**:训练 reward、RM accuracy、LLM judge、人工盲评、规则验证分别能证明到哪一步?
本章不声称给出“人类价值”的唯一数学定义。它讲的是可观测的 post-training 接口、训练信号和证据边界。
## 1. 四条因果链
### 1.1 从任务标签到自然语言接口
```text
每个任务训练一个专用模型
→ 多任务共享参数
→ 用 prompt template 把不同数据集写成自然语言任务
→ FLAN / T0:在许多 prompted tasks 上 instruction tuning
→ Self-Instruct:让模型自举生成 instruction / input / output
→ LIMA:检验少量高质量示范能把多大比例的预训练能力“叫出来”
→ 当代 SFT:混合通用、推理、工具、代码、安全与多轮轨迹
```
这里的核心变化不是“下一个 Token 目标消失”,而是训练条件从普通文本前缀变成了
`system / instruction / context / response` 的交互接口。
### 1.2 从比较轨迹到通用助手 RLHF
```text
Christiano et al. 2017:人比较两段行为轨迹
→ reward predictor 拟合 pairwise preference
→ Ziegler et al. 2019:把 RM + KL + PPO 接到语言模型
→ Stiennon et al. 2020:摘要任务验证完整三段式管线
→ InstructGPT 2022SFT → RM → PPO-ptx 扩展到开放指令
→ HH-RLHF / Llama 2helpfulness、安全与多轮迭代被显式分账
```
真正的桥梁是“比较比绝对打分更容易”,并通过 Bradley–Terry 风格的选择模型把比较拟合成可优化标量。
### 1.3 从显式奖励模型到直接偏好目标
```text
RM + PPO:先拟合 scalar reward,再对当前 policy 做在线优化
→ RRHF / SLiC-HF:用排序或似然校准直接作用到回答概率
→ DPO:在 BT + KL-regularized optimum 假设下,把 reward 改写成 policy/reference log-ratio
→ IPO:指出确定性偏好假设下的过拟合问题,改用回归式间隔
→ KTO:允许 desirable / undesirable 非成对反馈
→ ORPO:把 SFT 与 odds-ratio preference 合为单阶段
→ SimPO:用长度归一平均 log-prob 和 margin 构造 reference-free reward
```
“无需 reward model”不等于“无需偏好信号”,也不等于“自动 on-policy”。
### 1.4 从人类偏好到 AI、规则与环境反馈
```text
Human demonstrations / rankings
→ Constitutional AI:原则 → 自我批评/修订 → AI preference
→ RLAIF / UltraFeedback:用 LLM 扩大标签量与维度
→ rule-based verifier:数学答案、编译器、测试用例
→ generative reward model:按 rubric 生成评价过程与分数
→ DeepSeekSFT + GRPO + rule/model/GRM,多阶段合并
→ Kimi K3SFT → 3 domains × 3 efforts RL teachers → MOPD
```
这不是“AI 反馈取代人类”的单向历史。现代系统常把人工定义的目标、AI 扩标、可执行规则和环境结果组合起来。
## 2. 最小数学:四个不同对象
### 2.1 SFT:模仿一个给定回答
对 prompt `x` 与示范回答 `y = (y₁,…,y_T)`
```text
L_SFT = - Σ_t m_t log πθ(y_t | x, y_<t)
```
`m_t` 通常只让 assistant response token 计入损失;system/user token 用作条件但不作为目标。
它在问:
> 在已经给定这个参考答案的条件下,模型是否提高了每个参考 Token 的概率?
它没有直接问“另一个回答是否更好”,也没有在自由 rollout 分布上训练纠错。
### 2.2 偏好模型:比较两个完整回答
对同一 prompt 的 chosen `y_w` 与 rejected `y_l`BradleyTerry 形式为:
```text
P(y_w ≻ y_l | x)
= σ(rφ(x,y_w) - rφ(x,y_l))
```
reward model loss
```text
L_RM = -log σ(rφ(x,y_w) - rφ(x,y_l))
```
只有 reward difference 可辨识:给同一 prompt 的全部奖励同时加一个常数,不改变偏好概率。
### 2.3 KL-regularized policy optimization
典型目标的抽象形式:
```text
max_π E[rφ(x,y)] - β KL(π(·|x) || π_ref(·|x))
```
`π_ref` 不是装饰:
- 把 policy 留在 reward model 见过的分布附近;
- 保持语言质量与已有行为;
- 让 reward 与偏离成本之间形成可调边界。
InstructGPT 还加入 pretraining mix
```text
reward - β log(π_RL / π_SFT) + γ log π_RL(x_pretrain)
```
因此论文默认的 InstructGPT 是 PPO-ptx,不应把它简化成“纯 PPO”。
### 2.4 DPO:用 policy/reference 比值参数化隐式奖励
在论文的假设下:
```text
rθ(x,y) = β log [πθ(y|x) / π_ref(y|x)]
```
DPO loss
```text
L_DPO =
-log σ( β[
log πθ(y_w|x) - log π_ref(y_w|x)
- log πθ(y_l|x) + log π_ref(y_l|x)
])
```
它训练的是“相对 referencechosen 比 rejected 获得更大的 log-ratio 提升”。
所以 DPO 仍依赖:
- preference pair 的质量;
- pair 来自哪个行为分布;
- reference policy
- `β`
- sequence log-prob 的求和、mask 与长度口径。
## 3. 十二张教学账
### 3.1 行为目标账:先说清“对齐什么”
至少区分:
| 目标 | 典型问题 | 不能替代的证据 |
|---|---|---|
| Instruction following | 是否遵守格式、约束和任务 | 仅看流畅度不够 |
| Helpfulness | 是否解决用户真实问题 | RM 分数不是用户成功率 |
| Harmlessness / safety | 是否拒绝或安全重定向 | “总是拒答”不是完整安全 |
| Honesty / calibration | 是否承认不知道、避免编造 | 偏好者也可能奖励自信语气 |
| Reasoning / coding | 是否得到可验证结果 | 长 CoT 或漂亮代码不等于通过 |
| Agent execution | 是否在环境中完成长程任务 | 单轮 chat win-rate 不足 |
| Style / personality | 是否符合表达规范 | 不应冒充能力增长 |
“能力学习”与“行为塑形”不是二选一。SFT 可注入新任务知识,RL 也可能重排甚至扩展可访问策略;
但任何因果归因都需要控制 base、数据、预算和评测。
### 3.2 监督单位账:标签落在哪里
| 信号 | 单位 | 优点 | 盲点 |
|---|---|---|---|
| Demonstration | 整段目标回答的 Token | 稠密、稳定 | 只有一种参考路径 |
| Pairwise preference | 两个完整回答 | 比绝对分数容易 | 只给相对次序 |
| Likert / scalar | 单回答 | 可表达强弱 | 标尺跨人漂移 |
| Outcome reward | 轨迹末端 | 便宜、客观 | credit assignment 稀疏 |
| Process reward | 中间步骤 | 更细粒度 | 标注贵,可能不忠实 |
| Token teacher signal | 每个 Token | 稠密整合能力 | teacher 偏差逐 Token 传递 |
| Environment reward | 状态变化/测试 | 接近任务结果 | verifier 可能有漏洞 |
### 3.3 数据来源账:谁定义“更好”
1. 专业标注者;
2. 目标用户或产品日志;
3. 众包标注者;
4. AI judge / teacher
5. 宪法或书面 rubric
6. ground truth / 单元测试 / 编译器;
7. 沙箱环境的真实结果;
8. 多来源混合。
来源决定偏差。把 “human preference” 聚合成单一标量,会隐藏群体分歧、标注者训练、文化背景和任务专长。
### 3.4 SFT 账:稳定冷启动,不是万能答案
SFT 的三个主要作用:
- 教交互协议、角色与输出格式;
- 把 base model 的已有能力放到用户可调用的接口上;
- 给 RL 提供足够可靠的 cold-start policy,避免 rollout 一开始全是无效样本。
主要代价:
- teacher forcing 与自由生成分布不一致;
- 参考答案不是唯一正确策略;
- 每个回答 Token 都被模仿,难表达“这部分好、那部分差”;
- 低质量、重复或模板化示范会被直接学习;
- 过强模仿可能缩小探索空间。
LIMA 的 1,000 高质量样本是“强 base + 指定评测 + 风格/接口”的实证结果,不是“小数据对齐普遍定律”。
### 3.5 偏好测量账:比较也不是客观真值
偏好数据必须记录:
- candidate 由哪些 policy、temperature、长度上限生成;
- 是两两比较、K-way ranking 还是独立评分;
- 是否允许 tie / both bad
- rubric 是总体质量还是多维评分;
- 是否随机交换展示位置;
- 每个样本有几名标注者、分歧如何保留;
- chosen 是否只是“两者较好”,而不是真正高质量。
训练集若只有“一个差回答和一个明显好回答”,RM 可能只学会表面线索;
部署时遇到两个都很强、差异很细的回答就会失准。
### 3.6 奖励模型账:代理目标的力量和危险来自同一处
reward model 把开放式判断压成一个可微标量,policy 因而能在没有唯一参考答案时继续优化。
但 policy 会主动寻找 RM 的高分区域,而这些区域可能远离 RM 的训练分布。
重要检查:
- in-distribution pair accuracy
- hard / OOD / adversarial pairs
- 长度、格式、拒答等 shortcut;
- calibration 与多人分歧;
- gold human evaluation 随 KL / optimization strength 的曲线;
- reward ensemble 或 uncertainty。
RewardBench 是对 RM 本身的测试入口,不是最终 assistant 质量的充分证明。
### 3.7 策略优化账:PPO 不是 RLHF 的同义词
PPO 的 clipped surrogate 限制单次 importance ratio
```text
min(
ρ_t A_t,
clip(ρ_t, 1-ε, 1+ε) A_t
)
```
LLM RLHF 的完整系统还常包含:
- actor / policy
- reference policy
- reward model
- critic / value
- rollout engine
- GAE / return
- token mask、长度处理、KL controller
- 可选 pretraining gradient。
RLOO、GRPO 等方法可省去 learned critic,但不因此自动解决 reward misspecification。
### 3.8 直接偏好账:算法名字先归到角色合同
| 方法 | 数据 | 显式 RM | Reference | 核心角色 |
|---|---|---:|---:|---|
| DPO | chosen/rejected pair | 否 | 是 | policy/reference log-ratio 分类 |
| IPO | pair | 否 | 是 | 回归到有限偏好 margin |
| KTO | desirable / undesirable 可非配对 | 否 | 通常是 | prospect-theoretic utility |
| ORPO | pair + SFT | 否 | 否 | NLL + odds-ratio penalty |
| SimPO | pair | 否 | 否 | 平均 log-prob reward + target margin |
| RRHF | ranking / 多来源候选 | 否 | 否 | 序列得分排序 |
| SLiC-HF | pair | 否 | 可选校准基线 | sequence likelihood calibration |
不能从“模型数更少”直接推出“效果更好”。2024 NeurIPS 的 DPO/PPO 解耦实验明确把
preference data、learning algorithm、reward model 和 policy prompts 分成四个变量,并发现数据质量影响最大。
### 3.9 分布账:online/offline 与 on/off-policy 是两组词
- **offline preference optimization**:固定 pair 数据训练,不随着当前 policy 更新标签;
- **online preference optimization**:当前 policy 生成新候选,再获取反馈;
- **on-policy RL**:梯度主要使用当前 policy 的 rollout
- **off-policy / stale rollout**:行为 policy 与当前 policy 不同,需要 importance correction 或 clipping。
DPO 通常是 offlinePPO 通常需要近 on-policy rolloutK3 partial rollout 会让超长轨迹跨迭代变旧,
因此必须显式做 off-policy 稳定化。这些词描述不同轴。
### 3.10 约束账:为什么不能只追 reward
常见防线:
1. reference KL
2. PPO ratio clipping
3. pretraining / SFT replay
4. response length / verbosity budget
5. language consistency
6. safety constraint reward
7. rule-based verifier 优先;
8. reward ensemble / uncertainty
9. 在线补充 policy 当前分布上的偏好数据;
10. hidden evaluator 与提交预算。
约束会产生真实 trade-off。例如语言一致性奖励可能轻微降低某些任务表现,却改善目标语言可读性;
这不是“白送”的收益。
### 3.11 失效账:高 reward 不等于高真实效用
#### Reward overoptimization
Gao et al. 使用 proxygold synthetic setup 展示:
```text
proxy reward 持续上升
gold reward 先上升、后饱和甚至下降
```
这是 Goodhart 风险的受控实证,不应外推成所有真实 RLHF 的统一数值曲线。
#### 长度与语气偏置
长回答更容易显得完整;礼貌、自信、分点也可能成为 shortcut。
需要 length-controlled evaluation,而不是看到 win-rate 上升就断言事实性更好。
#### 迎合
如果人更喜欢被认同,模型可能学会顺着错误前提。helpfulness、honesty 和 user approval 必须分开评测。
#### 过度拒答
只奖励“不产生危险文本”会推动模型拒绝无害请求。安全评测必须同时测 should-refuse 和 should-respond。
#### Alignment tax
RL 或偏好优化可能让某些标准能力退化。DeepSeek-V2 报告明确观察到部分 benchmark 的 alignment tax
并通过训练策略缓解;不能只报 chat judge。
### 3.12 证据账:每个数字到底证明什么
| 证据 | 能证明 | 不能单独证明 |
|---|---|---|
| SFT loss | 模仿训练集 Token 的拟合 | 用户偏好、事实性 |
| RM pair accuracy | 在该 pair 分布上的排序 | policy 优化后的 OOD 可靠性 |
| training reward | 对当前 proxy 的优化 | 真实人类效用 |
| KL | 与 reference 的分布距离 | 改变是好是坏 |
| LLM judge win-rate | 该 judge/rubric 下的相对偏好 | 无偏人类共识 |
| blind human eval | 特定人群/协议下偏好 | 普适价值 |
| rule pass rate | verifier 定义的正确性 | 开放式质量与安全 |
| downstream benchmark | 指定任务能力 | 完整助手行为 |
## 4. DeepSeek:从 SFT+DPO 到多源 GRPO / GRM
### 4.1 DeepSeek LLM
官方报告公开:
- 超过 100 万 SFT instances
- 7B 使用 4 epochs67B 使用 2 epochs
- helpfulness 与 harmlessness preference data
- DPO 训练 1 epoch
- 数学 SFT 过多会提高重复率;
- 报告把 reasoning 改善谨慎归因:SFT 可能主要注入了题型与知识,不能直接证明学会一般推理。
这是一条典型的 `base → SFT chat → DPO` 管线。
### 4.2 DeepSeek-V2
V2 把对齐管线改成:
```text
base
→ SFT
→ reasoning alignment
→ human preference alignment
```
第二阶段采用 helpful、safety 与 rule-based 多奖励;RL 使用 GRPO。
报告同时讨论:
- SFT 数量与质量;
- alignment tax
- online RL 与 offline preference alignment 的差异;
- code preference 来自 compiler feedback,数学来自 ground-truth labels。
### 4.3 DeepSeek-V3
V3 的 post-training 包括:
- 从 expert model / DeepSeek-R1 蒸馏 reasoning data
- 两个 epochs 的 SFT
- rule-based RM 与 model-based RM
- GRPO
- generative reward model 的探索;
- 尽可能优先使用规则验证以降低 reward hacking。
官方报告给出 pretraining、context extension、post-training 的计算分账;不能把整套 V3 能力归因于 GRPO。
### 4.4 DeepSeek-R1
必须分开:
- **R1-Zero**:从 base 直接做 rule-based reasoning RL,没有初始 SFT
- **R1**cold-start data → reasoning RL → rejection sampling / SFT → broader RL
- **distilled models**:只做 SFT,不等于复现 R1 的 RL 训练。
报告附录展示 helpful RM reward hackingreward 上升而测试表现下降;也展示语言一致性 reward 的能力 trade-off。
### 4.5 DeepSeek-V3.2 / V4
V3.2 把 reasoning、agent 与 human alignment 合并进一个大规模 GRPO 阶段,
通用任务采用 generative reward modelagent/reasoning 尽量使用规则结果。
V4 的两阶段主线:
```text
SFT:高质量、多领域、能力冷启动
→ GRPOdomain-aligned behavior
```
对 hard-to-verify tasksV4 报告明确说不再使用传统 scalar RM,而采用 rubric-guided data 与
Generative Reward Modeleasy-to-verify tasks 继续用规则或测试。
## 5. Kimi:从长轨迹 RL 到 K3 多教师整合
### 5.1 Kimi K2 / K2.5
K2 公开 post-training 覆盖:
- general RL
- self-critique rubric reward
- verifiable reward
- PTX 与 budget control。
K2.5 继续扩展 unified agentic RL、视觉与并行 agentRollout Manager 支持大规模并发任务。
这些工作已经超出“聊天回答偏好”:reward 来自执行环境、规则与生成式 rubric 的组合。
### 5.2 Kimi K3 的三阶段合同
K3 官方报告明确:
```text
Stage 1 · SFT
建立高质量 cold-start agent policy
Stage 2 · RL experts
general / general-agent / coding
× low / high / max reasoning effort
= 9 个领域-强度专家
Stage 3 · MOPD
student on-policy rollout
+ 对应 teacher 的逐 Token log-ratio reward
→ 把九个专家整合回一个统一模型
```
MOPD 的逐 Token信号是:
```text
r_opd(y_t)
= clip(stopgrad(log π_teacher(y_t|prefix) / π_student(y_t|prefix)),
-R_max, R_max)
```
概念边界:
- K3 的 partial rollout 是长轨迹跨迭代产生的 off-policy 稳定性问题;
- MOPD 则在当前 student 自己访问的状态上计算 teacher signal
- 两者可以在同一系统中共存,但不是同一种算法;
- agentic GRM 仍需 verbosity budget,报告明确把它作为防 reward hacking 的约束;
- MXFP4 QAT 从 SFT 起覆盖整个 post-training,是部署约束,不是偏好目标。
## 6. 正式一手论文链(44 个节点)
| # | 年份 | 节点 | 本章角色 | 核验入口 |
|---:|---:|---|---|---|
| 01 | 2017 | Deep RL from Human Preferences | pairwise trajectory → reward | `1706.03741` Eq.1 / Fig.1 |
| 02 | 2017 | PPO | clipped on-policy update | `1707.06347` Eq.7 |
| 03 | 2019 | Fine-Tuning LMs from Human Preferences | LM reward + KL + PPO | `1909.08593` Eq.12 |
| 04 | 2020 | Learning to Summarize from Human Feedback | 完整生成式 RLHF | `2009.01325` Fig.2 / Fig.5 |
| 05 | 2021 | Natural Instructions | declarative task interface | `2104.08773` |
| 06 | 2021 | FLAN | instruction-tuned zero-shot | `2109.01652` Fig.6 |
| 07 | 2021 | T0 | prompted multitask mixture | `2110.08207` Fig.2 |
| 08 | 2021 | WebGPT | browser action + preference | `2112.09332` |
| 09 | 2022 | InstructGPT | SFT → RM → PPO-ptx | `2203.02155` Fig.2 / Eq.12 |
| 10 | 2022 | HH-RLHF | helpful / harmless assistant | `2204.05862` |
| 11 | 2022 | Super-NaturalInstructions | 1,600+ task generalization | `2204.07705` |
| 12 | 2022 | Scaling Instruction-Finetuned LMs | Flan collection scaling | `2210.11416` |
| 13 | 2022 | Reward Model Overoptimization | proxy / gold Goodhart curve | `2210.10760` |
| 14 | 2022 | Constitutional AI | self-critique + RLAIF | `2212.08073` Fig.1 |
| 15 | 2022 | Self-Instruct | synthetic instruction bootstrap | `2212.10560` Fig.2 |
| 16 | 2023 | OpenAssistant Conversations | open conversation / ranking tree | `2304.07327` |
| 17 | 2023 | RRHF | response ranking objective | `2304.05302` |
| 18 | 2023 | SLiC-HF | sequence likelihood calibration | `2305.10425` |
| 19 | 2023 | LIMA | 1K curated SFT | `2305.11206` |
| 20 | 2023 | AlpacaFarm | feedback simulator / baselines | `2305.14387` |
| 21 | 2023 | DPO | implicit reward / direct objective | `2305.18290` Eq.57 |
| 22 | 2023 | RLAIF vs RLHF | human/AI label comparison | `2309.00267` |
| 23 | 2023 | UltraFeedback | scaled multi-aspect AI feedback | `2310.01377` |
| 24 | 2023 | IPO theory | finite-margin preference regression | `2310.12036` |
| 25 | 2023 | Zephyr | dSFT + AI preference dDPO | `2310.16944` Fig.2 |
| 26 | 2024 | KTO | unpaired binary feedback | `2402.01306` |
| 27 | 2024 | RLOO | critic-free REINFORCE baseline | `2402.14740` |
| 28 | 2024 | ORPO | SFT + odds-ratio single stage | `2403.07691` |
| 29 | 2024 | RewardBench | reward model evaluation | `2403.13787` Fig.1 |
| 30 | 2024 | SimPO | reference-free mean log-prob | `2405.14734` |
| 31 | 2024 | Unpacking DPO and PPO | data/algorithm/RM/prompt 四变量 | NeurIPS 2024 |
| 32 | 2024 | Tülu 3 | open SFT → DPO → RLVR recipe | `2411.15124` |
| 33 | 2024 | DeepSeek LLM | 1M+ SFT + DPO | `2401.02954` §4 |
| 34 | 2024 | DeepSeekMath | GRPO | `2402.03300` |
| 35 | 2024 | DeepSeek-V2 | SFT + two-stage GRPO alignment | `2405.04434` §4 |
| 36 | 2024 | DeepSeek-V3 | SFT / RM / GRPO / GRM | `2412.19437` §5 |
| 37 | 2025 | DeepSeek-R1 | Zero / cold-start / RL / SFT 分层 | `2501.12948` |
| 38 | 2025 | DAPO | long-CoT GRPO stabilization | `2503.14476` |
| 39 | 2025 | Kimi K2 | verifiable + generative rewards | `2507.20534` |
| 40 | 2025 | DeepSeek-V3.2 | merged reasoning/agent/alignment RL | `2512.02556` §3 |
| 41 | 2026 | Kimi K2.5 | unified multimodal/agentic RL | `2602.02276` |
| 42 | 2026 | DeepSeek-V4 | SFT + GRPO + GRM | `2606.19348` §5 |
| 43 | 2026 | MOPD | multi-teacher on-policy distillation | `2606.30406` |
| 44 | 2026 | Kimi K3 | 9 experts → MOPD / 1M agentic RL | `2607.24653` §4 |
## 7. 常见误解清单
1. **“SFT 改了 next-token 目标”**:通常仍是 next-token cross-entropy,只是条件与训练分布变了。
2. **“chosen 就是完美答案”**pair 只保证 chosen 相对更受偏好,可能两者都差。
3. **“reward model 学到了人类价值”**:它拟合特定标签者、rubric、候选分布下的比较。
4. **“PPO 就是 RLHF”**PPO 只是 policy optimizerRLHF 还含反馈、RM、reference、rollout 和评测。
5. **“DPO 不需要 reward”**:它不训练显式 RM,但偏好 pair 与隐式 reward 假设仍在。
6. **“DPO 永远比 PPO 好”**:数据质量、online sampling、RM、prompt 分布和实现可改变结论。
7. **“RLAIF 没有人类参与”**:原则、rubric、teacher 训练与最终评测仍来自人类选择。
8. **“规则奖励不会被 hack”**:解析器、测试覆盖、沙箱和提交预算都可能有漏洞。
9. **“训练 reward 上升就是模型更好”**:必须看 gold/human/environment outcome 与 KL。
10. **“RLVR 与 RLHF 是两代技术”**:开放任务可用偏好,数学/代码可用 verifier,现代系统混合两者。
11. **“R1-Zero 就是 DeepSeek-R1”**:正式 R1 还有 cold start、SFT、多阶段 RL 与蒸馏。
12. **“K3 MOPD 是普通离线蒸馏”**student 在自己的 rollout 状态上接收对应 teacher 的逐 Token 信号。
## 8. 页面与交互验收合同
### 8.1 正文
- 2022 个正文区段;
- 十二张账;
- 至少 44 个正式一手节点;
- DeepSeek LLM → V2 → V3 → R1 → V3.2 → V4 完整主线;
- Kimi K2 → K2.5 → K3 完整主线;
- 所有机制图为原创 HTML/CSS/SVG 示意,显式标注证据边界。
### 8.2 四联实验室
1. **SFT 损失显微镜**
可切换 prompt masking、参考回答质量和长度;显示哪些 Token 产生梯度、NLL 与 teacher-forcing 边界。
2. **偏好与奖励模型实验**
调整两回答的 factuality/helpfulness/style/length、标注噪声与 reward weights
显示 BradleyTerry 概率、shortcut 与“chosen 不等于绝对好”。
3. **PPO / DPO 更新控制室**
调 reward gap、KL/β、policy/reference log-ratio、数据新鲜度;
分别展示显式 RM+rollout 与离线 pair 的更新合同,不伪造可比总分。
4. **现代 Post-training 配方比较器**
InstructGPT / Constitutional AI / DPO / DeepSeek-V2 / DeepSeek-V4 / Kimi K3
比较反馈源、模型组件、在线/离线、监督粒度、约束与主要失效模式。
### 8.3 工程闸门
- 键盘 tabs 与 `aria-selected`
- 390px 移动端根页面零横向溢出;
- 交互数字标为教学模拟;
- 论文链接全部指向 canonical primary source
- Astro check / build / internal link checker / 真实 Chrome regression 全部通过。