feat: publish alignment deep dive

This commit is contained in:
wuyang
2026-07-29 06:07:42 +08:00
parent a030de41fa
commit 8378e2a741
22 changed files with 3463 additions and 35 deletions
+108
View File
@@ -0,0 +1,108 @@
# AlignmentGrok 候选论文线索
> 状态:**未核验候选账**
> 生成方式:本机 Grok CLI Headless 模式,2026-07-29
> 使用约束:这里只记录检索线索,不能直接作为正文事实、公式、数字或历史结论的依据。正式内容必须回到论文 PDF、会议页面或研究机构原文逐项核验。
## 这次线索检索的用途
正式研究账本已经覆盖 SFT、偏好数据、奖励模型、PPO/RLHF、RLAIF、DPO、RLVR、DeepSeek 与 Kimi/K3。Grok 的任务不是替正文写作,而是做一次“漏项扫描”:寻找可能缺失的论文分支、失败模式和边界案例。
它给出 45 个候选条目,按下列九组组织:
| 候选组 | 条目数 | 对正式研究最有价值的提醒 |
|---|---:|---|
| SFT | 6 | FLAN、T0、Natural Instructions、SuperNI、Self-Instruct、LIMA 需要区分任务泛化、数据生成与少量高质量示范 |
| 偏好 / 奖励模型 | 5 | 不只看标注规模,也要检查偏好分歧、长度相关性和奖励泛化 |
| PPO / RLHF | 6 | Christiano → Ziegler → Stiennon → InstructGPT 的主线应与 PPO 算法本体分开 |
| RLAIF | 4 | Constitutional AI、自我批评修订与 AI preference 不是同一层概念 |
| DPO 分支 | 8 | RRHF、SLiC-HF、IPO、KTO、ORPO、SimPO 等不能笼统称作“DPO 小改版” |
| 失败模式 | 5 | reward hacking、overoptimization、sycophancy、verbosity bias 应拆成不同故障 |
| RLVR | 4 | PRM 是前驱但不等于程序化 verifierDeepSeekMath 的 GRPO 与具体奖励来源要分开 |
| DeepSeek | 4 | LLM、Math、V3、R1 的角色不同,不能把 R1-Zero 的纯 RL 结论外推到完整 R1 |
| Kimi | 3 | k1.5、K2、K2.5 的推理、agentic、多模态主线不同 |
## 候选清单
以下名称保留为后续查漏入口;存在重复跨组复用,不代表 45 篇互不重复的唯一论文。
### SFT 与指令数据
- Finetuned Language Models Are Zero-Shot LearnersFLAN
- Multitask Prompted Training Enables Zero-Shot Task GeneralizationT0
- Natural Instructions
- Super-NaturalInstructions
- Scaling Instruction-Finetuned Language Models
- Self-Instruct
- LIMA: Less Is More for Alignment
### 偏好、奖励模型与 RLHF
- Deep Reinforcement Learning from Human Preferences
- Fine-Tuning Language Models from Human Preferences
- Learning to Summarize from Human Feedback
- Training Language Models to Follow Instructions with Human Feedback
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
- Proximal Policy Optimization Algorithms
- Scaling Laws for Reward Model Overoptimization
- AlpacaFarm
- OpenAssistant Conversations
- Llama 2: Open Foundation and Fine-Tuned Chat Models
- Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMs
### RLAIF 与宪法式约束
- Constitutional AI: Harmlessness from AI Feedback
- RLAIF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
- UltraFeedback
- Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
### 直接偏好优化分支
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- RRHF: Rank Responses to Align Language Models with Human Feedback
- SLiC-HF: Sequence Likelihood Calibration with Human Feedback
- A General Theoretical Paradigm to Understand Learning from Human PreferencesIPO
- KTO: Model Alignment as Prospect Theoretic Optimization
- ORPO: Monolithic Preference Optimization without Reference Model
- SimPO: Simple Preference Optimization with a Reference-Free Reward
- Zephyr: Direct Distillation of LM Alignment
- Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
### 失败模式与评测
- Sycophancy / 用户信念迎合相关研究
- A Long Way to Go: Investigating Length Correlations in RLHF
- RewardBench
- reward overoptimization / Goodhart 效应相关研究
- 偏好标注分歧、both-bad pair 与 verbosity bias 相关研究
### RLVR、DeepSeek 与 Kimi
- Lets Verify Step by Step
- Tülu 3: Pushing Frontiers in Open Language Model Post-Training
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains
- DeepSeek LLM
- DeepSeek-V3 Technical Report
- DeepSeek-R1
- Kimi k1.5
- Kimi K2
- Kimi K2.5
## 必须保留的边界提醒
1. “偏好更长”不能直接写成人类真正想要冗长答案;奖励模型可能只学到了长度代理特征。
2. sycophancy 不完全等于撒谎,它可能来自 helpfulness、agreeableness 与偏好标签的纠缠。
3. 人类标注的步骤正确性不等于程序可验证奖励,PRM 只能作为 RLVR 前驱来讲。
4. DeepSeekMath 同时讨论模型奖励与规则奖励;“用了 GRPO”不能反推出“奖励一定可验证”。
5. R1-Zero 的少监督 / 纯 RL 路径不能外推为完整 DeepSeek-R1 不需要冷启动与监督数据。
6. Kimi K2、K2.5 的 agentic / multimodal 叙事不能替代 k1.5 的推理 RL 算法细节。
7. “DPO 不需要奖励模型”仅指不单独训练显式 RM 并运行 PPO;偏好、参考策略与数据分布仍然存在。
## 当前裁决
- 已进入正式账本:有一手 PDF 或官方页面支撑、且边界已经逐项复核的节点。
- 暂留候选:`Crossing the Reward Bridge`、具体 sycophancy 论文、长度相关论文等,需要在对应专题扩写时重新核对标题、版本、实验设定和数字。
- 明确不采用:任何仅凭二手叙事得出的“某算法彻底取代另一算法”“纯 RL 不再需要数据”“AI feedback 等于没有人类价值输入”等强结论。
+601
View File
@@ -0,0 +1,601 @@
# 指令微调与人类偏好研究账本
状态:正式一手证据账本,Chapter 10 首版研究中
研究截止:2026-07-29
本轮本地缓存:24 份新增一手 PDF / 文本,复用 PPO、DeepSeek、Kimi 与推理专题既有缓存
线索发现:K3 references、论文引用网络、会议/作者页面、Grok CLI
结论依据:原论文正文、会议论文页、官方技术报告;Grok 只用于扩大候选召回
## 0. 这一章真正要回答什么
“Alignment / 对齐”经常被说成一个模糊的终点,仿佛模型经过某种神秘训练后就“符合人类价值”。
为了避免这种过度承诺,本章把问题限定为:
> 一个只会延续互联网文本分布的 base language model
> 如何学会理解用户接口、产生可协作行为、区分更好与更差的回答,
> 并在代理目标、反馈偏差与能力退化之间保持可检查的边界?
至少要分开十二张账:
1. **行为目标账**:我们想改变 helpfulness、harmlessness、honesty、格式遵循、风格还是某项能力?
2. **监督单位账**:标签作用于 Token、整段 demonstration、pairwise preference、标量、步骤还是环境结果?
3. **数据来源账**:人类、AI teacher、constitution、规则 verifier、执行环境分别提供什么信息?
4. **SFT 账**teacher forcing 的条件似然学到了什么,又没有学到什么?
5. **偏好测量账**:排序、评分、二元可取性与多人分歧怎样进入数据?
6. **奖励模型账**Bradley–Terry 类模型如何把比较变成标量代理?
7. **策略优化账**PPO、REINFORCE/RLOO、GRPO 分别怎样更新 policy
8. **直接偏好账**DPO、IPO、KTO、ORPO、SimPO 消掉了哪些组件,保留了哪些假设?
9. **分布账**:反馈来自当前 policy 还是旧 policyonline、offline、on-policy、off-policy 不能混写。
10. **约束账**reference KL、pretraining mix、长度/语言/安全约束怎样防止“为了高分走太远”?
11. **失效账**reward hacking、过优化、迎合、长度偏置、拒答过度与 alignment tax 怎样出现?
12. **证据账**:训练 reward、RM accuracy、LLM judge、人工盲评、规则验证分别能证明到哪一步?
本章不声称给出“人类价值”的唯一数学定义。它讲的是可观测的 post-training 接口、训练信号和证据边界。
## 1. 四条因果链
### 1.1 从任务标签到自然语言接口
```text
每个任务训练一个专用模型
→ 多任务共享参数
→ 用 prompt template 把不同数据集写成自然语言任务
→ FLAN / T0:在许多 prompted tasks 上 instruction tuning
→ Self-Instruct:让模型自举生成 instruction / input / output
→ LIMA:检验少量高质量示范能把多大比例的预训练能力“叫出来”
→ 当代 SFT:混合通用、推理、工具、代码、安全与多轮轨迹
```
这里的核心变化不是“下一个 Token 目标消失”,而是训练条件从普通文本前缀变成了
`system / instruction / context / response` 的交互接口。
### 1.2 从比较轨迹到通用助手 RLHF
```text
Christiano et al. 2017:人比较两段行为轨迹
→ reward predictor 拟合 pairwise preference
→ Ziegler et al. 2019:把 RM + KL + PPO 接到语言模型
→ Stiennon et al. 2020:摘要任务验证完整三段式管线
→ InstructGPT 2022SFT → RM → PPO-ptx 扩展到开放指令
→ HH-RLHF / Llama 2helpfulness、安全与多轮迭代被显式分账
```
真正的桥梁是“比较比绝对打分更容易”,并通过 Bradley–Terry 风格的选择模型把比较拟合成可优化标量。
### 1.3 从显式奖励模型到直接偏好目标
```text
RM + PPO:先拟合 scalar reward,再对当前 policy 做在线优化
→ RRHF / SLiC-HF:用排序或似然校准直接作用到回答概率
→ DPO:在 BT + KL-regularized optimum 假设下,把 reward 改写成 policy/reference log-ratio
→ IPO:指出确定性偏好假设下的过拟合问题,改用回归式间隔
→ KTO:允许 desirable / undesirable 非成对反馈
→ ORPO:把 SFT 与 odds-ratio preference 合为单阶段
→ SimPO:用长度归一平均 log-prob 和 margin 构造 reference-free reward
```
“无需 reward model”不等于“无需偏好信号”,也不等于“自动 on-policy”。
### 1.4 从人类偏好到 AI、规则与环境反馈
```text
Human demonstrations / rankings
→ Constitutional AI:原则 → 自我批评/修订 → AI preference
→ RLAIF / UltraFeedback:用 LLM 扩大标签量与维度
→ rule-based verifier:数学答案、编译器、测试用例
→ generative reward model:按 rubric 生成评价过程与分数
→ DeepSeekSFT + GRPO + rule/model/GRM,多阶段合并
→ Kimi K3SFT → 3 domains × 3 efforts RL teachers → MOPD
```
这不是“AI 反馈取代人类”的单向历史。现代系统常把人工定义的目标、AI 扩标、可执行规则和环境结果组合起来。
## 2. 最小数学:四个不同对象
### 2.1 SFT:模仿一个给定回答
对 prompt `x` 与示范回答 `y = (y₁,…,y_T)`
```text
L_SFT = - Σ_t m_t log πθ(y_t | x, y_<t)
```
`m_t` 通常只让 assistant response token 计入损失;system/user token 用作条件但不作为目标。
它在问:
> 在已经给定这个参考答案的条件下,模型是否提高了每个参考 Token 的概率?
它没有直接问“另一个回答是否更好”,也没有在自由 rollout 分布上训练纠错。
### 2.2 偏好模型:比较两个完整回答
对同一 prompt 的 chosen `y_w` 与 rejected `y_l`BradleyTerry 形式为:
```text
P(y_w ≻ y_l | x)
= σ(rφ(x,y_w) - rφ(x,y_l))
```
reward model loss
```text
L_RM = -log σ(rφ(x,y_w) - rφ(x,y_l))
```
只有 reward difference 可辨识:给同一 prompt 的全部奖励同时加一个常数,不改变偏好概率。
### 2.3 KL-regularized policy optimization
典型目标的抽象形式:
```text
max_π E[rφ(x,y)] - β KL(π(·|x) || π_ref(·|x))
```
`π_ref` 不是装饰:
- 把 policy 留在 reward model 见过的分布附近;
- 保持语言质量与已有行为;
- 让 reward 与偏离成本之间形成可调边界。
InstructGPT 还加入 pretraining mix
```text
reward - β log(π_RL / π_SFT) + γ log π_RL(x_pretrain)
```
因此论文默认的 InstructGPT 是 PPO-ptx,不应把它简化成“纯 PPO”。
### 2.4 DPO:用 policy/reference 比值参数化隐式奖励
在论文的假设下:
```text
rθ(x,y) = β log [πθ(y|x) / π_ref(y|x)]
```
DPO loss
```text
L_DPO =
-log σ( β[
log πθ(y_w|x) - log π_ref(y_w|x)
- log πθ(y_l|x) + log π_ref(y_l|x)
])
```
它训练的是“相对 referencechosen 比 rejected 获得更大的 log-ratio 提升”。
所以 DPO 仍依赖:
- preference pair 的质量;
- pair 来自哪个行为分布;
- reference policy
- `β`
- sequence log-prob 的求和、mask 与长度口径。
## 3. 十二张教学账
### 3.1 行为目标账:先说清“对齐什么”
至少区分:
| 目标 | 典型问题 | 不能替代的证据 |
|---|---|---|
| Instruction following | 是否遵守格式、约束和任务 | 仅看流畅度不够 |
| Helpfulness | 是否解决用户真实问题 | RM 分数不是用户成功率 |
| Harmlessness / safety | 是否拒绝或安全重定向 | “总是拒答”不是完整安全 |
| Honesty / calibration | 是否承认不知道、避免编造 | 偏好者也可能奖励自信语气 |
| Reasoning / coding | 是否得到可验证结果 | 长 CoT 或漂亮代码不等于通过 |
| Agent execution | 是否在环境中完成长程任务 | 单轮 chat win-rate 不足 |
| Style / personality | 是否符合表达规范 | 不应冒充能力增长 |
“能力学习”与“行为塑形”不是二选一。SFT 可注入新任务知识,RL 也可能重排甚至扩展可访问策略;
但任何因果归因都需要控制 base、数据、预算和评测。
### 3.2 监督单位账:标签落在哪里
| 信号 | 单位 | 优点 | 盲点 |
|---|---|---|---|
| Demonstration | 整段目标回答的 Token | 稠密、稳定 | 只有一种参考路径 |
| Pairwise preference | 两个完整回答 | 比绝对分数容易 | 只给相对次序 |
| Likert / scalar | 单回答 | 可表达强弱 | 标尺跨人漂移 |
| Outcome reward | 轨迹末端 | 便宜、客观 | credit assignment 稀疏 |
| Process reward | 中间步骤 | 更细粒度 | 标注贵,可能不忠实 |
| Token teacher signal | 每个 Token | 稠密整合能力 | teacher 偏差逐 Token 传递 |
| Environment reward | 状态变化/测试 | 接近任务结果 | verifier 可能有漏洞 |
### 3.3 数据来源账:谁定义“更好”
1. 专业标注者;
2. 目标用户或产品日志;
3. 众包标注者;
4. AI judge / teacher
5. 宪法或书面 rubric
6. ground truth / 单元测试 / 编译器;
7. 沙箱环境的真实结果;
8. 多来源混合。
来源决定偏差。把 “human preference” 聚合成单一标量,会隐藏群体分歧、标注者训练、文化背景和任务专长。
### 3.4 SFT 账:稳定冷启动,不是万能答案
SFT 的三个主要作用:
- 教交互协议、角色与输出格式;
- 把 base model 的已有能力放到用户可调用的接口上;
- 给 RL 提供足够可靠的 cold-start policy,避免 rollout 一开始全是无效样本。
主要代价:
- teacher forcing 与自由生成分布不一致;
- 参考答案不是唯一正确策略;
- 每个回答 Token 都被模仿,难表达“这部分好、那部分差”;
- 低质量、重复或模板化示范会被直接学习;
- 过强模仿可能缩小探索空间。
LIMA 的 1,000 高质量样本是“强 base + 指定评测 + 风格/接口”的实证结果,不是“小数据对齐普遍定律”。
### 3.5 偏好测量账:比较也不是客观真值
偏好数据必须记录:
- candidate 由哪些 policy、temperature、长度上限生成;
- 是两两比较、K-way ranking 还是独立评分;
- 是否允许 tie / both bad
- rubric 是总体质量还是多维评分;
- 是否随机交换展示位置;
- 每个样本有几名标注者、分歧如何保留;
- chosen 是否只是“两者较好”,而不是真正高质量。
训练集若只有“一个差回答和一个明显好回答”,RM 可能只学会表面线索;
部署时遇到两个都很强、差异很细的回答就会失准。
### 3.6 奖励模型账:代理目标的力量和危险来自同一处
reward model 把开放式判断压成一个可微标量,policy 因而能在没有唯一参考答案时继续优化。
但 policy 会主动寻找 RM 的高分区域,而这些区域可能远离 RM 的训练分布。
重要检查:
- in-distribution pair accuracy
- hard / OOD / adversarial pairs
- 长度、格式、拒答等 shortcut;
- calibration 与多人分歧;
- gold human evaluation 随 KL / optimization strength 的曲线;
- reward ensemble 或 uncertainty。
RewardBench 是对 RM 本身的测试入口,不是最终 assistant 质量的充分证明。
### 3.7 策略优化账:PPO 不是 RLHF 的同义词
PPO 的 clipped surrogate 限制单次 importance ratio
```text
min(
ρ_t A_t,
clip(ρ_t, 1-ε, 1+ε) A_t
)
```
LLM RLHF 的完整系统还常包含:
- actor / policy
- reference policy
- reward model
- critic / value
- rollout engine
- GAE / return
- token mask、长度处理、KL controller
- 可选 pretraining gradient。
RLOO、GRPO 等方法可省去 learned critic,但不因此自动解决 reward misspecification。
### 3.8 直接偏好账:算法名字先归到角色合同
| 方法 | 数据 | 显式 RM | Reference | 核心角色 |
|---|---|---:|---:|---|
| DPO | chosen/rejected pair | 否 | 是 | policy/reference log-ratio 分类 |
| IPO | pair | 否 | 是 | 回归到有限偏好 margin |
| KTO | desirable / undesirable 可非配对 | 否 | 通常是 | prospect-theoretic utility |
| ORPO | pair + SFT | 否 | 否 | NLL + odds-ratio penalty |
| SimPO | pair | 否 | 否 | 平均 log-prob reward + target margin |
| RRHF | ranking / 多来源候选 | 否 | 否 | 序列得分排序 |
| SLiC-HF | pair | 否 | 可选校准基线 | sequence likelihood calibration |
不能从“模型数更少”直接推出“效果更好”。2024 NeurIPS 的 DPO/PPO 解耦实验明确把
preference data、learning algorithm、reward model 和 policy prompts 分成四个变量,并发现数据质量影响最大。
### 3.9 分布账:online/offline 与 on/off-policy 是两组词
- **offline preference optimization**:固定 pair 数据训练,不随着当前 policy 更新标签;
- **online preference optimization**:当前 policy 生成新候选,再获取反馈;
- **on-policy RL**:梯度主要使用当前 policy 的 rollout
- **off-policy / stale rollout**:行为 policy 与当前 policy 不同,需要 importance correction 或 clipping。
DPO 通常是 offlinePPO 通常需要近 on-policy rolloutK3 partial rollout 会让超长轨迹跨迭代变旧,
因此必须显式做 off-policy 稳定化。这些词描述不同轴。
### 3.10 约束账:为什么不能只追 reward
常见防线:
1. reference KL
2. PPO ratio clipping
3. pretraining / SFT replay
4. response length / verbosity budget
5. language consistency
6. safety constraint reward
7. rule-based verifier 优先;
8. reward ensemble / uncertainty
9. 在线补充 policy 当前分布上的偏好数据;
10. hidden evaluator 与提交预算。
约束会产生真实 trade-off。例如语言一致性奖励可能轻微降低某些任务表现,却改善目标语言可读性;
这不是“白送”的收益。
### 3.11 失效账:高 reward 不等于高真实效用
#### Reward overoptimization
Gao et al. 使用 proxygold synthetic setup 展示:
```text
proxy reward 持续上升
gold reward 先上升、后饱和甚至下降
```
这是 Goodhart 风险的受控实证,不应外推成所有真实 RLHF 的统一数值曲线。
#### 长度与语气偏置
长回答更容易显得完整;礼貌、自信、分点也可能成为 shortcut。
需要 length-controlled evaluation,而不是看到 win-rate 上升就断言事实性更好。
#### 迎合
如果人更喜欢被认同,模型可能学会顺着错误前提。helpfulness、honesty 和 user approval 必须分开评测。
#### 过度拒答
只奖励“不产生危险文本”会推动模型拒绝无害请求。安全评测必须同时测 should-refuse 和 should-respond。
#### Alignment tax
RL 或偏好优化可能让某些标准能力退化。DeepSeek-V2 报告明确观察到部分 benchmark 的 alignment tax
并通过训练策略缓解;不能只报 chat judge。
### 3.12 证据账:每个数字到底证明什么
| 证据 | 能证明 | 不能单独证明 |
|---|---|---|
| SFT loss | 模仿训练集 Token 的拟合 | 用户偏好、事实性 |
| RM pair accuracy | 在该 pair 分布上的排序 | policy 优化后的 OOD 可靠性 |
| training reward | 对当前 proxy 的优化 | 真实人类效用 |
| KL | 与 reference 的分布距离 | 改变是好是坏 |
| LLM judge win-rate | 该 judge/rubric 下的相对偏好 | 无偏人类共识 |
| blind human eval | 特定人群/协议下偏好 | 普适价值 |
| rule pass rate | verifier 定义的正确性 | 开放式质量与安全 |
| downstream benchmark | 指定任务能力 | 完整助手行为 |
## 4. DeepSeek:从 SFT+DPO 到多源 GRPO / GRM
### 4.1 DeepSeek LLM
官方报告公开:
- 超过 100 万 SFT instances
- 7B 使用 4 epochs67B 使用 2 epochs
- helpfulness 与 harmlessness preference data
- DPO 训练 1 epoch
- 数学 SFT 过多会提高重复率;
- 报告把 reasoning 改善谨慎归因:SFT 可能主要注入了题型与知识,不能直接证明学会一般推理。
这是一条典型的 `base → SFT chat → DPO` 管线。
### 4.2 DeepSeek-V2
V2 把对齐管线改成:
```text
base
→ SFT
→ reasoning alignment
→ human preference alignment
```
第二阶段采用 helpful、safety 与 rule-based 多奖励;RL 使用 GRPO。
报告同时讨论:
- SFT 数量与质量;
- alignment tax
- online RL 与 offline preference alignment 的差异;
- code preference 来自 compiler feedback,数学来自 ground-truth labels。
### 4.3 DeepSeek-V3
V3 的 post-training 包括:
- 从 expert model / DeepSeek-R1 蒸馏 reasoning data
- 两个 epochs 的 SFT
- rule-based RM 与 model-based RM
- GRPO
- generative reward model 的探索;
- 尽可能优先使用规则验证以降低 reward hacking。
官方报告给出 pretraining、context extension、post-training 的计算分账;不能把整套 V3 能力归因于 GRPO。
### 4.4 DeepSeek-R1
必须分开:
- **R1-Zero**:从 base 直接做 rule-based reasoning RL,没有初始 SFT
- **R1**cold-start data → reasoning RL → rejection sampling / SFT → broader RL
- **distilled models**:只做 SFT,不等于复现 R1 的 RL 训练。
报告附录展示 helpful RM reward hackingreward 上升而测试表现下降;也展示语言一致性 reward 的能力 trade-off。
### 4.5 DeepSeek-V3.2 / V4
V3.2 把 reasoning、agent 与 human alignment 合并进一个大规模 GRPO 阶段,
通用任务采用 generative reward modelagent/reasoning 尽量使用规则结果。
V4 的两阶段主线:
```text
SFT:高质量、多领域、能力冷启动
→ GRPOdomain-aligned behavior
```
对 hard-to-verify tasksV4 报告明确说不再使用传统 scalar RM,而采用 rubric-guided data 与
Generative Reward Modeleasy-to-verify tasks 继续用规则或测试。
## 5. Kimi:从长轨迹 RL 到 K3 多教师整合
### 5.1 Kimi K2 / K2.5
K2 公开 post-training 覆盖:
- general RL
- self-critique rubric reward
- verifiable reward
- PTX 与 budget control。
K2.5 继续扩展 unified agentic RL、视觉与并行 agentRollout Manager 支持大规模并发任务。
这些工作已经超出“聊天回答偏好”:reward 来自执行环境、规则与生成式 rubric 的组合。
### 5.2 Kimi K3 的三阶段合同
K3 官方报告明确:
```text
Stage 1 · SFT
建立高质量 cold-start agent policy
Stage 2 · RL experts
general / general-agent / coding
× low / high / max reasoning effort
= 9 个领域-强度专家
Stage 3 · MOPD
student on-policy rollout
+ 对应 teacher 的逐 Token log-ratio reward
→ 把九个专家整合回一个统一模型
```
MOPD 的逐 Token信号是:
```text
r_opd(y_t)
= clip(stopgrad(log π_teacher(y_t|prefix) / π_student(y_t|prefix)),
-R_max, R_max)
```
概念边界:
- K3 的 partial rollout 是长轨迹跨迭代产生的 off-policy 稳定性问题;
- MOPD 则在当前 student 自己访问的状态上计算 teacher signal
- 两者可以在同一系统中共存,但不是同一种算法;
- agentic GRM 仍需 verbosity budget,报告明确把它作为防 reward hacking 的约束;
- MXFP4 QAT 从 SFT 起覆盖整个 post-training,是部署约束,不是偏好目标。
## 6. 正式一手论文链(44 个节点)
| # | 年份 | 节点 | 本章角色 | 核验入口 |
|---:|---:|---|---|---|
| 01 | 2017 | Deep RL from Human Preferences | pairwise trajectory → reward | `1706.03741` Eq.1 / Fig.1 |
| 02 | 2017 | PPO | clipped on-policy update | `1707.06347` Eq.7 |
| 03 | 2019 | Fine-Tuning LMs from Human Preferences | LM reward + KL + PPO | `1909.08593` Eq.12 |
| 04 | 2020 | Learning to Summarize from Human Feedback | 完整生成式 RLHF | `2009.01325` Fig.2 / Fig.5 |
| 05 | 2021 | Natural Instructions | declarative task interface | `2104.08773` |
| 06 | 2021 | FLAN | instruction-tuned zero-shot | `2109.01652` Fig.6 |
| 07 | 2021 | T0 | prompted multitask mixture | `2110.08207` Fig.2 |
| 08 | 2021 | WebGPT | browser action + preference | `2112.09332` |
| 09 | 2022 | InstructGPT | SFT → RM → PPO-ptx | `2203.02155` Fig.2 / Eq.12 |
| 10 | 2022 | HH-RLHF | helpful / harmless assistant | `2204.05862` |
| 11 | 2022 | Super-NaturalInstructions | 1,600+ task generalization | `2204.07705` |
| 12 | 2022 | Scaling Instruction-Finetuned LMs | Flan collection scaling | `2210.11416` |
| 13 | 2022 | Reward Model Overoptimization | proxy / gold Goodhart curve | `2210.10760` |
| 14 | 2022 | Constitutional AI | self-critique + RLAIF | `2212.08073` Fig.1 |
| 15 | 2022 | Self-Instruct | synthetic instruction bootstrap | `2212.10560` Fig.2 |
| 16 | 2023 | OpenAssistant Conversations | open conversation / ranking tree | `2304.07327` |
| 17 | 2023 | RRHF | response ranking objective | `2304.05302` |
| 18 | 2023 | SLiC-HF | sequence likelihood calibration | `2305.10425` |
| 19 | 2023 | LIMA | 1K curated SFT | `2305.11206` |
| 20 | 2023 | AlpacaFarm | feedback simulator / baselines | `2305.14387` |
| 21 | 2023 | DPO | implicit reward / direct objective | `2305.18290` Eq.57 |
| 22 | 2023 | RLAIF vs RLHF | human/AI label comparison | `2309.00267` |
| 23 | 2023 | UltraFeedback | scaled multi-aspect AI feedback | `2310.01377` |
| 24 | 2023 | IPO theory | finite-margin preference regression | `2310.12036` |
| 25 | 2023 | Zephyr | dSFT + AI preference dDPO | `2310.16944` Fig.2 |
| 26 | 2024 | KTO | unpaired binary feedback | `2402.01306` |
| 27 | 2024 | RLOO | critic-free REINFORCE baseline | `2402.14740` |
| 28 | 2024 | ORPO | SFT + odds-ratio single stage | `2403.07691` |
| 29 | 2024 | RewardBench | reward model evaluation | `2403.13787` Fig.1 |
| 30 | 2024 | SimPO | reference-free mean log-prob | `2405.14734` |
| 31 | 2024 | Unpacking DPO and PPO | data/algorithm/RM/prompt 四变量 | NeurIPS 2024 |
| 32 | 2024 | Tülu 3 | open SFT → DPO → RLVR recipe | `2411.15124` |
| 33 | 2024 | DeepSeek LLM | 1M+ SFT + DPO | `2401.02954` §4 |
| 34 | 2024 | DeepSeekMath | GRPO | `2402.03300` |
| 35 | 2024 | DeepSeek-V2 | SFT + two-stage GRPO alignment | `2405.04434` §4 |
| 36 | 2024 | DeepSeek-V3 | SFT / RM / GRPO / GRM | `2412.19437` §5 |
| 37 | 2025 | DeepSeek-R1 | Zero / cold-start / RL / SFT 分层 | `2501.12948` |
| 38 | 2025 | DAPO | long-CoT GRPO stabilization | `2503.14476` |
| 39 | 2025 | Kimi K2 | verifiable + generative rewards | `2507.20534` |
| 40 | 2025 | DeepSeek-V3.2 | merged reasoning/agent/alignment RL | `2512.02556` §3 |
| 41 | 2026 | Kimi K2.5 | unified multimodal/agentic RL | `2602.02276` |
| 42 | 2026 | DeepSeek-V4 | SFT + GRPO + GRM | `2606.19348` §5 |
| 43 | 2026 | MOPD | multi-teacher on-policy distillation | `2606.30406` |
| 44 | 2026 | Kimi K3 | 9 experts → MOPD / 1M agentic RL | `2607.24653` §4 |
## 7. 常见误解清单
1. **“SFT 改了 next-token 目标”**:通常仍是 next-token cross-entropy,只是条件与训练分布变了。
2. **“chosen 就是完美答案”**pair 只保证 chosen 相对更受偏好,可能两者都差。
3. **“reward model 学到了人类价值”**:它拟合特定标签者、rubric、候选分布下的比较。
4. **“PPO 就是 RLHF”**PPO 只是 policy optimizerRLHF 还含反馈、RM、reference、rollout 和评测。
5. **“DPO 不需要 reward”**:它不训练显式 RM,但偏好 pair 与隐式 reward 假设仍在。
6. **“DPO 永远比 PPO 好”**:数据质量、online sampling、RM、prompt 分布和实现可改变结论。
7. **“RLAIF 没有人类参与”**:原则、rubric、teacher 训练与最终评测仍来自人类选择。
8. **“规则奖励不会被 hack”**:解析器、测试覆盖、沙箱和提交预算都可能有漏洞。
9. **“训练 reward 上升就是模型更好”**:必须看 gold/human/environment outcome 与 KL。
10. **“RLVR 与 RLHF 是两代技术”**:开放任务可用偏好,数学/代码可用 verifier,现代系统混合两者。
11. **“R1-Zero 就是 DeepSeek-R1”**:正式 R1 还有 cold start、SFT、多阶段 RL 与蒸馏。
12. **“K3 MOPD 是普通离线蒸馏”**student 在自己的 rollout 状态上接收对应 teacher 的逐 Token 信号。
## 8. 页面与交互验收合同
### 8.1 正文
- 2022 个正文区段;
- 十二张账;
- 至少 44 个正式一手节点;
- DeepSeek LLM → V2 → V3 → R1 → V3.2 → V4 完整主线;
- Kimi K2 → K2.5 → K3 完整主线;
- 所有机制图为原创 HTML/CSS/SVG 示意,显式标注证据边界。
### 8.2 四联实验室
1. **SFT 损失显微镜**
可切换 prompt masking、参考回答质量和长度;显示哪些 Token 产生梯度、NLL 与 teacher-forcing 边界。
2. **偏好与奖励模型实验**
调整两回答的 factuality/helpfulness/style/length、标注噪声与 reward weights
显示 BradleyTerry 概率、shortcut 与“chosen 不等于绝对好”。
3. **PPO / DPO 更新控制室**
调 reward gap、KL/β、policy/reference log-ratio、数据新鲜度;
分别展示显式 RM+rollout 与离线 pair 的更新合同,不伪造可比总分。
4. **现代 Post-training 配方比较器**
InstructGPT / Constitutional AI / DPO / DeepSeek-V2 / DeepSeek-V4 / Kimi K3
比较反馈源、模型组件、在线/离线、监督粒度、约束与主要失效模式。
### 8.3 工程闸门
- 键盘 tabs 与 `aria-selected`
- 390px 移动端根页面零横向溢出;
- 交互数字标为教学模拟;
- 论文链接全部指向 canonical primary source
- Astro check / build / internal link checker / 真实 Chrome regression 全部通过。
+10
View File
@@ -21,3 +21,13 @@
其余已核节点通过 DOI、ACL Anthology、PMLR、ISCA、JMLR、NeurIPS 或官方 arXiv 页面定位,
完整证据边界见 `../LANGUAGE_MODEL_HISTORY_RESEARCH.md`
Alignment 首轮缓存位于 `alignment/`(不提交 PDF/TXT):
- Christiano 2017、Ziegler 2019、Stiennon 2020 与 InstructGPT
- Natural Instructions、FLAN、T0、HH-RLHF、Constitutional AI 与 Self-Instruct
- DPO、RRHF、SLiC-HF、LIMA、RLAIF、UltraFeedback、IPO、KTO、ORPO、RewardBench 与 SimPO。
DeepSeek LLM/V2/V3/R1/V3.2/V4、Kimi K2/K2.5/K3 与 MOPD 复用既有本地缓存。
正式机制、公式、版本边界与 44 节点论文链见 `../ALIGNMENT_RESEARCH.md`Grok 候选线索单独保存在
`../ALIGNMENT_GROK_LEADS.md`,不能直接作为正文证据。