Files
llm-atlas/research/ALIGNMENT_RESEARCH.md
T
2026-07-29 06:07:42 +08:00

25 KiB
Raw Blame History

指令微调与人类偏好研究账本

状态:正式一手证据账本,Chapter 10 首版研究中
研究截止:2026-07-29
本轮本地缓存:24 份新增一手 PDF / 文本,复用 PPO、DeepSeek、Kimi 与推理专题既有缓存
线索发现:K3 references、论文引用网络、会议/作者页面、Grok CLI
结论依据:原论文正文、会议论文页、官方技术报告;Grok 只用于扩大候选召回

0. 这一章真正要回答什么

“Alignment / 对齐”经常被说成一个模糊的终点,仿佛模型经过某种神秘训练后就“符合人类价值”。 为了避免这种过度承诺,本章把问题限定为:

一个只会延续互联网文本分布的 base language model
如何学会理解用户接口、产生可协作行为、区分更好与更差的回答,
并在代理目标、反馈偏差与能力退化之间保持可检查的边界?

至少要分开十二张账:

  1. 行为目标账:我们想改变 helpfulness、harmlessness、honesty、格式遵循、风格还是某项能力?
  2. 监督单位账:标签作用于 Token、整段 demonstration、pairwise preference、标量、步骤还是环境结果?
  3. 数据来源账:人类、AI teacher、constitution、规则 verifier、执行环境分别提供什么信息?
  4. SFT 账teacher forcing 的条件似然学到了什么,又没有学到什么?
  5. 偏好测量账:排序、评分、二元可取性与多人分歧怎样进入数据?
  6. 奖励模型账Bradley–Terry 类模型如何把比较变成标量代理?
  7. 策略优化账PPO、REINFORCE/RLOO、GRPO 分别怎样更新 policy
  8. 直接偏好账DPO、IPO、KTO、ORPO、SimPO 消掉了哪些组件,保留了哪些假设?
  9. 分布账:反馈来自当前 policy 还是旧 policyonline、offline、on-policy、off-policy 不能混写。
  10. 约束账reference KL、pretraining mix、长度/语言/安全约束怎样防止“为了高分走太远”?
  11. 失效账reward hacking、过优化、迎合、长度偏置、拒答过度与 alignment tax 怎样出现?
  12. 证据账:训练 reward、RM accuracy、LLM judge、人工盲评、规则验证分别能证明到哪一步?

本章不声称给出“人类价值”的唯一数学定义。它讲的是可观测的 post-training 接口、训练信号和证据边界。

1. 四条因果链

1.1 从任务标签到自然语言接口

每个任务训练一个专用模型
→ 多任务共享参数
→ 用 prompt template 把不同数据集写成自然语言任务
→ FLAN / T0:在许多 prompted tasks 上 instruction tuning
→ Self-Instruct:让模型自举生成 instruction / input / output
→ LIMA:检验少量高质量示范能把多大比例的预训练能力“叫出来”
→ 当代 SFT:混合通用、推理、工具、代码、安全与多轮轨迹

这里的核心变化不是“下一个 Token 目标消失”,而是训练条件从普通文本前缀变成了 system / instruction / context / response 的交互接口。

1.2 从比较轨迹到通用助手 RLHF

Christiano et al. 2017:人比较两段行为轨迹
→ reward predictor 拟合 pairwise preference
→ Ziegler et al. 2019:把 RM + KL + PPO 接到语言模型
→ Stiennon et al. 2020:摘要任务验证完整三段式管线
→ InstructGPT 2022SFT → RM → PPO-ptx 扩展到开放指令
→ HH-RLHF / Llama 2helpfulness、安全与多轮迭代被显式分账

真正的桥梁是“比较比绝对打分更容易”,并通过 Bradley–Terry 风格的选择模型把比较拟合成可优化标量。

1.3 从显式奖励模型到直接偏好目标

RM + PPO:先拟合 scalar reward,再对当前 policy 做在线优化
→ RRHF / SLiC-HF:用排序或似然校准直接作用到回答概率
→ DPO:在 BT + KL-regularized optimum 假设下,把 reward 改写成 policy/reference log-ratio
→ IPO:指出确定性偏好假设下的过拟合问题,改用回归式间隔
→ KTO:允许 desirable / undesirable 非成对反馈
→ ORPO:把 SFT 与 odds-ratio preference 合为单阶段
→ SimPO:用长度归一平均 log-prob 和 margin 构造 reference-free reward

“无需 reward model”不等于“无需偏好信号”,也不等于“自动 on-policy”。

1.4 从人类偏好到 AI、规则与环境反馈

Human demonstrations / rankings
→ Constitutional AI:原则 → 自我批评/修订 → AI preference
→ RLAIF / UltraFeedback:用 LLM 扩大标签量与维度
→ rule-based verifier:数学答案、编译器、测试用例
→ generative reward model:按 rubric 生成评价过程与分数
→ DeepSeekSFT + GRPO + rule/model/GRM,多阶段合并
→ Kimi K3SFT → 3 domains × 3 efforts RL teachers → MOPD

这不是“AI 反馈取代人类”的单向历史。现代系统常把人工定义的目标、AI 扩标、可执行规则和环境结果组合起来。

2. 最小数学:四个不同对象

2.1 SFT:模仿一个给定回答

对 prompt x 与示范回答 y = (y₁,…,y_T)

L_SFT = - Σ_t m_t log πθ(y_t | x, y_<t)

m_t 通常只让 assistant response token 计入损失;system/user token 用作条件但不作为目标。

它在问:

在已经给定这个参考答案的条件下,模型是否提高了每个参考 Token 的概率?

它没有直接问“另一个回答是否更好”,也没有在自由 rollout 分布上训练纠错。

2.2 偏好模型:比较两个完整回答

对同一 prompt 的 chosen y_w 与 rejected y_lBradleyTerry 形式为:

P(y_w ≻ y_l | x)
  = σ(rφ(x,y_w) - rφ(x,y_l))

reward model loss

L_RM = -log σ(rφ(x,y_w) - rφ(x,y_l))

只有 reward difference 可辨识:给同一 prompt 的全部奖励同时加一个常数,不改变偏好概率。

2.3 KL-regularized policy optimization

典型目标的抽象形式:

max_π E[rφ(x,y)] - β KL(π(·|x) || π_ref(·|x))

π_ref 不是装饰:

  • 把 policy 留在 reward model 见过的分布附近;
  • 保持语言质量与已有行为;
  • 让 reward 与偏离成本之间形成可调边界。

InstructGPT 还加入 pretraining mix

reward - β log(π_RL / π_SFT) + γ log π_RL(x_pretrain)

因此论文默认的 InstructGPT 是 PPO-ptx,不应把它简化成“纯 PPO”。

2.4 DPO:用 policy/reference 比值参数化隐式奖励

在论文的假设下:

rθ(x,y) = β log [πθ(y|x) / π_ref(y|x)]

DPO loss

L_DPO =
 -log σ( β[
    log πθ(y_w|x) - log π_ref(y_w|x)
  - log πθ(y_l|x) + log π_ref(y_l|x)
 ])

它训练的是“相对 referencechosen 比 rejected 获得更大的 log-ratio 提升”。 所以 DPO 仍依赖:

  • preference pair 的质量;
  • pair 来自哪个行为分布;
  • reference policy
  • β
  • sequence log-prob 的求和、mask 与长度口径。

3. 十二张教学账

3.1 行为目标账:先说清“对齐什么”

至少区分:

目标 典型问题 不能替代的证据
Instruction following 是否遵守格式、约束和任务 仅看流畅度不够
Helpfulness 是否解决用户真实问题 RM 分数不是用户成功率
Harmlessness / safety 是否拒绝或安全重定向 “总是拒答”不是完整安全
Honesty / calibration 是否承认不知道、避免编造 偏好者也可能奖励自信语气
Reasoning / coding 是否得到可验证结果 长 CoT 或漂亮代码不等于通过
Agent execution 是否在环境中完成长程任务 单轮 chat win-rate 不足
Style / personality 是否符合表达规范 不应冒充能力增长

“能力学习”与“行为塑形”不是二选一。SFT 可注入新任务知识,RL 也可能重排甚至扩展可访问策略; 但任何因果归因都需要控制 base、数据、预算和评测。

3.2 监督单位账:标签落在哪里

信号 单位 优点 盲点
Demonstration 整段目标回答的 Token 稠密、稳定 只有一种参考路径
Pairwise preference 两个完整回答 比绝对分数容易 只给相对次序
Likert / scalar 单回答 可表达强弱 标尺跨人漂移
Outcome reward 轨迹末端 便宜、客观 credit assignment 稀疏
Process reward 中间步骤 更细粒度 标注贵,可能不忠实
Token teacher signal 每个 Token 稠密整合能力 teacher 偏差逐 Token 传递
Environment reward 状态变化/测试 接近任务结果 verifier 可能有漏洞

3.3 数据来源账:谁定义“更好”

  1. 专业标注者;
  2. 目标用户或产品日志;
  3. 众包标注者;
  4. AI judge / teacher
  5. 宪法或书面 rubric
  6. ground truth / 单元测试 / 编译器;
  7. 沙箱环境的真实结果;
  8. 多来源混合。

来源决定偏差。把 “human preference” 聚合成单一标量,会隐藏群体分歧、标注者训练、文化背景和任务专长。

3.4 SFT 账:稳定冷启动,不是万能答案

SFT 的三个主要作用:

  • 教交互协议、角色与输出格式;
  • 把 base model 的已有能力放到用户可调用的接口上;
  • 给 RL 提供足够可靠的 cold-start policy,避免 rollout 一开始全是无效样本。

主要代价:

  • teacher forcing 与自由生成分布不一致;
  • 参考答案不是唯一正确策略;
  • 每个回答 Token 都被模仿,难表达“这部分好、那部分差”;
  • 低质量、重复或模板化示范会被直接学习;
  • 过强模仿可能缩小探索空间。

LIMA 的 1,000 高质量样本是“强 base + 指定评测 + 风格/接口”的实证结果,不是“小数据对齐普遍定律”。

3.5 偏好测量账:比较也不是客观真值

偏好数据必须记录:

  • candidate 由哪些 policy、temperature、长度上限生成;
  • 是两两比较、K-way ranking 还是独立评分;
  • 是否允许 tie / both bad
  • rubric 是总体质量还是多维评分;
  • 是否随机交换展示位置;
  • 每个样本有几名标注者、分歧如何保留;
  • chosen 是否只是“两者较好”,而不是真正高质量。

训练集若只有“一个差回答和一个明显好回答”,RM 可能只学会表面线索; 部署时遇到两个都很强、差异很细的回答就会失准。

3.6 奖励模型账:代理目标的力量和危险来自同一处

reward model 把开放式判断压成一个可微标量,policy 因而能在没有唯一参考答案时继续优化。 但 policy 会主动寻找 RM 的高分区域,而这些区域可能远离 RM 的训练分布。

重要检查:

  • in-distribution pair accuracy
  • hard / OOD / adversarial pairs
  • 长度、格式、拒答等 shortcut
  • calibration 与多人分歧;
  • gold human evaluation 随 KL / optimization strength 的曲线;
  • reward ensemble 或 uncertainty。

RewardBench 是对 RM 本身的测试入口,不是最终 assistant 质量的充分证明。

3.7 策略优化账:PPO 不是 RLHF 的同义词

PPO 的 clipped surrogate 限制单次 importance ratio

min(
  ρ_t A_t,
  clip(ρ_t, 1-ε, 1+ε) A_t
)

LLM RLHF 的完整系统还常包含:

  • actor / policy
  • reference policy
  • reward model
  • critic / value
  • rollout engine
  • GAE / return
  • token mask、长度处理、KL controller
  • 可选 pretraining gradient。

RLOO、GRPO 等方法可省去 learned critic,但不因此自动解决 reward misspecification。

3.8 直接偏好账:算法名字先归到角色合同

方法 数据 显式 RM Reference 核心角色
DPO chosen/rejected pair policy/reference log-ratio 分类
IPO pair 回归到有限偏好 margin
KTO desirable / undesirable 可非配对 通常是 prospect-theoretic utility
ORPO pair + SFT NLL + odds-ratio penalty
SimPO pair 平均 log-prob reward + target margin
RRHF ranking / 多来源候选 序列得分排序
SLiC-HF pair 可选校准基线 sequence likelihood calibration

不能从“模型数更少”直接推出“效果更好”。2024 NeurIPS 的 DPO/PPO 解耦实验明确把 preference data、learning algorithm、reward model 和 policy prompts 分成四个变量,并发现数据质量影响最大。

3.9 分布账:online/offline 与 on/off-policy 是两组词

  • offline preference optimization:固定 pair 数据训练,不随着当前 policy 更新标签;
  • online preference optimization:当前 policy 生成新候选,再获取反馈;
  • on-policy RL:梯度主要使用当前 policy 的 rollout
  • off-policy / stale rollout:行为 policy 与当前 policy 不同,需要 importance correction 或 clipping。

DPO 通常是 offlinePPO 通常需要近 on-policy rolloutK3 partial rollout 会让超长轨迹跨迭代变旧, 因此必须显式做 off-policy 稳定化。这些词描述不同轴。

3.10 约束账:为什么不能只追 reward

常见防线:

  1. reference KL
  2. PPO ratio clipping
  3. pretraining / SFT replay
  4. response length / verbosity budget
  5. language consistency
  6. safety constraint reward
  7. rule-based verifier 优先;
  8. reward ensemble / uncertainty
  9. 在线补充 policy 当前分布上的偏好数据;
  10. hidden evaluator 与提交预算。

约束会产生真实 trade-off。例如语言一致性奖励可能轻微降低某些任务表现,却改善目标语言可读性; 这不是“白送”的收益。

3.11 失效账:高 reward 不等于高真实效用

Reward overoptimization

Gao et al. 使用 proxygold synthetic setup 展示:

proxy reward 持续上升
gold reward 先上升、后饱和甚至下降

这是 Goodhart 风险的受控实证,不应外推成所有真实 RLHF 的统一数值曲线。

长度与语气偏置

长回答更容易显得完整;礼貌、自信、分点也可能成为 shortcut。 需要 length-controlled evaluation,而不是看到 win-rate 上升就断言事实性更好。

迎合

如果人更喜欢被认同,模型可能学会顺着错误前提。helpfulness、honesty 和 user approval 必须分开评测。

过度拒答

只奖励“不产生危险文本”会推动模型拒绝无害请求。安全评测必须同时测 should-refuse 和 should-respond。

Alignment tax

RL 或偏好优化可能让某些标准能力退化。DeepSeek-V2 报告明确观察到部分 benchmark 的 alignment tax 并通过训练策略缓解;不能只报 chat judge。

3.12 证据账:每个数字到底证明什么

证据 能证明 不能单独证明
SFT loss 模仿训练集 Token 的拟合 用户偏好、事实性
RM pair accuracy 在该 pair 分布上的排序 policy 优化后的 OOD 可靠性
training reward 对当前 proxy 的优化 真实人类效用
KL 与 reference 的分布距离 改变是好是坏
LLM judge win-rate 该 judge/rubric 下的相对偏好 无偏人类共识
blind human eval 特定人群/协议下偏好 普适价值
rule pass rate verifier 定义的正确性 开放式质量与安全
downstream benchmark 指定任务能力 完整助手行为

4. DeepSeek:从 SFT+DPO 到多源 GRPO / GRM

4.1 DeepSeek LLM

官方报告公开:

  • 超过 100 万 SFT instances
  • 7B 使用 4 epochs67B 使用 2 epochs
  • helpfulness 与 harmlessness preference data
  • DPO 训练 1 epoch
  • 数学 SFT 过多会提高重复率;
  • 报告把 reasoning 改善谨慎归因:SFT 可能主要注入了题型与知识,不能直接证明学会一般推理。

这是一条典型的 base → SFT chat → DPO 管线。

4.2 DeepSeek-V2

V2 把对齐管线改成:

base
→ SFT
→ reasoning alignment
→ human preference alignment

第二阶段采用 helpful、safety 与 rule-based 多奖励;RL 使用 GRPO。 报告同时讨论:

  • SFT 数量与质量;
  • alignment tax
  • online RL 与 offline preference alignment 的差异;
  • code preference 来自 compiler feedback,数学来自 ground-truth labels。

4.3 DeepSeek-V3

V3 的 post-training 包括:

  • 从 expert model / DeepSeek-R1 蒸馏 reasoning data
  • 两个 epochs 的 SFT
  • rule-based RM 与 model-based RM
  • GRPO
  • generative reward model 的探索;
  • 尽可能优先使用规则验证以降低 reward hacking。

官方报告给出 pretraining、context extension、post-training 的计算分账;不能把整套 V3 能力归因于 GRPO。

4.4 DeepSeek-R1

必须分开:

  • R1-Zero:从 base 直接做 rule-based reasoning RL,没有初始 SFT
  • R1cold-start data → reasoning RL → rejection sampling / SFT → broader RL
  • distilled models:只做 SFT,不等于复现 R1 的 RL 训练。

报告附录展示 helpful RM reward hackingreward 上升而测试表现下降;也展示语言一致性 reward 的能力 trade-off。

4.5 DeepSeek-V3.2 / V4

V3.2 把 reasoning、agent 与 human alignment 合并进一个大规模 GRPO 阶段, 通用任务采用 generative reward modelagent/reasoning 尽量使用规则结果。

V4 的两阶段主线:

SFT:高质量、多领域、能力冷启动
→ GRPOdomain-aligned behavior

对 hard-to-verify tasksV4 报告明确说不再使用传统 scalar RM,而采用 rubric-guided data 与 Generative Reward Modeleasy-to-verify tasks 继续用规则或测试。

5. Kimi:从长轨迹 RL 到 K3 多教师整合

5.1 Kimi K2 / K2.5

K2 公开 post-training 覆盖:

  • general RL
  • self-critique rubric reward
  • verifiable reward
  • PTX 与 budget control。

K2.5 继续扩展 unified agentic RL、视觉与并行 agentRollout Manager 支持大规模并发任务。

这些工作已经超出“聊天回答偏好”:reward 来自执行环境、规则与生成式 rubric 的组合。

5.2 Kimi K3 的三阶段合同

K3 官方报告明确:

Stage 1 · SFT
  建立高质量 cold-start agent policy

Stage 2 · RL experts
  general / general-agent / coding
  × low / high / max reasoning effort
  = 9 个领域-强度专家

Stage 3 · MOPD
  student on-policy rollout
  + 对应 teacher 的逐 Token log-ratio reward
  → 把九个专家整合回一个统一模型

MOPD 的逐 Token信号是:

r_opd(y_t)
  = clip(stopgrad(log π_teacher(y_t|prefix) / π_student(y_t|prefix)),
         -R_max, R_max)

概念边界:

  • K3 的 partial rollout 是长轨迹跨迭代产生的 off-policy 稳定性问题;
  • MOPD 则在当前 student 自己访问的状态上计算 teacher signal
  • 两者可以在同一系统中共存,但不是同一种算法;
  • agentic GRM 仍需 verbosity budget,报告明确把它作为防 reward hacking 的约束;
  • MXFP4 QAT 从 SFT 起覆盖整个 post-training,是部署约束,不是偏好目标。

6. 正式一手论文链(44 个节点)

# 年份 节点 本章角色 核验入口
01 2017 Deep RL from Human Preferences pairwise trajectory → reward 1706.03741 Eq.1 / Fig.1
02 2017 PPO clipped on-policy update 1707.06347 Eq.7
03 2019 Fine-Tuning LMs from Human Preferences LM reward + KL + PPO 1909.08593 Eq.12
04 2020 Learning to Summarize from Human Feedback 完整生成式 RLHF 2009.01325 Fig.2 / Fig.5
05 2021 Natural Instructions declarative task interface 2104.08773
06 2021 FLAN instruction-tuned zero-shot 2109.01652 Fig.6
07 2021 T0 prompted multitask mixture 2110.08207 Fig.2
08 2021 WebGPT browser action + preference 2112.09332
09 2022 InstructGPT SFT → RM → PPO-ptx 2203.02155 Fig.2 / Eq.12
10 2022 HH-RLHF helpful / harmless assistant 2204.05862
11 2022 Super-NaturalInstructions 1,600+ task generalization 2204.07705
12 2022 Scaling Instruction-Finetuned LMs Flan collection scaling 2210.11416
13 2022 Reward Model Overoptimization proxy / gold Goodhart curve 2210.10760
14 2022 Constitutional AI self-critique + RLAIF 2212.08073 Fig.1
15 2022 Self-Instruct synthetic instruction bootstrap 2212.10560 Fig.2
16 2023 OpenAssistant Conversations open conversation / ranking tree 2304.07327
17 2023 RRHF response ranking objective 2304.05302
18 2023 SLiC-HF sequence likelihood calibration 2305.10425
19 2023 LIMA 1K curated SFT 2305.11206
20 2023 AlpacaFarm feedback simulator / baselines 2305.14387
21 2023 DPO implicit reward / direct objective 2305.18290 Eq.57
22 2023 RLAIF vs RLHF human/AI label comparison 2309.00267
23 2023 UltraFeedback scaled multi-aspect AI feedback 2310.01377
24 2023 IPO theory finite-margin preference regression 2310.12036
25 2023 Zephyr dSFT + AI preference dDPO 2310.16944 Fig.2
26 2024 KTO unpaired binary feedback 2402.01306
27 2024 RLOO critic-free REINFORCE baseline 2402.14740
28 2024 ORPO SFT + odds-ratio single stage 2403.07691
29 2024 RewardBench reward model evaluation 2403.13787 Fig.1
30 2024 SimPO reference-free mean log-prob 2405.14734
31 2024 Unpacking DPO and PPO data/algorithm/RM/prompt 四变量 NeurIPS 2024
32 2024 Tülu 3 open SFT → DPO → RLVR recipe 2411.15124
33 2024 DeepSeek LLM 1M+ SFT + DPO 2401.02954 §4
34 2024 DeepSeekMath GRPO 2402.03300
35 2024 DeepSeek-V2 SFT + two-stage GRPO alignment 2405.04434 §4
36 2024 DeepSeek-V3 SFT / RM / GRPO / GRM 2412.19437 §5
37 2025 DeepSeek-R1 Zero / cold-start / RL / SFT 分层 2501.12948
38 2025 DAPO long-CoT GRPO stabilization 2503.14476
39 2025 Kimi K2 verifiable + generative rewards 2507.20534
40 2025 DeepSeek-V3.2 merged reasoning/agent/alignment RL 2512.02556 §3
41 2026 Kimi K2.5 unified multimodal/agentic RL 2602.02276
42 2026 DeepSeek-V4 SFT + GRPO + GRM 2606.19348 §5
43 2026 MOPD multi-teacher on-policy distillation 2606.30406
44 2026 Kimi K3 9 experts → MOPD / 1M agentic RL 2607.24653 §4

7. 常见误解清单

  1. “SFT 改了 next-token 目标”:通常仍是 next-token cross-entropy,只是条件与训练分布变了。
  2. “chosen 就是完美答案”pair 只保证 chosen 相对更受偏好,可能两者都差。
  3. “reward model 学到了人类价值”:它拟合特定标签者、rubric、候选分布下的比较。
  4. “PPO 就是 RLHF”PPO 只是 policy optimizerRLHF 还含反馈、RM、reference、rollout 和评测。
  5. “DPO 不需要 reward”:它不训练显式 RM,但偏好 pair 与隐式 reward 假设仍在。
  6. “DPO 永远比 PPO 好”:数据质量、online sampling、RM、prompt 分布和实现可改变结论。
  7. “RLAIF 没有人类参与”:原则、rubric、teacher 训练与最终评测仍来自人类选择。
  8. “规则奖励不会被 hack”:解析器、测试覆盖、沙箱和提交预算都可能有漏洞。
  9. “训练 reward 上升就是模型更好”:必须看 gold/human/environment outcome 与 KL。
  10. “RLVR 与 RLHF 是两代技术”:开放任务可用偏好,数学/代码可用 verifier,现代系统混合两者。
  11. “R1-Zero 就是 DeepSeek-R1”:正式 R1 还有 cold start、SFT、多阶段 RL 与蒸馏。
  12. “K3 MOPD 是普通离线蒸馏”student 在自己的 rollout 状态上接收对应 teacher 的逐 Token 信号。

8. 页面与交互验收合同

8.1 正文

  • 2022 个正文区段;
  • 十二张账;
  • 至少 44 个正式一手节点;
  • DeepSeek LLM → V2 → V3 → R1 → V3.2 → V4 完整主线;
  • Kimi K2 → K2.5 → K3 完整主线;
  • 所有机制图为原创 HTML/CSS/SVG 示意,显式标注证据边界。

8.2 四联实验室

  1. SFT 损失显微镜
    可切换 prompt masking、参考回答质量和长度;显示哪些 Token 产生梯度、NLL 与 teacher-forcing 边界。

  2. 偏好与奖励模型实验
    调整两回答的 factuality/helpfulness/style/length、标注噪声与 reward weights 显示 BradleyTerry 概率、shortcut 与“chosen 不等于绝对好”。

  3. PPO / DPO 更新控制室
    调 reward gap、KL/β、policy/reference log-ratio、数据新鲜度; 分别展示显式 RM+rollout 与离线 pair 的更新合同,不伪造可比总分。

  4. 现代 Post-training 配方比较器
    InstructGPT / Constitutional AI / DPO / DeepSeek-V2 / DeepSeek-V4 / Kimi K3 比较反馈源、模型组件、在线/离线、监督粒度、约束与主要失效模式。

8.3 工程闸门

  • 键盘 tabs 与 aria-selected
  • 390px 移动端根页面零横向溢出;
  • 交互数字标为教学模拟;
  • 论文链接全部指向 canonical primary source
  • Astro check / build / internal link checker / 真实 Chrome regression 全部通过。