# 指令微调与人类偏好研究账本 状态:正式一手证据账本,Chapter 10 首版研究中 研究截止:2026-07-29 本轮本地缓存:24 份新增一手 PDF / 文本,复用 PPO、DeepSeek、Kimi 与推理专题既有缓存 线索发现:K3 references、论文引用网络、会议/作者页面、Grok CLI 结论依据:原论文正文、会议论文页、官方技术报告;Grok 只用于扩大候选召回 ## 0. 这一章真正要回答什么 “Alignment / 对齐”经常被说成一个模糊的终点,仿佛模型经过某种神秘训练后就“符合人类价值”。 为了避免这种过度承诺,本章把问题限定为: > 一个只会延续互联网文本分布的 base language model, > 如何学会理解用户接口、产生可协作行为、区分更好与更差的回答, > 并在代理目标、反馈偏差与能力退化之间保持可检查的边界? 至少要分开十二张账: 1. **行为目标账**:我们想改变 helpfulness、harmlessness、honesty、格式遵循、风格还是某项能力? 2. **监督单位账**:标签作用于 Token、整段 demonstration、pairwise preference、标量、步骤还是环境结果? 3. **数据来源账**:人类、AI teacher、constitution、规则 verifier、执行环境分别提供什么信息? 4. **SFT 账**:teacher forcing 的条件似然学到了什么,又没有学到什么? 5. **偏好测量账**:排序、评分、二元可取性与多人分歧怎样进入数据? 6. **奖励模型账**:Bradley–Terry 类模型如何把比较变成标量代理? 7. **策略优化账**:PPO、REINFORCE/RLOO、GRPO 分别怎样更新 policy? 8. **直接偏好账**:DPO、IPO、KTO、ORPO、SimPO 消掉了哪些组件,保留了哪些假设? 9. **分布账**:反馈来自当前 policy 还是旧 policy;online、offline、on-policy、off-policy 不能混写。 10. **约束账**:reference KL、pretraining mix、长度/语言/安全约束怎样防止“为了高分走太远”? 11. **失效账**:reward hacking、过优化、迎合、长度偏置、拒答过度与 alignment tax 怎样出现? 12. **证据账**:训练 reward、RM accuracy、LLM judge、人工盲评、规则验证分别能证明到哪一步? 本章不声称给出“人类价值”的唯一数学定义。它讲的是可观测的 post-training 接口、训练信号和证据边界。 ## 1. 四条因果链 ### 1.1 从任务标签到自然语言接口 ```text 每个任务训练一个专用模型 → 多任务共享参数 → 用 prompt template 把不同数据集写成自然语言任务 → FLAN / T0:在许多 prompted tasks 上 instruction tuning → Self-Instruct:让模型自举生成 instruction / input / output → LIMA:检验少量高质量示范能把多大比例的预训练能力“叫出来” → 当代 SFT:混合通用、推理、工具、代码、安全与多轮轨迹 ``` 这里的核心变化不是“下一个 Token 目标消失”,而是训练条件从普通文本前缀变成了 `system / instruction / context / response` 的交互接口。 ### 1.2 从比较轨迹到通用助手 RLHF ```text Christiano et al. 2017:人比较两段行为轨迹 → reward predictor 拟合 pairwise preference → Ziegler et al. 2019:把 RM + KL + PPO 接到语言模型 → Stiennon et al. 2020:摘要任务验证完整三段式管线 → InstructGPT 2022:SFT → RM → PPO-ptx 扩展到开放指令 → HH-RLHF / Llama 2:helpfulness、安全与多轮迭代被显式分账 ``` 真正的桥梁是“比较比绝对打分更容易”,并通过 Bradley–Terry 风格的选择模型把比较拟合成可优化标量。 ### 1.3 从显式奖励模型到直接偏好目标 ```text RM + PPO:先拟合 scalar reward,再对当前 policy 做在线优化 → RRHF / SLiC-HF:用排序或似然校准直接作用到回答概率 → DPO:在 BT + KL-regularized optimum 假设下,把 reward 改写成 policy/reference log-ratio → IPO:指出确定性偏好假设下的过拟合问题,改用回归式间隔 → KTO:允许 desirable / undesirable 非成对反馈 → ORPO:把 SFT 与 odds-ratio preference 合为单阶段 → SimPO:用长度归一平均 log-prob 和 margin 构造 reference-free reward ``` “无需 reward model”不等于“无需偏好信号”,也不等于“自动 on-policy”。 ### 1.4 从人类偏好到 AI、规则与环境反馈 ```text Human demonstrations / rankings → Constitutional AI:原则 → 自我批评/修订 → AI preference → RLAIF / UltraFeedback:用 LLM 扩大标签量与维度 → rule-based verifier:数学答案、编译器、测试用例 → generative reward model:按 rubric 生成评价过程与分数 → DeepSeek:SFT + GRPO + rule/model/GRM,多阶段合并 → Kimi K3:SFT → 3 domains × 3 efforts RL teachers → MOPD ``` 这不是“AI 反馈取代人类”的单向历史。现代系统常把人工定义的目标、AI 扩标、可执行规则和环境结果组合起来。 ## 2. 最小数学:四个不同对象 ### 2.1 SFT:模仿一个给定回答 对 prompt `x` 与示范回答 `y = (y₁,…,y_T)`: ```text L_SFT = - Σ_t m_t log πθ(y_t | x, y_ 在已经给定这个参考答案的条件下,模型是否提高了每个参考 Token 的概率? 它没有直接问“另一个回答是否更好”,也没有在自由 rollout 分布上训练纠错。 ### 2.2 偏好模型:比较两个完整回答 对同一 prompt 的 chosen `y_w` 与 rejected `y_l`,Bradley–Terry 形式为: ```text P(y_w ≻ y_l | x) = σ(rφ(x,y_w) - rφ(x,y_l)) ``` reward model loss: ```text L_RM = -log σ(rφ(x,y_w) - rφ(x,y_l)) ``` 只有 reward difference 可辨识:给同一 prompt 的全部奖励同时加一个常数,不改变偏好概率。 ### 2.3 KL-regularized policy optimization 典型目标的抽象形式: ```text max_π E[rφ(x,y)] - β KL(π(·|x) || π_ref(·|x)) ``` `π_ref` 不是装饰: - 把 policy 留在 reward model 见过的分布附近; - 保持语言质量与已有行为; - 让 reward 与偏离成本之间形成可调边界。 InstructGPT 还加入 pretraining mix: ```text reward - β log(π_RL / π_SFT) + γ log π_RL(x_pretrain) ``` 因此论文默认的 InstructGPT 是 PPO-ptx,不应把它简化成“纯 PPO”。 ### 2.4 DPO:用 policy/reference 比值参数化隐式奖励 在论文的假设下: ```text rθ(x,y) = β log [πθ(y|x) / π_ref(y|x)] ``` DPO loss: ```text L_DPO = -log σ( β[ log πθ(y_w|x) - log π_ref(y_w|x) - log πθ(y_l|x) + log π_ref(y_l|x) ]) ``` 它训练的是“相对 reference,chosen 比 rejected 获得更大的 log-ratio 提升”。 所以 DPO 仍依赖: - preference pair 的质量; - pair 来自哪个行为分布; - reference policy; - `β`; - sequence log-prob 的求和、mask 与长度口径。 ## 3. 十二张教学账 ### 3.1 行为目标账:先说清“对齐什么” 至少区分: | 目标 | 典型问题 | 不能替代的证据 | |---|---|---| | Instruction following | 是否遵守格式、约束和任务 | 仅看流畅度不够 | | Helpfulness | 是否解决用户真实问题 | RM 分数不是用户成功率 | | Harmlessness / safety | 是否拒绝或安全重定向 | “总是拒答”不是完整安全 | | Honesty / calibration | 是否承认不知道、避免编造 | 偏好者也可能奖励自信语气 | | Reasoning / coding | 是否得到可验证结果 | 长 CoT 或漂亮代码不等于通过 | | Agent execution | 是否在环境中完成长程任务 | 单轮 chat win-rate 不足 | | Style / personality | 是否符合表达规范 | 不应冒充能力增长 | “能力学习”与“行为塑形”不是二选一。SFT 可注入新任务知识,RL 也可能重排甚至扩展可访问策略; 但任何因果归因都需要控制 base、数据、预算和评测。 ### 3.2 监督单位账:标签落在哪里 | 信号 | 单位 | 优点 | 盲点 | |---|---|---|---| | Demonstration | 整段目标回答的 Token | 稠密、稳定 | 只有一种参考路径 | | Pairwise preference | 两个完整回答 | 比绝对分数容易 | 只给相对次序 | | Likert / scalar | 单回答 | 可表达强弱 | 标尺跨人漂移 | | Outcome reward | 轨迹末端 | 便宜、客观 | credit assignment 稀疏 | | Process reward | 中间步骤 | 更细粒度 | 标注贵,可能不忠实 | | Token teacher signal | 每个 Token | 稠密整合能力 | teacher 偏差逐 Token 传递 | | Environment reward | 状态变化/测试 | 接近任务结果 | verifier 可能有漏洞 | ### 3.3 数据来源账:谁定义“更好” 1. 专业标注者; 2. 目标用户或产品日志; 3. 众包标注者; 4. AI judge / teacher; 5. 宪法或书面 rubric; 6. ground truth / 单元测试 / 编译器; 7. 沙箱环境的真实结果; 8. 多来源混合。 来源决定偏差。把 “human preference” 聚合成单一标量,会隐藏群体分歧、标注者训练、文化背景和任务专长。 ### 3.4 SFT 账:稳定冷启动,不是万能答案 SFT 的三个主要作用: - 教交互协议、角色与输出格式; - 把 base model 的已有能力放到用户可调用的接口上; - 给 RL 提供足够可靠的 cold-start policy,避免 rollout 一开始全是无效样本。 主要代价: - teacher forcing 与自由生成分布不一致; - 参考答案不是唯一正确策略; - 每个回答 Token 都被模仿,难表达“这部分好、那部分差”; - 低质量、重复或模板化示范会被直接学习; - 过强模仿可能缩小探索空间。 LIMA 的 1,000 高质量样本是“强 base + 指定评测 + 风格/接口”的实证结果,不是“小数据对齐普遍定律”。 ### 3.5 偏好测量账:比较也不是客观真值 偏好数据必须记录: - candidate 由哪些 policy、temperature、长度上限生成; - 是两两比较、K-way ranking 还是独立评分; - 是否允许 tie / both bad; - rubric 是总体质量还是多维评分; - 是否随机交换展示位置; - 每个样本有几名标注者、分歧如何保留; - chosen 是否只是“两者较好”,而不是真正高质量。 训练集若只有“一个差回答和一个明显好回答”,RM 可能只学会表面线索; 部署时遇到两个都很强、差异很细的回答就会失准。 ### 3.6 奖励模型账:代理目标的力量和危险来自同一处 reward model 把开放式判断压成一个可微标量,policy 因而能在没有唯一参考答案时继续优化。 但 policy 会主动寻找 RM 的高分区域,而这些区域可能远离 RM 的训练分布。 重要检查: - in-distribution pair accuracy; - hard / OOD / adversarial pairs; - 长度、格式、拒答等 shortcut; - calibration 与多人分歧; - gold human evaluation 随 KL / optimization strength 的曲线; - reward ensemble 或 uncertainty。 RewardBench 是对 RM 本身的测试入口,不是最终 assistant 质量的充分证明。 ### 3.7 策略优化账:PPO 不是 RLHF 的同义词 PPO 的 clipped surrogate 限制单次 importance ratio: ```text min( ρ_t A_t, clip(ρ_t, 1-ε, 1+ε) A_t ) ``` LLM RLHF 的完整系统还常包含: - actor / policy; - reference policy; - reward model; - critic / value; - rollout engine; - GAE / return; - token mask、长度处理、KL controller; - 可选 pretraining gradient。 RLOO、GRPO 等方法可省去 learned critic,但不因此自动解决 reward misspecification。 ### 3.8 直接偏好账:算法名字先归到角色合同 | 方法 | 数据 | 显式 RM | Reference | 核心角色 | |---|---|---:|---:|---| | DPO | chosen/rejected pair | 否 | 是 | policy/reference log-ratio 分类 | | IPO | pair | 否 | 是 | 回归到有限偏好 margin | | KTO | desirable / undesirable 可非配对 | 否 | 通常是 | prospect-theoretic utility | | ORPO | pair + SFT | 否 | 否 | NLL + odds-ratio penalty | | SimPO | pair | 否 | 否 | 平均 log-prob reward + target margin | | RRHF | ranking / 多来源候选 | 否 | 否 | 序列得分排序 | | SLiC-HF | pair | 否 | 可选校准基线 | sequence likelihood calibration | 不能从“模型数更少”直接推出“效果更好”。2024 NeurIPS 的 DPO/PPO 解耦实验明确把 preference data、learning algorithm、reward model 和 policy prompts 分成四个变量,并发现数据质量影响最大。 ### 3.9 分布账:online/offline 与 on/off-policy 是两组词 - **offline preference optimization**:固定 pair 数据训练,不随着当前 policy 更新标签; - **online preference optimization**:当前 policy 生成新候选,再获取反馈; - **on-policy RL**:梯度主要使用当前 policy 的 rollout; - **off-policy / stale rollout**:行为 policy 与当前 policy 不同,需要 importance correction 或 clipping。 DPO 通常是 offline;PPO 通常需要近 on-policy rollout;K3 partial rollout 会让超长轨迹跨迭代变旧, 因此必须显式做 off-policy 稳定化。这些词描述不同轴。 ### 3.10 约束账:为什么不能只追 reward 常见防线: 1. reference KL; 2. PPO ratio clipping; 3. pretraining / SFT replay; 4. response length / verbosity budget; 5. language consistency; 6. safety constraint reward; 7. rule-based verifier 优先; 8. reward ensemble / uncertainty; 9. 在线补充 policy 当前分布上的偏好数据; 10. hidden evaluator 与提交预算。 约束会产生真实 trade-off。例如语言一致性奖励可能轻微降低某些任务表现,却改善目标语言可读性; 这不是“白送”的收益。 ### 3.11 失效账:高 reward 不等于高真实效用 #### Reward overoptimization Gao et al. 使用 proxy–gold synthetic setup 展示: ```text proxy reward 持续上升 gold reward 先上升、后饱和甚至下降 ``` 这是 Goodhart 风险的受控实证,不应外推成所有真实 RLHF 的统一数值曲线。 #### 长度与语气偏置 长回答更容易显得完整;礼貌、自信、分点也可能成为 shortcut。 需要 length-controlled evaluation,而不是看到 win-rate 上升就断言事实性更好。 #### 迎合 如果人更喜欢被认同,模型可能学会顺着错误前提。helpfulness、honesty 和 user approval 必须分开评测。 #### 过度拒答 只奖励“不产生危险文本”会推动模型拒绝无害请求。安全评测必须同时测 should-refuse 和 should-respond。 #### Alignment tax RL 或偏好优化可能让某些标准能力退化。DeepSeek-V2 报告明确观察到部分 benchmark 的 alignment tax, 并通过训练策略缓解;不能只报 chat judge。 ### 3.12 证据账:每个数字到底证明什么 | 证据 | 能证明 | 不能单独证明 | |---|---|---| | SFT loss | 模仿训练集 Token 的拟合 | 用户偏好、事实性 | | RM pair accuracy | 在该 pair 分布上的排序 | policy 优化后的 OOD 可靠性 | | training reward | 对当前 proxy 的优化 | 真实人类效用 | | KL | 与 reference 的分布距离 | 改变是好是坏 | | LLM judge win-rate | 该 judge/rubric 下的相对偏好 | 无偏人类共识 | | blind human eval | 特定人群/协议下偏好 | 普适价值 | | rule pass rate | verifier 定义的正确性 | 开放式质量与安全 | | downstream benchmark | 指定任务能力 | 完整助手行为 | ## 4. DeepSeek:从 SFT+DPO 到多源 GRPO / GRM ### 4.1 DeepSeek LLM 官方报告公开: - 超过 100 万 SFT instances; - 7B 使用 4 epochs,67B 使用 2 epochs; - helpfulness 与 harmlessness preference data; - DPO 训练 1 epoch; - 数学 SFT 过多会提高重复率; - 报告把 reasoning 改善谨慎归因:SFT 可能主要注入了题型与知识,不能直接证明学会一般推理。 这是一条典型的 `base → SFT chat → DPO` 管线。 ### 4.2 DeepSeek-V2 V2 把对齐管线改成: ```text base → SFT → reasoning alignment → human preference alignment ``` 第二阶段采用 helpful、safety 与 rule-based 多奖励;RL 使用 GRPO。 报告同时讨论: - SFT 数量与质量; - alignment tax; - online RL 与 offline preference alignment 的差异; - code preference 来自 compiler feedback,数学来自 ground-truth labels。 ### 4.3 DeepSeek-V3 V3 的 post-training 包括: - 从 expert model / DeepSeek-R1 蒸馏 reasoning data; - 两个 epochs 的 SFT; - rule-based RM 与 model-based RM; - GRPO; - generative reward model 的探索; - 尽可能优先使用规则验证以降低 reward hacking。 官方报告给出 pretraining、context extension、post-training 的计算分账;不能把整套 V3 能力归因于 GRPO。 ### 4.4 DeepSeek-R1 必须分开: - **R1-Zero**:从 base 直接做 rule-based reasoning RL,没有初始 SFT; - **R1**:cold-start data → reasoning RL → rejection sampling / SFT → broader RL; - **distilled models**:只做 SFT,不等于复现 R1 的 RL 训练。 报告附录展示 helpful RM reward hacking:reward 上升而测试表现下降;也展示语言一致性 reward 的能力 trade-off。 ### 4.5 DeepSeek-V3.2 / V4 V3.2 把 reasoning、agent 与 human alignment 合并进一个大规模 GRPO 阶段, 通用任务采用 generative reward model,agent/reasoning 尽量使用规则结果。 V4 的两阶段主线: ```text SFT:高质量、多领域、能力冷启动 → GRPO:domain-aligned behavior ``` 对 hard-to-verify tasks,V4 报告明确说不再使用传统 scalar RM,而采用 rubric-guided data 与 Generative Reward Model;easy-to-verify tasks 继续用规则或测试。 ## 5. Kimi:从长轨迹 RL 到 K3 多教师整合 ### 5.1 Kimi K2 / K2.5 K2 公开 post-training 覆盖: - general RL; - self-critique rubric reward; - verifiable reward; - PTX 与 budget control。 K2.5 继续扩展 unified agentic RL、视觉与并行 agent,Rollout Manager 支持大规模并发任务。 这些工作已经超出“聊天回答偏好”:reward 来自执行环境、规则与生成式 rubric 的组合。 ### 5.2 Kimi K3 的三阶段合同 K3 官方报告明确: ```text Stage 1 · SFT 建立高质量 cold-start agent policy Stage 2 · RL experts general / general-agent / coding × low / high / max reasoning effort = 9 个领域-强度专家 Stage 3 · MOPD student on-policy rollout + 对应 teacher 的逐 Token log-ratio reward → 把九个专家整合回一个统一模型 ``` MOPD 的逐 Token信号是: ```text r_opd(y_t) = clip(stopgrad(log π_teacher(y_t|prefix) / π_student(y_t|prefix)), -R_max, R_max) ``` 概念边界: - K3 的 partial rollout 是长轨迹跨迭代产生的 off-policy 稳定性问题; - MOPD 则在当前 student 自己访问的状态上计算 teacher signal; - 两者可以在同一系统中共存,但不是同一种算法; - agentic GRM 仍需 verbosity budget,报告明确把它作为防 reward hacking 的约束; - MXFP4 QAT 从 SFT 起覆盖整个 post-training,是部署约束,不是偏好目标。 ## 6. 正式一手论文链(44 个节点) | # | 年份 | 节点 | 本章角色 | 核验入口 | |---:|---:|---|---|---| | 01 | 2017 | Deep RL from Human Preferences | pairwise trajectory → reward | `1706.03741` Eq.1 / Fig.1 | | 02 | 2017 | PPO | clipped on-policy update | `1707.06347` Eq.7 | | 03 | 2019 | Fine-Tuning LMs from Human Preferences | LM reward + KL + PPO | `1909.08593` Eq.1–2 | | 04 | 2020 | Learning to Summarize from Human Feedback | 完整生成式 RLHF | `2009.01325` Fig.2 / Fig.5 | | 05 | 2021 | Natural Instructions | declarative task interface | `2104.08773` | | 06 | 2021 | FLAN | instruction-tuned zero-shot | `2109.01652` Fig.6 | | 07 | 2021 | T0 | prompted multitask mixture | `2110.08207` Fig.2 | | 08 | 2021 | WebGPT | browser action + preference | `2112.09332` | | 09 | 2022 | InstructGPT | SFT → RM → PPO-ptx | `2203.02155` Fig.2 / Eq.1–2 | | 10 | 2022 | HH-RLHF | helpful / harmless assistant | `2204.05862` | | 11 | 2022 | Super-NaturalInstructions | 1,600+ task generalization | `2204.07705` | | 12 | 2022 | Scaling Instruction-Finetuned LMs | Flan collection scaling | `2210.11416` | | 13 | 2022 | Reward Model Overoptimization | proxy / gold Goodhart curve | `2210.10760` | | 14 | 2022 | Constitutional AI | self-critique + RLAIF | `2212.08073` Fig.1 | | 15 | 2022 | Self-Instruct | synthetic instruction bootstrap | `2212.10560` Fig.2 | | 16 | 2023 | OpenAssistant Conversations | open conversation / ranking tree | `2304.07327` | | 17 | 2023 | RRHF | response ranking objective | `2304.05302` | | 18 | 2023 | SLiC-HF | sequence likelihood calibration | `2305.10425` | | 19 | 2023 | LIMA | 1K curated SFT | `2305.11206` | | 20 | 2023 | AlpacaFarm | feedback simulator / baselines | `2305.14387` | | 21 | 2023 | DPO | implicit reward / direct objective | `2305.18290` Eq.5–7 | | 22 | 2023 | RLAIF vs RLHF | human/AI label comparison | `2309.00267` | | 23 | 2023 | UltraFeedback | scaled multi-aspect AI feedback | `2310.01377` | | 24 | 2023 | IPO theory | finite-margin preference regression | `2310.12036` | | 25 | 2023 | Zephyr | dSFT + AI preference dDPO | `2310.16944` Fig.2 | | 26 | 2024 | KTO | unpaired binary feedback | `2402.01306` | | 27 | 2024 | RLOO | critic-free REINFORCE baseline | `2402.14740` | | 28 | 2024 | ORPO | SFT + odds-ratio single stage | `2403.07691` | | 29 | 2024 | RewardBench | reward model evaluation | `2403.13787` Fig.1 | | 30 | 2024 | SimPO | reference-free mean log-prob | `2405.14734` | | 31 | 2024 | Unpacking DPO and PPO | data/algorithm/RM/prompt 四变量 | NeurIPS 2024 | | 32 | 2024 | Tülu 3 | open SFT → DPO → RLVR recipe | `2411.15124` | | 33 | 2024 | DeepSeek LLM | 1M+ SFT + DPO | `2401.02954` §4 | | 34 | 2024 | DeepSeekMath | GRPO | `2402.03300` | | 35 | 2024 | DeepSeek-V2 | SFT + two-stage GRPO alignment | `2405.04434` §4 | | 36 | 2024 | DeepSeek-V3 | SFT / RM / GRPO / GRM | `2412.19437` §5 | | 37 | 2025 | DeepSeek-R1 | Zero / cold-start / RL / SFT 分层 | `2501.12948` | | 38 | 2025 | DAPO | long-CoT GRPO stabilization | `2503.14476` | | 39 | 2025 | Kimi K2 | verifiable + generative rewards | `2507.20534` | | 40 | 2025 | DeepSeek-V3.2 | merged reasoning/agent/alignment RL | `2512.02556` §3 | | 41 | 2026 | Kimi K2.5 | unified multimodal/agentic RL | `2602.02276` | | 42 | 2026 | DeepSeek-V4 | SFT + GRPO + GRM | `2606.19348` §5 | | 43 | 2026 | MOPD | multi-teacher on-policy distillation | `2606.30406` | | 44 | 2026 | Kimi K3 | 9 experts → MOPD / 1M agentic RL | `2607.24653` §4 | ## 7. 常见误解清单 1. **“SFT 改了 next-token 目标”**:通常仍是 next-token cross-entropy,只是条件与训练分布变了。 2. **“chosen 就是完美答案”**:pair 只保证 chosen 相对更受偏好,可能两者都差。 3. **“reward model 学到了人类价值”**:它拟合特定标签者、rubric、候选分布下的比较。 4. **“PPO 就是 RLHF”**:PPO 只是 policy optimizer;RLHF 还含反馈、RM、reference、rollout 和评测。 5. **“DPO 不需要 reward”**:它不训练显式 RM,但偏好 pair 与隐式 reward 假设仍在。 6. **“DPO 永远比 PPO 好”**:数据质量、online sampling、RM、prompt 分布和实现可改变结论。 7. **“RLAIF 没有人类参与”**:原则、rubric、teacher 训练与最终评测仍来自人类选择。 8. **“规则奖励不会被 hack”**:解析器、测试覆盖、沙箱和提交预算都可能有漏洞。 9. **“训练 reward 上升就是模型更好”**:必须看 gold/human/environment outcome 与 KL。 10. **“RLVR 与 RLHF 是两代技术”**:开放任务可用偏好,数学/代码可用 verifier,现代系统混合两者。 11. **“R1-Zero 就是 DeepSeek-R1”**:正式 R1 还有 cold start、SFT、多阶段 RL 与蒸馏。 12. **“K3 MOPD 是普通离线蒸馏”**:student 在自己的 rollout 状态上接收对应 teacher 的逐 Token 信号。 ## 8. 页面与交互验收合同 ### 8.1 正文 - 20–22 个正文区段; - 十二张账; - 至少 44 个正式一手节点; - DeepSeek LLM → V2 → V3 → R1 → V3.2 → V4 完整主线; - Kimi K2 → K2.5 → K3 完整主线; - 所有机制图为原创 HTML/CSS/SVG 示意,显式标注证据边界。 ### 8.2 四联实验室 1. **SFT 损失显微镜** 可切换 prompt masking、参考回答质量和长度;显示哪些 Token 产生梯度、NLL 与 teacher-forcing 边界。 2. **偏好与奖励模型实验** 调整两回答的 factuality/helpfulness/style/length、标注噪声与 reward weights; 显示 Bradley–Terry 概率、shortcut 与“chosen 不等于绝对好”。 3. **PPO / DPO 更新控制室** 调 reward gap、KL/β、policy/reference log-ratio、数据新鲜度; 分别展示显式 RM+rollout 与离线 pair 的更新合同,不伪造可比总分。 4. **现代 Post-training 配方比较器** InstructGPT / Constitutional AI / DPO / DeepSeek-V2 / DeepSeek-V4 / Kimi K3; 比较反馈源、模型组件、在线/离线、监督粒度、约束与主要失效模式。 ### 8.3 工程闸门 - 键盘 tabs 与 `aria-selected`; - 390px 移动端根页面零横向溢出; - 交互数字标为教学模拟; - 论文链接全部指向 canonical primary source; - Astro check / build / internal link checker / 真实 Chrome regression 全部通过。