feat: publish alignment deep dive

This commit is contained in:
wuyang
2026-07-29 06:07:42 +08:00
parent a030de41fa
commit 8378e2a741
22 changed files with 3463 additions and 35 deletions
+5
View File
@@ -84,6 +84,11 @@ Adam/AdamW、Adafactor、μP、MuonFP16/BF16/FP8/MXFP4、量化感知训练
Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。
首版已发布:以目标、监督单位、数据来源、SFT、偏好测量、奖励模型、策略更新、直接偏好、
分布、约束、失效与证据十二张账,串起 2017–2026 的 44 个一手节点。正文明确区分
SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM→V2→V3→R1→V3.2→V4
与 Kimi K2→K2.5→K3,并提供 SFT 显微镜、偏好/RM、PPO/DPO 更新和配方比较四个独立实验。
### 11. 推理模型与测试时扩展
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。