feat: publish alignment deep dive
This commit is contained in:
@@ -84,6 +84,11 @@ Adam/AdamW、Adafactor、μP、Muon;FP16/BF16/FP8/MXFP4、量化感知训练
|
||||
|
||||
Instruction Tuning、SFT、RLHF/PPO、RLAIF、Constitutional AI、DPO 及其后续。解释 base model 如何变成可协作助手。
|
||||
|
||||
首版已发布:以目标、监督单位、数据来源、SFT、偏好测量、奖励模型、策略更新、直接偏好、
|
||||
分布、约束、失效与证据十二张账,串起 2017–2026 的 44 个一手节点。正文明确区分
|
||||
SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM→V2→V3→R1→V3.2→V4
|
||||
与 Kimi K2→K2.5→K3,并提供 SFT 显微镜、偏好/RM、PPO/DPO 更新和配方比较四个独立实验。
|
||||
|
||||
### 11. 推理模型与测试时扩展
|
||||
|
||||
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。
|
||||
|
||||
Reference in New Issue
Block a user