feat: deepen DeepSeek technical lineage

This commit is contained in:
wuyang
2026-07-29 11:17:53 +08:00
parent 5c8a2e44bd
commit cd96dab22d
27 changed files with 2905 additions and 102 deletions
+5
View File
@@ -100,6 +100,11 @@ SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。
DeepSeek 聚光二轮已完成:以 24 张问题账和 10 次问题转向,串起 DeepSeek LLM、DeepSeekMoE、
DeepSeekMath、V2、V3、R1-Zero/R1、V3.2 与 V4;DAPO / Dr.GRPO 明确作为公开后续反查,
Coder/Prover/VL/OCR/系统实现/Engram 作为旁支。配套稀疏容量、MLA 缓存、V3 协同与 RL 偏差四个实验,
并以 60 个一手论文或官方仓库节点连接 Kimi K2/K3。
### 12. 工具使用与长程 Agent
WebGPT、Toolformer、ReAct、Reflexion、代码 Agent、Computer Use、环境奖励、可验证任务、沙箱、百万 Token 轨迹与 K3 Agentic RL。