feat: trace DeepSeek Chat completion depth
This commit is contained in:
+5
-3
@@ -100,10 +100,12 @@ SFT / RM / PPO / DPO / RLAIF / RLVR 的角色合同,重点追踪 DeepSeek LLM
|
||||
|
||||
CoT、自洽性、搜索、验证器、过程奖励、GRPO、DeepSeekMath、DeepSeek-R1/R1-Zero、Kimi k1.5、multi-effort RL 与 on-policy distillation。
|
||||
|
||||
DeepSeek 聚光二轮已完成:以 24 张问题账和 10 次问题转向,串起 DeepSeek LLM、DeepSeekMoE、
|
||||
DeepSeek 聚光五轮持续推进:以 24 张问题账和 10 次问题转向,串起 DeepSeek LLM、DeepSeekMoE、
|
||||
DeepSeekMath、V2、V3、R1-Zero/R1、V3.2 与 V4;DAPO / Dr.GRPO 明确作为公开后续反查,
|
||||
Coder/Prover/VL/OCR/系统实现/Engram 作为旁支。配套稀疏容量、MLA 缓存、V3 协同与 RL 偏差四个实验,
|
||||
并以 60 个一手论文或官方仓库节点连接 Kimi K2/K3。
|
||||
并以 60 个一手论文或官方仓库节点连接 Kimi K2/K3;真实权重线已从 Base 前七层、吸收缓存和
|
||||
11,289,744 次公开语料路由,推进到完整 Chat 生成、统一 512-token completion evaluator、
|
||||
29-stage hidden-state 与 26-gate router trace。
|
||||
|
||||
### 12. 工具使用与长程 Agent
|
||||
|
||||
@@ -156,7 +158,7 @@ pass^k、校准、动态基准、代码 Verifier、LLM Judge、Arena、Agent 最
|
||||
1. **Kimi K3 解剖**:二轮已完成 32 张问题账、Figure 1–16 / Table 1–5 审计、
|
||||
8 个报告实验与 100 节点阅读链;三轮首个里程碑进一步固定官方 revisions,审计 96 个 checkpoint shards、
|
||||
497,220 个 tensor entries、真实 KDA / MLA / MoE / MoonViT shapes,并用 4 个工件视图公开复现边界。
|
||||
2. **DeepSeek 技术谱系**:DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文;四轮已经从 24 张问题账、60 个一手/官方节点和 4 个公式实验,推进到 13 个 Base 工件实验与 1 个完整 Chat 行为实验。最新生成层固定 31.4 GB 官方 V2-Lite-Chat BF16 权重,以 16 个来源 × 8 条件得到 128 个输出,并把自然 EOS、长度截断、成对分歧和 32 / 32 独立复现分账。
|
||||
2. **DeepSeek 技术谱系**:DeepSeek LLM → DeepSeekMoE → V2/MLA → V3/FP8/MTP/DualPipe → Math/GRPO → R1 → V3.2/DSA → V4 长上下文;五轮已经从 24 张问题账、60 个一手/官方节点和 4 个公式实验,推进到 13 个 Base 工件实验、完整 Chat 行为与 completion/full-depth 实验。最新一轮让 16 个来源 × 8 条件统一使用 512-token 预算,分开报告 121 / 128 自然 EOS、Math/Code evaluator 与 32 / 32 长序列复现;同一 checkpoint 的 29-stage hidden / 26-gate route trace 覆盖 1,918,176 次目标路由决定,并以 5,184 个新进程哈希 exact 收口。
|
||||
3. **“一个 Token 的旅行”**:从文本分词,经注意力、MoE、GPU 集群、后训练,再到线上推理与工具调用。
|
||||
|
||||
## 完成标准
|
||||
|
||||
Reference in New Issue
Block a user