feat: trace DeepSeek Chat completion depth
This commit is contained in:
+14
-3
@@ -14,7 +14,7 @@
|
||||
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
|
||||
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
|
||||
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
|
||||
| DeepSeek 专题 | 四轮实证进行中 | 98% | completion-aware 生成评测、完整 27 层与固定 batch-content 对照,再推进 SM90 FlashMLA、FP8/pipeline 与 R1-like RL 复现 |
|
||||
| DeepSeek 专题 | 五轮实证进行中 | 99% | 扩大 completion/task 样本与 sampling 复现,再推进 SM90 FlashMLA、FP8/pipeline、干预式 mediation 与 R1-like RL 复现 |
|
||||
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
|
||||
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
|
||||
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
|
||||
@@ -41,7 +41,7 @@
|
||||
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
|
||||
- [x] 完成可检索、可按专题筛选的论文库页面。
|
||||
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十八联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十五个原创交互视图。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十九联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十六个原创交互视图。
|
||||
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
|
||||
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
|
||||
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
|
||||
@@ -241,11 +241,17 @@
|
||||
- [x] 第十八个 DeepSeek 交互实验将逐来源双输出、十边分歧图、29 单元设备切分与证据阶梯放到同一页;compact 构建器同时校验固定 revision、官方工件 hash 与 32 / 32 长复现合同。
|
||||
- [x] DeepSeek Chat 行为层本地闸门通过:75 个 Astro 文件零诊断,21 个页面、1,151 个站内引用、12 个跨页锚点零失败;十四页签桌面与 390px 移动端无运行时异常或文档级横向溢出,十六套真实 Chrome 专题回归全部通过。
|
||||
- [x] DeepSeek Chat 行为层以源提交 `96443d4`、不可变镜像 `20260729T144827Z-96443d4` 发布;OCI digest `sha256:9468b546…db214`,复用 NAS `12010→8080`、NPM host 31 / cert 41、门户 `LLM ATLAS / projects / 180`,HTTPS、HTTP/2 与十六套生产 Chrome 回归全通过;保留 `20260729T134520Z-1d0a331` 回滚。
|
||||
- [x] DeepSeek Round 05 预注册统一 512-token 预算,不选择性续写 97 个截断格;29 GiB formal OOM 发生在写 JSON 前,透明修订为 28 GiB static placement、GPU layers 0–23 + layers 24–26/norm/head offload,并以 29→28 GiB smoke 的 32 / 32 完整 token exact 闸门确认放置不改输出。
|
||||
- [x] 512-token formal 对 128 / 128 prompt hashes 与前 128 generated-token prefixes 全部 exact;自然 EOS 从 31 / 128 增至 121 / 128,仍有 7 格截断。GSM8K strict-complete numeric exact 为 23 / 32;HumanEval 在 pinned、无网络、只读、无 host mount 的逐 candidate 容器中 24 / 32 通过官方 tests。
|
||||
- [x] 512-token 新进程复跑覆盖每域第 1 条的 32 格,完整 generated token IDs、decoded text、EOS 与 truncation state 均 32 / 32 exact;不冒充 128 / 128 全覆盖。
|
||||
- [x] 完成相同 Chat checkpoint 的 prompt-only 全深度 trace:embedding + 27 decoder layers + final norm 共 29 阶段,26 个 MoE gate;1,537 个精确 interior content tokens / condition 产生 1,918,176 次 target top-6 route decisions,56 个 boundary-crossing tokens 明确排除。
|
||||
- [x] 全深度新进程复跑的 4 / 4 source objects(去 runtime 后)、1,856 / 1,856 hidden tensor hashes、1,664 / 1,664 ordered-route hashes 与 1,664 / 1,664 route-weight hashes 全部 exact;复现核对抓到并修正 source-level content-token hash 的循环变量缺陷,正式与复跑文件随后全部重跑。
|
||||
- [x] 第十九个 DeepSeek 交互实验用四页签分开 128→512 completion、Math/Code evaluator、29-stage hidden divergence 与 26-gate route divergence;桌面、390px 移动端、键盘 tab、分域/分边/分指标交互与无横向溢出闸门通过。
|
||||
|
||||
## 正在进行
|
||||
|
||||
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
|
||||
- [ ] DeepSeek 四轮下一闸门:把 31 / 128 completion 提升为长度分层、可执行 evaluator 与更长生成预算;扩到完整 27 层并固定 batch content 审计,再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] DeepSeek 五轮下一闸门:扩大 GSM8K/HumanEval 与语言 source 样本,加入 sampling robustness 和干预式 mediation;再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
|
||||
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
|
||||
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
|
||||
@@ -404,6 +410,11 @@
|
||||
| 2026-07-29 | 生成实验把 completion 设为首要审计字段 | 31 / 128 自然 EOS 与 97 / 128 长度截断分开报告;截断输出不被当作完整答案参与越界判断 |
|
||||
| 2026-07-29 | CPU offload 是执行拓扑而非模型属性 | 31.4 GB BF16 工件不因本机 25-GPU-layer / 2-CPU-layer 切分而改变模型身份;设备映射、参数字节与峰值显存都进入复现合同 |
|
||||
| 2026-07-29 | DeepSeek Chat 行为层以 `20260729T144827Z-96443d4` 发布 | OCI digest `sha256:9468b546…db214`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
|
||||
| 2026-07-29 | 更长预算必须统一重跑全部条件 | 不只续写先前截断格;128→512 的 128 / 128 prompt 与 generated-prefix exact 进入正式结果闸门 |
|
||||
| 2026-07-29 | 停止、任务终点、可评测与正确分四张账 | 自然 EOS 不等于正确;fallback 不冒充 strict completion;HumanEval tests pass 不冒充代码安全 |
|
||||
| 2026-07-29 | 全深度目标范围排除 boundary-crossing tokens | 八格目标内容先验证 token IDs exact,再比较 1,537 个完全位于字符区间内部的 tokens;56 个相交 token 明确剔除 |
|
||||
| 2026-07-29 | hidden/router association 不升级为 mediation | 29-stage 表示曲线与 26-gate route 曲线描述传播路径;没有干预式中介实验前不解释能力因果 |
|
||||
| 2026-07-29 | 复跑逐字段覆盖身份元数据 | source-level hash 的循环变量缺陷虽不影响激活/路由结论,仍修复并重跑正式与复现文件;不只比较 headline 数字 |
|
||||
| 2026-07-29 | K3 二轮按 32 张对象账与完整报告顺序重建 | total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要 |
|
||||
| 2026-07-29 | K3 原生视觉事实回到 §2.4 / §3.3 核验 | 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP |
|
||||
| 2026-07-29 | K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 | 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签 |
|
||||
|
||||
Reference in New Issue
Block a user