feat: isolate DeepSeek history boundary token
This commit is contained in:
+12
-3
@@ -14,7 +14,7 @@
|
||||
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
|
||||
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
|
||||
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
|
||||
| DeepSeek 专题 | 三轮实证进行中 | 95% | SM90 FlashMLA kernel、完整 27 层、EOS / 角色 / 多 filler / 内容正交控制、FP8/pipeline 与 R1-like RL 复现 |
|
||||
| DeepSeek 专题 | 三轮实证进行中 | 96% | 角色标记与 special-token family、V2-Lite-Chat 行为、完整 27 层与固定 batch-shape 对照,再推进 SM90 FlashMLA、FP8/pipeline 与 R1-like RL 复现 |
|
||||
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
|
||||
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
|
||||
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
|
||||
@@ -41,7 +41,7 @@
|
||||
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
|
||||
- [x] 完成可检索、可按专题筛选的论文库页面。
|
||||
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十三联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十个原创交互视图。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十四联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十一个原创交互视图。
|
||||
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
|
||||
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
|
||||
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
|
||||
@@ -210,11 +210,17 @@
|
||||
- [x] 六格正式运行与独立复跑 SHA-256 均为 `423a095d…e648e`,约 41 MiB JSON byte-exact;网站第九个真实工件页签联动 layer、scope、aggregation 与两个 TV 台阶 depth map。
|
||||
- [x] 等长历史控制本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,9 页签桌面端与 390px 移动端均无文档级横向溢出。
|
||||
- [x] DeepSeek 等长历史控制里程碑以源提交 `8130e37`、不可变镜像 `20260729T110301Z-8130e37` 发布;OCI digest `sha256:e4b79166…5c0846`,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T100729Z-efe3ffc` 回滚。
|
||||
- [x] 历史边界单 token 控制固定官方 V2-Lite template:在 system 0/1 × EOS/x/句点/换行八格中保留重复词元历史、`Assistant:` / `User:`、长度、目标绝对位置、attention mask 与同一 32-row batch,只将 assistant EOS `100001` 替换为一个普通 token ID。
|
||||
- [x] RTX 5090 执行 1,024 个输入变体、56,784 个输入 token,新增 2,044,224 次真实 top-6 路由,使公开语料累计达到 5,157,072 次;八格各有相同的 2,874 个精确对齐目标 token,768 / 768 个反事实序列恰好只改一个 input ID。
|
||||
- [x] 目标内容的 system-edge TV 均值为 EOS `.0374`、x `.0539`、句点 `.0553`、换行 `.0492`;x / 句点在 24 / 24 格点估计高于 EOS、23 / 24 配对区间完全高于零,换行为 23 / 24 与 16 / 24。结论只命名为“EOS token identity 在固定协议中的路由效应”,不升级为回合理解、能力或 Chat 模型行为。
|
||||
- [x] 直接 EOS↔control 的 S1−S0 interaction 与 ΔCV 均跨层跨域混合;完整输入差异也远弱于目标内容主结果。网站明确保留 `User:` role marker、base ≠ Chat/SFT、反事实非官方合法 chat、没有生成/准确率指标等边界。
|
||||
- [x] 八格正式运行与独立复跑各 54,254,445 bytes,SHA-256 均为 `9bb93834…b9c37` 且 byte-exact;确定性 compact 生成器把前端载荷降至约 1.2 MiB,同时在产物内钉住两份完整来源 hash。
|
||||
- [x] 历史边界控制本地闸门通过:70 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败;十页签桌面与 390px 移动端浏览器回归通过,无运行时异常或文档级横向溢出。
|
||||
|
||||
## 正在进行
|
||||
|
||||
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
|
||||
- [ ] DeepSeek 三轮下一闸门:在官方支持的 SM90 环境执行 FlashMLA 优化 kernel;扩到完整 27 层并继续拆分 EOS、角色、多 filler、示例内容与 batch shape,再推进 FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] DeepSeek 三轮下一闸门:拆分 `User:` / `Assistant:` 角色标记与 special-token family,加入 V2-Lite-Chat 生成/行为对照;扩到完整 27 层并固定 batch shape 审计,再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
|
||||
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
|
||||
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
|
||||
@@ -357,6 +363,9 @@
|
||||
| 2026-07-29 | 等长历史的两个 TV 台阶分开报告 | none→filler 回答“历史结构是否足以复现缓冲”;filler→demo 回答固定协议字段后的文本替换;两者都不升级为能力或示例正确性 |
|
||||
| 2026-07-29 | batch contract 是 BF16 路由复现的一部分 | 跨实验 512/512 token-ID 合同 exact,但矩阵形状改变会让深层临界 gate hash 分化;正式结论只使用同一次六格 batch 内对比 |
|
||||
| 2026-07-29 | DeepSeek 等长历史控制以 `20260729T110301Z-8130e37` 发布 | OCI digest `sha256:e4b79166…5c0846`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
|
||||
| 2026-07-29 | 历史 assistant 边界使用单 token ID 替换,不删除 token | EOS→x/句点/换行逐条保持长度、目标位置、角色标记、mask 与 batch;识别的是一个输入 ID 的干预,不是假装移除了全部回合边界 |
|
||||
| 2026-07-29 | 边界控制主结论只使用精确对齐目标内容 TV | x/句点/换行相对 EOS 的 system edge 更大,但 direct interaction、CV 与完整输入方向更混合;不命名为路由更优、回合理解或能力变化 |
|
||||
| 2026-07-29 | base checkpoint 与 Chat 行为永久分证据层 | 当前 V2-Lite base 虽使用官方 tokenizer/template 构造协议,却没有 Chat/SFT 行为身份;后续必须另跑 Chat checkpoint 与生成/任务指标 |
|
||||
| 2026-07-29 | K3 二轮按 32 张对象账与完整报告顺序重建 | total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要 |
|
||||
| 2026-07-29 | K3 原生视觉事实回到 §2.4 / §3.3 核验 | 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP |
|
||||
| 2026-07-29 | K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 | 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签 |
|
||||
|
||||
Reference in New Issue
Block a user