feat: add DeepSeek message-history factorial probe

This commit is contained in:
wuyang
2026-07-29 18:05:59 +08:00
parent 28f8066626
commit efe3ffcb4e
11 changed files with 1890088 additions and 33 deletions
+12 -3
View File
@@ -14,7 +14,7 @@
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
| DeepSeek 专题 | 三轮实证进行中 | 93% | SM90 FlashMLA kernel、完整 27 层、词元边界 / system / few-shot 正交扰动、FP8/pipeline 与 R1-like RL 复现 |
| DeepSeek 专题 | 三轮实证进行中 | 94% | SM90 FlashMLA kernel、完整 27 层、词元边界 / 距离 / EOS / 角色正交控制、FP8/pipeline 与 R1-like RL 复现 |
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
@@ -41,7 +41,7 @@
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
- [x] 完成可检索、可按专题筛选的论文库页面。
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十一联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等七十八个原创交互视图。
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十二联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等七十九个原创交互视图。
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
@@ -196,11 +196,17 @@
- [x] RAW→USER 的模板敏感性不写成单向规律:L1 英文/中文与 L2 中文/代码更平,L3 中文、L5 中文/代码与 L6 四域更集中;网站第七个真实工件页签联动 layer、scope、aggregation,并展示 paired 95% 区间与逐 token top-6 稳定性。
- [x] 模板扰动里程碑本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,桌面与 390px 移动端无文档级横向溢出。
- [x] DeepSeek 官方模板敏感性版本以源提交 `b0acc8b`、不可变镜像 `20260729T092426Z-b0acc8b` 发布;OCI digest `sha256:f1bf2d09…e1463`,NAS / VPS / NPM / DNS / TLS / HTTP2 / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T081849Z-9ca0850` 回滚。
- [x] 消息历史实验复用上一轮完全相同的 128-source / 23-content-token cohort,把 system 与 one-shot 构成 2×2:system 在两个 one-shot 水平都固定每条 +16 tokens,one-shot 在两个 system 水平都固定每条 +17 tokens,四格同一 padded batch。
- [x] RTX 5090 执行 512 个消息历史变体、24,040 个输入 token,新增 865,440 次真实 top-6 路由,使公开语料累计达到 1,736,352 次;四格各有相同的 2,874 个精确对齐目标 token。
- [x] 2×2 source-paired bootstrap 同报 system main、few-shot main 与 difference-in-differences interaction;CV 区间完全正 / 负 / 跨零分别为 system `8/13/3`、few-shot `7/7/10`、interaction `8/8/8`,不压成单向规律。
- [x] 固定消息中的历史缓冲模式闭环:system-at-F1 相对 system-at-F0 的目标 TV 在 24 / 24 个 layer×domain 全部下降,均值 `.073→.019`;绝对 CV 变化 21 / 24 下降,逐 token top-6 set exact 在六层均明显提高。
- [x] 消息历史正式运行与独立复跑 SHA-256 均为 `5765fbf8…c1fb`,约 28 MiB JSON byte-exact;网站第八个真实工件页签联动 layer、scope、aggregation 与 system/few-shot/interaction depth map。
- [x] 消息历史里程碑本地闸门通过:69 个 Astro 文件零诊断、21 个页面、1,151 个站内引用、12 个跨页锚点零失败,十六套真实 Chrome 回归全部通过,桌面与 390px 移动端无文档级横向溢出。
## 正在进行
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
- [ ] DeepSeek 三轮下一闸门:在官方支持的 SM90 环境执行 FlashMLA 优化 kernel;扩到完整 27 层并补词元边界 / system / few-shot 正交扰动,再推进 FP8 / pipeline traces 与 R1-like RL 小模型复现。
- [ ] DeepSeek 三轮下一闸门:在官方支持的 SM90 环境执行 FlashMLA 优化 kernel;扩到完整 27 层并继续拆分词元边界、历史距离、EOS、角色与示例内容,再推进 FP8 / pipeline traces 与 R1-like RL 小模型复现。
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
@@ -335,6 +341,9 @@
| 2026-07-29 | `Assistant:` 追加条件承担 causal-mask 负对照 | 21,852 个共享前缀 ordered top-6 全部 exact;证明未来 suffix 不改写过去,但不推出 suffix 自身没有路由作用 |
| 2026-07-29 | 模板效应永久分 scope、layer 与 domain 报告 | 对齐内容回答上下文条件化,完整输入回答真实协议流量;RAW→USER 的 CV 方向跨层翻转,不压成“角色模板更均衡/更集中” |
| 2026-07-29 | DeepSeek 官方模板敏感性里程碑以 `20260729T092426Z-b0acc8b` 发布 | OCI digest `sha256:f1bf2d09…e1463`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
| 2026-07-29 | system × one-shot 使用固定 16 / 17-token 正交增量 | 四格同 cohort、同 target、同 batch;主效应与交互共用 source-prompt bootstrap indices,避免把两条独立两组实验误拼成因子结论 |
| 2026-07-29 | one-shot 后的 system-edge TV 下降只命名为历史缓冲模式 | 24 / 24 格下降与逐 token set/Jaccard 同向;示例语义、距离、EOS、角色转换和固定文本尚未拆开,因此不写成 few-shot 因果语义 |
| 2026-07-29 | 因子分布 effect 使用 half-L1 magnitude 而非普通 TV | 主效应和 interaction 是带符号 expert-share 向量;只有四条实际条件边继续使用标准 TV / JSD |
| 2026-07-29 | K3 二轮按 32 张对象账与完整报告顺序重建 | total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要 |
| 2026-07-29 | K3 原生视觉事实回到 §2.4 / §3.3 核验 | 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP |
| 2026-07-29 | K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 | 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签 |