feat: add paired DeepSeek routing length control
This commit is contained in:
+10
-2
@@ -14,7 +14,7 @@
|
||||
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
|
||||
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
|
||||
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
|
||||
| DeepSeek 专题 | 三轮实证进行中 | 91% | SM90 FlashMLA kernel、完整 27 层、长度匹配对照、FP8/pipeline 与 R1-like RL 复现 |
|
||||
| DeepSeek 专题 | 三轮实证进行中 | 92% | SM90 FlashMLA kernel、完整 27 层、tokenization 扰动、FP8/pipeline 与 R1-like RL 复现 |
|
||||
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
|
||||
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
|
||||
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
|
||||
@@ -184,11 +184,16 @@
|
||||
- [x] 统计单位从 token 修正为 prompt:域内有放回重采样 2,000 次,固定 seed `20260729`,同时报告 token-weighted / prompt-balanced 的 CV、Gini、effective experts、top share、64 专家份额与两两 JSD 95% percentile 区间。
|
||||
- [x] 多域路由正式运行与独立重跑 byte-exact:两份 1.6 MiB JSON SHA-256 均为 `4678a1d1…a09e4`;六联交互实验可切换层与聚合口径,并永久注明不是训练分布、线上流量、专家语义或显著性检验。
|
||||
- [x] DeepSeek 多域路由版本以源提交 `5bcfd58`、不可变镜像 `20260729T073342Z-5bcfd58` 发布;OCI digest `sha256:dd8bcbce…33abd4`,NAS / VPS / NPM / DNS / TLS / gzip / 门户与十六套生产 Chrome 回归全通过;保留 `20260729T065822Z-9ba26da` 回滚。
|
||||
- [x] 长度敏感性实验固定同一批 128 条源 prompt:四域均要求至少 24 tokens,再用同一固定 salt 选出 32 条;16-token 输入严格是 24-token 输入前缀,避免换样本后把内容差异误记成长度效应。
|
||||
- [x] RTX 5090 新增 16 / 24-token 两个等长 cohort:共 5,120 个有效 token、184,320 次真实 top-6 路由;两档独立重跑分别以完整 JSON SHA-256 `f8d437d5…aebd` / `bed54835…436` byte-exact。
|
||||
- [x] 成对 prompt bootstrap 闭环:2,000 次重采样共用同一组 prompt indices;16→24 tokens 后 24 个 layer×domain 中 22 个 CV 点估计下降、20 个区间完全低于零,最大变化为 Layer 2 Python 代码 `0.969→0.718`、prompt-balanced Δ `-0.251 [-0.283,-0.215]`。
|
||||
- [x] 中文↔代码 JSD 在六层均下降但没有消失;Layer 2 `0.091→0.065`、Δ `-0.026 [-0.036,-0.018]`。结论限定为固定前缀长度敏感性,不推出因果内容效应、专家语义或训练/线上总体。
|
||||
- [x] 自然长度与等长 16 / 24 三 cohort 合计 13,580 个有效 token、488,880 次真实路由;机器可读比较结果第二次生成 SHA-256 均为 `00bdc7fe…61a1`,网站加入 cohort、层、聚合口径与 paired delta 联动。
|
||||
|
||||
## 正在进行
|
||||
|
||||
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
|
||||
- [ ] DeepSeek 三轮下一闸门:在官方支持的 SM90 环境执行 FlashMLA 优化 kernel;扩到完整 27 层并做长度/tokenization 匹配对照,再推进 FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] DeepSeek 三轮下一闸门:在官方支持的 SM90 环境执行 FlashMLA 优化 kernel;扩到完整 27 层并补 tokenizer / prompt-template 扰动对照,再推进 FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
|
||||
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
|
||||
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
|
||||
@@ -315,6 +320,9 @@
|
||||
| 2026-07-29 | 路由区间以 prompt 而非 token 为抽样单位 | 同 prompt token 有共同前缀与主题,不能伪装成独立样本;域内 2,000 次 bootstrap,同时保留 token 加权与 prompt 等权 |
|
||||
| 2026-07-29 | 路由分布差异与 expert semantics 永久分开 | Layer 4 中文、Layer 5/6 数学的集中度与域间 JSD 只描述 128-prompt 探针;不命名 expert,不冒充训练/线上总体或显著性检验 |
|
||||
| 2026-07-29 | DeepSeek 多域路由版本以 `20260729T073342Z-5bcfd58` 发布 | OCI digest `sha256:dd8bcbce…33abd4`;复用 `12010→8080`、NPM 31 / cert 41、门户 order 180;HTML gzip 与十六套生产 Chrome 回归通过,保留 `20260729T065822Z-9ba26da` 回滚 |
|
||||
| 2026-07-29 | 取消 32-token 长度对照,改用同源 prompt 的 16→24-token 成对设计 | TNEWS 仅 105/10,000 样本达到 32 tokens,强行统一 32 会选中约 1% 极端长尾;24-token eligibility 仍有 1,609 条中文候选 |
|
||||
| 2026-07-29 | 长度效应必须用 paired prompt bootstrap | 16-token 输入是 24-token 输入前缀,2,000 次重采样共用 prompt indices;区间描述固定 cohort 的敏感性,不升级为内容因果或总体显著性 |
|
||||
| 2026-07-29 | 自然长度、matched-16 与 matched-24 永久分开呈现 | 自然 cohort 回答“本批原始样本如何路由”;matched cohort 回答“同一前缀多看 8 tokens 后如何变化”,不能互相替代 |
|
||||
| 2026-07-29 | K3 二轮按 32 张对象账与完整报告顺序重建 | total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要 |
|
||||
| 2026-07-29 | K3 原生视觉事实回到 §2.4 / §3.3 核验 | 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP |
|
||||
| 2026-07-29 | K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 | 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签 |
|
||||
|
||||
Reference in New Issue
Block a user