feat: audit DeepSeek Chat across sources
This commit is contained in:
+14
-3
@@ -14,7 +14,7 @@
|
||||
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
|
||||
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
|
||||
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
|
||||
| DeepSeek 专题 | 六轮实证进行中 | 99% | 扩大 sampling 的 source/task 覆盖,再推进干预式 mediation、SM90 FlashMLA、FP8/pipeline 与 R1-like RL 复现 |
|
||||
| DeepSeek 专题 | 七轮实证进行中 | 99% | 扩大到可做 task-level bootstrap,加入 per-row RNG,再推进干预式 mediation、SM90 FlashMLA、FP8/pipeline 与 R1-like RL |
|
||||
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
|
||||
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
|
||||
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
|
||||
@@ -41,7 +41,7 @@
|
||||
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
|
||||
- [x] 完成可检索、可按专题筛选的论文库页面。
|
||||
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 二十联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十七个原创交互视图。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 二十一联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十八个原创交互视图。
|
||||
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
|
||||
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
|
||||
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
|
||||
@@ -256,11 +256,18 @@
|
||||
- [x] 第二十个 DeepSeek 交互实验以四页签讲解八 seed 轨迹显微镜、Math/Code 失败账、aligned/nearest 样本集合比较与随机性×复现合同;完整协议、结果审计、运行脚本与 compact 数据均已记录在项目本地。
|
||||
- [x] Round 06 本地闸门通过:80 个受检文件零诊断,21 个页面、1,151 个站内引用、12 个跨页锚点零失败;DeepSeek 历史全量与 sampling 专项真实 Chrome 回归均通过,桌面/390px 移动端无文档级溢出、无 offender、无运行时异常。
|
||||
- [x] DeepSeek Round 06 以源提交 `580f696`、不可变镜像 `20260729T180228Z-580f696` 发布;OCI digest `sha256:aabc13a4…fa3ed`,复用 NAS `12010→8080`、NPM host 31 / cert 41 与门户 order 180。NAS / VPS / HTTPS / gzip / immutable assets、sampling 专项和 DeepSeek 全量生产 Chrome 回归均通过,保留 `20260729T162625Z-8bb488f` 回滚。
|
||||
- [x] DeepSeek Round 07 在正式输出前冻结跨来源 sampling 协议:16 条 source 来自既有 SHA-256 selection rank,每域 4 条;4 个新 SHA-256 seed、`system off/on × EOS/句点` 四行 batch 与 `.3/.95/top-k 0` 固定。source 是主要覆盖单位,seed 是题内重复;句点是受 Round 06 启发的定向复查,不冒充盲确认。
|
||||
- [x] 16-token smoke 的 64 / 64 prompt hashes 与 Round 05 exact,R0 同进程 replay 64 / 64 全合同 exact,R0/R1 34 / 64 格分叉且无 OOM/NaN/exception;正式 256 条输出为 250 natural EOS、6 条截断、247 个完整 token trajectory hashes,R0/R1 63 / 64 同格分叉。
|
||||
- [x] 跨题 evaluator 分离 stopping、task terminal、coverage 与 correctness:Math 47 / 64、Code 52 / 64;Math 四题为 `14/16 · 16/16 · 8/16 · 9/16`,Code 四题为 `16/16 · 8/16 · 12/16 · 16/16`。修复跨不同 GSM8K gold 聚合 final-answer frequency 的统计身份错误,单题前序总账不变。
|
||||
- [x] source-blocked 分析逐 source 计算 contrast,不报告 p-value 或 population CI。句点在 11 / 16 条 source 上缩短平均长度;English `/0443` 为 −121,但另三条为 +44.5 / +41 / +1.375,导致 domain mean −8.5 与 3 / 4 source 的正方向相反。Code task interaction 的 +1 / −1 也在 domain mean 0 中完全抵消。
|
||||
- [x] 全新进程重跑 16 sources × R0 × 4 conditions;run seed、prompt hash、完整 token IDs、decoded text、EOS、truncation 与 CPU/CUDA RNG pre-state 八项均 64 / 64 exact。formal/eval/rerun/compare/analysis SHA-256 为 `f013132…d7f7c` / `e88b274…b8975` / `143dc9d…02a6` / `ec4a478…a556` / `d0dece3…bc84`。
|
||||
- [x] 第二十一个 DeepSeek 交互实验以四页签讲解 source→seed 层级、Math/Code 4×4 task matrix、source-level 方向与均值反例、64 格八字段复现及五段 hash chain;协议、完整审计、探针、独立 evaluator、analysis 与 compact builder 全部落盘。
|
||||
- [x] Round 07 本地闸门通过:83 个 Astro 文件零诊断,21 个页面、1,151 个站内引用、12 个跨页锚点零失败;Python 探针/评测/分析编译通过,compact builder 重建 SHA-256 不变。跨来源专项与 DeepSeek 全量真实 Chrome 回归通过,4×4 矩阵、English 反例、键盘页签、桌面/390px 移动端无溢出及零运行时异常均有自动断言。
|
||||
|
||||
## 正在进行
|
||||
|
||||
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
|
||||
- [ ] DeepSeek 六轮下一闸门:扩大 GSM8K/HumanEval 与语言 source 的 sampling 覆盖,加入干预式 mediation;再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] DeepSeek 七轮下一闸门:扩大到可做 task-level bootstrap 的预注册 source 抽样框,加入 per-row RNG/common-random-number 对照与 failure taxonomy;再推进干预式 mediation、SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
|
||||
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
|
||||
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
|
||||
@@ -438,6 +445,10 @@
|
||||
| 2026-07-30 | sampled completion 与任务失败分账 | 256 条中 251 natural EOS、242 unique token trajectories;Math 62/64、Code 63/64,具体错误回到推理与官方 tests |
|
||||
| 2026-07-30 | sampling 的随机性与复现同时过闸 | R0/R1 31/32 同格分叉;新进程复跑 64 格的 seed、prompt、token、text、stop 与 CPU/CUDA RNG pre-state 八项全部 exact |
|
||||
| 2026-07-30 | DeepSeek sampling robustness 里程碑以 `20260729T180228Z-580f696` 发布 | OCI digest `sha256:aabc13a4…fa3ed`;复用 NAS `12010→8080`、NPM 31 / cert 41、门户 order 180;sampling 专项与 DeepSeek 全量生产 Chrome 回归通过,保留 `20260729T162625Z-8bb488f` 回滚 |
|
||||
| 2026-07-30 | Round 07 把 source 冻结为主要覆盖单位 | 16 sources × 4 seeds × 4 conditions;seed 是题内重复,四题方向不升级为 benchmark、p-value 或总体置信区间 |
|
||||
| 2026-07-30 | 跨题矩阵替代单题 micro total | Math 四题 14/16、16/16、8/16、9/16;Code 四题 16/16、8/16、12/16、16/16;跨不同 gold 不再聚合 final-answer frequency |
|
||||
| 2026-07-30 | 域均值必须与 source 方向同时展示 | English 句点 contrast 的均值 −8.5,但 3/4 source 为正;Code task interaction 的 +1 与 −1 在域均值 0 中抵消 |
|
||||
| 2026-07-30 | Round 07 随机分叉与复现同时过闸 | R0/R1 63/64 同格 trajectory 分叉;新进程 R0 的八项预注册字段 64/64 exact,五段 artifact hash chain 闭合 |
|
||||
|
||||
## 未决问题
|
||||
|
||||
|
||||
Reference in New Issue
Block a user