feat: map DeepSeek Chat sampling robustness
This commit is contained in:
+14
-4
@@ -1,6 +1,6 @@
|
||||
# 持续进度
|
||||
|
||||
最后更新:2026-07-29
|
||||
最后更新:2026-07-30
|
||||
|
||||
## 总体状态
|
||||
|
||||
@@ -14,7 +14,7 @@
|
||||
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
|
||||
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
|
||||
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
|
||||
| DeepSeek 专题 | 五轮实证进行中 | 99% | 扩大 completion/task 样本与 sampling 复现,再推进 SM90 FlashMLA、FP8/pipeline、干预式 mediation 与 R1-like RL 复现 |
|
||||
| DeepSeek 专题 | 六轮实证进行中 | 99% | 扩大 sampling 的 source/task 覆盖,再推进干预式 mediation、SM90 FlashMLA、FP8/pipeline 与 R1-like RL 复现 |
|
||||
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
|
||||
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
|
||||
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
|
||||
@@ -41,7 +41,7 @@
|
||||
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
|
||||
- [x] 完成可检索、可按专题筛选的论文库页面。
|
||||
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十九联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十六个原创交互视图。
|
||||
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 二十联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十七个原创交互视图。
|
||||
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
|
||||
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
|
||||
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
|
||||
@@ -248,11 +248,18 @@
|
||||
- [x] 全深度新进程复跑的 4 / 4 source objects(去 runtime 后)、1,856 / 1,856 hidden tensor hashes、1,664 / 1,664 ordered-route hashes 与 1,664 / 1,664 route-weight hashes 全部 exact;复现核对抓到并修正 source-level content-token hash 的循环变量缺陷,正式与复跑文件随后全部重跑。
|
||||
- [x] 第十九个 DeepSeek 交互实验用四页签分开 128→512 completion、Math/Code evaluator、29-stage hidden divergence 与 26-gate route divergence;桌面、390px 移动端、键盘 tab、分域/分边/分指标交互与无横向溢出闸门通过。
|
||||
- [x] DeepSeek completion/full-depth 版本以源提交 `8bb488f`、不可变镜像 `20260729T162625Z-8bb488f` 发布;OCI index digest `sha256:297fef91…b0c02`,复用 NAS `12010→8080`、NPM host 31 / cert 41、门户 `LLM ATLAS / projects / 180`,HTTPS/2、gzip 与十六套生产 Chrome 回归全通过;保留 `20260729T144827Z-96443d4` 回滚。
|
||||
- [x] DeepSeek Round 06 在看到正式结果前预注册 official sampling 合同:4 条固定 source、8 个 SHA-256 派生 base seed、8 条固定 batch 行、`temperature=.3 / top_p=.95 / top_k=0` 与 512-token 统一上限;明确 batch-seed aligned 不是 common-random-number paired design。
|
||||
- [x] 16-token smoke 的 32 / 32 prompt hash 与 greedy baseline exact,R0 同进程重放 32 / 32 全合同 exact,R0/R1 的 32 个同格中 18 格分叉;正式 256 条 sampled outputs 全部落盘,251 条 natural EOS、5 条截断、242 个完整 token trajectory hashes。
|
||||
- [x] sampling 独立 evaluator 把 stopping、task terminal、coverage 与 correctness 分账:单条 GSM8K 的 64 个样本中 62 个 strict exact;单条 HumanEval 的 64 个样本全部 AST 可解析并进入 pinned sandbox,63 个通过 official tests。两条数学失败与一个偶数 prime-check 失败均定位到具体推理/代码错误。
|
||||
- [x] 新进程只复跑 R0/R1 的 64 格;run seed、prompt hash、完整 generated token IDs、decoded text、EOS、truncation、CPU RNG pre-state 与 CUDA RNG pre-state 八项均 64 / 64 exact,不冒充 256 / 256。
|
||||
- [x] Round 06 四份冻结 artifact SHA-256 为 formal `46c7edf…345af`、eval `078f486…24c4d8`、rerun `72d050e…91f6a0`、reproduction `4d59a77…f82d15`;compact builder 强制验证三段 hash 链与 64 / 64 复现闸门。
|
||||
- [x] 第二十个 DeepSeek 交互实验以四页签讲解八 seed 轨迹显微镜、Math/Code 失败账、aligned/nearest 样本集合比较与随机性×复现合同;完整协议、结果审计、运行脚本与 compact 数据均已记录在项目本地。
|
||||
- [x] Round 06 本地闸门通过:80 个受检文件零诊断,21 个页面、1,151 个站内引用、12 个跨页锚点零失败;DeepSeek 历史全量与 sampling 专项真实 Chrome 回归均通过,桌面/390px 移动端无文档级溢出、无 offender、无运行时异常。
|
||||
|
||||
## 正在进行
|
||||
|
||||
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
|
||||
- [ ] DeepSeek 五轮下一闸门:扩大 GSM8K/HumanEval 与语言 source 样本,加入 sampling robustness 和干预式 mediation;再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] DeepSeek 六轮下一闸门:扩大 GSM8K/HumanEval 与语言 source 的 sampling 覆盖,加入干预式 mediation;再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
|
||||
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
|
||||
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
|
||||
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
|
||||
@@ -426,6 +433,9 @@
|
||||
| 2026-07-29 | 开放工件证据使用 O / D / X / S / U 五种身份 | 观测、推导、本机执行、合成探针与未决矛盾不互相冒充;FlashKDA 作者 benchmark 不写成本机 benchmark |
|
||||
| 2026-07-29 | `A_log [128]` 与 expected `[96]` 保持未决 | 并列报告 checkpoint、config、remote code 与 kernel API;等待官方 loader / 修订解释,不擅自 reshape |
|
||||
| 2026-07-29 | K3 三轮开放工件里程碑用不可变镜像 `20260729T044605Z-be2b291` 发布 | OCI digest `sha256:99aa953e…d00cdf`;复用 `12010→8080`、NPM host 31 / cert 41、门户 order 180 与公开 Forgejo;十六套生产 Chrome 回归通过,保留 `20260729T040336Z-b669615` 回滚 |
|
||||
| 2026-07-30 | DeepSeek Round 06 在结果前冻结多种子 sampling 协议 | official `.3/.95` sampling、显式 top-k 0、四条 source、八个 SHA-256 seed 与固定八行 batch;batch-seed aligned 不冒充 common random numbers |
|
||||
| 2026-07-30 | sampled completion 与任务失败分账 | 256 条中 251 natural EOS、242 unique token trajectories;Math 62/64、Code 63/64,具体错误回到推理与官方 tests |
|
||||
| 2026-07-30 | sampling 的随机性与复现同时过闸 | R0/R1 31/32 同格分叉;新进程复跑 64 格的 seed、prompt、token、text、stop 与 CPU/CUDA RNG pre-state 八项全部 exact |
|
||||
|
||||
## 未决问题
|
||||
|
||||
|
||||
Reference in New Issue
Block a user