diff --git a/PROGRESS.md b/PROGRESS.md index 9abb81d..0104826 100644 --- a/PROGRESS.md +++ b/PROGRESS.md @@ -14,7 +14,7 @@ | 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 | | Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 | | 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces | -| DeepSeek 专题 | 七轮实证进行中 | 99% | 扩大到可做 task-level bootstrap,加入 per-row RNG,再推进干预式 mediation、SM90 FlashMLA、FP8/pipeline 与 R1-like RL | +| DeepSeek 专题 | 八轮实证进行中 | 99% | 推进干预式 mediation、SM90 FlashMLA、FP8/pipeline 与 R1-like RL | | 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 | | 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 | | 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 | @@ -41,7 +41,7 @@ - [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。 - [x] 完成可检索、可按专题筛选的论文库页面。 - [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。 -- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 二十一联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十八个原创交互视图。 +- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 二十二联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十九个原创交互视图。 - [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。 - [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。 - [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。 @@ -264,11 +264,17 @@ - [x] 第二十一个 DeepSeek 交互实验以四页签讲解 source→seed 层级、Math/Code 4×4 task matrix、source-level 方向与均值反例、64 格八字段复现及五段 hash chain;协议、完整审计、探针、独立 evaluator、analysis 与 compact builder 全部落盘。 - [x] Round 07 本地闸门通过:83 个 Astro 文件零诊断,21 个页面、1,151 个站内引用、12 个跨页锚点零失败;Python 探针/评测/分析编译通过,compact builder 重建 SHA-256 不变。跨来源专项与 DeepSeek 全量真实 Chrome 回归通过,4×4 矩阵、English 反例、键盘页签、桌面/390px 移动端无溢出及零运行时异常均有自动断言。 - [x] DeepSeek Round 07 以源提交 `9211333`、不可变镜像 `20260729T195952Z-9211333` 发布;OCI index digest `sha256:6c92883b…5584e2`,复用 NAS `12010→8080`、NPM host 31 / cert 41 与门户 `LLM ATLAS / projects / 180`。容器 healthy、0 次重启,NAS / VPS Tailscale / HTTPS / gzip / immutable assets、跨来源专项与 DeepSeek 全量生产 Chrome 回归通过;保留 `20260729T180228Z-580f696` 回滚。 +- [x] DeepSeek Round 08 在任何正式输出前冻结 HumanEval / GSM8K 各 32 条任务、四条件、T0 主分析与 T1–T3 诊断,并把共同随机数实现为 SHA-256 派生的显式 uniform tape;四个条件对同一 `u_t` 各自计算 float32 CDF,不再把 generator seed 重置冒充 CRN。 +- [x] 64 条短 smoke 的 prompt 64/64 exact、同进程重放 32/32 exact、CPU/CUDA RNG 16/16 不变;正式执行 64 tasks × T0 × 4 conditions 与 8 tasks × T1–T3 × 4 conditions,共 352 条输出,343 条 natural EOS、9 条截断、320 个完整 trajectory hashes。 +- [x] 独立 evaluator 对 256 条 T0 输出逐题评分:Code 四格 pass 为 `16/32 · 16/32 · 15/32 · 12/32`,Math 为 `19/32 · 19/32 · 17/32 · 16/32`;不把 59/128 与 71/128 写成 benchmark accuracy。 +- [x] 两域分别做 10,000 次选定任务 paired bootstrap,八个正确性 contrast 区间都跨零;长度 system-at-period 在 Code 为 `−130.875 [−178.688,−83.218]`,Math 为 `+25.125 [7.874,44.531]`,揭示任务域方向相反。 +- [x] 共同随机数对照的 256 / 256 个 contrast 全部共享相同 uniform tape;新进程重放 64 条结果,uniform hashes、token IDs、文本、停止状态与 RNG 等十二字段全部 64 / 64 exact。审计同时公开运行器在生成进程结束前已加载 gold、但 gold 没有进入 prompt/tokenizer/logits/warpers/CDF/tape/selection 的流程偏差。 +- [x] 第二十二个 DeepSeek 交互实验用五页签讲解显式 CRN sampler、选定任务 bootstrap、32 题浏览器、4×4 tape 诊断与十二字段复现/失败/偏差账;正式协议、manifest、runner、独立 evaluator、分析、复现与完整/compact 数据均已进入开源树。 ## 正在进行 - [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。 -- [ ] DeepSeek 七轮下一闸门:扩大到可做 task-level bootstrap 的预注册 source 抽样框,加入 per-row RNG/common-random-number 对照与 failure taxonomy;再推进干预式 mediation、SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。 +- [ ] DeepSeek 八轮下一闸门:推进干预式 mediation、SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。 - [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。 - [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。 - [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。 @@ -451,6 +457,10 @@ | 2026-07-30 | 域均值必须与 source 方向同时展示 | English 句点 contrast 的均值 −8.5,但 3/4 source 为正;Code task interaction 的 +1 与 −1 在域均值 0 中抵消 | | 2026-07-30 | Round 07 随机分叉与复现同时过闸 | R0/R1 63/64 同格 trajectory 分叉;新进程 R0 的八项预注册字段 64/64 exact,五段 artifact hash chain 闭合 | | 2026-07-30 | DeepSeek Round 07 跨来源采样里程碑发布 | 源提交 `9211333`、镜像 `20260729T195952Z-9211333`、OCI `sha256:6c92883b…5584e2`;生产专项/全量 Chrome、HTTPS 与门户通过,保留 Round 06 回滚点 | +| 2026-07-30 | Round 08 用显式 uniform tape 实现真正的共同随机数 | 64 tasks × T0 × 4 conditions,加 8 tasks × 3 诊断 tapes × 4 conditions;352 条正式输出的四条件 CDF 共享逐步 `u_t` | +| 2026-07-30 | bootstrap 只描述冻结任务集的敏感性 | HumanEval / GSM8K 分开做 10,000 次 task-paired resamples;正确性带全跨零,不报告总体/seed CI 或 p-value | +| 2026-07-30 | 输出长度揭示强任务域交互 | system-at-period 在 Code 为负、Math 为正,两个选定任务带都不跨零;不从长度外推能力 | +| 2026-07-30 | Round 08 十二字段重放过闸 | 64/64 exact;uniform hash、完整 token IDs、文本、stop 与 RNG 一并进入复现合同,评分 gold 提前加载的流程偏差公开保留 | ## 未决问题 diff --git a/README.md b/README.md index a4c2490..3b56861 100644 --- a/README.md +++ b/README.md @@ -19,7 +19,7 @@ 当前里程碑包含 17 专题学习地图、486 篇关键论文索引、Kimi K3 完整导读, 语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 技术谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、工具使用与长程 Agent、原生多模态、训练系统、推理服务、数值优化,以及评测与安全深度专题, -以及 88 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、 +以及 89 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、 8 个交互实验和 100 个一手/官方节点,完整覆盖架构、预训练、后训练、系统、评测、案例与附录。 第三轮已完成开放工件与首个真实 kernel 里程碑:固定官方模型与 FlashKDA revisions,审计 96 个 checkpoint shards、 497,220 个 tensor entries、真实 KDA / MLA / MoE / MoonViT shapes 与小范围参数统计,并用 4 个新视图 @@ -27,8 +27,8 @@ `sm_120a` wheel,在 RTX 5090 上完成 6/6 官方参考 exact-match 和 K3 fixed / varlen 形状计时。详见 [K3_ARTIFACT_AUDIT.md](./research/K3_ARTIFACT_AUDIT.md) 与 [checkpoint_probe.py](./experiments/k3/checkpoint_probe.py)、[FlashKDA probe](./experiments/k3/flashkda/)。 -DeepSeek 七轮专题以 24 张问题账、10 次技术转向、 -21 个交互实验和 60 个一手/官方节点,串起 Dense、MoE、MLA、V3 协同、R1 与 V4; +DeepSeek 八轮专题以 24 张问题账、10 次技术转向、 +22 个交互实验和 60 个一手/官方节点,串起 Dense、MoE、MLA、V3 协同、R1 与 V4; 并固定官方 V2-Lite revision,在 RTX 5090 上连续执行 7/27 层,记录 3,240 次真实专家选择、 MLA/HF eager cache shapes 与 `31/31` exact 独立复跑;进一步用真实 layer-1 权重执行官方 V3 naive/absorb 路径,实际写入 576 元素 latent cache,并以 FP32 将两种结合顺序的最大误差压到 @@ -85,6 +85,14 @@ Round 07 保持 256 条输出预算不变,改为 16 条预先冻结的 source `16/16 · 8/16 · 12/16 · 16/16`。句点在 11 / 16 条 source 上缩短平均长度,但 English 的首条 source 为 `−121`、其余三条为正,证明单题均值会与多数 source 方向相反;新进程 R0 的八项合同字段仍为 `64 / 64` exact。 +Round 08 再把覆盖扩大到 HumanEval / GSM8K 各 32 条冻结任务,并以 SHA-256 显式 +uniform tape 代替“重置同一 seed”的伪共同随机数:T0 全任务四条件 256 条、额外三条 +随机带诊断 96 条,共 352 条正式输出,343 条 natural EOS、320 个完整 trajectory hashes。 +两个域分别做 10,000 次选定任务 paired bootstrap;八个正确性区间全部跨零,但 +system-at-period 的输出长度在 Code 为 `−130.9 [−178.7,−83.2]`、在 Math 为 +`+25.1 [7.9,44.5]`,说明干预方向依赖任务域。全新进程对 64 条输出的 uniform hash、 +token IDs、文本与停止等十二字段逐一重放,`64 / 64` exact;同时公开评分金标准被运行器 +提前加载、但没有进入 prompt / logits / CDF / tape / selection 的流程偏差。 详见 [DEEPSEEK_V2_LITE_TRACE.md](./research/DEEPSEEK_V2_LITE_TRACE.md) 与 [DEEPSEEK_MLA_ABSORB_AUDIT.md](./research/DEEPSEEK_MLA_ABSORB_AUDIT.md)、 @@ -102,7 +110,9 @@ English 的首条 source 为 `−121`、其余三条为正,证明单题均值 [DEEPSEEK_V2_LITE_CHAT_SAMPLING_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_SAMPLING_PROTOCOL.md) 与 [DEEPSEEK_V2_LITE_CHAT_SAMPLING_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_SAMPLING_AUDIT.md),以及 [DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_PROTOCOL.md) 与 -[DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md)。 +[DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_CROSS_SOURCE_SAMPLING_AUDIT.md),以及 +[DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_PROTOCOL.md](./research/DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_PROTOCOL.md) 与 +[DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_CRN_AUDIT.md](./research/DEEPSEEK_V2_LITE_CHAT_TASK_BOOTSTRAP_CRN_AUDIT.md)。 其余专题按进度账本持续扩建。 ## 本地开发 diff --git a/package.json b/package.json index f6cd0cc..fa2cc64 100644 --- a/package.json +++ b/package.json @@ -37,6 +37,7 @@ "check:deepseek-browser": "node scripts/check-deepseek-browser.mjs", "check:deepseek-sampling-browser": "node scripts/check-deepseek-sampling-browser.mjs", "check:deepseek-cross-source-sampling-browser": "node scripts/check-deepseek-cross-source-sampling-browser.mjs", + "check:deepseek-task-bootstrap-browser": "node scripts/check-deepseek-task-bootstrap-browser.mjs", "check:k3-browser": "node scripts/check-k3-browser.mjs" }, "dependencies": { diff --git a/scripts/check-deepseek-browser.mjs b/scripts/check-deepseek-browser.mjs index 1fc0a4b..fae74eb 100644 --- a/scripts/check-deepseek-browser.mjs +++ b/scripts/check-deepseek-browser.mjs @@ -1212,7 +1212,7 @@ console.log(JSON.stringify(report, null, 2)); const numeric = (text) => Number.parseFloat(text.replaceAll(",", "")); const failures = []; if (!overview.title.includes("为什么转向")) failures.push("专题标题异常"); -if (overview.sections !== 30 || overview.tocLinks !== 30) failures.push("二十九个编号专题加阅读链的目录结构异常"); +if (overview.sections !== 31 || overview.tocLinks !== 31) failures.push("三十个编号专题加阅读链的目录结构异常"); if (overview.ledgers !== 24 || overview.waves !== 10) failures.push("二十四张问题账或十次转向结构异常"); if (overview.paperLinks !== 60 || overview.branches !== 5 || overview.followups !== 1) failures.push("论文链、旁支或公开后续标记异常"); if (overview.labTabs !== 4 || overview.labPanels !== 4) failures.push("四联实验结构异常"); @@ -1220,7 +1220,7 @@ if (overview.artifactTabs !== 13 || overview.artifactPanels !== 13 || overview.a if (overview.behaviorTabs !== 4 || overview.behaviorPanels !== 4 || overview.behaviorSources !== 16 || overview.behaviorEdges !== 10) failures.push("Chat 行为实验结构异常"); if (overview.completionDepthTabs !== 4 || overview.completionDepthPanels !== 4 || overview.hiddenStages !== 29 || overview.routerLayers !== 26) failures.push("Chat 完成度与全深度实验结构异常"); if (overview.crossSourceTabs !== 4 || overview.crossSourcePanels !== 4) failures.push("跨来源采样实验结构异常"); -if (overview.heroLabs !== "21 个可操作实验") failures.push("DeepSeek 实验总数账异常"); +if (overview.heroLabs !== "22 个可操作实验") failures.push("DeepSeek 实验总数账异常"); if (overview.navLinks !== 20 || home.navLinks !== 20 || mobile.mobileLinks !== 20 || overview.activeNav !== "DeepSeek") failures.push("全站导航未同步 DeepSeek"); if (overview.documentOverflow > 1 || mobile.documentOverflow > 1) failures.push("桌面或移动端存在文档级横向溢出"); if (capacity.initial.panel !== "capacity" || capacity.initial.total !== "32.1× FFN" || capacity.initial.active !== "1.13× FFN") failures.push("V3 稀疏容量初始账异常"); diff --git a/scripts/check-deepseek-cross-source-sampling-browser.mjs b/scripts/check-deepseek-cross-source-sampling-browser.mjs index cdc1427..da1beb8 100644 --- a/scripts/check-deepseek-cross-source-sampling-browser.mjs +++ b/scripts/check-deepseek-cross-source-sampling-browser.mjs @@ -240,8 +240,8 @@ assert(overview.facts["SAMPLED OUTPUTS"] === "256", "output headline 异常"); assert(overview.facts["NATURAL EOS"] === "250 / 256", "EOS headline 异常"); assert(overview.facts["MATH · STRICT"] === "47 / 64", "Math headline 异常"); assert(overview.facts["CODE · TESTS"] === "52 / 64", "Code headline 异常"); -assert(overview.labs === "21 个可操作实验", "DeepSeek LABS 总账异常"); -assert(overview.status === "七轮 · 512 条采样", "DeepSeek STATUS 总账异常"); +assert(overview.labs === "22 个可操作实验", "DeepSeek LABS 总账异常"); +assert(overview.status === "八轮 · 864 条采样", "DeepSeek STATUS 总账异常"); assert(overview.overflow <= 1, `桌面横向溢出 ${overview.overflow}px`); assert(hierarchySwitch.cards.length === 4, "Code source cards 数量异常"); diff --git a/scripts/check-deepseek-sampling-browser.mjs b/scripts/check-deepseek-sampling-browser.mjs index 6ca85d8..3add5df 100644 --- a/scripts/check-deepseek-sampling-browser.mjs +++ b/scripts/check-deepseek-sampling-browser.mjs @@ -223,7 +223,7 @@ assert(overview.panels === 4, `sampling panels=${overview.panels}`); assert(overview.seedBars === 8, `initial seed bars=${overview.seedBars}`); assert(overview.conditions === 8, `condition rows=${overview.conditions}`); assert(overview.edges === 10, `edge rows=${overview.edges}`); -assert(overview.heroLabs?.startsWith("20"), `hero labs=${overview.heroLabs}`); +assert(overview.heroLabs === "22 个可操作实验", `hero labs=${overview.heroLabs}`); assert(overview.activePanel === "trajectories", `active=${overview.activePanel}`); assert(overview.unique === "8 / 8", `initial unique=${overview.unique}`); assert(overview.eos === "5 / 8", `initial eos=${overview.eos}`); diff --git a/scripts/check-deepseek-task-bootstrap-browser.mjs b/scripts/check-deepseek-task-bootstrap-browser.mjs new file mode 100644 index 0000000..6b979c7 --- /dev/null +++ b/scripts/check-deepseek-task-bootstrap-browser.mjs @@ -0,0 +1,302 @@ +import { writeFileSync } from "node:fs"; + +const cdpPort = process.env.CDP_PORT ?? "9231"; +const baseUrl = process.env.SITE_URL ?? "http://127.0.0.1:4327"; +const pages = await fetch(`http://127.0.0.1:${cdpPort}/json/list`) + .then((response) => response.json()); +const page = pages.find((entry) => entry.type === "page"); +if (!page) throw new Error(`CDP ${cdpPort} 没有可用页面`); + +const socket = new WebSocket(page.webSocketDebuggerUrl); +await new Promise((resolve, reject) => { + socket.addEventListener("open", resolve, { once: true }); + socket.addEventListener("error", reject, { once: true }); +}); + +let nextId = 0; +const pending = new Map(); +const exceptions = []; +socket.addEventListener("message", (event) => { + const message = JSON.parse(event.data); + if (message.id && pending.has(message.id)) { + const { resolve, reject } = pending.get(message.id); + pending.delete(message.id); + if (message.error) reject(new Error(message.error.message)); + else resolve(message.result); + } + if (message.method === "Runtime.exceptionThrown") { + exceptions.push( + message.params.exceptionDetails.exception?.description + ?? message.params.exceptionDetails.text, + ); + } +}); + +const command = (method, params = {}) => new Promise((resolve, reject) => { + const id = ++nextId; + pending.set(id, { resolve, reject }); + socket.send(JSON.stringify({ id, method, params })); +}); +const pause = (milliseconds) => new Promise( + (resolve) => setTimeout(resolve, milliseconds), +); +const evaluate = async (expression) => { + const result = await command("Runtime.evaluate", { + expression, + returnByValue: true, + awaitPromise: true, + }); + if (result.exceptionDetails) { + throw new Error( + result.exceptionDetails.exception?.description + ?? result.exceptionDetails.text, + ); + } + return result.result.value; +}; +const screenshot = async (path) => { + const result = await command("Page.captureScreenshot", { + format: "png", + captureBeyondViewport: false, + }); + writeFileSync(path, Buffer.from(result.data, "base64")); +}; +const assert = (condition, message) => { + if (!condition) throw new Error(message); +}; + +await command("Page.enable"); +await command("Runtime.enable"); +await command("Emulation.setDeviceMetricsOverride", { + width: 1440, + height: 1100, + deviceScaleFactor: 1, + mobile: false, +}); +await command("Page.navigate", { + url: `${baseUrl}/deepseek/#task-bootstrap-crn`, +}); +for (let attempt = 0; attempt < 100; attempt += 1) { + await pause(100); + if (await evaluate("document.readyState === 'complete'")) break; +} + +const overview = await evaluate(`(() => { + const root = document.querySelector("[data-task-bootstrap-lab]"); + if (!root) return null; + document.documentElement.style.scrollBehavior = "auto"; + window.scrollTo(0, root.getBoundingClientRect().top + window.scrollY); + const facts = Object.fromEntries( + [...root.querySelectorAll(".tb-ledger article")].map((node) => [ + node.querySelector("span").textContent.trim(), + node.querySelector("b").textContent.trim(), + ]), + ); + return { + tabs: root.querySelectorAll("[data-tb-tab]").length, + panels: root.querySelectorAll("[data-tb-panel]").length, + active: root.querySelector("[data-tb-panel]:not([hidden])")?.dataset.tbPanel, + bars: root.querySelectorAll(".uniform-bars article").length, + lanes: root.querySelectorAll(".token-lanes article").length, + laneTokens: root.querySelectorAll(".token-lanes article i").length, + facts, + labs: [...document.querySelectorAll(".page-facts > div")] + .find((node) => node.querySelector("dt")?.textContent.trim() === "LABS") + ?.querySelector("dd")?.textContent.trim(), + status: [...document.querySelectorAll(".page-facts > div")] + .find((node) => node.querySelector("dt")?.textContent.trim() === "STATUS") + ?.querySelector("dd")?.textContent.trim(), + documentOverflow: document.documentElement.scrollWidth + - document.documentElement.clientWidth, + }; +})()`); +await pause(250); +await screenshot("/tmp/llm-atlas-task-bootstrap-sampler-desktop.png"); + +const bootstrap = await evaluate(`(() => { + const root = document.querySelector("[data-task-bootstrap-lab]"); + root.querySelector('[data-tb-tab="bootstrap"]').click(); + const read = () => ({ + active: root.querySelector("[data-tb-panel]:not([hidden])").dataset.tbPanel, + conditionCards: [...root.querySelectorAll("[data-tb-condition-cards] article")] + .map((node) => node.querySelector("b").textContent.trim()), + forest: [...root.querySelectorAll("[data-tb-forest] > article")].map((node) => ({ + label: node.querySelector("span").textContent.trim(), + point: node.querySelector(":scope > b").textContent.trim(), + band: node.querySelector("small").textContent.trim(), + clear: node.querySelector("u").classList.contains("clear"), + })), + robust: root.querySelector("[data-tb-robust-count]").textContent.trim(), + }); + const codeCorrectness = read(); + root.querySelector('[data-tb-metric="generated_tokens"]').click(); + const codeLength = read(); + root.querySelector('[data-tb-domain="math"]').click(); + const mathLength = read(); + return { codeCorrectness, codeLength, mathLength }; +})()`); +await pause(150); +await screenshot("/tmp/llm-atlas-task-bootstrap-forest-desktop.png"); + +const taskExplorer = await evaluate(`(() => { + const root = document.querySelector("[data-task-bootstrap-lab]"); + root.querySelector('[data-tb-tab="tasks"]').click(); + const domain = root.querySelector("[data-tb-task-domain]"); + const contrast = root.querySelector("[data-tb-task-contrast]"); + domain.value = "math"; + domain.dispatchEvent(new Event("change", { bubbles: true })); + contrast.value = "system_at_eos"; + contrast.dispatchEvent(new Event("change", { bubbles: true })); + root.querySelector('[data-tb-task-page="2"]').click(); + return { + active: root.querySelector("[data-tb-panel]:not([hidden])").dataset.tbPanel, + rows: root.querySelectorAll("[data-tb-task-rows] > article").length, + page: root.querySelector("[data-tb-task-page-label]").textContent.trim(), + selectedPage: root.querySelector('[data-tb-task-page][aria-pressed="true"]') + .dataset.tbTaskPage, + firstTask: root.querySelector("[data-tb-task-rows] > article span b") + .textContent.trim(), + transition: [...root.querySelectorAll("[data-tb-transition-cards] article")] + .map((node) => node.querySelector("b").textContent.trim()), + }; +})()`); + +const tape = await evaluate(`(() => { + const root = document.querySelector("[data-task-bootstrap-lab]"); + root.querySelector('[data-tb-tab="tapes"]').click(); + const domain = root.querySelector("[data-tb-tape-domain]"); + const contrast = root.querySelector("[data-tb-tape-contrast]"); + domain.value = "math"; + domain.dispatchEvent(new Event("change", { bubbles: true })); + contrast.value = "system_at_eos"; + contrast.dispatchEvent(new Event("change", { bubbles: true })); + return { + active: root.querySelector("[data-tb-panel]:not([hidden])").dataset.tbPanel, + rows: root.querySelectorAll("[data-tb-tape-rows] > article").length, + cells: root.querySelectorAll("[data-tb-tape-rows] > article > b").length, + means: [...root.querySelectorAll("[data-tb-tape-means] > b")] + .map((node) => node.textContent.trim()), + taskRange: root.querySelector("[data-tb-task-range]").textContent.trim(), + tapeRange: root.querySelector("[data-tb-tape-range]").textContent.trim(), + }; +})()`); + +const audit = await evaluate(`(() => { + const root = document.querySelector("[data-task-bootstrap-lab]"); + root.querySelector('[data-tb-tab="audit"]').click(); + return { + active: root.querySelector("[data-tb-panel]:not([hidden])").dataset.tbPanel, + fields: [...root.querySelectorAll(".replay-fields article")] + .map((node) => node.querySelector("b").textContent.trim()), + codeOutcomes: root.querySelectorAll(".failure-ledger > article:first-child > div").length, + mathOutcomes: root.querySelectorAll(".failure-ledger > article:last-child > div").length, + deviations: root.querySelectorAll(".deviation-ledger article").length, + artifacts: root.querySelectorAll(".artifact-chain article").length, + }; +})()`); + +const keyboard = await evaluate(`(() => { + const root = document.querySelector("[data-task-bootstrap-lab]"); + const first = root.querySelector('[data-tb-tab="sampler"]'); + first.click(); + first.focus(); + first.dispatchEvent(new KeyboardEvent("keydown", { + key: "ArrowRight", + bubbles: true, + })); + return { + selected: root.querySelector('[data-tb-tab][aria-selected="true"]').dataset.tbTab, + active: root.querySelector("[data-tb-panel]:not([hidden])").dataset.tbPanel, + focused: document.activeElement.dataset.tbTab, + }; +})()`); + +await command("Emulation.setDeviceMetricsOverride", { + width: 390, + height: 844, + deviceScaleFactor: 1, + mobile: true, +}); +await pause(300); +const mobile = await evaluate(`(() => { + const root = document.querySelector("[data-task-bootstrap-lab]"); + root.querySelector('[data-tb-tab="tasks"]').click(); + root.scrollIntoView(); + return { + documentOverflow: document.documentElement.scrollWidth + - document.documentElement.clientWidth, + rootOverflow: root.scrollWidth - root.clientWidth, + tableWidth: root.querySelector(".task-table").getBoundingClientRect().width, + tableScrollWidth: root.querySelector(".task-table").scrollWidth, + viewport: window.innerWidth, + }; +})()`); +await screenshot("/tmp/llm-atlas-task-bootstrap-mobile.png"); + +assert(overview, "找不到任务 bootstrap 实验"); +assert(overview.tabs === 5 && overview.panels === 5, "五页签/面板合同异常"); +assert(overview.active === "sampler", "初始面板不是 sampler"); +assert(overview.bars === 8, "uniform tape 前八步渲染异常"); +assert(overview.lanes === 4 && overview.laneTokens === 32, "四条件 token lane 异常"); +assert(overview.facts.TASKS === "32 + 32", "任务 headline 异常"); +assert(overview.facts["FORMAL GRID"] === "352", "formal headline 异常"); +assert(overview.facts["UNIFORM AUDIT"] === "352 / 352", "uniform headline 异常"); +assert(overview.facts["FRESH PROCESS"] === "64 / 64", "replay headline 异常"); +assert(overview.labs === "22 个可操作实验", "DeepSeek LABS 总账异常"); +assert(overview.status === "八轮 · 864 条采样", "DeepSeek STATUS 总账异常"); +assert(overview.documentOverflow <= 1, `桌面横向溢出 ${overview.documentOverflow}px`); + +assert(bootstrap.codeCorrectness.active === "bootstrap", "bootstrap 面板切换异常"); +assert(bootstrap.codeCorrectness.conditionCards.join("|") === "16 / 32 pass|16 / 32 pass|15 / 32 pass|12 / 32 pass", "Code 条件 pass 表异常"); +assert(bootstrap.codeCorrectness.forest.length === 4, "forest contrast 数异常"); +assert(bootstrap.codeCorrectness.robust === "0 / 4 bands 不跨 0", "Code correctness 带数异常"); +assert(bootstrap.codeLength.robust === "2 / 4 bands 不跨 0", "Code length 带数异常"); +assert(bootstrap.codeLength.forest.at(-1).point === "-130.9 tok", "Code system-period 长度异常"); +assert(bootstrap.mathLength.robust === "1 / 4 bands 不跨 0", "Math length 带数异常"); +assert(bootstrap.mathLength.forest.at(-1).point === "+25.1 tok", "Math system-period 长度异常"); + +assert(taskExplorer.active === "tasks", "逐题面板切换异常"); +assert(taskExplorer.rows === 8 && taskExplorer.page === "17–24 / 32", "逐题分页异常"); +assert(taskExplorer.selectedPage === "2", "逐题页按钮状态异常"); +assert(taskExplorer.firstTask === "gsm8k/test/1050", "逐题页首任务异常"); +assert(taskExplorer.transition.join("|") === "3 / 32|3 / 32|16 / 32|10 / 32", "Math system-EOS 转移异常"); + +assert(tape.active === "tapes", "tape 面板切换异常"); +assert(tape.rows === 4 && tape.cells === 16, "4×4 tape matrix 异常"); +assert(tape.means.join("|") === "0.00|+0.50|-0.25|+0.25", "Math system-EOS tape means 异常"); +assert(tape.taskRange === "1.25" && tape.tapeRange === "1.00", "tape/task range 异常"); + +assert(audit.active === "audit", "审计面板切换异常"); +assert(audit.fields.length === 12, "重放字段数不为 12"); +assert(audit.fields.every((value) => value === "64 / 64"), "重放字段未全部 exact"); +assert(audit.codeOutcomes === 6 && audit.mathOutcomes === 2, "失败分类数量异常"); +assert(audit.deviations === 2, "偏离账数量异常"); +assert(audit.artifacts === 4, "工件 hash 数量异常"); +assert( + keyboard.selected === "bootstrap" + && keyboard.active === "bootstrap" + && keyboard.focused === "bootstrap", + "页签键盘导航异常", +); +assert(mobile.documentOverflow <= 1, `移动端 document 横向溢出 ${mobile.documentOverflow}px`); +assert(mobile.rootOverflow <= 1, `移动端实验横向溢出 ${mobile.rootOverflow}px`); +assert(mobile.tableWidth <= mobile.viewport, "移动端任务表容器超出 viewport"); +assert(mobile.tableScrollWidth > mobile.tableWidth, "移动端任务表没有内部横向滚动"); +assert(exceptions.length === 0, `浏览器异常:${exceptions.join(" | ")}`); + +console.log(JSON.stringify({ + overview, + bootstrap, + taskExplorer, + tape, + audit, + keyboard, + mobile, + screenshots: [ + "/tmp/llm-atlas-task-bootstrap-sampler-desktop.png", + "/tmp/llm-atlas-task-bootstrap-forest-desktop.png", + "/tmp/llm-atlas-task-bootstrap-mobile.png", + ], +}, null, 2)); + +socket.close(); diff --git a/src/components/DeepSeekTaskBootstrapLab.astro b/src/components/DeepSeekTaskBootstrapLab.astro new file mode 100644 index 0000000..c0fa01d --- /dev/null +++ b/src/components/DeepSeekTaskBootstrapLab.astro @@ -0,0 +1,827 @@ +--- +import rawLab from "@/data/deepseek-v2-lite-chat-task-bootstrap-crn-compact.json"; + +const lab = rawLab as any; +const json = JSON.stringify(lab).replaceAll("<", "\\u003c"); +const example = lab.uniformExample; +const conditions = ["s0_eos", "s1_eos", "s0_period", "s1_period"]; +const conditionLabels: Record = { + s0_eos: "无 system · EOS", + s1_eos: "有 system · EOS", + s0_period: "无 system · 句点", + s1_period: "有 system · 句点", +}; +--- + +
+
+
+

ROUND 08 / TASK BOOTSTRAP × EXPLICIT CRN

+

把“换题”和“换随机数”拆开,再问 prompt 到底改变了什么

+
+

+ 主分析固定 T0,在 HumanEval 与 GSM8K 各 32 道预选题上逐题配对; + 另取每域 4 题跑 T0–T3。四格在第 t 步读取同一个显式 + uₜ,再各自穿过不同的 token CDF。 +

+
+ +
+
TASKS32 + 32

Code / Math 始终分开

+
FORMAL GRID352

256 主分析 + 96 额外 tape

+
PROMPT HASH256 / 256

输出前冻结并逐格 exact

+
UNIFORM AUDIT352 / 352

每条消费前缀重新派生

+
TASK BOOTSTRAP10,000×

固定 32 题框,不外推总体

+
FRESH PROCESS64 / 64

十二项字段全部 exact

+
+ +
+ + + + + +
+ +
+
+
I / COMMON RANDOM NUMBERS

同一个 seed,不一定是同一个随机冲击

+

+ 旧实验把四行放在同一个 seeded batch,torch.multinomial 为不同 + 行消费不同 RNG 子流。本轮直接定义每一步的均匀数,所以配对对象终于可见、可重建。 +

+
+ +
+
+ ROUND 06–07 · BATCH SEED +
seed→r₀r₁r₂r₃
+

同一 seed 与调用时序,但四行不是同一概率分位。

+
+
+ ROUND 08 · EXPLICIT TAPE +
uₜ→uₜuₜuₜuₜ
+

同题、同 tape、同 step 的四格读取完全相同的 uₜ。

+
+
+ +
+
01 / HASHSHA-256

protocol · tape · source · step

+ → +
02 / SHAREDuₜ ∈ (0,1)

四格同一个概率分位

+ → +
03 / FOUR DISTRIBUTIONST .3 · P .95

prompt 改变各自 logits / CDF

+ → +
04 / TOKENsearchsorted

同 uₜ 可以落入不同 token

+
+ +
+
+
REAL T0 TAPE / {example.sourceId}前 8 个生成步
+

柱高是 float32 uₜ;hex 是冻结的 uint64 前缀。

+
+
+ {example.uniformFloat32FirstEight.map((value: number, index: number) => ( +
+ + t{index} + {value.toFixed(3)} + {example.uniformUint64FirstEightHex[index].slice(0, 6)} +
+ ))} +
+
+ {conditions.map((condition) => ( +
+
{condition}{conditionLabels[condition]}
+
+ {example.conditions[condition].generatedTokenIds.map((token: number, index: number) => ( + t{index}{token} + ))} +
+
+ ))} +
+
+ + +
+ + + + + + + + + +
+ 证据边界 + + 两个 domain 各 32 道预选题,不是完整 benchmark;selected-task band 固定 T0, + 不覆盖 generation-tape uncertainty;句点是 counterfactual,不是官方聊天格式。 + + FORMAL ea0607…1809 · EVAL 82b2fc…77ab · REPLAY 64/64 +
+ + +
+ + + + diff --git a/src/pages/deepseek/index.astro b/src/pages/deepseek/index.astro index 5617224..f5090c5 100644 --- a/src/pages/deepseek/index.astro +++ b/src/pages/deepseek/index.astro @@ -7,6 +7,7 @@ import DeepSeekBehaviorLab from "@/components/DeepSeekBehaviorLab.astro"; import DeepSeekCompletionDepthLab from "@/components/DeepSeekCompletionDepthLab.astro"; import DeepSeekSamplingLab from "@/components/DeepSeekSamplingLab.astro"; import DeepSeekCrossSourceSamplingLab from "@/components/DeepSeekCrossSourceSamplingLab.astro"; +import DeepSeekTaskBootstrapLab from "@/components/DeepSeekTaskBootstrapLab.astro"; import { deepseekBranches, deepseekLedgers, deepseekPaperChain, deepseekWaves } from "@/data/deepseek"; const toc = [ @@ -37,21 +38,22 @@ const toc = [ ["24", "completion-depth", "Chat:完成度与全深度"], ["25", "sampling", "Chat:多种子采样稳健性"], ["26", "cross-source-sampling", "Chat:跨题采样与统计单位"], - ["27", "branches", "别漏掉旁支"], - ["28", "audit", "事实、推导与教学模型"], + ["27", "task-bootstrap-crn", "Chat:任务 bootstrap 与共同随机数"], + ["28", "branches", "别漏掉旁支"], + ["29", "audit", "事实、推导与教学模型"], ["↳", "papers", "六十节点阅读链"], ]; ---
-

SPOTLIGHT / DEEPSEEK · ROUND 07 SOURCE COVERAGE × SAMPLING × FULL DEPTH

+

SPOTLIGHT / DEEPSEEK · ROUND 08 TASK BOOTSTRAP × COMMON RANDOM NUMBERS × FULL DEPTH

不要背模型名
要看懂每次为什么转向

这不是七篇报告的摘要,而是一套可追问、可计算、可反驳的技术谱系: @@ -63,9 +65,9 @@ const toc = [

SPAN
2024.01 → 2026.06
LEDGERS
24 张问题账
LINEAGE
10 次技术转向
-
LABS
21 个可操作实验
+
LABS
22 个可操作实验
EVIDENCE
60 个一手 / 官方节点
-
STATUS
七轮 · 512 条采样
+
STATUS
八轮 · 864 条采样
@@ -840,8 +842,22 @@ const toc = [ +
+

27 TASKS ARE NOT RANDOM TAPES

+

换一道题与换一条随机带,不是同一种不确定性:把 32 题 bootstrap 与真正的共同随机数接起来

+

+ Round 07 把 source 提升为覆盖单位,却仍只有每域四题;四行也只是共享 batch + seed,不是真正共享同一概率分位。Round 08 在 HumanEval 与 GSM8K 各冻结 32 题, + 主分析统一使用 T0;另取每域四题跑 T0–T3。每个 source、tape、step 的 + uₜ 由 SHA-256 显式派生,四个 prompt 条件读取同一个 + uₜ,再穿过各自的 temperature=.3 / top_p=.95 + CDF。这样可以把任务差异、sampling tape 差异与 prompt 条件差异放进不同账本。 +

+ +
+
-

27 THE MAIN LINE IS NOT THE WHOLE TREE

+

28 THE MAIN LINE IS NOT THE WHOLE TREE

如果只读 V2 → V3 → R1 → V4,会漏掉五条反过来影响主线的旁支

{deepseekBranches.map(([name, line, text, url]) => ( @@ -861,7 +877,7 @@ const toc = [
-

28 EVIDENCE AUDIT

+

29 EVIDENCE AUDIT

同一张页面里有三种知识,它们的语气必须不同

diff --git a/src/pages/index.astro b/src/pages/index.astro index 2638045..7a6e4b8 100644 --- a/src/pages/index.astro +++ b/src/pages/index.astro @@ -145,18 +145,18 @@ const paths = [
-

NEW / DEEPSEEK ROUND 07 CROSS-SOURCE SAMPLING · SOURCE-BLOCKED AUDIT

+

NEW / DEEPSEEK ROUND 08 TASK BOOTSTRAP · EXPLICIT COMMON RANDOM NUMBERS

从 Dense 到百万上下文:每次创新都在偿还上一代最贵的一张账

- 单题抽 64 次仍然只有一道题。新一轮保持 256 条预算不变,改用 16 条预先冻结的 - source:Math 四题从 8 / 16 到 16 / 16,Code 四题也从 8 / 16 到 16 / 16; - English 甚至出现域均值与 3 / 4 source 方向相反。新进程 R0 仍 64 / 64 格 exact。 + 从每域四题扩到 HumanEval / GSM8K 各 32 题,并把“同 seed”升级为显式共享 + uniform tape:352 条正式输出、10,000 次选定任务配对 bootstrap 与 64 条 + 十二字段新进程重放。正确性区间都跨零,但输出长度揭示 Code 与 Math 方向相反。

LINEAGE
1991 → 2026 · 10 次转向
NODES
60 个一手 / 官方节点
-
LAB
21 · Base / Chat / sampling
+
LAB
22 · Base / Chat / sampling
diff --git a/src/pages/progress/index.astro b/src/pages/progress/index.astro index efe6616..47b055f 100644 --- a/src/pages/progress/index.astro +++ b/src/pages/progress/index.astro @@ -15,7 +15,7 @@ const workstreams = [ { label: "表示、位置与残差高速公路", value: 81, next: "加入真实 hidden-state / norm traces、长上下文位置外推复现与更多深层稳定性消融" }, { label: "Scaling Laws", value: 74, next: "加入真实拟合复现、置信区间与更多模型族对照" }, { label: "数据工程与预训练配方", value: 73, next: "逐图精读 FineWeb / DCLM,加入真实去重与 mixture traces" }, - { label: "DeepSeek 专题", value: 99, next: "把跨题采样扩大到可做 task-level bootstrap,再推进 per-row RNG、干预式 mediation、SM90 FlashMLA 与 R1-like RL" }, + { label: "DeepSeek 专题", value: 99, next: "推进干预式 mediation、SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现" }, { label: "指令微调与人类偏好", value: 75, next: "加入真实偏好分歧样本、RM 长度偏置与 PPO/DPO 小模型复现" }, { label: "推理与测试时扩展", value: 76, next: "真实模型采样曲线、PRM 案例与逐篇图表精读" }, { label: "工具使用与长程 Agent", value: 74, next: "补真实环境 traces、cross-harness 对照、Agent RL 训练曲线与安全案例" }, @@ -97,12 +97,12 @@ const workstreams = [
✓

K3 报告已结构化拆解

47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。

✓

17 专题知识图

从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。

✓

编辑式网站系统

响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。

-
✓

八十八个原创交互视图

K3 三轴图、八联报告实验与四联开放工件实验,DeepSeek 四联公式实验、十三联 Base 工件实验、Chat 行为、completion/full-depth、multi-seed 与 cross-source sampling 四轮实验,以及语言模型前史、Transformer、表示深度、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。

+
✓

八十九个原创交互视图

K3 三轴图、八联报告实验与四联开放工件实验,DeepSeek 四联公式实验、十三联 Base 工件实验、Chat 行为、completion/full-depth、multi-seed、cross-source 与 task-bootstrap CRN 五轮实验,以及语言模型前史、Transformer、表示深度、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。

✓

十七篇首版长文

K3、语言模型前史、Transformer、表示/位置/残差、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。

✓

语言模型前史深度专题

八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。

✓

Transformer 深度专题

十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。

✓

表示、位置与残差高速公路深度专题

二十张问题账、66 个一手节点、DeepSeek/Kimi 双谱系,以及 Token—位置—Norm—Residual/FFN 四联实验。

-
✓

DeepSeek 七轮真实权重里程碑

继单题多 seed 之后,保持 256 条预算并把覆盖扩大到 16 条预先冻结的 source:250 条 natural EOS、247 个 unique trajectories;Math 四题为 14/16、16/16、8/16、9/16,Code 四题为 16/16、8/16、12/16、16/16。source-blocked 方向揭示 English 均值与多数题相反,新进程 R0 八项合同字段 64 / 64 exact。

+
✓

DeepSeek 八轮真实权重里程碑

把覆盖扩到 HumanEval / GSM8K 各 32 条冻结任务,用显式 SHA-256 uniform tape 驱动四个条件的共同随机数采样:352 条正式输出中 343 条 natural EOS、320 个 unique trajectories;10,000 次选定任务配对 bootstrap 的正确性区间均跨零,长度则揭示 Code 与 Math 的相反方向。新进程十二字段重放 64 / 64 exact。

✓

Kimi K3 技术报告二轮深读

三十二张问题账、Figure 1–16 / Table 1–5 审计、100 节点阅读链,以及 Delta—Decay—AttnRes—LatentMoE—SiTU—QB—MOPD—Cache 八联实验。

✓

Kimi K3 三轮开放工件里程碑

固定官方 revisions,审计 96 个 shards、497,220 个 tensor entries 与真实 KDA / MLA / MoE / MoonViT shapes;四联实验分开显示层型、tensor anatomy、参数范围和复现边界。

✓

FlashKDA RTX 5090 执行闸门

隔离 CUDA 13.0 / glibc 2.39 编译 sm_120a wheel;6/6 官方参考逐元素相等,并完成 fixed / varlen、三种 state mode 的 1,800 个 CUDA Event samples。

@@ -134,7 +134,7 @@ const workstreams = [
优先级专题本轮交付完成闸门
P0K3 三轮

开放权重 traces → FlashKDA / AttnRes / MoE 真实行为 → Figure 1–16 数值重绘与独立复现

运行证据 + 逐图复现
-
P0DeepSeek 七轮后续

扩大到 task-level bootstrap → per-row RNG 对照 → 干预式 mediation → SM90 FlashMLA / FP8 / pipeline traces → R1-like RL 小模型复现

运行证据 + 独立复现
+
P0DeepSeek 八轮后续

干预式 mediation → SM90 FlashMLA / FP8 / pipeline traces → R1-like RL 小模型复现

运行证据 + 独立复现
P0Transformer 二轮

多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照

逐图笔记 + 实测边界
P0表示、位置与残差二轮

真实 hidden-state / norm traces → 长上下文位置外推 → mHC / AttnRes 深层稳定性消融

可复现实验 + 逐图笔记
P0语言模型前史二轮

Kneser–Ney / LSTM / Bahdanau 逐图 → 真实小语料复现 → tokenizer 公平性

可复现实验 + 逐图笔记
@@ -237,6 +237,10 @@ const workstreams = [
任务总数必须展开为逐题矩阵

Math 与 Code 的四题都从 8/16 跨到 16/16;跨不同 GSM8K gold 的 final-answer frequency 禁止聚合。

均值与 source 方向同时展示

English 句点 contrast 均值 −8.5,但 3/4 source 为正;Code 两道题 +1/−1 interaction 在域均值 0 中抵消。

跨题 sampling 仍要求精确复跑

R0/R1 63/64 同格分叉;新进程 R0 的 seed、prompt、token、text、stop 与 CPU/CUDA RNG pre-state 八字段 64/64 exact。

+
共同随机数必须共享 uniform tape

仅把生成器 seed 重置为同一个值并不等于 CRN;Round 08 用 SHA-256 逐 task/tape/step 生成显式 u,并让四个条件把同一 u 映射到各自 token CDF。

+
bootstrap 的统计单位是任务

HumanEval 与 GSM8K 各 32 题分开做 10,000 次成对任务重采样;这是冻结题集的敏感性带,不冒充 benchmark 总体或跨 seed 置信区间。

+
正确性未定,不等于没有行为效应

八个正确性 contrast 区间全部跨零;system-at-period 的长度带在 Code 为 −130.9 [−178.7,−83.2],在 Math 为 +25.1 [7.9,44.5],明确显示任务域交互。

+
复现合同扩到随机带本身

64 条新进程重放逐字段核对 uniform hash、token IDs、文本、停止状态与 RNG;十二字段全部 64/64 exact,并公开评分文件提前加载这一流程偏差。