feat: add DeepSeek Chat behavior evidence

This commit is contained in:
wuyang
2026-07-29 22:47:03 +08:00
parent b615224798
commit 96443d4dfc
18 changed files with 35709 additions and 34 deletions
+12 -3
View File
@@ -14,7 +14,7 @@
| 表示、位置与残差高速公路 | 完成首版 | 81% | 真实 hidden-state / norm traces、长上下文位置外推与深层稳定性消融 |
| Scaling Laws | 完成首版 | 74% | 真实拟合复现、置信区间与更多模型族对照 |
| 数据工程与预训练配方 | 完成首版 | 73% | FineWeb / DCLM 逐图精读、真实去重误伤与 mixture traces |
| DeepSeek 专题 | 三轮实证进行中 | 98% | V2-Lite-Chat 生成/行为对照、完整 27 层与固定 batch-content 对照,再推进 SM90 FlashMLA、FP8/pipeline 与 R1-like RL 复现 |
| DeepSeek 专题 | 四轮实证进行中 | 98% | completion-aware 生成评测、完整 27 层与固定 batch-content 对照,再推进 SM90 FlashMLA、FP8/pipeline 与 R1-like RL 复现 |
| 指令微调与人类偏好 | 完成首版 | 75% | 真实偏好分歧、RM 长度偏置与 PPO/DPO 小模型复现 |
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
| 工具使用与长程 Agent | 完成首版 | 74% | 真实环境 traces、cross-harness 对照、Agent RL 曲线与安全案例 |
@@ -41,7 +41,7 @@
- [x] 完成 486 篇关键论文索引,覆盖 16 个标签专题与 Kimi/DeepSeek 聚光主线。
- [x] 完成可检索、可按专题筛选的论文库页面。
- [x] 完成 K3、语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全十七篇首版长文。
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十七联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十四个原创交互视图。
- [x] 完成 K3 三轴架构、八联报告实验与四联开放工件实验、语言模型前史四联实验、Transformer 四联实验、表示深度四联实验、DeepSeek 十八联实验、长上下文、MoE 路由、推理三页签,以及训练系统、推理服务、Scaling、数据工程、数值、Alignment、Agent、原生多模态与评测安全专题各四页签等八十五个原创交互视图。
- [x] 完成长上下文首版:五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。
- [x] 核验 FlashAttention、DeepSeek-V2/V3.2/V4、Kimi Linear/K3 等六份论文原文,并建立长上下文研究账本。
- [x] 核验 Switch、ST-MoE、DeepSeekMoE、Loss-Free、V3、LatentMoE 与 K3 原文,并建立 MoE 研究账本。
@@ -234,11 +234,17 @@
- [x] 完整角色块正式运行与独立复跑各 66,975,110 bytes、SHA-256 均为 `a703dddb…7e82`,byte-exact;新增 2,044,224 次真实路由,使累计达到 11,289,744 次。两组 compact 产物分别约 1.4 / 3.3 MiB,累计正式实验集达到 10 / 10 byte-exact。
- [x] special family + 完整角色块本地闸门通过:73 个 Astro 文件零诊断,21 个页面、1,151 个站内引用、12 个跨页锚点零失败;十三页签桌面与 390px 移动端无运行时异常或文档级横向溢出,十六套真实 Chrome 专题回归全部通过。
- [x] DeepSeek special family + 完整角色块以源提交 `1d0a331`、不可变镜像 `20260729T134520Z-1d0a331` 发布;OCI digest `sha256:0c922769…3bfd5`,复用 NAS `12010→8080`、NPM host 31 / cert 41、门户 `LLM ATLAS / projects / 180`,HTTPS 与十六套生产 Chrome 回归全通过;保留 `20260729T124516Z-ea49ed0` 回滚。
- [x] DeepSeek Round 04 固定官方 `DeepSeek-V2-Lite-Chat` revision `85864749…f64c7`,核验 4 个 safetensors 分片与索引中的 `31,412,968,448` tensor bytes;完整 BF16 权重采用 GPU 25 层 + CPU 2 层、norm 与 lm_head 的显式 offload,设备字节账与官方 index 精确闭合。
- [x] 以 English / 中文 / code / math 各 4 个完整公开来源,执行 system 0/1 × EOS/BOS/x/句点 8 条件、共 128 个 greedy 输出;十条成对边分别报告 exact、共同前缀、编辑距离与 token similarity,不把单个特殊词元干预写成能力、遵循或路由解释。
- [x] 128 个输出中 31 个自然命中 EOS、97 个在 `max_new_tokens=128` 处截断;所有聚合永久同时显示 completion 状态,math 上的 2/4 system-EOS exact 仅是固定样本描述,不升级为领域能力结论。
- [x] 独立每域 1-source 复跑的 32 / 32 prompt hash、生成 token IDs、文本与 EOS 状态 exact;formal / repro 完整 JSON SHA-256 为 `54496955…b0e6196e` / `b74c3160…025b0c72`,模型配置、代码、tokenizer 与四个权重分片 hash 一并固化。
- [x] 第十八个 DeepSeek 交互实验将逐来源双输出、十边分歧图、29 单元设备切分与证据阶梯放到同一页;compact 构建器同时校验固定 revision、官方工件 hash 与 32 / 32 长复现合同。
- [x] DeepSeek Chat 行为层本地闸门通过:75 个 Astro 文件零诊断,21 个页面、1,151 个站内引用、12 个跨页锚点零失败;十四页签桌面与 390px 移动端无运行时异常或文档级横向溢出,十六套真实 Chrome 专题回归全部通过。
## 正在进行
- [ ] K3 三轮下一闸门:获得真实 token hidden states、expert load 与 cache traces,解释或修订 `A_log [128]` 工件冲突,再做 Figure 3/4/5 数值重绘和独立小模型复现。
- [ ] DeepSeek 三轮下一闸门:加入 V2-Lite-Chat 生成/行为对照;扩到完整 27 层并固定 batch content 审计,再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
- [ ] DeepSeek 四轮下一闸门:把 31 / 128 completion 提升为长度分层、可执行 evaluator 与更长生成预算;扩到完整 27 层并固定 batch content 审计,再推进 SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现。
- [ ] 表示、位置与残差二轮:真实 hidden-state / norm traces、长上下文位置外推复现与 mHC / AttnRes 深层稳定性消融。
- [ ] 评测安全二轮:真实 cross-harness / pass@k 复跑、Judge 元评测、动态污染与过拒案例。
- [ ] 推理服务二轮:真实 GPU kernel / workload traces、功耗与成本、跨 vLLM / SGLang / TensorRT-LLM 复现。
@@ -393,6 +399,9 @@
| 2026-07-29 | 角色块按 head × delimiter 分解 | `User:`/`Assistant:` 都是两个普通 IDs;head、delimiter、interaction 与四条 direct edges 分账,不把单位置作用冒充完整角色语义 |
| 2026-07-29 | target-content 与 full-input 永久分因果身份 | 精确对齐目标只观察编辑后的下游传播;完整输入包含被编辑 token 自身,因此方向变化不是主结果矛盾 |
| 2026-07-29 | DeepSeek 十三联工件实验以 `20260729T134520Z-1d0a331` 发布 | OCI digest `sha256:0c922769…3bfd5`;复用 NAS 12010→8080、NPM 31 / cert 41、门户 order 180;十六套生产 Chrome 回归通过,保留上一不可变镜像回滚 |
| 2026-07-29 | Chat checkpoint、生成行为与能力评测分三层 | 官方 SFT Chat 权重可以支撑真实生成;成对输出分歧只证明干预传播,未配任务 evaluator、样本置信区间与足够 completion 前不写成能力结论 |
| 2026-07-29 | 生成实验把 completion 设为首要审计字段 | 31 / 128 自然 EOS 与 97 / 128 长度截断分开报告;截断输出不被当作完整答案参与越界判断 |
| 2026-07-29 | CPU offload 是执行拓扑而非模型属性 | 31.4 GB BF16 工件不因本机 25-GPU-layer / 2-CPU-layer 切分而改变模型身份;设备映射、参数字节与峰值显存都进入复现合同 |
| 2026-07-29 | K3 二轮按 32 张对象账与完整报告顺序重建 | total/active、2.5×、KDA state、深度来源、专家路由、视觉目标、轨迹、缓存与评测协议不再压成一页组件摘要 |
| 2026-07-29 | K3 原生视觉事实回到 §2.4 / §3.3 核验 | 删除“先冻结语言模型再解冻”旧表述;明确 MoonViT-V2 从头训练,视觉/文本从开始共同 NTP |
| 2026-07-29 | K3 Figure 1–16 / Table 1–5 全部建立课程视觉契约 | 每张图同时写支持范围与不可外推项;作者报告、论文、推导与 toy model 使用 R/P/D/T 标签 |