Files
llm-atlas/research/SCALING_LAWS_RESEARCH.md
T
2026-07-29 01:41:40 +08:00

621 lines
26 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# LLM Scaling Laws 研究账本
> 状态:第一轮证据框架
> 研究截止:2026-07-29
> 课程位置:专题 04「Scaling Laws:规模为什么有效」
> 目标:先解释“我们到底在缩放什么、优化什么”,再讨论 Kaplan、Chinchilla、过训练、数据约束、涌现争议,以及 DeepSeek / Kimi 如何真的使用 scaling study。
> 原则:正文关键事实来自 P0 论文 / 正式技术报告或 P1 作者实现;Grok 只提供 discovery leads。
---
## 0. 本章不是“大模型越大越好”
Scaling law 是在一个明确实验族、数据分布、训练配方和指标下,用小规模实验拟合规模变化规律,再外推更昂贵训练的工程工具。
本章必须同时回答:
1. 横轴是参数、Token、训练 FLOPs、推理请求,还是 RL / test-time compute
2. 纵轴是交叉熵、bits-per-byte、平均下游错误率,还是某个离散 benchmark;
3. “最优”是在固定训练算力下最小化 loss,还是最小化训练与部署总成本;
4. 参数是总参数、非 embedding 参数、每 Token 激活参数,还是 non-embedding FLOPs/token
5. 数据是训练中看过的 Token、唯一 Token、重复 Token,还是经过质量与合成处理后的“有效数据”;
6. 拟合是否覆盖目标规模,是否报告 bootstrap / confidence interval
7. 架构、优化器、学习率、batch、warmup、tokenizer 和数据分布是否保持可比;
8. 平滑 loss 能否预测单个下游任务,所谓“涌现”是否来自指标本身;
9. Dense、MoE、多模态、后训练与推理时扩展能否放在同一条曲线上。
一句话总纲:
> Scaling law 不是自然常数,而是带条件的经验地图;地图能帮助规划路线,但不能替代目标函数、坐标定义和误差条。
---
## 1. 九张不能混在一起的账
| 账本 | 问题 | 常用量 | 最容易犯的错 |
|---|---|---|---|
| L1 观测量 | “变好”具体指什么 | CE loss、NLL、perplexity、BPB、task error | 跨 tokenizer 直接比较 perplexity |
| L2 模型规模 | 模型有多大 | total / non-embedding / active parameters | MoE 只报总参数或只报激活参数 |
| L3 数据规模 | 训练看到了什么 | seen / unique / repeated Token、epoch | 把重复 Token 当等价的新 Token |
| L4 算术量 | 理论做了多少计算 | training FLOPs、FLOPs/token | 把硬件峰值、GPU hour 与理论 FLOPs 混写 |
| L5 配比 | 固定预算怎样分 N 与 D | TPP、IsoFLOP frontier | 把 “约 20 Token/参数”当永久常数 |
| L6 配方 | 哪些超参数随规模改变 | batch、LR、warmup、schedule、shape | 用同一组超参比较不同 schedule |
| L7 外推 | 小实验能否预测大实验 | exponent、residual、CI、hold-out | 只展示拟合内误差,不做真正外推 |
| L8 经济目标 | 训练后要服务多少次 | train + inference compute / cost | 把训练最优当部署最优 |
| L9 能力与阶段 | loss 以外出现了什么 | aggregate error、task score、RL/test compute | 把不连续指标的阶跃叫物理相变 |
本章所有图、公式与互动实验都必须标明自己在付哪张账。
---
## 2. 坐标系与最小公式
### 2.1 四个基本符号
- `N`:模型规模。必须注明是 total、non-embedding,还是 active parameters。
- `D`:训练数据规模。通常是训练过程中处理的 Token 数,不自动等于唯一语料量。
- `C`:训练计算量。Dense Transformer 常用 `C ≈ 6ND` 作为一阶近似。
- `L`:被拟合的损失或误差。必须注明数据集、tokenizer 和聚合方式。
`6ND` 的边界:
- `6` 来自 Dense Transformer 参数在一次 Token 训练中的前向与反向近似;
- 长序列 attention、重计算、embedding / vocabulary、路由和其他算子会改变常数;
- MoE 不能把 total parameters 直接代入;
- 它不等于设备峰值 FLOP/s,也不等于真实 GPU hours
- DeepSeek LLM 因而改用 non-embedding FLOPs/token `M`,写成 `C = MD`
### 2.2 单轴幂律
最简形式:
```text
L(x) = L∞ + A · x^-α
```
直觉:
- `L∞`:即使继续扩大规模也无法由当前模型族消掉的 irreducible floor
- `A`:当前数据、架构和 tokenizer 决定的垂直位移;
- `α`log-log 图上的下降斜率;
- `α` 很小仍可在跨多个数量级时积累巨大收益。
它不是说每一个任务都平滑,也不是说同一指数跨数据、架构和优化器不变。
### 2.3 Chinchilla 型双轴损失面
Hoffmann 等人的 Approach 3 使用:
```text
L(N, D) = E + A / N^α + B / D^β
```
`C ≈ 6ND` 约束下,最优 frontier 有:
```text
Nopt(C) ∝ C^[β / (α + β)]
Dopt(C) ∝ C^[α / (α + β)]
```
关键不是背指数,而是看两种可约误差:
- 模型太小:`A / N^α` 主导;
- 数据太少 / 训练不够:`B / D^β` 主导;
- 固定算力时增加一边会挤压另一边,IsoFLOP 谷底就是两者的折中。
### 2.4 IsoFLOP 不等于“训练一次画条线”
标准流程:
1. 选多个固定 compute budget
2. 每个 budget 下训练多种 `N × D` 配比;
3. 每条 IsoFLOP 曲线找 loss 最小点;
4. 用这些最小点拟合 `Nopt(C)``Dopt(C)`
5. 用未参与拟合的更大 run 检查外推;
6. 报告拟合残差、不确定性和超参数搜索方法。
真正昂贵的是:每个 budget 都要有足够多的点覆盖谷底两侧。
---
## 3. 历史主线
### 3.1 20172019:幂律先于“大语言模型”
#### Hestness et al. 2017
[Deep Learning Scaling is Predictable, Empirically](https://arxiv.org/abs/1712.00409) 在语言、视觉、语音和机器翻译等任务上观察到泛化误差随数据规模呈稳定幂律。
贡献:
- 把“多给数据通常更好”变成可以拟合和外推的曲线;
- 提出不同任务有不同指数与不可约误差;
- 说明缩放规律不是 Transformer 或 LLM 出现后才有。
边界:
- 任务与架构跨度大,不能把某一指数直接移植到现代 LLM;
- 主要说明经验可预测性,不回答现代 `NDC` 最优分配。
#### McCandlish et al. 2018
[An Empirical Model of Large-Batch Training](https://arxiv.org/abs/1812.06162) 用 gradient noise scale 连接 batch size、步数和算力效率。
它进入本章的原因:
- 训练规模不仅由 `N``D` 决定;
- batch 太小会浪费并行机会,太大则新增样本对一步更新的边际价值下降;
- Kaplan 与 DeepSeek 后来的 scaling study 都必须处理 batch / LR 的规模依赖。
这不是 loss scaling law,不能用它直接预测最终语言模型能力。
### 3.2 2020Kaplan 建立经典 LLM scaling 坐标系
[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361) 在 WebText2 与一族 Transformer 上拟合:
- 参数受限:`L(N) = (Nc / N)^αN`,报告 `αN ≈ 0.076`
- 数据受限:`L(D) = (Dc / D)^αD`,报告 `αD ≈ 0.095`
- 计算受限最优曲线:`αCmin ≈ 0.050`
- 其配方下的 compute-optimal 结论更偏向增大模型,报告 `Nopt ∝ C^0.73`
必须保留的限定:
- `N` 是 non-embedding parameters
- 常数依赖 WebText2、词表和 tokenizer
- 论文使用的 warmup、last-layer FLOPs 计数和优化器调参后来被证明会影响最优指数;
- 这是 2020 实验族的结论,不是“模型永远应比数据增长更快”。
### 3.3 20202022:跨模态幂律与大模型实证
[Scaling Laws for Autoregressive Generative Modeling](https://arxiv.org/abs/2010.14701) 将经验幂律扩展到图像、视频、数学等自回归生成任务,说明“平滑缩放”具有跨模态共性,但指数依赖模态与数据。
Gopher 与 PaLM 是规模实践节点:
- [Gopher](https://arxiv.org/abs/2112.11446) 展示 280B Dense 模型的任务分化;
- [PaLM](https://arxiv.org/abs/2204.02311) 展示 540B 规模与部分任务的非平滑行为;
- 它们不是 compute-optimal 定律本身,但为 Chinchilla 的反例式比较和 emergent abilities 讨论提供背景。
### 3.4 2022Chinchilla 改写“最优分配”
[Training Compute-Optimal Large Language Models](https://arxiv.org/abs/2203.15556) 用三种方法研究固定训练 FLOPs 下如何分配参数与 Token。
原论文表 2
| 方法 | `Nopt ∝ C^a` | `Dopt ∝ C^b` |
|---|---:|---:|
| 训练曲线最小值 | 0.50 | 0.50 |
| IsoFLOP profiles | 0.49 | 0.51 |
| parametric loss fit | 0.46 | 0.54 |
| Kaplan 2020 对照 | 0.73 | 0.27 |
“20 Token / parameter”的正确教法:
- 表 3 中 1B 对应约 20.2B Token、10B 对应约 205.1B、67B 对应约 1.5T
- 它是该论文实验与拟合范围内的实用近似;
- 不是跨 tokenizer、数据质量、优化器、MoE、部署需求都不变的常数;
- Chinchilla 的核心结论是参数与数据应近似同比例扩展,而不是要求所有模型严格停在 20 TPP。
### 3.5 20222023:涌现、指标与折断幂律
[Emergent Abilities of Large Language Models](https://arxiv.org/abs/2206.07682) 把“小模型近随机、大模型突然明显变好”的任务表现系统化。
[Are Emergent Abilities of Large Language Models a Mirage?](https://arxiv.org/abs/2304.15004) 说明:
- exact match、multiple-choice grade 等不连续或非线性指标可以把平滑的 per-token 误差改善变成阶跃;
- token edit distance、Brier score 等连续指标可能恢复平滑曲线;
- 因而“图上突然跳升”不自动证明内部发生相变。
不能过度外推:
- Mirage 论文没有证明所有涌现都不存在;
- 新机制、数据阈值、grokking 或工具使用仍可能产生真实 regime change
- 正确结论是先检查指标与采样方差,再谈能力相变。
[Broken Neural Scaling Laws](https://arxiv.org/abs/2210.14891) 用 smoothly broken power law 表达 plateau、拐点、double descent 或新的下降斜率。
风险:
- 更灵活的函数也更容易在数据稀少时过拟合;
- 需要留出外推点,而不只比较训练集拟合误差;
- “能拟合拐点”不等于提前知道拐点为何出现。
### 3.6 2023–2025:唯一数据、过训练与部署目标
#### 数据受限
[Scaling Data-Constrained Language Models](https://arxiv.org/abs/2305.16264) 区分:
- `UD`unique data
- `RD`repetition count
- `D = UD × (RD + 1)`:训练实际处理的总 Token。
论文在 10M9B 参数、最多 900B training Token 的研究范围内报告:
- 单 epoch 的每算力 validation loss 最优;
- 最多约 4 epoch 的重复数据与使用同量 unique data 的差距可很小;
- 继续重复仍可能有收益,但边际收益最终趋近于零;
- 数据受限时,应同时增加模型规模与训练 epoch,而不是只重复或只增参数。
这些是该实验范围的结论,不能写成“任何数据重复四遍都无害”。
2026 年的 [Data-Constrained Language Model Pretraining](https://arxiv.org/abs/2606.06888) 提出 SoftQ,将模型与数据项耦合以处理有限 unique data 下的重复训练,并研究 masked-input regularization。它是新的前沿修正,首版应与经典结果分层呈现,避免用单篇新论文覆盖已有证据。
#### 过训练
[Language models scale reliably with over-training and on downstream tasks](https://arxiv.org/abs/2403.08540)
- 训练 104 个、11M6.9B 参数模型;
- 覆盖 C4、RedPajama、RefinedWeb
- 用 token multiplier `M = D/N` 描述 over-training
- 报告不同 multiplier 下 reducible loss 的 log-log 线近似平行;
- 能从低约 300× compute 的实验预测其目标 over-trained run 的 validation loss
- aggregate downstream error 比单个任务更可预测。
边界:
- “平均 17/46 个任务”平滑,不代表每个任务都可精确预测;
- 数据分布改变会移动曲线;
- 预测建立在不 under-train、实验族可比的条件上。
2025 年 [Overtrained Language Models Are Harder to Fine-Tune](https://arxiv.org/abs/2503.19206) 提醒:更低 pretraining loss 不保证更好的后续可塑性。课程应把“base loss 最优”和“post-training 后最终能力最优”分成两张账。
#### 把推理也计入
[Beyond Chinchilla-Optimal](https://arxiv.org/abs/2401.00448) 把总目标改为:
```text
total cost = pretraining cost + inference demand × per-request inference cost
```
论文结论的正确范围:
- 在其硬件、成本和请求量假设下,高推理需求会把最优点推向更小模型、更长训练;
- 论文训练 47 个 150M6B 模型,探索 1010,000 TPP
- 在研究范围内未观察到 loss 因极高 TPP 完全停止改善;
- 不能把“约十亿请求”当所有业务的固定转折点。
### 3.7 2024Chinchilla 复现与 KaplanChinchilla 和解
[Chinchilla Scaling: A replication attempt](https://arxiv.org/abs/2404.10102) 指出:
- 原论文 Approach 3 的正文参数、TeX 参数与拟合数据存在不一致问题;
- 报告的置信区间过窄;
- 重新拟合后仍可与 Approach 1 / 2 的近等比例扩展结论相容。
所以正确结论不是“Chinchilla 被推翻”,而是:
- 核心近等比例结论较稳;
- 某一组精确系数与极窄 CI 不应当作不可争议常数;
- 论文复现必须保存数据、拟合代码、版本和停止条件。
[Resolving Discrepancies in Compute-Optimal Scaling of Language Models](https://arxiv.org/abs/2406.19146) 复现 Kaplan 风格实验并识别三类差异来源:
1. last layer computational cost 的计数;
2. warmup duration
3. scale-dependent optimizer tuning。
修正后结果向 Chinchilla 靠拢。它提供一个重要方法论:
> scaling exponent 既反映模型与数据,也反映训练 recipe 是否在各规模上公平调优。
### 3.8 20242026:从单一 loss 到 task ladder 与新拟合目标
- [Optimization Hyper-parameter Laws](https://arxiv.org/abs/2409.04777) 把动态学习率 schedule 纳入可预测对象;
- [Establishing Task Scaling Laws via Compute-Efficient Model Ladders](https://arxiv.org/abs/2412.04403) 用两阶段方法从模型/数据预测 task loss,再从 task loss 预测任务表现;
- 单个任务方差更大,任务指标不能无条件由通用 validation loss 替代;
- 首版应展示“可预测性层级”,而非声称一个公式预测所有能力。
---
## 4. DeepSeek:把 scaling study 变成训练前的工程搜索
### 4.1 DeepSeek LLM 的关键改变
[DeepSeek LLM](https://arxiv.org/abs/2401.02954) §3 不只拟合最终 loss,还先搜索超参数。
#### 超参数缩放
论文报告:
```text
ηopt = 0.3118 · C^-0.1250
Bopt = 0.2920 · C^0.3271
```
这些系数的正确边界:
- `C`、batch 和 LR 使用论文自己的单位与配方;
- 它们是 DeepSeek LLM 实验族的经验拟合,不是可直接复制到任意模型的默认值;
- 论文承认同 compute、不同 model/data allocation 的近优超参数空间也会略变。
#### 用 `M` 替代参数数
论文定义 non-embedding FLOPs/token
```text
M = 72 · n_layer · d_model²
+ 12 · n_layer · d_model · l_seq
C = M · D
```
动机:
- `6N_non-embedding` 忽略 attention 随序列长度的计算;
- `6N_total` 又把 vocabulary computation 计入“容量”;
- 小模型上两种参数代理相对真实 `M` 的误差尤其明显。
其 IsoFLOP 拟合报告:
```text
Mopt = 0.1715 · C^0.5243
Dopt = 5.8316 · C^0.4757
```
仍然必须保留:
- 数据质量改变时,论文 §3.3 的 exponent 也改变;
- BPB、tokenizer 与数据分布定义不可省略;
- `M` 是 Dense LLaMA-like 实验族的算术代理,不自动解决 MoE 比较。
### 4.2 DeepSeekMoE → V2 → V3 → V4 的 scaling 含义
这一谱系不应被压成同一条 `ND` 曲线:
| 节点 | 新的缩放变量 | 不能省略的账 |
|---|---|---|
| DeepSeekMoE | total vs active parameters | 路由、负载、通信 |
| DeepSeek-V2 | MLA + 稀疏专家 | KV / 激活参数 / 训练经济性 |
| DeepSeek-V3 | 671B total / 37B active、14.8T Token | FP8、DualPipe、硬件与系统效率 |
| DeepSeek-V4 | 1M context hybrid attention、Muon、mHC | context cost、训练 recipe 与 preview 边界 |
DeepSeek 专题的亮点不是“参数越来越大”,而是:
- 用 scaling study 决定 model/data/hyperparameter
- 用 MoE 改变容量与每 Token 计算的关系;
- 用 MLA / hybrid attention 改变上下文与服务成本;
- 用低精度和系统共设计缩小理论 FLOPs 与实际成本之间的差距。
---
## 5. KimiK2 的 token efficiency 到 K3 的 family-level scaling
### 5.1 Kimi K2
[Kimi K2](https://arxiv.org/abs/2507.20534) 把“高质量自然数据有限”作为缩放约束:
- 1T-class MoE32.6B activated parameters
- 报告在 15.5T curated Token 上预训练;
- 用 MuonClip 追求 token efficiency 与稳定性;
- 用 knowledge / mathematics rephrasing 增加同一来源的表达与视角;
- 用 sparsity scaling law 选择专家稀疏度;
- 训练 recipe 使用 WSD 主阶段与后续 cosine decay。
边界:
- rephrasing 的收益是报告实验,不等于合成数据永远等价于新自然数据;
- sparsity scaling 需同时计激活计算、总容量、路由与系统开销;
- “zero loss spike”是该训练运行的作者报告。
### 5.2 Kimi K3
[Kimi K3](https://arxiv.org/abs/2607.24653) §3.2 的 scaling study
- 新模型族同时包含 KDA、AttnRes、Stable LatentMoE、数据与训练 recipe
- 重新搜索 batch size、learning rate、TPP 与 model shape
- 用 held-out OOD validation data 拟合 K2 / K3 曲线;
- Figure 7 报告 K3 相对 K2 约 `2.5× overall scaling efficiency`
- cosine 与 WSD 各自独立搜索最优超参数后,报告选择 cosine。
`2.5×` 必须这样写:
- 是 K3 作者在其验证 lossFLOPs 曲线上的 family-level 报告;
- 是架构、数据与训练 recipe 的合计,不是某一个组件的独立消融;
- 不是“参数效率 2.5×”“吞吐 2.5×”或“所有 benchmark 2.5×”;
- 不是第三方独立复现;
- Figure 7 没有公开足以独立重建曲线的所有原始 run 点与拟合细节。
K3 对学习率 schedule 的方法论尤其重要:
> 如果 cosine 与 WSD 的最优 peak LR 和 batch 不同,用一套共享超参比较会系统性偏袒其中一方。
这与 2024 年 KaplanChinchilla 和解论文形成呼应:scale-aware tuning 不是“实现细节”,它能改变看见的 scaling law。
---
## 6. 网站叙事与视觉草案
### 6.1 章节问题链
1. 为什么 log-log 图常是一条直线;
2. 参数、数据、算力为什么不能只看一个;
3. Kaplan 为什么得出“大模型优先”;
4. Chinchilla 为什么把结论改成“参数与数据一起长”;
5. 20 TPP 为什么是历史经验点,不是自然常数;
6. 数据重复、过训练与部署需求如何移动最优点;
7. 涌现是真变化还是指标折射;
8. Dense、MoE、长上下文与 RL 为什么需要新坐标;
9. DeepSeek 与 Kimi 如何在真实项目里做 scaling study
10. 怎样判断一张 scaling 图是否可信。
### 6.2 至少 12 个原创机制图
1. `NDC` 三轴与 `C = 6ND` 约束面;
2. log-log 幂律斜率与 diminishing returns
3. Chinchilla 损失分解的三块堆叠;
4. 多条 IsoFLOP 曲线与谷底 frontier
5. Kaplan / Chinchilla 最优射线对照;
6. 20 TPP 尺子与“不是常数”警告;
7. unique / repeated / effective Token 三个水箱;
8. train-optimal / deployment-optimal 双目标;
9. 平滑 per-token error 如何被 exact match 变成阶跃;
10. single power law 与 broken power law
11. Dense / MoE 的 total-active-compute 三联表;
12. DeepSeek / Kimi 双谱系时间河;
13. scale-aware hyperparameter search 网格;
14. K3 Figure 7 的不带伪数据概念重绘:同 loss 的横向 FLOPs 差。
### 6.3 四个独立交互实验
#### Tab AScaling Surface
输入:
- compute budget
- `α / β`
- irreducible loss
- model / data cost 系数。
输出:
- `N × D` loss surface
- IsoFLOP curve
- compute-optimal point
- 当前选择相对最优多花的 FLOPs。
#### Tab BTrain vs Serve
输入:
- 目标质量;
- 请求数;
- 平均输入 / 输出 Token
- 每参数推理成本近似。
输出:
- 仅训练最优;
- 训练 + 推理总成本最优;
- 请求增多时模型更小、训练更长的移动轨迹。
必须标 deterministic teaching model,不冒充任何云价格或真实 GPU benchmark。
#### Tab CData Reuse
输入:
- unique Token
- epochs
- 重复 Token 衰减率;
- 合成 / 改写增益假设。
输出:
- seen Token 与 effective Token 分离;
- 单 epoch、四 epoch 与高重复区;
- 数据受限时继续增参数 / 增 epoch 的取舍。
#### Tab DEmergence Lens
同一条平滑 per-token correct probability
- token edit distance
- sequence exact match
- multiple-choice threshold
- 多次采样 pass@k
让读者看到指标变换如何制造或消除阶跃。
---
## 7. 第一轮一手来源矩阵
新缓存于本地忽略目录 `research/sources/scaling-laws/` 的 22 份论文:
| ID | 年 | 作用 | 首轮状态 |
|---|---:|---|---|
| `1712.00409` | 2017 | 跨任务可预测 scaling | 已缓存 / 摘要与主结论核验 |
| `1812.06162` | 2018 | gradient noise / critical batch | 已缓存 / 摘要核验 |
| `2001.08361` | 2020 | Kaplan 经典 LLM 幂律 | 已缓存 / §1、§4、§6 核验 |
| `2010.14701` | 2020 | 自回归生成跨模态 scaling | 已缓存 / 摘要核验 |
| `2112.11446` | 2021 | Gopher 规模实践 | 已缓存 / 摘要核验 |
| `2203.15556` | 2022 | Chinchilla compute-optimal | 已缓存 / §3、表 23 核验 |
| `2204.02311` | 2022 | PaLM 与规模实证 | 已缓存 / 摘要核验 |
| `2206.07682` | 2022 | emergent abilities | 已缓存 / 摘要核验 |
| `2210.14891` | 2022 | broken scaling laws | 已缓存 / 摘要与限制核验 |
| `2302.13971` | 2023 | LLaMA 小模型长训练 | 已缓存 / 摘要核验 |
| `2304.15004` | 2023 | emergence metric mirage | 已缓存 / 主实验核验 |
| `2305.16264` | 2023 | data-constrained scaling | 已缓存 / §13 核验 |
| `2401.00448` | 2024 | inference-aware scaling | 已缓存 / §15 核验 |
| `2401.02954` | 2024 | DeepSeek LLM scaling | 已缓存 / §3 核验 |
| `2403.08540` | 2024 | over-training / downstream | 已缓存 / §13、限制核验 |
| `2404.10102` | 2024 | Chinchilla replication | 已缓存 / 全文主结论核验 |
| `2404.19484` | 2024 | compute-allocation 假说 | 已缓存 / 仅作争议节点 |
| `2406.19146` | 2024 | KaplanChinchilla reconciliation | 已缓存 / §13 核验 |
| `2409.04777` | 2024 | optimization hyperparameter laws | 已缓存 / 摘要核验 |
| `2412.04403` | 2024 | task scaling / model ladders | 已缓存 / 摘要核验 |
| `2503.19206` | 2025 | catastrophic overtraining | 已缓存 / 摘要核验 |
| `2606.06888` | 2026 | SoftQ / data-constrained frontier | 已缓存 / 摘要与方法核验 |
复用已有正式来源:
- DeepSeek-V2 `2405.04434`
- DeepSeek-V3 `2412.19437`
- DeepSeek-V4 `2606.19348`
- Kimi K2 `2507.20534`
- Kimi K3 `2607.24653`
- Kimi k1.5 `2501.12599`
- 训练系统、MoE、长上下文与推理专题已经核验的交叉来源。
---
## 8. Grok 线索的保留与纠错
Grok Headless 用于扩展候选论文、视觉和互动方案。其输出明确降级为未核验 leads。
已发现的错误:
- Grok 称“K3 正式 scaling 论文需核验是否存在 / 公开技术边界不清”;
- 实际已有 2026-07-27 提交的正式 arXiv 技术报告 `2607.24653`
- 本地已有同一 47 页报告,§3.2 与 Figure 7 明确描述 scaling study。
处理规则:
- Grok 的年代、模型数字、公式、URL 不直接进入网站;
- 候选节点必须打开 P0 / P1
- 无法回查的产品说法删掉,而不是降格成模糊事实;
- 线索包错误也保留在研究记录中,作为为什么必须做来源分级的实例。
---
## 9. 高风险事实闸门
- [x] Kaplan 的 `N` 限定为 non-embedding parameters。
- [x] Kaplan 的 0.73 / 0.27 限定在其 compute-optimal recipe。
- [x] Chinchilla 三种 approach 的指数分别抄回表 2。
- [x] “约 20 TPP”写成论文范围内 heuristic,不写成常数。
- [x] Chinchilla replication 的结论写成“精确拟合有问题,核心近等比例结论未被推翻”。
- [x] KaplanChinchilla 差异包含 last-layer FLOPs、warmup、scale-aware optimizer tuning。
- [x] `C ≈ 6ND` 明确是 Dense 近似。
- [x] DeepSeek `M``C = MD` 的定义回查 §3.2。
- [x] DeepSeek batch / LR law 保留实验族与单位边界。
- [x] unique、seen、repeated、effective Token 分开。
- [x] “最多约 4 epoch 差距很小”限定 Muennighoff 实验范围。
- [x] inference-aware optimum 限定请求量、成本与硬件假设。
- [x] aggregate task error 与 individual task prediction 分开。
- [x] emergence 与 metric-induced emergence 并列,不做全称判断。
- [x] Dense 与 MoE 的 total / active parameters 分开。
- [x] K2 rephrasing 不写成无限合成数据定律。
- [x] K3 2.5× 写成 family-level、OOD validation、author-reported。
- [x] K3 cosine / WSD 是各自独立调参后的报告结论。
- [x] Grok 对 K3 的错误已隔离,不进入正式结论。
- [ ] 22 份新论文逐篇完成图表与实验段落精读。
- [ ] 所有网站数字都有邻近来源与版本号。
- [ ] 设计并实现四个 teaching-model 交互的单元与浏览器断言。
- [ ] desktop / mobile / keyboard / reduced-motion 验证。
- [ ] 生产镜像与公开仓库全链发布验证。
## 10. 首版页面完成闸门
- [ ] 初学者能解释 log-log 直线与 diminishing returns。
- [ ] 能区分 `N / D / C / L` 及各自口径。
- [ ] 能在 IsoFLOP 图上找到 compute-optimal point。
- [ ] 能说明 Kaplan 与 Chinchilla 为什么看似矛盾。
- [ ] 能说明 20 TPP 为什么不是自然常数。
- [ ] 能区分 train-optimal、serve-optimal 与 data-constrained optimum。
- [ ] 能用连续指标解释至少一个“伪涌现”案例。
- [ ] 能解释 DeepSeek 为什么用 FLOPs/token `M`
- [ ] 能解释 K3 2.5× claim 的真实口径与证据边界。
- [ ] 四个互动实验均能触发一个反直觉场景。
- [ ] 类型检查、链接、浏览器、容器和生产验证全部通过。