Files
llm-atlas/research/SCALING_LAWS_RESEARCH.md
2026-07-29 01:41:40 +08:00

26 KiB
Raw Permalink Blame History

LLM Scaling Laws 研究账本

状态:第一轮证据框架
研究截止:2026-07-29
课程位置:专题 04「Scaling Laws:规模为什么有效」
目标:先解释“我们到底在缩放什么、优化什么”,再讨论 Kaplan、Chinchilla、过训练、数据约束、涌现争议,以及 DeepSeek / Kimi 如何真的使用 scaling study。
原则:正文关键事实来自 P0 论文 / 正式技术报告或 P1 作者实现;Grok 只提供 discovery leads。


0. 本章不是“大模型越大越好”

Scaling law 是在一个明确实验族、数据分布、训练配方和指标下,用小规模实验拟合规模变化规律,再外推更昂贵训练的工程工具。

本章必须同时回答:

  1. 横轴是参数、Token、训练 FLOPs、推理请求,还是 RL / test-time compute
  2. 纵轴是交叉熵、bits-per-byte、平均下游错误率,还是某个离散 benchmark;
  3. “最优”是在固定训练算力下最小化 loss,还是最小化训练与部署总成本;
  4. 参数是总参数、非 embedding 参数、每 Token 激活参数,还是 non-embedding FLOPs/token
  5. 数据是训练中看过的 Token、唯一 Token、重复 Token,还是经过质量与合成处理后的“有效数据”;
  6. 拟合是否覆盖目标规模,是否报告 bootstrap / confidence interval
  7. 架构、优化器、学习率、batch、warmup、tokenizer 和数据分布是否保持可比;
  8. 平滑 loss 能否预测单个下游任务,所谓“涌现”是否来自指标本身;
  9. Dense、MoE、多模态、后训练与推理时扩展能否放在同一条曲线上。

一句话总纲:

Scaling law 不是自然常数,而是带条件的经验地图;地图能帮助规划路线,但不能替代目标函数、坐标定义和误差条。


1. 九张不能混在一起的账

账本 问题 常用量 最容易犯的错
L1 观测量 “变好”具体指什么 CE loss、NLL、perplexity、BPB、task error 跨 tokenizer 直接比较 perplexity
L2 模型规模 模型有多大 total / non-embedding / active parameters MoE 只报总参数或只报激活参数
L3 数据规模 训练看到了什么 seen / unique / repeated Token、epoch 把重复 Token 当等价的新 Token
L4 算术量 理论做了多少计算 training FLOPs、FLOPs/token 把硬件峰值、GPU hour 与理论 FLOPs 混写
L5 配比 固定预算怎样分 N 与 D TPP、IsoFLOP frontier 把 “约 20 Token/参数”当永久常数
L6 配方 哪些超参数随规模改变 batch、LR、warmup、schedule、shape 用同一组超参比较不同 schedule
L7 外推 小实验能否预测大实验 exponent、residual、CI、hold-out 只展示拟合内误差,不做真正外推
L8 经济目标 训练后要服务多少次 train + inference compute / cost 把训练最优当部署最优
L9 能力与阶段 loss 以外出现了什么 aggregate error、task score、RL/test compute 把不连续指标的阶跃叫物理相变

本章所有图、公式与互动实验都必须标明自己在付哪张账。


2. 坐标系与最小公式

2.1 四个基本符号

  • N:模型规模。必须注明是 total、non-embedding,还是 active parameters。
  • D:训练数据规模。通常是训练过程中处理的 Token 数,不自动等于唯一语料量。
  • C:训练计算量。Dense Transformer 常用 C ≈ 6ND 作为一阶近似。
  • L:被拟合的损失或误差。必须注明数据集、tokenizer 和聚合方式。

6ND 的边界:

  • 6 来自 Dense Transformer 参数在一次 Token 训练中的前向与反向近似;
  • 长序列 attention、重计算、embedding / vocabulary、路由和其他算子会改变常数;
  • MoE 不能把 total parameters 直接代入;
  • 它不等于设备峰值 FLOP/s,也不等于真实 GPU hours
  • DeepSeek LLM 因而改用 non-embedding FLOPs/token M,写成 C = MD

2.2 单轴幂律

最简形式:

L(x) = L∞ + A · x^-α

直觉:

  • L∞:即使继续扩大规模也无法由当前模型族消掉的 irreducible floor
  • A:当前数据、架构和 tokenizer 决定的垂直位移;
  • αlog-log 图上的下降斜率;
  • α 很小仍可在跨多个数量级时积累巨大收益。

它不是说每一个任务都平滑,也不是说同一指数跨数据、架构和优化器不变。

2.3 Chinchilla 型双轴损失面

Hoffmann 等人的 Approach 3 使用:

L(N, D) = E + A / N^α + B / D^β

C ≈ 6ND 约束下,最优 frontier 有:

Nopt(C) ∝ C^[β / (α + β)]
Dopt(C) ∝ C^[α / (α + β)]

关键不是背指数,而是看两种可约误差:

  • 模型太小:A / N^α 主导;
  • 数据太少 / 训练不够:B / D^β 主导;
  • 固定算力时增加一边会挤压另一边,IsoFLOP 谷底就是两者的折中。

2.4 IsoFLOP 不等于“训练一次画条线”

标准流程:

  1. 选多个固定 compute budget
  2. 每个 budget 下训练多种 N × D 配比;
  3. 每条 IsoFLOP 曲线找 loss 最小点;
  4. 用这些最小点拟合 Nopt(C)Dopt(C)
  5. 用未参与拟合的更大 run 检查外推;
  6. 报告拟合残差、不确定性和超参数搜索方法。

真正昂贵的是:每个 budget 都要有足够多的点覆盖谷底两侧。


3. 历史主线

3.1 2017–2019:幂律先于“大语言模型”

Hestness et al. 2017

Deep Learning Scaling is Predictable, Empirically 在语言、视觉、语音和机器翻译等任务上观察到泛化误差随数据规模呈稳定幂律。

贡献:

  • 把“多给数据通常更好”变成可以拟合和外推的曲线;
  • 提出不同任务有不同指数与不可约误差;
  • 说明缩放规律不是 Transformer 或 LLM 出现后才有。

边界:

  • 任务与架构跨度大,不能把某一指数直接移植到现代 LLM;
  • 主要说明经验可预测性,不回答现代 NDC 最优分配。

McCandlish et al. 2018

An Empirical Model of Large-Batch Training 用 gradient noise scale 连接 batch size、步数和算力效率。

它进入本章的原因:

  • 训练规模不仅由 ND 决定;
  • batch 太小会浪费并行机会,太大则新增样本对一步更新的边际价值下降;
  • Kaplan 与 DeepSeek 后来的 scaling study 都必须处理 batch / LR 的规模依赖。

这不是 loss scaling law,不能用它直接预测最终语言模型能力。

3.2 2020Kaplan 建立经典 LLM scaling 坐标系

Scaling Laws for Neural Language Models 在 WebText2 与一族 Transformer 上拟合:

  • 参数受限:L(N) = (Nc / N)^αN,报告 αN ≈ 0.076
  • 数据受限:L(D) = (Dc / D)^αD,报告 αD ≈ 0.095
  • 计算受限最优曲线:αCmin ≈ 0.050
  • 其配方下的 compute-optimal 结论更偏向增大模型,报告 Nopt ∝ C^0.73

必须保留的限定:

  • N 是 non-embedding parameters
  • 常数依赖 WebText2、词表和 tokenizer
  • 论文使用的 warmup、last-layer FLOPs 计数和优化器调参后来被证明会影响最优指数;
  • 这是 2020 实验族的结论,不是“模型永远应比数据增长更快”。

3.3 2020–2022:跨模态幂律与大模型实证

Scaling Laws for Autoregressive Generative Modeling 将经验幂律扩展到图像、视频、数学等自回归生成任务,说明“平滑缩放”具有跨模态共性,但指数依赖模态与数据。

Gopher 与 PaLM 是规模实践节点:

  • Gopher 展示 280B Dense 模型的任务分化;
  • PaLM 展示 540B 规模与部分任务的非平滑行为;
  • 它们不是 compute-optimal 定律本身,但为 Chinchilla 的反例式比较和 emergent abilities 讨论提供背景。

3.4 2022Chinchilla 改写“最优分配”

Training Compute-Optimal Large Language Models 用三种方法研究固定训练 FLOPs 下如何分配参数与 Token。

原论文表 2

方法 Nopt ∝ C^a Dopt ∝ C^b
训练曲线最小值 0.50 0.50
IsoFLOP profiles 0.49 0.51
parametric loss fit 0.46 0.54
Kaplan 2020 对照 0.73 0.27

“20 Token / parameter”的正确教法:

  • 表 3 中 1B 对应约 20.2B Token、10B 对应约 205.1B、67B 对应约 1.5T
  • 它是该论文实验与拟合范围内的实用近似;
  • 不是跨 tokenizer、数据质量、优化器、MoE、部署需求都不变的常数;
  • Chinchilla 的核心结论是参数与数据应近似同比例扩展,而不是要求所有模型严格停在 20 TPP。

3.5 2022–2023:涌现、指标与折断幂律

Emergent Abilities of Large Language Models 把“小模型近随机、大模型突然明显变好”的任务表现系统化。

Are Emergent Abilities of Large Language Models a Mirage? 说明:

  • exact match、multiple-choice grade 等不连续或非线性指标可以把平滑的 per-token 误差改善变成阶跃;
  • token edit distance、Brier score 等连续指标可能恢复平滑曲线;
  • 因而“图上突然跳升”不自动证明内部发生相变。

不能过度外推:

  • Mirage 论文没有证明所有涌现都不存在;
  • 新机制、数据阈值、grokking 或工具使用仍可能产生真实 regime change
  • 正确结论是先检查指标与采样方差,再谈能力相变。

Broken Neural Scaling Laws 用 smoothly broken power law 表达 plateau、拐点、double descent 或新的下降斜率。

风险:

  • 更灵活的函数也更容易在数据稀少时过拟合;
  • 需要留出外推点,而不只比较训练集拟合误差;
  • “能拟合拐点”不等于提前知道拐点为何出现。

3.6 2023–2025:唯一数据、过训练与部署目标

数据受限

Scaling Data-Constrained Language Models 区分:

  • UDunique data
  • RDrepetition count
  • D = UD × (RD + 1):训练实际处理的总 Token。

论文在 10M9B 参数、最多 900B training Token 的研究范围内报告:

  • 单 epoch 的每算力 validation loss 最优;
  • 最多约 4 epoch 的重复数据与使用同量 unique data 的差距可很小;
  • 继续重复仍可能有收益,但边际收益最终趋近于零;
  • 数据受限时,应同时增加模型规模与训练 epoch,而不是只重复或只增参数。

这些是该实验范围的结论,不能写成“任何数据重复四遍都无害”。

2026 年的 Data-Constrained Language Model Pretraining 提出 SoftQ,将模型与数据项耦合以处理有限 unique data 下的重复训练,并研究 masked-input regularization。它是新的前沿修正,首版应与经典结果分层呈现,避免用单篇新论文覆盖已有证据。

过训练

Language models scale reliably with over-training and on downstream tasks

  • 训练 104 个、11M–6.9B 参数模型;
  • 覆盖 C4、RedPajama、RefinedWeb
  • 用 token multiplier M = D/N 描述 over-training
  • 报告不同 multiplier 下 reducible loss 的 log-log 线近似平行;
  • 能从低约 300× compute 的实验预测其目标 over-trained run 的 validation loss
  • aggregate downstream error 比单个任务更可预测。

边界:

  • “平均 17/46 个任务”平滑,不代表每个任务都可精确预测;
  • 数据分布改变会移动曲线;
  • 预测建立在不 under-train、实验族可比的条件上。

2025 年 Overtrained Language Models Are Harder to Fine-Tune 提醒:更低 pretraining loss 不保证更好的后续可塑性。课程应把“base loss 最优”和“post-training 后最终能力最优”分成两张账。

把推理也计入

Beyond Chinchilla-Optimal 把总目标改为:

total cost = pretraining cost + inference demand × per-request inference cost

论文结论的正确范围:

  • 在其硬件、成本和请求量假设下,高推理需求会把最优点推向更小模型、更长训练;
  • 论文训练 47 个 150M6B 模型,探索 1010,000 TPP
  • 在研究范围内未观察到 loss 因极高 TPP 完全停止改善;
  • 不能把“约十亿请求”当所有业务的固定转折点。

3.7 2024Chinchilla 复现与 KaplanChinchilla 和解

Chinchilla Scaling: A replication attempt 指出:

  • 原论文 Approach 3 的正文参数、TeX 参数与拟合数据存在不一致问题;
  • 报告的置信区间过窄;
  • 重新拟合后仍可与 Approach 1 / 2 的近等比例扩展结论相容。

所以正确结论不是“Chinchilla 被推翻”,而是:

  • 核心近等比例结论较稳;
  • 某一组精确系数与极窄 CI 不应当作不可争议常数;
  • 论文复现必须保存数据、拟合代码、版本和停止条件。

Resolving Discrepancies in Compute-Optimal Scaling of Language Models 复现 Kaplan 风格实验并识别三类差异来源:

  1. last layer computational cost 的计数;
  2. warmup duration
  3. scale-dependent optimizer tuning。

修正后结果向 Chinchilla 靠拢。它提供一个重要方法论:

scaling exponent 既反映模型与数据,也反映训练 recipe 是否在各规模上公平调优。

3.8 20242026:从单一 loss 到 task ladder 与新拟合目标


4. DeepSeek:把 scaling study 变成训练前的工程搜索

4.1 DeepSeek LLM 的关键改变

DeepSeek LLM §3 不只拟合最终 loss,还先搜索超参数。

超参数缩放

论文报告:

ηopt = 0.3118 · C^-0.1250
Bopt = 0.2920 · C^0.3271

这些系数的正确边界:

  • C、batch 和 LR 使用论文自己的单位与配方;
  • 它们是 DeepSeek LLM 实验族的经验拟合,不是可直接复制到任意模型的默认值;
  • 论文承认同 compute、不同 model/data allocation 的近优超参数空间也会略变。

M 替代参数数

论文定义 non-embedding FLOPs/token

M = 72 · n_layer · d_model²
  + 12 · n_layer · d_model · l_seq

C = M · D

动机:

  • 6N_non-embedding 忽略 attention 随序列长度的计算;
  • 6N_total 又把 vocabulary computation 计入“容量”;
  • 小模型上两种参数代理相对真实 M 的误差尤其明显。

其 IsoFLOP 拟合报告:

Mopt = 0.1715 · C^0.5243
Dopt = 5.8316 · C^0.4757

仍然必须保留:

  • 数据质量改变时,论文 §3.3 的 exponent 也改变;
  • BPB、tokenizer 与数据分布定义不可省略;
  • M 是 Dense LLaMA-like 实验族的算术代理,不自动解决 MoE 比较。

4.2 DeepSeekMoE → V2 → V3 → V4 的 scaling 含义

这一谱系不应被压成同一条 ND 曲线:

节点 新的缩放变量 不能省略的账
DeepSeekMoE total vs active parameters 路由、负载、通信
DeepSeek-V2 MLA + 稀疏专家 KV / 激活参数 / 训练经济性
DeepSeek-V3 671B total / 37B active、14.8T Token FP8、DualPipe、硬件与系统效率
DeepSeek-V4 1M context hybrid attention、Muon、mHC context cost、训练 recipe 与 preview 边界

DeepSeek 专题的亮点不是“参数越来越大”,而是:

  • 用 scaling study 决定 model/data/hyperparameter
  • 用 MoE 改变容量与每 Token 计算的关系;
  • 用 MLA / hybrid attention 改变上下文与服务成本;
  • 用低精度和系统共设计缩小理论 FLOPs 与实际成本之间的差距。

5. KimiK2 的 token efficiency 到 K3 的 family-level scaling

5.1 Kimi K2

Kimi K2 把“高质量自然数据有限”作为缩放约束:

  • 1T-class MoE32.6B activated parameters
  • 报告在 15.5T curated Token 上预训练;
  • 用 MuonClip 追求 token efficiency 与稳定性;
  • 用 knowledge / mathematics rephrasing 增加同一来源的表达与视角;
  • 用 sparsity scaling law 选择专家稀疏度;
  • 训练 recipe 使用 WSD 主阶段与后续 cosine decay。

边界:

  • rephrasing 的收益是报告实验,不等于合成数据永远等价于新自然数据;
  • sparsity scaling 需同时计激活计算、总容量、路由与系统开销;
  • “zero loss spike”是该训练运行的作者报告。

5.2 Kimi K3

Kimi K3 §3.2 的 scaling study

  • 新模型族同时包含 KDA、AttnRes、Stable LatentMoE、数据与训练 recipe
  • 重新搜索 batch size、learning rate、TPP 与 model shape
  • 用 held-out OOD validation data 拟合 K2 / K3 曲线;
  • Figure 7 报告 K3 相对 K2 约 2.5× overall scaling efficiency
  • cosine 与 WSD 各自独立搜索最优超参数后,报告选择 cosine。

2.5× 必须这样写:

  • 是 K3 作者在其验证 lossFLOPs 曲线上的 family-level 报告;
  • 是架构、数据与训练 recipe 的合计,不是某一个组件的独立消融;
  • 不是“参数效率 2.5×”“吞吐 2.5×”或“所有 benchmark 2.5×”;
  • 不是第三方独立复现;
  • Figure 7 没有公开足以独立重建曲线的所有原始 run 点与拟合细节。

K3 对学习率 schedule 的方法论尤其重要:

如果 cosine 与 WSD 的最优 peak LR 和 batch 不同,用一套共享超参比较会系统性偏袒其中一方。

这与 2024 年 KaplanChinchilla 和解论文形成呼应:scale-aware tuning 不是“实现细节”,它能改变看见的 scaling law。


6. 网站叙事与视觉草案

6.1 章节问题链

  1. 为什么 log-log 图常是一条直线;
  2. 参数、数据、算力为什么不能只看一个;
  3. Kaplan 为什么得出“大模型优先”;
  4. Chinchilla 为什么把结论改成“参数与数据一起长”;
  5. 20 TPP 为什么是历史经验点,不是自然常数;
  6. 数据重复、过训练与部署需求如何移动最优点;
  7. 涌现是真变化还是指标折射;
  8. Dense、MoE、长上下文与 RL 为什么需要新坐标;
  9. DeepSeek 与 Kimi 如何在真实项目里做 scaling study
  10. 怎样判断一张 scaling 图是否可信。

6.2 至少 12 个原创机制图

  1. NDC 三轴与 C = 6ND 约束面;
  2. log-log 幂律斜率与 diminishing returns
  3. Chinchilla 损失分解的三块堆叠;
  4. 多条 IsoFLOP 曲线与谷底 frontier
  5. Kaplan / Chinchilla 最优射线对照;
  6. 20 TPP 尺子与“不是常数”警告;
  7. unique / repeated / effective Token 三个水箱;
  8. train-optimal / deployment-optimal 双目标;
  9. 平滑 per-token error 如何被 exact match 变成阶跃;
  10. single power law 与 broken power law
  11. Dense / MoE 的 total-active-compute 三联表;
  12. DeepSeek / Kimi 双谱系时间河;
  13. scale-aware hyperparameter search 网格;
  14. K3 Figure 7 的不带伪数据概念重绘:同 loss 的横向 FLOPs 差。

6.3 四个独立交互实验

Tab AScaling Surface

输入:

  • compute budget
  • α / β
  • irreducible loss
  • model / data cost 系数。

输出:

  • N × D loss surface
  • IsoFLOP curve
  • compute-optimal point
  • 当前选择相对最优多花的 FLOPs。

Tab BTrain vs Serve

输入:

  • 目标质量;
  • 请求数;
  • 平均输入 / 输出 Token
  • 每参数推理成本近似。

输出:

  • 仅训练最优;
  • 训练 + 推理总成本最优;
  • 请求增多时模型更小、训练更长的移动轨迹。

必须标 deterministic teaching model,不冒充任何云价格或真实 GPU benchmark。

Tab CData Reuse

输入:

  • unique Token
  • epochs
  • 重复 Token 衰减率;
  • 合成 / 改写增益假设。

输出:

  • seen Token 与 effective Token 分离;
  • 单 epoch、四 epoch 与高重复区;
  • 数据受限时继续增参数 / 增 epoch 的取舍。

Tab DEmergence Lens

同一条平滑 per-token correct probability

  • token edit distance
  • sequence exact match
  • multiple-choice threshold
  • 多次采样 pass@k。

让读者看到指标变换如何制造或消除阶跃。


7. 第一轮一手来源矩阵

新缓存于本地忽略目录 research/sources/scaling-laws/ 的 22 份论文:

ID 作用 首轮状态
1712.00409 2017 跨任务可预测 scaling 已缓存 / 摘要与主结论核验
1812.06162 2018 gradient noise / critical batch 已缓存 / 摘要核验
2001.08361 2020 Kaplan 经典 LLM 幂律 已缓存 / §1、§4、§6 核验
2010.14701 2020 自回归生成跨模态 scaling 已缓存 / 摘要核验
2112.11446 2021 Gopher 规模实践 已缓存 / 摘要核验
2203.15556 2022 Chinchilla compute-optimal 已缓存 / §3、表 23 核验
2204.02311 2022 PaLM 与规模实证 已缓存 / 摘要核验
2206.07682 2022 emergent abilities 已缓存 / 摘要核验
2210.14891 2022 broken scaling laws 已缓存 / 摘要与限制核验
2302.13971 2023 LLaMA 小模型长训练 已缓存 / 摘要核验
2304.15004 2023 emergence metric mirage 已缓存 / 主实验核验
2305.16264 2023 data-constrained scaling 已缓存 / §13 核验
2401.00448 2024 inference-aware scaling 已缓存 / §15 核验
2401.02954 2024 DeepSeek LLM scaling 已缓存 / §3 核验
2403.08540 2024 over-training / downstream 已缓存 / §13、限制核验
2404.10102 2024 Chinchilla replication 已缓存 / 全文主结论核验
2404.19484 2024 compute-allocation 假说 已缓存 / 仅作争议节点
2406.19146 2024 KaplanChinchilla reconciliation 已缓存 / §13 核验
2409.04777 2024 optimization hyperparameter laws 已缓存 / 摘要核验
2412.04403 2024 task scaling / model ladders 已缓存 / 摘要核验
2503.19206 2025 catastrophic overtraining 已缓存 / 摘要核验
2606.06888 2026 SoftQ / data-constrained frontier 已缓存 / 摘要与方法核验

复用已有正式来源:

  • DeepSeek-V2 2405.04434
  • DeepSeek-V3 2412.19437
  • DeepSeek-V4 2606.19348
  • Kimi K2 2507.20534
  • Kimi K3 2607.24653
  • Kimi k1.5 2501.12599
  • 训练系统、MoE、长上下文与推理专题已经核验的交叉来源。

8. Grok 线索的保留与纠错

Grok Headless 用于扩展候选论文、视觉和互动方案。其输出明确降级为未核验 leads。

已发现的错误:

  • Grok 称“K3 正式 scaling 论文需核验是否存在 / 公开技术边界不清”;
  • 实际已有 2026-07-27 提交的正式 arXiv 技术报告 2607.24653
  • 本地已有同一 47 页报告,§3.2 与 Figure 7 明确描述 scaling study。

处理规则:

  • Grok 的年代、模型数字、公式、URL 不直接进入网站;
  • 候选节点必须打开 P0 / P1
  • 无法回查的产品说法删掉,而不是降格成模糊事实;
  • 线索包错误也保留在研究记录中,作为为什么必须做来源分级的实例。

9. 高风险事实闸门

  • Kaplan 的 N 限定为 non-embedding parameters。
  • Kaplan 的 0.73 / 0.27 限定在其 compute-optimal recipe。
  • Chinchilla 三种 approach 的指数分别抄回表 2。
  • “约 20 TPP”写成论文范围内 heuristic,不写成常数。
  • Chinchilla replication 的结论写成“精确拟合有问题,核心近等比例结论未被推翻”。
  • KaplanChinchilla 差异包含 last-layer FLOPs、warmup、scale-aware optimizer tuning。
  • C ≈ 6ND 明确是 Dense 近似。
  • DeepSeek MC = MD 的定义回查 §3.2。
  • DeepSeek batch / LR law 保留实验族与单位边界。
  • unique、seen、repeated、effective Token 分开。
  • “最多约 4 epoch 差距很小”限定 Muennighoff 实验范围。
  • inference-aware optimum 限定请求量、成本与硬件假设。
  • aggregate task error 与 individual task prediction 分开。
  • emergence 与 metric-induced emergence 并列,不做全称判断。
  • Dense 与 MoE 的 total / active parameters 分开。
  • K2 rephrasing 不写成无限合成数据定律。
  • K3 2.5× 写成 family-level、OOD validation、author-reported。
  • K3 cosine / WSD 是各自独立调参后的报告结论。
  • Grok 对 K3 的错误已隔离,不进入正式结论。
  • 22 份新论文逐篇完成图表与实验段落精读。
  • 所有网站数字都有邻近来源与版本号。
  • 设计并实现四个 teaching-model 交互的单元与浏览器断言。
  • desktop / mobile / keyboard / reduced-motion 验证。
  • 生产镜像与公开仓库全链发布验证。

10. 首版页面完成闸门

  • 初学者能解释 log-log 直线与 diminishing returns。
  • 能区分 N / D / C / L 及各自口径。
  • 能在 IsoFLOP 图上找到 compute-optimal point。
  • 能说明 Kaplan 与 Chinchilla 为什么看似矛盾。
  • 能说明 20 TPP 为什么不是自然常数。
  • 能区分 train-optimal、serve-optimal 与 data-constrained optimum。
  • 能用连续指标解释至少一个“伪涌现”案例。
  • 能解释 DeepSeek 为什么用 FLOPs/token M
  • 能解释 K3 2.5× claim 的真实口径与证据边界。
  • 四个互动实验均能触发一个反直觉场景。
  • 类型检查、链接、浏览器、容器和生产验证全部通过。