research: map llm scaling laws
This commit is contained in:
+8
-2
@@ -6,16 +6,17 @@
|
||||
|
||||
| 工作流 | 状态 | 完成度 | 下一检查点 |
|
||||
|---|---:|---:|---|
|
||||
| 研究框架与规范 | 进行中 | 82% | 给推理专题补逐篇图表/实验精读层级 |
|
||||
| 研究框架与规范 | 进行中 | 83% | 完成 Scaling Laws 逐篇图表/实验精读 |
|
||||
| 网站设计系统 | 进行中 | 89% | 打印样式与更多通用可视化组件 |
|
||||
| Kimi K3 深读 | 进行中 | 64% | 扩写 scaling / pre-training / infra 逐图笔记 |
|
||||
| Transformer 基础 | 进行中 | 52% | 矩阵形状动画与手算练习 |
|
||||
| Scaling Laws | 研究中 | 31% | 逐篇图表精读、拟合复现与四页签实验 |
|
||||
| DeepSeek 专题 | 进行中 | 71% | 补 R1 / DAPO 的逐图训练轨迹与复现对照 |
|
||||
| 推理与测试时扩展 | 完成首版 | 76% | 真实模型采样曲线、PRM 案例与逐篇图表精读 |
|
||||
| 稀疏计算与 MoE | 完成首版 | 74% | 真实负载 traces 与专家特化案例 |
|
||||
| 长上下文专题 | 完成首版 | 72% | 真实模型配置、内核细节与失败案例 |
|
||||
| 大规模训练系统 | 完成首版 | 71% | 真实集群 traces、故障案例与精确 topology 配置 |
|
||||
| 引用与事实检查 | 进行中 | 54% | 自动化外链复查与来源等级扩展 |
|
||||
| 引用与事实检查 | 进行中 | 55% | Scaling Laws 数字、版本与外推边界复核 |
|
||||
| 开源仓库 | 已完成首版 | 100% | 持续提交研究与网站迭代 |
|
||||
| k1412 部署 | 已完成首版 | 100% | 每轮发布保留不可变镜像与回滚点 |
|
||||
|
||||
@@ -51,9 +52,12 @@
|
||||
- [x] 创建 `wuyang/llm-atlas` 公开仓库,匿名 API 确认 `private: false`。
|
||||
- [x] 当前生产镜像通过健康检查、11 个页面路由与关键资源烟雾测试。
|
||||
- [x] 通过 Unraid Compose Manager、Nginx Proxy Manager 与 HTTPS 发布首版。
|
||||
- [x] 启动 Scaling Laws 专题:缓存 22 篇新的一手论文,建立九张账、DeepSeek / Kimi 双谱系与四实验首轮证据框架。
|
||||
- [x] 使用 Grok Headless 扩展 Scaling 候选路线,并纠正其对 K3 正式报告存在性的错误;线索与正式账本分离。
|
||||
|
||||
## 正在进行
|
||||
|
||||
- [ ] Scaling Laws 二轮精读:逐篇图表、拟合公式、置信区间、外推失败与 DeepSeek / K3 对照。
|
||||
- [ ] 大规模训练系统二轮:真实集群 traces、故障恢复案例与精确 topology / kernel 配置。
|
||||
- [ ] 推理专题二轮:真实 pass@k 曲线、PRM 失败案例与逐篇图表精读。
|
||||
- [ ] 长上下文专题的真实模型配置对比、内核细节与失败案例二轮深化。
|
||||
@@ -85,6 +89,8 @@
|
||||
| 2026-07-29 | 训练系统首版用四个独立实验闭环 | 显存、device mesh、pipeline 与通信不合成一个伪“系统总分” |
|
||||
| 2026-07-29 | 论文库随训练系统一手链扩充到 166 篇 | 新增 checkpoint、mixed precision、自动并行、FSDP、MoE/CP 与大集群系统节点 |
|
||||
| 2026-07-29 | 训练系统首版用不可变镜像 `20260728T172750Z-c6306fe` 发布 | 保留 `12010→8080`、NPM host 31 / cert 41 与公开 Forgejo;11 路由、关键资源和四页签生产交互全部复核 |
|
||||
| 2026-07-29 | Scaling Laws 拆成观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账 | 防止把 `20 TPP`、`6ND`、MoE 总参、部署成本和“涌现”混成一条万能曲线 |
|
||||
| 2026-07-29 | Grok 对 K3 报告存在性的错误保留在未核验 leads | 正式账本回到 arXiv `2607.24653` 与本地 47 页报告,展示来源分级为何必要 |
|
||||
|
||||
## 未决问题
|
||||
|
||||
|
||||
@@ -0,0 +1,63 @@
|
||||
# Scaling Laws · Grok Discovery Leads
|
||||
|
||||
> **未核验线索,不是正式研究账本。**
|
||||
>
|
||||
> 2026-07-29 通过本机 Grok CLI Headless + web search 生成候选路线。
|
||||
> 正式结论只进入 `SCALING_LAWS_RESEARCH.md`,并以论文 / 官方报告原文为准。
|
||||
|
||||
## Grok 建议的候选主线
|
||||
|
||||
1. Hestness:跨任务经验幂律;
|
||||
2. Kaplan:语言模型的参数、数据与计算幂律;
|
||||
3. Chinchilla:固定训练 FLOPs 下的模型—数据近等比例扩展;
|
||||
4. Gopher / PaLM / LLaMA:从大而欠训到小而长训;
|
||||
5. Emergent Abilities 与 Mirage:能力变化还是指标折射;
|
||||
6. Broken Neural Scaling Laws:单一幂律之外的拐点;
|
||||
7. data-constrained scaling:有限唯一数据与重复训练;
|
||||
8. inference-aware scaling:训练最优与部署最优分离;
|
||||
9. over-training 与 downstream task scaling;
|
||||
10. DeepSeek 的稀疏激活、MLA、低精度和系统经济性;
|
||||
11. Kimi K2 的 token efficiency、MuonClip、rephrasing 与 sparsity scaling;
|
||||
12. 预训练 scaling、RL scaling 与 test-time compute 必须分轴。
|
||||
|
||||
## 候选资源账
|
||||
|
||||
- 经典交叉熵幂律;
|
||||
- compute-optimal allocation;
|
||||
- unique / repeated data;
|
||||
- over-training;
|
||||
- train + inference total cost;
|
||||
- emergent metric;
|
||||
- Dense / MoE effective compute;
|
||||
- hyperparameter scaling;
|
||||
- post-training / test-time scaling。
|
||||
|
||||
## 候选视觉
|
||||
|
||||
- `N–D–C` 三轴;
|
||||
- IsoFLOP 山谷;
|
||||
- Kaplan / Chinchilla 射线;
|
||||
- TPP 尺子;
|
||||
- unique / repeated Token;
|
||||
- train-optimal / serve-optimal 双目标;
|
||||
- exact match 制造阶跃;
|
||||
- broken power law;
|
||||
- Dense / MoE 双参数账;
|
||||
- DeepSeek / Kimi 双谱系。
|
||||
|
||||
## 候选互动
|
||||
|
||||
1. IsoFLOP loss surface;
|
||||
2. 请求量改变部署最优点;
|
||||
3. 数据重复边际价值衰减;
|
||||
4. 同一平滑能力曲线切换指标后产生 / 消失“涌现”。
|
||||
|
||||
## 已识别的错误与降级原因
|
||||
|
||||
- Grok 错误地将 K3 写成“正式 scaling 论文是否存在仍需核验”;
|
||||
- 实际 P0 来源为 [Kimi K3: Open Frontier Intelligence](https://arxiv.org/abs/2607.24653),提交于 2026-07-27;
|
||||
- 正式报告 §3.2、Figure 7 明确给出 K2 / K3 fitted scaling-law curves 与约 2.5× author-reported overall scaling efficiency;
|
||||
- 因此 Grok 输出中的 K3、V4 与产品线数字全部不得直接采用;
|
||||
- 其他公式、年份与 URL 也必须逐项回到 P0 / P1。
|
||||
|
||||
这个错误本身说明了本项目的检索原则:模型可以加速“找什么”,不能替代“证据究竟说了什么”。
|
||||
@@ -0,0 +1,620 @@
|
||||
# LLM Scaling Laws 研究账本
|
||||
|
||||
> 状态:第一轮证据框架
|
||||
> 研究截止:2026-07-29
|
||||
> 课程位置:专题 04「Scaling Laws:规模为什么有效」
|
||||
> 目标:先解释“我们到底在缩放什么、优化什么”,再讨论 Kaplan、Chinchilla、过训练、数据约束、涌现争议,以及 DeepSeek / Kimi 如何真的使用 scaling study。
|
||||
> 原则:正文关键事实来自 P0 论文 / 正式技术报告或 P1 作者实现;Grok 只提供 discovery leads。
|
||||
|
||||
---
|
||||
|
||||
## 0. 本章不是“大模型越大越好”
|
||||
|
||||
Scaling law 是在一个明确实验族、数据分布、训练配方和指标下,用小规模实验拟合规模变化规律,再外推更昂贵训练的工程工具。
|
||||
|
||||
本章必须同时回答:
|
||||
|
||||
1. 横轴是参数、Token、训练 FLOPs、推理请求,还是 RL / test-time compute;
|
||||
2. 纵轴是交叉熵、bits-per-byte、平均下游错误率,还是某个离散 benchmark;
|
||||
3. “最优”是在固定训练算力下最小化 loss,还是最小化训练与部署总成本;
|
||||
4. 参数是总参数、非 embedding 参数、每 Token 激活参数,还是 non-embedding FLOPs/token;
|
||||
5. 数据是训练中看过的 Token、唯一 Token、重复 Token,还是经过质量与合成处理后的“有效数据”;
|
||||
6. 拟合是否覆盖目标规模,是否报告 bootstrap / confidence interval;
|
||||
7. 架构、优化器、学习率、batch、warmup、tokenizer 和数据分布是否保持可比;
|
||||
8. 平滑 loss 能否预测单个下游任务,所谓“涌现”是否来自指标本身;
|
||||
9. Dense、MoE、多模态、后训练与推理时扩展能否放在同一条曲线上。
|
||||
|
||||
一句话总纲:
|
||||
|
||||
> Scaling law 不是自然常数,而是带条件的经验地图;地图能帮助规划路线,但不能替代目标函数、坐标定义和误差条。
|
||||
|
||||
---
|
||||
|
||||
## 1. 九张不能混在一起的账
|
||||
|
||||
| 账本 | 问题 | 常用量 | 最容易犯的错 |
|
||||
|---|---|---|---|
|
||||
| L1 观测量 | “变好”具体指什么 | CE loss、NLL、perplexity、BPB、task error | 跨 tokenizer 直接比较 perplexity |
|
||||
| L2 模型规模 | 模型有多大 | total / non-embedding / active parameters | MoE 只报总参数或只报激活参数 |
|
||||
| L3 数据规模 | 训练看到了什么 | seen / unique / repeated Token、epoch | 把重复 Token 当等价的新 Token |
|
||||
| L4 算术量 | 理论做了多少计算 | training FLOPs、FLOPs/token | 把硬件峰值、GPU hour 与理论 FLOPs 混写 |
|
||||
| L5 配比 | 固定预算怎样分 N 与 D | TPP、IsoFLOP frontier | 把 “约 20 Token/参数”当永久常数 |
|
||||
| L6 配方 | 哪些超参数随规模改变 | batch、LR、warmup、schedule、shape | 用同一组超参比较不同 schedule |
|
||||
| L7 外推 | 小实验能否预测大实验 | exponent、residual、CI、hold-out | 只展示拟合内误差,不做真正外推 |
|
||||
| L8 经济目标 | 训练后要服务多少次 | train + inference compute / cost | 把训练最优当部署最优 |
|
||||
| L9 能力与阶段 | loss 以外出现了什么 | aggregate error、task score、RL/test compute | 把不连续指标的阶跃叫物理相变 |
|
||||
|
||||
本章所有图、公式与互动实验都必须标明自己在付哪张账。
|
||||
|
||||
---
|
||||
|
||||
## 2. 坐标系与最小公式
|
||||
|
||||
### 2.1 四个基本符号
|
||||
|
||||
- `N`:模型规模。必须注明是 total、non-embedding,还是 active parameters。
|
||||
- `D`:训练数据规模。通常是训练过程中处理的 Token 数,不自动等于唯一语料量。
|
||||
- `C`:训练计算量。Dense Transformer 常用 `C ≈ 6ND` 作为一阶近似。
|
||||
- `L`:被拟合的损失或误差。必须注明数据集、tokenizer 和聚合方式。
|
||||
|
||||
`6ND` 的边界:
|
||||
|
||||
- `6` 来自 Dense Transformer 参数在一次 Token 训练中的前向与反向近似;
|
||||
- 长序列 attention、重计算、embedding / vocabulary、路由和其他算子会改变常数;
|
||||
- MoE 不能把 total parameters 直接代入;
|
||||
- 它不等于设备峰值 FLOP/s,也不等于真实 GPU hours;
|
||||
- DeepSeek LLM 因而改用 non-embedding FLOPs/token `M`,写成 `C = MD`。
|
||||
|
||||
### 2.2 单轴幂律
|
||||
|
||||
最简形式:
|
||||
|
||||
```text
|
||||
L(x) = L∞ + A · x^-α
|
||||
```
|
||||
|
||||
直觉:
|
||||
|
||||
- `L∞`:即使继续扩大规模也无法由当前模型族消掉的 irreducible floor;
|
||||
- `A`:当前数据、架构和 tokenizer 决定的垂直位移;
|
||||
- `α`:log-log 图上的下降斜率;
|
||||
- `α` 很小仍可在跨多个数量级时积累巨大收益。
|
||||
|
||||
它不是说每一个任务都平滑,也不是说同一指数跨数据、架构和优化器不变。
|
||||
|
||||
### 2.3 Chinchilla 型双轴损失面
|
||||
|
||||
Hoffmann 等人的 Approach 3 使用:
|
||||
|
||||
```text
|
||||
L(N, D) = E + A / N^α + B / D^β
|
||||
```
|
||||
|
||||
在 `C ≈ 6ND` 约束下,最优 frontier 有:
|
||||
|
||||
```text
|
||||
Nopt(C) ∝ C^[β / (α + β)]
|
||||
Dopt(C) ∝ C^[α / (α + β)]
|
||||
```
|
||||
|
||||
关键不是背指数,而是看两种可约误差:
|
||||
|
||||
- 模型太小:`A / N^α` 主导;
|
||||
- 数据太少 / 训练不够:`B / D^β` 主导;
|
||||
- 固定算力时增加一边会挤压另一边,IsoFLOP 谷底就是两者的折中。
|
||||
|
||||
### 2.4 IsoFLOP 不等于“训练一次画条线”
|
||||
|
||||
标准流程:
|
||||
|
||||
1. 选多个固定 compute budget;
|
||||
2. 每个 budget 下训练多种 `N × D` 配比;
|
||||
3. 每条 IsoFLOP 曲线找 loss 最小点;
|
||||
4. 用这些最小点拟合 `Nopt(C)` 与 `Dopt(C)`;
|
||||
5. 用未参与拟合的更大 run 检查外推;
|
||||
6. 报告拟合残差、不确定性和超参数搜索方法。
|
||||
|
||||
真正昂贵的是:每个 budget 都要有足够多的点覆盖谷底两侧。
|
||||
|
||||
---
|
||||
|
||||
## 3. 历史主线
|
||||
|
||||
### 3.1 2017–2019:幂律先于“大语言模型”
|
||||
|
||||
#### Hestness et al. 2017
|
||||
|
||||
[Deep Learning Scaling is Predictable, Empirically](https://arxiv.org/abs/1712.00409) 在语言、视觉、语音和机器翻译等任务上观察到泛化误差随数据规模呈稳定幂律。
|
||||
|
||||
贡献:
|
||||
|
||||
- 把“多给数据通常更好”变成可以拟合和外推的曲线;
|
||||
- 提出不同任务有不同指数与不可约误差;
|
||||
- 说明缩放规律不是 Transformer 或 LLM 出现后才有。
|
||||
|
||||
边界:
|
||||
|
||||
- 任务与架构跨度大,不能把某一指数直接移植到现代 LLM;
|
||||
- 主要说明经验可预测性,不回答现代 `N–D–C` 最优分配。
|
||||
|
||||
#### McCandlish et al. 2018
|
||||
|
||||
[An Empirical Model of Large-Batch Training](https://arxiv.org/abs/1812.06162) 用 gradient noise scale 连接 batch size、步数和算力效率。
|
||||
|
||||
它进入本章的原因:
|
||||
|
||||
- 训练规模不仅由 `N` 和 `D` 决定;
|
||||
- batch 太小会浪费并行机会,太大则新增样本对一步更新的边际价值下降;
|
||||
- Kaplan 与 DeepSeek 后来的 scaling study 都必须处理 batch / LR 的规模依赖。
|
||||
|
||||
这不是 loss scaling law,不能用它直接预测最终语言模型能力。
|
||||
|
||||
### 3.2 2020:Kaplan 建立经典 LLM scaling 坐标系
|
||||
|
||||
[Scaling Laws for Neural Language Models](https://arxiv.org/abs/2001.08361) 在 WebText2 与一族 Transformer 上拟合:
|
||||
|
||||
- 参数受限:`L(N) = (Nc / N)^αN`,报告 `αN ≈ 0.076`;
|
||||
- 数据受限:`L(D) = (Dc / D)^αD`,报告 `αD ≈ 0.095`;
|
||||
- 计算受限最优曲线:`αCmin ≈ 0.050`;
|
||||
- 其配方下的 compute-optimal 结论更偏向增大模型,报告 `Nopt ∝ C^0.73`。
|
||||
|
||||
必须保留的限定:
|
||||
|
||||
- `N` 是 non-embedding parameters;
|
||||
- 常数依赖 WebText2、词表和 tokenizer;
|
||||
- 论文使用的 warmup、last-layer FLOPs 计数和优化器调参后来被证明会影响最优指数;
|
||||
- 这是 2020 实验族的结论,不是“模型永远应比数据增长更快”。
|
||||
|
||||
### 3.3 2020–2022:跨模态幂律与大模型实证
|
||||
|
||||
[Scaling Laws for Autoregressive Generative Modeling](https://arxiv.org/abs/2010.14701) 将经验幂律扩展到图像、视频、数学等自回归生成任务,说明“平滑缩放”具有跨模态共性,但指数依赖模态与数据。
|
||||
|
||||
Gopher 与 PaLM 是规模实践节点:
|
||||
|
||||
- [Gopher](https://arxiv.org/abs/2112.11446) 展示 280B Dense 模型的任务分化;
|
||||
- [PaLM](https://arxiv.org/abs/2204.02311) 展示 540B 规模与部分任务的非平滑行为;
|
||||
- 它们不是 compute-optimal 定律本身,但为 Chinchilla 的反例式比较和 emergent abilities 讨论提供背景。
|
||||
|
||||
### 3.4 2022:Chinchilla 改写“最优分配”
|
||||
|
||||
[Training Compute-Optimal Large Language Models](https://arxiv.org/abs/2203.15556) 用三种方法研究固定训练 FLOPs 下如何分配参数与 Token。
|
||||
|
||||
原论文表 2:
|
||||
|
||||
| 方法 | `Nopt ∝ C^a` | `Dopt ∝ C^b` |
|
||||
|---|---:|---:|
|
||||
| 训练曲线最小值 | 0.50 | 0.50 |
|
||||
| IsoFLOP profiles | 0.49 | 0.51 |
|
||||
| parametric loss fit | 0.46 | 0.54 |
|
||||
| Kaplan 2020 对照 | 0.73 | 0.27 |
|
||||
|
||||
“20 Token / parameter”的正确教法:
|
||||
|
||||
- 表 3 中 1B 对应约 20.2B Token、10B 对应约 205.1B、67B 对应约 1.5T;
|
||||
- 它是该论文实验与拟合范围内的实用近似;
|
||||
- 不是跨 tokenizer、数据质量、优化器、MoE、部署需求都不变的常数;
|
||||
- Chinchilla 的核心结论是参数与数据应近似同比例扩展,而不是要求所有模型严格停在 20 TPP。
|
||||
|
||||
### 3.5 2022–2023:涌现、指标与折断幂律
|
||||
|
||||
[Emergent Abilities of Large Language Models](https://arxiv.org/abs/2206.07682) 把“小模型近随机、大模型突然明显变好”的任务表现系统化。
|
||||
|
||||
[Are Emergent Abilities of Large Language Models a Mirage?](https://arxiv.org/abs/2304.15004) 说明:
|
||||
|
||||
- exact match、multiple-choice grade 等不连续或非线性指标可以把平滑的 per-token 误差改善变成阶跃;
|
||||
- token edit distance、Brier score 等连续指标可能恢复平滑曲线;
|
||||
- 因而“图上突然跳升”不自动证明内部发生相变。
|
||||
|
||||
不能过度外推:
|
||||
|
||||
- Mirage 论文没有证明所有涌现都不存在;
|
||||
- 新机制、数据阈值、grokking 或工具使用仍可能产生真实 regime change;
|
||||
- 正确结论是先检查指标与采样方差,再谈能力相变。
|
||||
|
||||
[Broken Neural Scaling Laws](https://arxiv.org/abs/2210.14891) 用 smoothly broken power law 表达 plateau、拐点、double descent 或新的下降斜率。
|
||||
|
||||
风险:
|
||||
|
||||
- 更灵活的函数也更容易在数据稀少时过拟合;
|
||||
- 需要留出外推点,而不只比较训练集拟合误差;
|
||||
- “能拟合拐点”不等于提前知道拐点为何出现。
|
||||
|
||||
### 3.6 2023–2025:唯一数据、过训练与部署目标
|
||||
|
||||
#### 数据受限
|
||||
|
||||
[Scaling Data-Constrained Language Models](https://arxiv.org/abs/2305.16264) 区分:
|
||||
|
||||
- `UD`:unique data;
|
||||
- `RD`:repetition count;
|
||||
- `D = UD × (RD + 1)`:训练实际处理的总 Token。
|
||||
|
||||
论文在 10M–9B 参数、最多 900B training Token 的研究范围内报告:
|
||||
|
||||
- 单 epoch 的每算力 validation loss 最优;
|
||||
- 最多约 4 epoch 的重复数据与使用同量 unique data 的差距可很小;
|
||||
- 继续重复仍可能有收益,但边际收益最终趋近于零;
|
||||
- 数据受限时,应同时增加模型规模与训练 epoch,而不是只重复或只增参数。
|
||||
|
||||
这些是该实验范围的结论,不能写成“任何数据重复四遍都无害”。
|
||||
|
||||
2026 年的 [Data-Constrained Language Model Pretraining](https://arxiv.org/abs/2606.06888) 提出 SoftQ,将模型与数据项耦合以处理有限 unique data 下的重复训练,并研究 masked-input regularization。它是新的前沿修正,首版应与经典结果分层呈现,避免用单篇新论文覆盖已有证据。
|
||||
|
||||
#### 过训练
|
||||
|
||||
[Language models scale reliably with over-training and on downstream tasks](https://arxiv.org/abs/2403.08540):
|
||||
|
||||
- 训练 104 个、11M–6.9B 参数模型;
|
||||
- 覆盖 C4、RedPajama、RefinedWeb;
|
||||
- 用 token multiplier `M = D/N` 描述 over-training;
|
||||
- 报告不同 multiplier 下 reducible loss 的 log-log 线近似平行;
|
||||
- 能从低约 300× compute 的实验预测其目标 over-trained run 的 validation loss;
|
||||
- aggregate downstream error 比单个任务更可预测。
|
||||
|
||||
边界:
|
||||
|
||||
- “平均 17/46 个任务”平滑,不代表每个任务都可精确预测;
|
||||
- 数据分布改变会移动曲线;
|
||||
- 预测建立在不 under-train、实验族可比的条件上。
|
||||
|
||||
2025 年 [Overtrained Language Models Are Harder to Fine-Tune](https://arxiv.org/abs/2503.19206) 提醒:更低 pretraining loss 不保证更好的后续可塑性。课程应把“base loss 最优”和“post-training 后最终能力最优”分成两张账。
|
||||
|
||||
#### 把推理也计入
|
||||
|
||||
[Beyond Chinchilla-Optimal](https://arxiv.org/abs/2401.00448) 把总目标改为:
|
||||
|
||||
```text
|
||||
total cost = pretraining cost + inference demand × per-request inference cost
|
||||
```
|
||||
|
||||
论文结论的正确范围:
|
||||
|
||||
- 在其硬件、成本和请求量假设下,高推理需求会把最优点推向更小模型、更长训练;
|
||||
- 论文训练 47 个 150M–6B 模型,探索 10–10,000 TPP;
|
||||
- 在研究范围内未观察到 loss 因极高 TPP 完全停止改善;
|
||||
- 不能把“约十亿请求”当所有业务的固定转折点。
|
||||
|
||||
### 3.7 2024:Chinchilla 复现与 Kaplan–Chinchilla 和解
|
||||
|
||||
[Chinchilla Scaling: A replication attempt](https://arxiv.org/abs/2404.10102) 指出:
|
||||
|
||||
- 原论文 Approach 3 的正文参数、TeX 参数与拟合数据存在不一致问题;
|
||||
- 报告的置信区间过窄;
|
||||
- 重新拟合后仍可与 Approach 1 / 2 的近等比例扩展结论相容。
|
||||
|
||||
所以正确结论不是“Chinchilla 被推翻”,而是:
|
||||
|
||||
- 核心近等比例结论较稳;
|
||||
- 某一组精确系数与极窄 CI 不应当作不可争议常数;
|
||||
- 论文复现必须保存数据、拟合代码、版本和停止条件。
|
||||
|
||||
[Resolving Discrepancies in Compute-Optimal Scaling of Language Models](https://arxiv.org/abs/2406.19146) 复现 Kaplan 风格实验并识别三类差异来源:
|
||||
|
||||
1. last layer computational cost 的计数;
|
||||
2. warmup duration;
|
||||
3. scale-dependent optimizer tuning。
|
||||
|
||||
修正后结果向 Chinchilla 靠拢。它提供一个重要方法论:
|
||||
|
||||
> scaling exponent 既反映模型与数据,也反映训练 recipe 是否在各规模上公平调优。
|
||||
|
||||
### 3.8 2024–2026:从单一 loss 到 task ladder 与新拟合目标
|
||||
|
||||
- [Optimization Hyper-parameter Laws](https://arxiv.org/abs/2409.04777) 把动态学习率 schedule 纳入可预测对象;
|
||||
- [Establishing Task Scaling Laws via Compute-Efficient Model Ladders](https://arxiv.org/abs/2412.04403) 用两阶段方法从模型/数据预测 task loss,再从 task loss 预测任务表现;
|
||||
- 单个任务方差更大,任务指标不能无条件由通用 validation loss 替代;
|
||||
- 首版应展示“可预测性层级”,而非声称一个公式预测所有能力。
|
||||
|
||||
---
|
||||
|
||||
## 4. DeepSeek:把 scaling study 变成训练前的工程搜索
|
||||
|
||||
### 4.1 DeepSeek LLM 的关键改变
|
||||
|
||||
[DeepSeek LLM](https://arxiv.org/abs/2401.02954) §3 不只拟合最终 loss,还先搜索超参数。
|
||||
|
||||
#### 超参数缩放
|
||||
|
||||
论文报告:
|
||||
|
||||
```text
|
||||
ηopt = 0.3118 · C^-0.1250
|
||||
Bopt = 0.2920 · C^0.3271
|
||||
```
|
||||
|
||||
这些系数的正确边界:
|
||||
|
||||
- `C`、batch 和 LR 使用论文自己的单位与配方;
|
||||
- 它们是 DeepSeek LLM 实验族的经验拟合,不是可直接复制到任意模型的默认值;
|
||||
- 论文承认同 compute、不同 model/data allocation 的近优超参数空间也会略变。
|
||||
|
||||
#### 用 `M` 替代参数数
|
||||
|
||||
论文定义 non-embedding FLOPs/token:
|
||||
|
||||
```text
|
||||
M = 72 · n_layer · d_model²
|
||||
+ 12 · n_layer · d_model · l_seq
|
||||
|
||||
C = M · D
|
||||
```
|
||||
|
||||
动机:
|
||||
|
||||
- `6N_non-embedding` 忽略 attention 随序列长度的计算;
|
||||
- `6N_total` 又把 vocabulary computation 计入“容量”;
|
||||
- 小模型上两种参数代理相对真实 `M` 的误差尤其明显。
|
||||
|
||||
其 IsoFLOP 拟合报告:
|
||||
|
||||
```text
|
||||
Mopt = 0.1715 · C^0.5243
|
||||
Dopt = 5.8316 · C^0.4757
|
||||
```
|
||||
|
||||
仍然必须保留:
|
||||
|
||||
- 数据质量改变时,论文 §3.3 的 exponent 也改变;
|
||||
- BPB、tokenizer 与数据分布定义不可省略;
|
||||
- `M` 是 Dense LLaMA-like 实验族的算术代理,不自动解决 MoE 比较。
|
||||
|
||||
### 4.2 DeepSeekMoE → V2 → V3 → V4 的 scaling 含义
|
||||
|
||||
这一谱系不应被压成同一条 `N–D` 曲线:
|
||||
|
||||
| 节点 | 新的缩放变量 | 不能省略的账 |
|
||||
|---|---|---|
|
||||
| DeepSeekMoE | total vs active parameters | 路由、负载、通信 |
|
||||
| DeepSeek-V2 | MLA + 稀疏专家 | KV / 激活参数 / 训练经济性 |
|
||||
| DeepSeek-V3 | 671B total / 37B active、14.8T Token | FP8、DualPipe、硬件与系统效率 |
|
||||
| DeepSeek-V4 | 1M context hybrid attention、Muon、mHC | context cost、训练 recipe 与 preview 边界 |
|
||||
|
||||
DeepSeek 专题的亮点不是“参数越来越大”,而是:
|
||||
|
||||
- 用 scaling study 决定 model/data/hyperparameter;
|
||||
- 用 MoE 改变容量与每 Token 计算的关系;
|
||||
- 用 MLA / hybrid attention 改变上下文与服务成本;
|
||||
- 用低精度和系统共设计缩小理论 FLOPs 与实际成本之间的差距。
|
||||
|
||||
---
|
||||
|
||||
## 5. Kimi:K2 的 token efficiency 到 K3 的 family-level scaling
|
||||
|
||||
### 5.1 Kimi K2
|
||||
|
||||
[Kimi K2](https://arxiv.org/abs/2507.20534) 把“高质量自然数据有限”作为缩放约束:
|
||||
|
||||
- 1T-class MoE,32.6B activated parameters;
|
||||
- 报告在 15.5T curated Token 上预训练;
|
||||
- 用 MuonClip 追求 token efficiency 与稳定性;
|
||||
- 用 knowledge / mathematics rephrasing 增加同一来源的表达与视角;
|
||||
- 用 sparsity scaling law 选择专家稀疏度;
|
||||
- 训练 recipe 使用 WSD 主阶段与后续 cosine decay。
|
||||
|
||||
边界:
|
||||
|
||||
- rephrasing 的收益是报告实验,不等于合成数据永远等价于新自然数据;
|
||||
- sparsity scaling 需同时计激活计算、总容量、路由与系统开销;
|
||||
- “zero loss spike”是该训练运行的作者报告。
|
||||
|
||||
### 5.2 Kimi K3
|
||||
|
||||
[Kimi K3](https://arxiv.org/abs/2607.24653) §3.2 的 scaling study:
|
||||
|
||||
- 新模型族同时包含 KDA、AttnRes、Stable LatentMoE、数据与训练 recipe;
|
||||
- 重新搜索 batch size、learning rate、TPP 与 model shape;
|
||||
- 用 held-out OOD validation data 拟合 K2 / K3 曲线;
|
||||
- Figure 7 报告 K3 相对 K2 约 `2.5× overall scaling efficiency`;
|
||||
- cosine 与 WSD 各自独立搜索最优超参数后,报告选择 cosine。
|
||||
|
||||
`2.5×` 必须这样写:
|
||||
|
||||
- 是 K3 作者在其验证 loss–FLOPs 曲线上的 family-level 报告;
|
||||
- 是架构、数据与训练 recipe 的合计,不是某一个组件的独立消融;
|
||||
- 不是“参数效率 2.5×”“吞吐 2.5×”或“所有 benchmark 2.5×”;
|
||||
- 不是第三方独立复现;
|
||||
- Figure 7 没有公开足以独立重建曲线的所有原始 run 点与拟合细节。
|
||||
|
||||
K3 对学习率 schedule 的方法论尤其重要:
|
||||
|
||||
> 如果 cosine 与 WSD 的最优 peak LR 和 batch 不同,用一套共享超参比较会系统性偏袒其中一方。
|
||||
|
||||
这与 2024 年 Kaplan–Chinchilla 和解论文形成呼应:scale-aware tuning 不是“实现细节”,它能改变看见的 scaling law。
|
||||
|
||||
---
|
||||
|
||||
## 6. 网站叙事与视觉草案
|
||||
|
||||
### 6.1 章节问题链
|
||||
|
||||
1. 为什么 log-log 图常是一条直线;
|
||||
2. 参数、数据、算力为什么不能只看一个;
|
||||
3. Kaplan 为什么得出“大模型优先”;
|
||||
4. Chinchilla 为什么把结论改成“参数与数据一起长”;
|
||||
5. 20 TPP 为什么是历史经验点,不是自然常数;
|
||||
6. 数据重复、过训练与部署需求如何移动最优点;
|
||||
7. 涌现是真变化还是指标折射;
|
||||
8. Dense、MoE、长上下文与 RL 为什么需要新坐标;
|
||||
9. DeepSeek 与 Kimi 如何在真实项目里做 scaling study;
|
||||
10. 怎样判断一张 scaling 图是否可信。
|
||||
|
||||
### 6.2 至少 12 个原创机制图
|
||||
|
||||
1. `N–D–C` 三轴与 `C = 6ND` 约束面;
|
||||
2. log-log 幂律斜率与 diminishing returns;
|
||||
3. Chinchilla 损失分解的三块堆叠;
|
||||
4. 多条 IsoFLOP 曲线与谷底 frontier;
|
||||
5. Kaplan / Chinchilla 最优射线对照;
|
||||
6. 20 TPP 尺子与“不是常数”警告;
|
||||
7. unique / repeated / effective Token 三个水箱;
|
||||
8. train-optimal / deployment-optimal 双目标;
|
||||
9. 平滑 per-token error 如何被 exact match 变成阶跃;
|
||||
10. single power law 与 broken power law;
|
||||
11. Dense / MoE 的 total-active-compute 三联表;
|
||||
12. DeepSeek / Kimi 双谱系时间河;
|
||||
13. scale-aware hyperparameter search 网格;
|
||||
14. K3 Figure 7 的不带伪数据概念重绘:同 loss 的横向 FLOPs 差。
|
||||
|
||||
### 6.3 四个独立交互实验
|
||||
|
||||
#### Tab A:Scaling Surface
|
||||
|
||||
输入:
|
||||
|
||||
- compute budget;
|
||||
- `α / β`;
|
||||
- irreducible loss;
|
||||
- model / data cost 系数。
|
||||
|
||||
输出:
|
||||
|
||||
- `N × D` loss surface;
|
||||
- IsoFLOP curve;
|
||||
- compute-optimal point;
|
||||
- 当前选择相对最优多花的 FLOPs。
|
||||
|
||||
#### Tab B:Train vs Serve
|
||||
|
||||
输入:
|
||||
|
||||
- 目标质量;
|
||||
- 请求数;
|
||||
- 平均输入 / 输出 Token;
|
||||
- 每参数推理成本近似。
|
||||
|
||||
输出:
|
||||
|
||||
- 仅训练最优;
|
||||
- 训练 + 推理总成本最优;
|
||||
- 请求增多时模型更小、训练更长的移动轨迹。
|
||||
|
||||
必须标 deterministic teaching model,不冒充任何云价格或真实 GPU benchmark。
|
||||
|
||||
#### Tab C:Data Reuse
|
||||
|
||||
输入:
|
||||
|
||||
- unique Token;
|
||||
- epochs;
|
||||
- 重复 Token 衰减率;
|
||||
- 合成 / 改写增益假设。
|
||||
|
||||
输出:
|
||||
|
||||
- seen Token 与 effective Token 分离;
|
||||
- 单 epoch、四 epoch 与高重复区;
|
||||
- 数据受限时继续增参数 / 增 epoch 的取舍。
|
||||
|
||||
#### Tab D:Emergence Lens
|
||||
|
||||
同一条平滑 per-token correct probability:
|
||||
|
||||
- token edit distance;
|
||||
- sequence exact match;
|
||||
- multiple-choice threshold;
|
||||
- 多次采样 pass@k。
|
||||
|
||||
让读者看到指标变换如何制造或消除阶跃。
|
||||
|
||||
---
|
||||
|
||||
## 7. 第一轮一手来源矩阵
|
||||
|
||||
新缓存于本地忽略目录 `research/sources/scaling-laws/` 的 22 份论文:
|
||||
|
||||
| ID | 年 | 作用 | 首轮状态 |
|
||||
|---|---:|---|---|
|
||||
| `1712.00409` | 2017 | 跨任务可预测 scaling | 已缓存 / 摘要与主结论核验 |
|
||||
| `1812.06162` | 2018 | gradient noise / critical batch | 已缓存 / 摘要核验 |
|
||||
| `2001.08361` | 2020 | Kaplan 经典 LLM 幂律 | 已缓存 / §1、§4、§6 核验 |
|
||||
| `2010.14701` | 2020 | 自回归生成跨模态 scaling | 已缓存 / 摘要核验 |
|
||||
| `2112.11446` | 2021 | Gopher 规模实践 | 已缓存 / 摘要核验 |
|
||||
| `2203.15556` | 2022 | Chinchilla compute-optimal | 已缓存 / §3、表 2–3 核验 |
|
||||
| `2204.02311` | 2022 | PaLM 与规模实证 | 已缓存 / 摘要核验 |
|
||||
| `2206.07682` | 2022 | emergent abilities | 已缓存 / 摘要核验 |
|
||||
| `2210.14891` | 2022 | broken scaling laws | 已缓存 / 摘要与限制核验 |
|
||||
| `2302.13971` | 2023 | LLaMA 小模型长训练 | 已缓存 / 摘要核验 |
|
||||
| `2304.15004` | 2023 | emergence metric mirage | 已缓存 / 主实验核验 |
|
||||
| `2305.16264` | 2023 | data-constrained scaling | 已缓存 / §1–3 核验 |
|
||||
| `2401.00448` | 2024 | inference-aware scaling | 已缓存 / §1–5 核验 |
|
||||
| `2401.02954` | 2024 | DeepSeek LLM scaling | 已缓存 / §3 核验 |
|
||||
| `2403.08540` | 2024 | over-training / downstream | 已缓存 / §1–3、限制核验 |
|
||||
| `2404.10102` | 2024 | Chinchilla replication | 已缓存 / 全文主结论核验 |
|
||||
| `2404.19484` | 2024 | compute-allocation 假说 | 已缓存 / 仅作争议节点 |
|
||||
| `2406.19146` | 2024 | Kaplan–Chinchilla reconciliation | 已缓存 / §1–3 核验 |
|
||||
| `2409.04777` | 2024 | optimization hyperparameter laws | 已缓存 / 摘要核验 |
|
||||
| `2412.04403` | 2024 | task scaling / model ladders | 已缓存 / 摘要核验 |
|
||||
| `2503.19206` | 2025 | catastrophic overtraining | 已缓存 / 摘要核验 |
|
||||
| `2606.06888` | 2026 | SoftQ / data-constrained frontier | 已缓存 / 摘要与方法核验 |
|
||||
|
||||
复用已有正式来源:
|
||||
|
||||
- DeepSeek-V2 `2405.04434`;
|
||||
- DeepSeek-V3 `2412.19437`;
|
||||
- DeepSeek-V4 `2606.19348`;
|
||||
- Kimi K2 `2507.20534`;
|
||||
- Kimi K3 `2607.24653`;
|
||||
- Kimi k1.5 `2501.12599`;
|
||||
- 训练系统、MoE、长上下文与推理专题已经核验的交叉来源。
|
||||
|
||||
---
|
||||
|
||||
## 8. Grok 线索的保留与纠错
|
||||
|
||||
Grok Headless 用于扩展候选论文、视觉和互动方案。其输出明确降级为未核验 leads。
|
||||
|
||||
已发现的错误:
|
||||
|
||||
- Grok 称“K3 正式 scaling 论文需核验是否存在 / 公开技术边界不清”;
|
||||
- 实际已有 2026-07-27 提交的正式 arXiv 技术报告 `2607.24653`;
|
||||
- 本地已有同一 47 页报告,§3.2 与 Figure 7 明确描述 scaling study。
|
||||
|
||||
处理规则:
|
||||
|
||||
- Grok 的年代、模型数字、公式、URL 不直接进入网站;
|
||||
- 候选节点必须打开 P0 / P1;
|
||||
- 无法回查的产品说法删掉,而不是降格成模糊事实;
|
||||
- 线索包错误也保留在研究记录中,作为为什么必须做来源分级的实例。
|
||||
|
||||
---
|
||||
|
||||
## 9. 高风险事实闸门
|
||||
|
||||
- [x] Kaplan 的 `N` 限定为 non-embedding parameters。
|
||||
- [x] Kaplan 的 0.73 / 0.27 限定在其 compute-optimal recipe。
|
||||
- [x] Chinchilla 三种 approach 的指数分别抄回表 2。
|
||||
- [x] “约 20 TPP”写成论文范围内 heuristic,不写成常数。
|
||||
- [x] Chinchilla replication 的结论写成“精确拟合有问题,核心近等比例结论未被推翻”。
|
||||
- [x] Kaplan–Chinchilla 差异包含 last-layer FLOPs、warmup、scale-aware optimizer tuning。
|
||||
- [x] `C ≈ 6ND` 明确是 Dense 近似。
|
||||
- [x] DeepSeek `M` 与 `C = MD` 的定义回查 §3.2。
|
||||
- [x] DeepSeek batch / LR law 保留实验族与单位边界。
|
||||
- [x] unique、seen、repeated、effective Token 分开。
|
||||
- [x] “最多约 4 epoch 差距很小”限定 Muennighoff 实验范围。
|
||||
- [x] inference-aware optimum 限定请求量、成本与硬件假设。
|
||||
- [x] aggregate task error 与 individual task prediction 分开。
|
||||
- [x] emergence 与 metric-induced emergence 并列,不做全称判断。
|
||||
- [x] Dense 与 MoE 的 total / active parameters 分开。
|
||||
- [x] K2 rephrasing 不写成无限合成数据定律。
|
||||
- [x] K3 2.5× 写成 family-level、OOD validation、author-reported。
|
||||
- [x] K3 cosine / WSD 是各自独立调参后的报告结论。
|
||||
- [x] Grok 对 K3 的错误已隔离,不进入正式结论。
|
||||
- [ ] 22 份新论文逐篇完成图表与实验段落精读。
|
||||
- [ ] 所有网站数字都有邻近来源与版本号。
|
||||
- [ ] 设计并实现四个 teaching-model 交互的单元与浏览器断言。
|
||||
- [ ] desktop / mobile / keyboard / reduced-motion 验证。
|
||||
- [ ] 生产镜像与公开仓库全链发布验证。
|
||||
|
||||
## 10. 首版页面完成闸门
|
||||
|
||||
- [ ] 初学者能解释 log-log 直线与 diminishing returns。
|
||||
- [ ] 能区分 `N / D / C / L` 及各自口径。
|
||||
- [ ] 能在 IsoFLOP 图上找到 compute-optimal point。
|
||||
- [ ] 能说明 Kaplan 与 Chinchilla 为什么看似矛盾。
|
||||
- [ ] 能说明 20 TPP 为什么不是自然常数。
|
||||
- [ ] 能区分 train-optimal、serve-optimal 与 data-constrained optimum。
|
||||
- [ ] 能用连续指标解释至少一个“伪涌现”案例。
|
||||
- [ ] 能解释 DeepSeek 为什么用 FLOPs/token `M`。
|
||||
- [ ] 能解释 K3 2.5× claim 的真实口径与证据边界。
|
||||
- [ ] 四个互动实验均能触发一个反直觉场景。
|
||||
- [ ] 类型检查、链接、浏览器、容器和生产验证全部通过。
|
||||
Reference in New Issue
Block a user