当前损失面的谷底
INTERACTIVE / SCALING LAWS LAB
++ 四个实验都是确定性教学模型,不是任何实验室的训练预测器。参数只用来展示方向、约束和反直觉结果; + 论文中的真实指数、拟合范围与置信区间必须回到正文和原始来源。 +
+SCALING SURFACE
+
+ 这里使用 Chinchilla 型教学损失面 L = E + A/N^α + B/D^β。每个点都满足
+ Dense 一阶近似 C = 6ND;谷底只是当前假设下的 compute-optimal point。
+
当前损失面的谷底
约 9.1 TPP
相对同预算谷底
+ 双轴损失面的解析指数:N 的 compute exponent 为 β/(α+β),
+ D 为 α/(α+β)。系数与最优 TPP 仍由实验族决定。
+
“约 20 TPP”只是一段历史实验范围的经验点;改变数据、配方或部署目标,谷底会移动。
+TRAIN × SERVE
+
+ 对一组 Dense 候选模型,先反推达到同一教学目标 loss 所需的数据,再加上全部请求的一阶推理 FLOPs。
+ 推理按 2N × processed tokens 近似,不包含 KV、attention、批处理和硬件价格。
+
只最小化预训练 FLOPs
训练 + 所有推理请求
最优方案的总计算占比
论文里的“高推理需求”依赖请求量、硬件价格、batch、上下文和服务寿命;这里不提供采购结论。
+DATA REUSE
++ 教学模型把第一遍 unique Token 记为完整价值,随后每遍按 retention 衰减;改写只恢复部分边际价值。 + 这不是 Muennighoff 或 Kimi 的原始拟合式,只用于把 seen 与 effective 两个口径分开。 +
+系统实际处理的总量
教学衰减后的 unique-equivalent
相对第一遍的边际价值
第一次出现的原始 Token
训练计算真实付费
教学模型中的等效信号
质量过滤、代码、合成数据、改写、正则化与模型容量都会改变衰减;不能把 effective Token 当可直接测量的物理量。
+EMERGENCE LENS
++ 所有曲线共享同一条平滑 per-token correctness。Exact match 要整段全对,threshold 把连续分数切成 0/1, + pass@k 则用更多样本改变“至少一次成功”的概率;它们测到的不是同一个问题。 +
+底层连续能力
整段全部正确
越线才计为会
至少一个完整答案
先换成连续指标、增加采样点并报告方差;仍有稳定拐点时,再讨论数据、机制或训练阶段改变。
+NEW / CHAPTER 04 SCALING LAWS
++ 用观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段九张账, + 从早期经验幂律、Kaplan、Chinchilla 与复现争议,一路走到 DeepSeek scaling study 和 Kimi K3。 +
+NEW / CHAPTER 08 LARGE-SCALE TRAINING SYSTEMS
@@ -402,12 +420,20 @@ const paths = [ transition: transform 180ms ease, border-color 180ms ease; } + .scaling-release, .training-release, .reasoning-release { grid-column: 1 / -1; min-height: 510px; } + .scaling-release { + background: + radial-gradient(circle at 82% 18%, rgba(159, 91, 52, 0.18), transparent 30%), + repeating-linear-gradient(135deg, transparent 0 84px, rgba(159, 91, 52, 0.045) 84px 85px), + var(--paper-raised); + } + .training-release { background: radial-gradient(circle at 82% 18%, rgba(66, 111, 101, 0.19), transparent 30%), @@ -484,6 +510,7 @@ const paths = [ padding-bottom: 76px; } + .scaling-release, .training-release, .reasoning-release { grid-column: auto; diff --git a/src/pages/moe/index.astro b/src/pages/moe/index.astro index 5168ab4..a2d7398 100644 --- a/src/pages/moe/index.astro +++ b/src/pages/moe/index.astro @@ -683,7 +683,7 @@ const paperChain = [ diff --git a/src/pages/progress/index.astro b/src/pages/progress/index.astro index 5e107ed..d2f4105 100644 --- a/src/pages/progress/index.astro +++ b/src/pages/progress/index.astro @@ -7,16 +7,17 @@ const published = chapters.filter((chapter) => chapter.status === "published").l const researching = chapters.filter((chapter) => ["researching", "drafting"].includes(chapter.status)).length; const workstreams = [ - { label: "研究框架与规范", value: 82, next: "给推理专题补逐篇图表/实验精读层级" }, + { label: "研究框架与规范", value: 83, next: "给 Scaling 与推理专题补逐篇图表/实验精读层级" }, { label: "网站设计系统", value: 89, next: "打印样式与更多通用可视化组件" }, - { label: "Kimi K3 深读", value: 64, next: "扩写 scaling / pre-training / infra 逐图笔记" }, + { label: "Kimi K3 深读", value: 66, next: "扩写 pre-training / infra 逐图笔记" }, { label: "Transformer 基础", value: 52, next: "加入矩阵形状动画与手算练习" }, + { label: "Scaling Laws", value: 74, next: "加入真实拟合复现、置信区间与更多模型族对照" }, { label: "DeepSeek 专题", value: 71, next: "补 R1 / DAPO 的逐图训练轨迹与复现对照" }, { label: "推理与测试时扩展", value: 76, next: "真实模型采样曲线、PRM 案例与逐篇图表精读" }, { label: "稀疏计算与 MoE", value: 74, next: "补充真实集群 traces 与专家特化案例" }, { label: "长上下文专题", value: 72, next: "加入更多论文逐图笔记与真实模型配置对比" }, { label: "大规模训练系统", value: 71, next: "补真实集群 traces、故障案例与精确 topology 配置" }, - { label: "引用与事实检查", value: 54, next: "自动化外链复查与来源等级扩展" }, + { label: "引用与事实检查", value: 57, next: "自动化外链复查与来源等级扩展" }, { label: "开源与部署", value: 100, next: "每轮保留不可变镜像、提交与回滚点" }, ]; --- @@ -40,7 +41,7 @@ const workstreams = [01 WORKSTREAMS
-
内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。
@@ -87,13 +88,14 @@ const workstreams = [
47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。 从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。 响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。 K3、注意力、DeepSeek、长上下文、MoE、推理三页签,以及训练系统四页签实验。 K3 导读、Transformer 基础、DeepSeek 谱系、长上下文、MoE、推理与训练系统专题。 K3、注意力、DeepSeek、长上下文、MoE、推理三页签,以及训练系统与 Scaling 各四页签实验。 K3 导读、Transformer 基础、DeepSeek 谱系、Scaling、长上下文、MoE、推理与训练系统专题。 九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。 五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。 六张账、19 篇一手论文、DeepSeek/K3 主线与路由—容量—通信交互实验室。 八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与三页签互动实验室。 九张账、37 个一手节点、DeepSeek/Kimi 双谱系与显存—网格—气泡—通信实验室。 覆盖 12 个专题,支持全文搜索、标签筛选与 Kimi/DeepSeek 聚光主线。 覆盖 12 个专题,支持全文搜索、标签筛选与 Kimi/DeepSeek 聚光主线。 源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。K3 报告已结构化拆解
16 专题知识图
编辑式网站系统
十二个原创交互视图
七篇首版长文
十六个原创交互视图
八篇首版长文
Scaling Laws 深度专题
长上下文深度专题
MoE 深度专题
推理深度专题
训练系统深度专题
166 篇关键论文索引
182 篇关键论文索引
公开仓库与自托管发布
真实集群 traces → 故障恢复 → 精确 topology / kernel 配置
案例库 + 实测边界真实拟合复现 → 置信区间 → 更多模型族与下游任务外推
可复现实验 + 逐图笔记真实集群 traces → 故障恢复 → 精确 topology / kernel 配置
案例库 + 实测边界真实模型配置 → 内核细节 → 长上下文评测与失败案例
配置比较器 + 逐图论文笔记真实负载 traces → 专家特化可解释性 → 共享专家语义
案例库 + 集群证据真实 pass@k 曲线 → PRM 失败案例 → 逐篇图表精读
案例库 + 真实 traces源码公开到 git.k1412.top,网站部署到 k1412 私有基础设施。
把答案、覆盖、选择、过程、预算、优化、分布与系统证据分开核算。
把模型状态、激活、并行、气泡、通信、专家、上下文、数值与可靠性分开核算。
把观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段分开核算。
下面 30 篇构成本专题首版主干。课程中的机制、公式与数字优先回到这些一手来源; - 更完整的 166 篇跨专题索引位于论文库。 + 更完整的 182 篇跨专题索引位于论文库。
SCALING / 04 EMPIRICAL LAWS & ENGINEERING
++ Scaling law 不是一句“堆算力”。它要说明横轴是什么、纵轴是什么、固定了什么, + 以及一条从小实验外推到昂贵训练的曲线,究竟有多大误差、在哪些条件下会失效。 +
+00 NINE LEDGERS
++ 同样写着 “scaling”,可能是在研究训练 loss、唯一数据、激活参数、累计推理请求或 RL FLOPs。 + 坐标不同,最佳决策甚至会朝相反方向移动。下面九张账是本章的防混淆协议。 +
+ +{body}
+01 POWER LAW INTUITION
+
+ 许多实验观察到可约误差随资源 x 近似按 x-α 下降。
+ 取对数后,乘法变加法、指数变斜率,所以跨多个数量级的弯曲关系会变成近似直线。
+
若 α 很小,每次翻倍只改善一点;跨越 10³–10⁶ 倍资源后,累积效果才显著。
数据分布、架构、优化器或指标改变后,前因子、指数、下界乃至函数形状都会改变。
十个点能画出漂亮直线;真正的验证是把更大的目标 run 留到最后再揭晓。
02 2017 → 2026
++ Scaling laws 不是 GPT-3 后突然出现。2017 年的跨任务经验、2018 年的大 batch 统计, + 先把可预测性与训练效率摆上桌;语言模型只是把实验推到更大的数量级。 +
+ +{body}
03 KAPLAN 2020
++ Scaling Laws for Neural Language Models + 在 WebText2 和一族 Transformer 上分别研究参数受限、数据受限与计算受限的情况。 + 论文把 “规模有效” 变成了可拟合、可规划的工程问题。 +
+ +N 是 non-embedding parameters;需有足够数据并训练到接近收敛。
D 是 Token;常数依赖 WebText2、词表与 tokenizer。
该 recipe 下,大部分新增算力被分给更大的模型,数据增长较慢。
++ 固定 3,000-step warmup、last-layer FLOPs 计数与不同规模的优化器调参方式都会影响谷底。 + 2024 年复现实验证明,recipe 公平性可以改变看到的指数。 +
+04 CHINCHILLA 2022
+
+ Training Compute-Optimal Large Language Models
+ 不只训练一个大模型,而是用三套方法寻找多个固定预算下的最优 N × D 配比。
+ 三套结果共同指向:算力增长时,参数与 Token 应近似同比例增长。
+
{title}{body}
+ {n} + {d} ++ 表 3 的 1B→20.2B Token、10B→205.1B、67B→1.5T 形成约 20 TPP 的实用近似; + 它不保证跨数据质量、tokenizer、MoE、优化器或部署目标保持不变。 +
+05 ISOFLOP METHOD
++ 固定一笔 compute budget,模型变大时能看的 Token 必须变少。最小模型可能容量不足,最大模型可能数据不足, + 中间就形成一条 U 型 IsoFLOP 曲线。对多个预算重复,连接谷底才得到 compute-optimal frontier。 +
+ +至少多个跨数量级的训练 FLOPs。
每个预算都要覆盖谷底两侧。
不同规模的 LR、batch、warmup 需公平。
记录最优 N、D 与最终 loss。
用未参与拟合的大 run 检查误差。
06 REPLICATION & RECONCILIATION
++ 2024 年两条复现路线把争议从口号拉回实验细节。 + Chinchilla replication 检查原论文 Approach 3 的拟合; + Resolving Discrepancies 则从 Kaplan 风格训练重做实验。 +
+ +小模型大量训练仍在 warmup
谷底被推向更大模型
像是“规模定律”,实含 recipe 偏差
+ Scaling law 最值得学习的不是某个小数点,而是实验协议:定义、覆盖、调参、留出、误差条和失败条件。 ++
07 DATA-CONSTRAINED REGIME
+
+ Scaling Data-Constrained Language Models
+ 用 UD 表示唯一数据,用 RD 表示重复次数:
+ D = UD × (RD + 1)。这个拆分让“训练了多少 Token”和“拥有多少新语料”不再混写。
+
第一次出现的内容;筛选和去重决定底层分布。
+训练系统真实处理的量;每次重复仍付完整算力。
+不可直接测量的教学概念;重复、质量与正则化会改变它。
++ 2026 年的 SoftQ 进一步让模型与有限数据项发生耦合, + 并研究强权重衰减与 masked-input regularization。它是数据受限前沿的新证据,不是已定型的新常数。 +
+08 OVER-TRAINING & DEPLOYMENT
++ Chinchilla 只优化训练。如果一个模型会被调用十亿次,更小模型即使预训练更久, + 每次推理节省的计算也可能把额外训练成本赚回来。 +
+ +目标函数一变,最优点就可以从“大模型、少训练”移动到“小模型、长训练”。
+参数与数据在固定训练 FLOPs 下配平;不关心模型上线后调用多少次。
+用更多预训练摊薄每次调用;最终位置依赖流量、上下文、batch、硬件和寿命。
++ Sardana et al. 训练 47 个 150M–6B 模型, + 在研究范围内没有看到极高 TPP 的 loss 完全停止改善;这不证明无限长训。 +
++ Gadre et al. 发现多个 token multiplier 的 + reducible-loss 曲线近似平行;aggregate downstream error 比单任务更可预测。 +
++ Catastrophic overtraining 提醒: + 更低预训练 loss 可能伴随后续 fine-tuning 更困难,两阶段目标必须分账。 +
+09 EMERGENCE DEBATE
++ Emergent Abilities 系统记录多项任务在规模上从近随机跃升。 + Mirage 随后证明,非线性或不连续指标本身就能制造这种外观。 +
+ +Token-level、Brier score、edit distance,检查底层进展是否仍有拐点。
稀疏规模点和高方差 benchmark 很容易把噪声看成阈值。
若多个连续指标、种子和数据集都出现稳定转折,才追查数据或网络机制。
10 BEYOND DENSE N × D
++ Dense 模型里,参数量常能粗略代理每 Token 计算。MoE 把这条绑定拆开:模型可以拥有巨大总容量, + 每个 Token 只激活一小部分;但未激活参数仍需存储,路由还会引入通信和负载不均。 +
+ +模型能装下多少专家与知识
+该 Token 实际进入多少参数
+权重、dispatch、最慢 rank 与拓扑
+经典 scaling law 主轴。
容量、激活计算与序列长度。
数据生成、搜索和生命周期成本。
+ 因此 K3 报告所说的“双轴 scaling”——扩大预训练 foundation,同时扩大 RL、reasoning effort 与 agent 协作——
+ 不能被压回一条 L(N,D)。它们优化不同目标、消费不同数据、产生不同状态。
+
11 DEEPSEEK SPOTLIGHT
+
+ DeepSeek LLM §3 的重要性在于把 scaling study
+ 变成训练大模型前的工程程序:先搜索 batch / LR,再决定模型—数据配比,并用更贴近算术的 M 替代参数数。
+
系数只属于论文单位与实验族,不是通用配置。
+把 attention 随 sequence length 的计算纳入 non-embedding FLOPs/token。
+数据分布改变时,论文 §3.3 的 exponent 也会改变。
+{step.body}
+12 KIMI K2 → K3
++ Kimi K2 把高质量数据有限写进动机; + Kimi K3 则对包含新架构、新数据与新训练配方的模型家族重新做 scaling study。 +
+ +{step.body}
+overall scaling efficiency vs K2
作者在 held-out OOD validation loss–FLOPs fitted curves 上报告的 family-level 横向差异。
KDA、AttnRes、Stable LatentMoE、数据与训练 recipe 的合计影响。
单个组件消融、吞吐 2.5×、参数少 2.5×、所有 benchmark 都提升 2.5×。
足以独立重建全部曲线的原始 run 点、拟合代码、置信区间与完整数据配比。
+ K3 最值得带走的方法不是“cosine 永远优于 WSD”,而是不同 schedule 必须各自寻找近优 batch 与 peak LR,才能公平比较。 ++
13 INTERACTIVE LAB
++ 四个实验分别核算训练分配、生命周期成本、数据复用和指标变换。所有输出都是确定性教学模拟; + 它们展示因果方向和边界,不预测任何真实模型的 loss、价格或能力。 +
+14 CURVE READING PROTOCOL
+CE、BPB、PPL、平均错误率或单任务 accuracy?
参数、Token、FLOPs、GPU hour、请求还是 test-time compute?
total、non-embedding、active,是否包含 embedding / ViT?
unique、seen、重复、合成,tokenizer 是否一致?
6ND、真实算子 FLOPs,还是硬件峰值与 GPU hours?
架构、数据、优化器与训练稳定机制是否一起变化?
没有两侧就无法证明找到了最优点。
不同规模与 schedule 是否各自调 LR、batch、warmup?
拟合内漂亮不代表跨 100× compute 外推准确。
seed 方差、bootstrap CI、残差和版本是否公开?
训练 loss、部署总成本、下游平均还是 post-training 后能力?
原始点、拟合代码、数据配比与失败 run 都影响可信度。
+ 曲线告诉你在当前条件下资源如何换 loss; + 谷底告诉你当前目标怎样分配预算; + 误差条告诉你能信多远; + 边界告诉你换数据、架构、阶段或经济目标后必须重新实验。 +
+15 PRIMARY-SOURCE READING CHAIN
++ 推荐顺序:Hestness → Kaplan → Chinchilla → data-constrained / inference-aware → + replication / reconciliation → DeepSeek LLM → K2 / K3。涌现与 broken laws 可作为平行争议线。 +
+ +{note}
+ + ))} +Scaling law 把数据写成 D,数据工程则解释为什么两个同样大的 D,可能有完全不同的学习价值。
+