204 lines
10 KiB
Markdown
204 lines
10 KiB
Markdown
# 数据工程与预训练配方 · Grok Discovery Leads
|
||
|
||
> **未核验线索,不是正式研究账本。**
|
||
>
|
||
> 2026-07-29 使用本机 Grok CLI Headless 扩展候选论文、关键词与视觉方案。
|
||
> 正式结论只进入 `DATA_PRETRAINING_RESEARCH.md`,且必须回到论文、技术报告、数据卡或作者实现。
|
||
> Grok 被明确禁止调用子代理;其输出只承担“还有什么值得查”,不承担“事实究竟是什么”。
|
||
|
||
---
|
||
|
||
## 1. Grok 建议的十二张候选账
|
||
|
||
| 账 | 候选问题 | 候选关键词 |
|
||
|---|---|---|
|
||
| L1 来源与治理 | 数据来自哪里,是否允许获取、研究、训练与再分发 | data card、license、consent、robots、provenance、governance |
|
||
| L2 提取与解析 | HTML、PDF、代码与表格怎样变成没有被破坏的文档 | boilerplate removal、DOM、OCR、code parser、structural validation |
|
||
| L3 语言与领域 | 语言识别、领域识别和长尾覆盖怎样度量 | fastText、language ID、domain classifier、long tail |
|
||
| L4 质量过滤 | “高质量”由哪些可观测量定义 | heuristic、classifier、educational value、toxicity、PII |
|
||
| L5 去重 | exact、fuzzy、semantic 各去掉什么,又会误删什么 | hash、MinHash、LSH、embedding、cluster、frequency |
|
||
| L6 混合与采样 | 数据占比怎样变成模型能力的组合 | mixture weight、temperature、upsampling、proxy model、DoReMi |
|
||
| L7 Tokenizer 与 Packing | 文档怎样变成 Token 和训练序列 | BBPE、compression、BPB、best-fit packing、sample mask、FIM |
|
||
| L8 课程与退火 | 不同数据和长度何时进入训练 | curriculum、annealing、mid-training、continual pretraining、WSD |
|
||
| L9 合成与改写 | 重复、改写、翻译和生成数据有何不同 | WRAP、rephrasing、fidelity、teacher bias、model collapse |
|
||
| L10 污染与记忆 | benchmark、隐私和长串复现如何被发现 | decontamination、memorization、extraction、canary |
|
||
| L11 原生多模态 | 图片、视频、OCR、代码渲染怎样与文本共同训练 | caption、interleaved、MM1、native multimodal、coordinate supervision |
|
||
| L12 数据价值 | 哪个样本值得下一个训练 FLOP | influence、gradient matching、DSIR、MATES、JEST、data selection |
|
||
|
||
这十二张账是 discovery taxonomy,不表示这些问题可以被压缩成一个“数据质量总分”。
|
||
|
||
---
|
||
|
||
## 2. 候选历史节点
|
||
|
||
### 2019–2021:把互联网变成可训练语料
|
||
|
||
- T5 / C4:Common Crawl 清洗与 text-to-text 统一任务;
|
||
- CCNet:去重、语言识别与近似 Wikipedia 质量过滤;
|
||
- The Pile:22 个异质子语料与明确 mixture;
|
||
- ROOTS / BigScience:多语言、治理、数据卡与协作式语料建设;
|
||
- Gopher:大规模网页质量分类与 mixture 工程;
|
||
- Carlini et al.:训练数据抽取与隐私记忆风险。
|
||
|
||
### 2022–2023:去重、混合与数据中心化
|
||
|
||
- Lee et al.:近重复会污染验证集并放大记忆;
|
||
- FIM:预训练数据变换可以增加代码“补中间”能力;
|
||
- DoReMi:用小代理模型学习 domain weights;
|
||
- RefinedWeb:过滤网页数据可以支撑强模型;
|
||
- SemDeDup:embedding 空间中的语义去重;
|
||
- D4:去重之后继续做多样性选择;
|
||
- DSIR:按目标分布重要性重采样。
|
||
|
||
### 2024:公开数据工程成为可比较实验
|
||
|
||
- Dolma:3T English Token、开放工具与文档;
|
||
- FineWeb:大规模网页数据的清洗消融;
|
||
- DCLM:统一 pool、模型尺度与评测协议;
|
||
- WRAP:改写网页文档而不是只做原文多 epoch;
|
||
- MATES:模型感知的数据选择;
|
||
- SoftDedup:按频率降权,而非“一刀切”删除;
|
||
- Best-fit Packing:减少文档截断;
|
||
- MM1:多模态数据 mixture 消融;
|
||
- DeepSeek LLM / Math / V2 / V3:全局去重、领域构造、packing、FIM 与训练配方。
|
||
|
||
### 2025–2026:数据稀缺、合成扩展与超长上下文
|
||
|
||
- Kimi K2:知识与数学改写、15.5T Token、WSD 与长上下文激活;
|
||
- Swallow:代码与数学合成数据的受控持续预训练;
|
||
- Common Pile:更强调公开许可的数据源组合;
|
||
- Group-MATES:group-level data influence;
|
||
- DeepSeek-V4:过滤批量自动生成 / 模板内容、长文档与 agentic mid-training;
|
||
- Kimi K3:四文本域 + 大规模视觉语料、原生多模态与 8K → 64K → 256K → 1M 课程。
|
||
|
||
---
|
||
|
||
## 3. 候选论文池
|
||
|
||
下面只表示“值得回查”。表中的数字、结论和适用范围尚未因出现在这里而获得证据等级。
|
||
|
||
| 方向 | 候选来源 |
|
||
|---|---|
|
||
| 网页清洗 | T5/C4、CCNet、RefinedWeb、FineWeb、DCLM |
|
||
| 开放语料 | The Pile、ROOTS、Dolma、Common Pile |
|
||
| 质量分类 | Gopher data pipeline、FineWeb-Edu、DCLM fastText classifier |
|
||
| exact / fuzzy dedup | Lee et al. 2021、SlimPajama、Dolma |
|
||
| semantic dedup | SemDeDup、D4、SoftDedup |
|
||
| mixture | DoReMi、DSIR、Data Mixing Laws、RegMix |
|
||
| packing | Fewer Truncations Improve Language Modeling |
|
||
| FIM | Efficient Training of Language Models to Fill in the Middle |
|
||
| 改写 | WRAP、Swallow、Kimi K2、Kimi K3 |
|
||
| 动态数据价值 | MATES、Group-MATES、LESS、JEST |
|
||
| 污染 | Carlini extraction、Detecting Pretraining Data from LLMs、Contamination Detection |
|
||
| 多模态 mixture | MM1、JEST、Kimi K2.5、Kimi K3 |
|
||
| 长上下文数据 | DeepSeek-V4、Kimi K3、Long-context synthetic retrieval |
|
||
|
||
---
|
||
|
||
## 4. 候选视觉
|
||
|
||
1. **一条文档的生命线**
|
||
来源 → 下载 → 解析 → 语言 / 领域 → 质量 / 安全 → 去重 → 污染隔离 → 混合 → 改写 / FIM → Tokenize → Packing → Batch。
|
||
|
||
2. **去重显微镜**
|
||
同时展示 exact hash、shingle MinHash 与 embedding 相似度;拖动阈值观察漏删、误删和长尾损失。
|
||
|
||
3. **Mixture Studio**
|
||
调整 Web / Code / Math / Knowledge / Multimodal 权重;分开展示通用、代码、数学、多语言和平均 loss,不制造“万能能力分”。
|
||
|
||
4. **改写与重复实验**
|
||
对比 raw × epochs、faithful rephrase、错误 rephrase;展示 token utility、事实保真、风格多样性和生成成本。
|
||
|
||
5. **课程时间轴**
|
||
Token 轴上叠加学习率、batch、数据 mixture、context length、FIM 率与 synthetic 比例。
|
||
|
||
6. **污染火灾图**
|
||
benchmark 文档进入训练语料后,按 exact、n-gram、semantic、ground-truth overlap 不同检查器显示不同告警。
|
||
|
||
---
|
||
|
||
## 5. 候选互动实验
|
||
|
||
### 实验 A:Pipeline Ledger
|
||
|
||
- 输入:抓取量、解析通过率、质量阈值、去重阈值、许可 / PII 隔离策略;
|
||
- 输出:文档数、唯一 Token、各领域保留率、未知来源比例;
|
||
- 必须展示:减少的“量”不自动等于增加的“质量”。
|
||
|
||
### 实验 B:Dedup Lens
|
||
|
||
- 输入:exact / fuzzy / semantic 模式、相似度阈值、保留策略;
|
||
- 输出:duplicate precision / recall、benchmark overlap、长尾簇被删比例;
|
||
- 必须展示:同一句模板与真正重复文档不是同一个问题。
|
||
|
||
### 实验 C:Mixture Studio
|
||
|
||
- 输入:领域权重、temperature、目标验证集;
|
||
- 输出:各领域 loss / score 的 Pareto 变化;
|
||
- 必须展示:最优 mixture 依赖模型尺度、训练阶段与目标分布。
|
||
|
||
### 实验 D:Rewrite & Curriculum
|
||
|
||
- 输入:改写次数、fidelity、重复 epoch、context stage、长文 upsampling;
|
||
- 输出:有效新颖度、错误扩增、训练成本、长上下文覆盖;
|
||
- 必须展示:synthetic token 不是无成本的新事实。
|
||
|
||
---
|
||
|
||
## 6. 必须回到原文的高风险数字
|
||
|
||
- 任意语料的“原始文档数”“最终 Token 数”和过滤保留率;
|
||
- dedup 删除百分比,以及它是按文档、字节还是 Token 计;
|
||
- DCLM、FineWeb、WRAP、MATES、SoftDedup 的作者报告收益;
|
||
- Kimi K2 的 SimpleQA 改写消融;
|
||
- Kimi K2、DeepSeek-V3 / V4 的训练 Token 与 schedule;
|
||
- DeepSeek LLM 91 个 Common Crawl dump 的去重率;
|
||
- DeepSeekMath 的 120.2B corpus 和 500B continual-pretraining mixture;
|
||
- K3 的四文本域、视觉 taxonomy、原生多模态与长上下文阶段;
|
||
- 任何“X 倍更高效”的分母、模型大小、任务和预算。
|
||
|
||
---
|
||
|
||
## 7. 已在主代理回查中纠正的风险
|
||
|
||
1. **K3 没有披露总训练 Token 数。**
|
||
`2.78T` 是模型总参数,不是训练 Token;正式报告只描述数据域、pipeline 和训练阶段。
|
||
|
||
2. **K3 的 `2.5×` 不是某个数据技巧的独立收益。**
|
||
报告 §3.2 明确说它来自架构、数据和训练变化共同定义的新模型族,并在 held-out OOD scaling curve 上比较。
|
||
|
||
3. **K2 改写表不是普遍定律。**
|
||
`23.76 → 27.39 → 28.94` 来自 K2 早期 checkpoint、SimpleQA 与三种指定配置;生产中每个 corpus 最多改写两次。
|
||
|
||
4. **K2 的 WSD 与 K3 的 cosine 不构成简单胜负。**
|
||
K3 分别为两种 schedule 独立搜索 peak LR 和 batch 后才报告 cosine 更低;共享超参数会造成不公平比较。
|
||
|
||
5. **DeepSeek-V3 与 V4 的 packing 边界不同。**
|
||
V3 做 document packing 且不使用 cross-sample attention mask;V4 沿用 packing,但改为 sample-level attention masking。
|
||
|
||
6. **DeepSeek 的工业级语料仍是部分黑箱。**
|
||
报告公开阶段、部分总量和消融,但没有完整 source-by-source license map、最终 mixture、过滤阈值与 contamination 清单。
|
||
|
||
7. **“高质量”不能用 benchmark 提升循环定义。**
|
||
必须分别记录分类器目标、人工标注协议、保留率、误删率、长尾覆盖与独立验证。
|
||
|
||
8. **合成数据会继承生成模型偏差。**
|
||
fidelity filter 不能证明事实完全正确,也不能消除风格坍缩、毒性、版权、隐私或污染风险。
|
||
|
||
---
|
||
|
||
## 8. 从 leads 晋级正式账本的门槛
|
||
|
||
候选结论至少满足:
|
||
|
||
1. 找到稳定的一手入口;
|
||
2. 核对标题、作者、版本与年份;
|
||
3. 读到支持结论的正文 / 表格 / 附录,而不仅是搜索摘要;
|
||
4. 记录实验对象、模型大小、Token 预算、数据与评测协议;
|
||
5. 区分作者报告、独立复现与课程推导;
|
||
6. 明确失败条件与不可外推范围;
|
||
7. 数字能追到表、图、公式或可复现实验;
|
||
8. 无法公开确认的工业细节明确写为“未知”。
|
||
|
||
这份文件的价值不是“收集得多”,而是把发现阶段与证据阶段永久隔开。
|