10 KiB
数据工程与预训练配方 · Grok Discovery Leads
未核验线索,不是正式研究账本。
2026-07-29 使用本机 Grok CLI Headless 扩展候选论文、关键词与视觉方案。
正式结论只进入DATA_PRETRAINING_RESEARCH.md,且必须回到论文、技术报告、数据卡或作者实现。
Grok 被明确禁止调用子代理;其输出只承担“还有什么值得查”,不承担“事实究竟是什么”。
1. Grok 建议的十二张候选账
| 账 | 候选问题 | 候选关键词 |
|---|---|---|
| L1 来源与治理 | 数据来自哪里,是否允许获取、研究、训练与再分发 | data card、license、consent、robots、provenance、governance |
| L2 提取与解析 | HTML、PDF、代码与表格怎样变成没有被破坏的文档 | boilerplate removal、DOM、OCR、code parser、structural validation |
| L3 语言与领域 | 语言识别、领域识别和长尾覆盖怎样度量 | fastText、language ID、domain classifier、long tail |
| L4 质量过滤 | “高质量”由哪些可观测量定义 | heuristic、classifier、educational value、toxicity、PII |
| L5 去重 | exact、fuzzy、semantic 各去掉什么,又会误删什么 | hash、MinHash、LSH、embedding、cluster、frequency |
| L6 混合与采样 | 数据占比怎样变成模型能力的组合 | mixture weight、temperature、upsampling、proxy model、DoReMi |
| L7 Tokenizer 与 Packing | 文档怎样变成 Token 和训练序列 | BBPE、compression、BPB、best-fit packing、sample mask、FIM |
| L8 课程与退火 | 不同数据和长度何时进入训练 | curriculum、annealing、mid-training、continual pretraining、WSD |
| L9 合成与改写 | 重复、改写、翻译和生成数据有何不同 | WRAP、rephrasing、fidelity、teacher bias、model collapse |
| L10 污染与记忆 | benchmark、隐私和长串复现如何被发现 | decontamination、memorization、extraction、canary |
| L11 原生多模态 | 图片、视频、OCR、代码渲染怎样与文本共同训练 | caption、interleaved、MM1、native multimodal、coordinate supervision |
| L12 数据价值 | 哪个样本值得下一个训练 FLOP | influence、gradient matching、DSIR、MATES、JEST、data selection |
这十二张账是 discovery taxonomy,不表示这些问题可以被压缩成一个“数据质量总分”。
2. 候选历史节点
2019–2021:把互联网变成可训练语料
- T5 / C4:Common Crawl 清洗与 text-to-text 统一任务;
- CCNet:去重、语言识别与近似 Wikipedia 质量过滤;
- The Pile:22 个异质子语料与明确 mixture;
- ROOTS / BigScience:多语言、治理、数据卡与协作式语料建设;
- Gopher:大规模网页质量分类与 mixture 工程;
- Carlini et al.:训练数据抽取与隐私记忆风险。
2022–2023:去重、混合与数据中心化
- Lee et al.:近重复会污染验证集并放大记忆;
- FIM:预训练数据变换可以增加代码“补中间”能力;
- DoReMi:用小代理模型学习 domain weights;
- RefinedWeb:过滤网页数据可以支撑强模型;
- SemDeDup:embedding 空间中的语义去重;
- D4:去重之后继续做多样性选择;
- DSIR:按目标分布重要性重采样。
2024:公开数据工程成为可比较实验
- Dolma:3T English Token、开放工具与文档;
- FineWeb:大规模网页数据的清洗消融;
- DCLM:统一 pool、模型尺度与评测协议;
- WRAP:改写网页文档而不是只做原文多 epoch;
- MATES:模型感知的数据选择;
- SoftDedup:按频率降权,而非“一刀切”删除;
- Best-fit Packing:减少文档截断;
- MM1:多模态数据 mixture 消融;
- DeepSeek LLM / Math / V2 / V3:全局去重、领域构造、packing、FIM 与训练配方。
2025–2026:数据稀缺、合成扩展与超长上下文
- Kimi K2:知识与数学改写、15.5T Token、WSD 与长上下文激活;
- Swallow:代码与数学合成数据的受控持续预训练;
- Common Pile:更强调公开许可的数据源组合;
- Group-MATES:group-level data influence;
- DeepSeek-V4:过滤批量自动生成 / 模板内容、长文档与 agentic mid-training;
- Kimi K3:四文本域 + 大规模视觉语料、原生多模态与 8K → 64K → 256K → 1M 课程。
3. 候选论文池
下面只表示“值得回查”。表中的数字、结论和适用范围尚未因出现在这里而获得证据等级。
| 方向 | 候选来源 |
|---|---|
| 网页清洗 | T5/C4、CCNet、RefinedWeb、FineWeb、DCLM |
| 开放语料 | The Pile、ROOTS、Dolma、Common Pile |
| 质量分类 | Gopher data pipeline、FineWeb-Edu、DCLM fastText classifier |
| exact / fuzzy dedup | Lee et al. 2021、SlimPajama、Dolma |
| semantic dedup | SemDeDup、D4、SoftDedup |
| mixture | DoReMi、DSIR、Data Mixing Laws、RegMix |
| packing | Fewer Truncations Improve Language Modeling |
| FIM | Efficient Training of Language Models to Fill in the Middle |
| 改写 | WRAP、Swallow、Kimi K2、Kimi K3 |
| 动态数据价值 | MATES、Group-MATES、LESS、JEST |
| 污染 | Carlini extraction、Detecting Pretraining Data from LLMs、Contamination Detection |
| 多模态 mixture | MM1、JEST、Kimi K2.5、Kimi K3 |
| 长上下文数据 | DeepSeek-V4、Kimi K3、Long-context synthetic retrieval |
4. 候选视觉
-
一条文档的生命线
来源 → 下载 → 解析 → 语言 / 领域 → 质量 / 安全 → 去重 → 污染隔离 → 混合 → 改写 / FIM → Tokenize → Packing → Batch。 -
去重显微镜
同时展示 exact hash、shingle MinHash 与 embedding 相似度;拖动阈值观察漏删、误删和长尾损失。 -
Mixture Studio
调整 Web / Code / Math / Knowledge / Multimodal 权重;分开展示通用、代码、数学、多语言和平均 loss,不制造“万能能力分”。 -
改写与重复实验
对比 raw × epochs、faithful rephrase、错误 rephrase;展示 token utility、事实保真、风格多样性和生成成本。 -
课程时间轴
Token 轴上叠加学习率、batch、数据 mixture、context length、FIM 率与 synthetic 比例。 -
污染火灾图
benchmark 文档进入训练语料后,按 exact、n-gram、semantic、ground-truth overlap 不同检查器显示不同告警。
5. 候选互动实验
实验 A:Pipeline Ledger
- 输入:抓取量、解析通过率、质量阈值、去重阈值、许可 / PII 隔离策略;
- 输出:文档数、唯一 Token、各领域保留率、未知来源比例;
- 必须展示:减少的“量”不自动等于增加的“质量”。
实验 B:Dedup Lens
- 输入:exact / fuzzy / semantic 模式、相似度阈值、保留策略;
- 输出:duplicate precision / recall、benchmark overlap、长尾簇被删比例;
- 必须展示:同一句模板与真正重复文档不是同一个问题。
实验 C:Mixture Studio
- 输入:领域权重、temperature、目标验证集;
- 输出:各领域 loss / score 的 Pareto 变化;
- 必须展示:最优 mixture 依赖模型尺度、训练阶段与目标分布。
实验 D:Rewrite & Curriculum
- 输入:改写次数、fidelity、重复 epoch、context stage、长文 upsampling;
- 输出:有效新颖度、错误扩增、训练成本、长上下文覆盖;
- 必须展示:synthetic token 不是无成本的新事实。
6. 必须回到原文的高风险数字
- 任意语料的“原始文档数”“最终 Token 数”和过滤保留率;
- dedup 删除百分比,以及它是按文档、字节还是 Token 计;
- DCLM、FineWeb、WRAP、MATES、SoftDedup 的作者报告收益;
- Kimi K2 的 SimpleQA 改写消融;
- Kimi K2、DeepSeek-V3 / V4 的训练 Token 与 schedule;
- DeepSeek LLM 91 个 Common Crawl dump 的去重率;
- DeepSeekMath 的 120.2B corpus 和 500B continual-pretraining mixture;
- K3 的四文本域、视觉 taxonomy、原生多模态与长上下文阶段;
- 任何“X 倍更高效”的分母、模型大小、任务和预算。
7. 已在主代理回查中纠正的风险
-
K3 没有披露总训练 Token 数。
2.78T是模型总参数,不是训练 Token;正式报告只描述数据域、pipeline 和训练阶段。 -
K3 的
2.5×不是某个数据技巧的独立收益。
报告 §3.2 明确说它来自架构、数据和训练变化共同定义的新模型族,并在 held-out OOD scaling curve 上比较。 -
K2 改写表不是普遍定律。
23.76 → 27.39 → 28.94来自 K2 早期 checkpoint、SimpleQA 与三种指定配置;生产中每个 corpus 最多改写两次。 -
K2 的 WSD 与 K3 的 cosine 不构成简单胜负。
K3 分别为两种 schedule 独立搜索 peak LR 和 batch 后才报告 cosine 更低;共享超参数会造成不公平比较。 -
DeepSeek-V3 与 V4 的 packing 边界不同。
V3 做 document packing 且不使用 cross-sample attention mask;V4 沿用 packing,但改为 sample-level attention masking。 -
DeepSeek 的工业级语料仍是部分黑箱。
报告公开阶段、部分总量和消融,但没有完整 source-by-source license map、最终 mixture、过滤阈值与 contamination 清单。 -
“高质量”不能用 benchmark 提升循环定义。
必须分别记录分类器目标、人工标注协议、保留率、误删率、长尾覆盖与独立验证。 -
合成数据会继承生成模型偏差。
fidelity filter 不能证明事实完全正确,也不能消除风格坍缩、毒性、版权、隐私或污染风险。
8. 从 leads 晋级正式账本的门槛
候选结论至少满足:
- 找到稳定的一手入口;
- 核对标题、作者、版本与年份;
- 读到支持结论的正文 / 表格 / 附录,而不仅是搜索摘要;
- 记录实验对象、模型大小、Token 预算、数据与评测协议;
- 区分作者报告、独立复现与课程推导;
- 明确失败条件与不可外推范围;
- 数字能追到表、图、公式或可复现实验;
- 无法公开确认的工业细节明确写为“未知”。
这份文件的价值不是“收集得多”,而是把发现阶段与证据阶段永久隔开。