Files
llm-atlas/research/DATA_PRETRAINING_GROK_LEADS.md
2026-07-29 03:07:40 +08:00

10 KiB
Raw Permalink Blame History

数据工程与预训练配方 · Grok Discovery Leads

未核验线索,不是正式研究账本。

2026-07-29 使用本机 Grok CLI Headless 扩展候选论文、关键词与视觉方案。
正式结论只进入 DATA_PRETRAINING_RESEARCH.md,且必须回到论文、技术报告、数据卡或作者实现。
Grok 被明确禁止调用子代理;其输出只承担“还有什么值得查”,不承担“事实究竟是什么”。


1. Grok 建议的十二张候选账

候选问题 候选关键词
L1 来源与治理 数据来自哪里,是否允许获取、研究、训练与再分发 data card、license、consent、robots、provenance、governance
L2 提取与解析 HTML、PDF、代码与表格怎样变成没有被破坏的文档 boilerplate removal、DOM、OCR、code parser、structural validation
L3 语言与领域 语言识别、领域识别和长尾覆盖怎样度量 fastText、language ID、domain classifier、long tail
L4 质量过滤 “高质量”由哪些可观测量定义 heuristic、classifier、educational value、toxicity、PII
L5 去重 exact、fuzzy、semantic 各去掉什么,又会误删什么 hash、MinHash、LSH、embedding、cluster、frequency
L6 混合与采样 数据占比怎样变成模型能力的组合 mixture weight、temperature、upsampling、proxy model、DoReMi
L7 Tokenizer 与 Packing 文档怎样变成 Token 和训练序列 BBPE、compression、BPB、best-fit packing、sample mask、FIM
L8 课程与退火 不同数据和长度何时进入训练 curriculum、annealing、mid-training、continual pretraining、WSD
L9 合成与改写 重复、改写、翻译和生成数据有何不同 WRAP、rephrasing、fidelity、teacher bias、model collapse
L10 污染与记忆 benchmark、隐私和长串复现如何被发现 decontamination、memorization、extraction、canary
L11 原生多模态 图片、视频、OCR、代码渲染怎样与文本共同训练 caption、interleaved、MM1、native multimodal、coordinate supervision
L12 数据价值 哪个样本值得下一个训练 FLOP influence、gradient matching、DSIR、MATES、JEST、data selection

这十二张账是 discovery taxonomy,不表示这些问题可以被压缩成一个“数据质量总分”。


2. 候选历史节点

2019–2021:把互联网变成可训练语料

  • T5 / C4Common Crawl 清洗与 text-to-text 统一任务;
  • CCNet:去重、语言识别与近似 Wikipedia 质量过滤;
  • The Pile22 个异质子语料与明确 mixture;
  • ROOTS / BigScience:多语言、治理、数据卡与协作式语料建设;
  • Gopher:大规模网页质量分类与 mixture 工程;
  • Carlini et al.:训练数据抽取与隐私记忆风险。

2022–2023:去重、混合与数据中心化

  • Lee et al.:近重复会污染验证集并放大记忆;
  • FIM:预训练数据变换可以增加代码“补中间”能力;
  • DoReMi:用小代理模型学习 domain weights
  • RefinedWeb:过滤网页数据可以支撑强模型;
  • SemDeDupembedding 空间中的语义去重;
  • D4:去重之后继续做多样性选择;
  • DSIR:按目标分布重要性重采样。

2024:公开数据工程成为可比较实验

  • Dolma3T English Token、开放工具与文档;
  • FineWeb:大规模网页数据的清洗消融;
  • DCLM:统一 pool、模型尺度与评测协议;
  • WRAP:改写网页文档而不是只做原文多 epoch;
  • MATES:模型感知的数据选择;
  • SoftDedup:按频率降权,而非“一刀切”删除;
  • Best-fit Packing:减少文档截断;
  • MM1:多模态数据 mixture 消融;
  • DeepSeek LLM / Math / V2 / V3:全局去重、领域构造、packing、FIM 与训练配方。

2025–2026:数据稀缺、合成扩展与超长上下文

  • Kimi K2:知识与数学改写、15.5T Token、WSD 与长上下文激活;
  • Swallow:代码与数学合成数据的受控持续预训练;
  • Common Pile:更强调公开许可的数据源组合;
  • Group-MATESgroup-level data influence
  • DeepSeek-V4:过滤批量自动生成 / 模板内容、长文档与 agentic mid-training
  • Kimi K3:四文本域 + 大规模视觉语料、原生多模态与 8K → 64K → 256K → 1M 课程。

3. 候选论文池

下面只表示“值得回查”。表中的数字、结论和适用范围尚未因出现在这里而获得证据等级。

方向 候选来源
网页清洗 T5/C4、CCNet、RefinedWeb、FineWeb、DCLM
开放语料 The Pile、ROOTS、Dolma、Common Pile
质量分类 Gopher data pipeline、FineWeb-Edu、DCLM fastText classifier
exact / fuzzy dedup Lee et al. 2021、SlimPajama、Dolma
semantic dedup SemDeDup、D4、SoftDedup
mixture DoReMi、DSIR、Data Mixing Laws、RegMix
packing Fewer Truncations Improve Language Modeling
FIM Efficient Training of Language Models to Fill in the Middle
改写 WRAP、Swallow、Kimi K2、Kimi K3
动态数据价值 MATES、Group-MATES、LESS、JEST
污染 Carlini extraction、Detecting Pretraining Data from LLMs、Contamination Detection
多模态 mixture MM1、JEST、Kimi K2.5、Kimi K3
长上下文数据 DeepSeek-V4、Kimi K3、Long-context synthetic retrieval

4. 候选视觉

  1. 一条文档的生命线
    来源 → 下载 → 解析 → 语言 / 领域 → 质量 / 安全 → 去重 → 污染隔离 → 混合 → 改写 / FIM → Tokenize → Packing → Batch。

  2. 去重显微镜
    同时展示 exact hash、shingle MinHash 与 embedding 相似度;拖动阈值观察漏删、误删和长尾损失。

  3. Mixture Studio
    调整 Web / Code / Math / Knowledge / Multimodal 权重;分开展示通用、代码、数学、多语言和平均 loss,不制造“万能能力分”。

  4. 改写与重复实验
    对比 raw × epochs、faithful rephrase、错误 rephrase;展示 token utility、事实保真、风格多样性和生成成本。

  5. 课程时间轴
    Token 轴上叠加学习率、batch、数据 mixture、context length、FIM 率与 synthetic 比例。

  6. 污染火灾图
    benchmark 文档进入训练语料后,按 exact、n-gram、semantic、ground-truth overlap 不同检查器显示不同告警。


5. 候选互动实验

实验 APipeline Ledger

  • 输入:抓取量、解析通过率、质量阈值、去重阈值、许可 / PII 隔离策略;
  • 输出:文档数、唯一 Token、各领域保留率、未知来源比例;
  • 必须展示:减少的“量”不自动等于增加的“质量”。

实验 BDedup Lens

  • 输入:exact / fuzzy / semantic 模式、相似度阈值、保留策略;
  • 输出:duplicate precision / recall、benchmark overlap、长尾簇被删比例;
  • 必须展示:同一句模板与真正重复文档不是同一个问题。

实验 CMixture Studio

  • 输入:领域权重、temperature、目标验证集;
  • 输出:各领域 loss / score 的 Pareto 变化;
  • 必须展示:最优 mixture 依赖模型尺度、训练阶段与目标分布。

实验 DRewrite & Curriculum

  • 输入:改写次数、fidelity、重复 epoch、context stage、长文 upsampling
  • 输出:有效新颖度、错误扩增、训练成本、长上下文覆盖;
  • 必须展示:synthetic token 不是无成本的新事实。

6. 必须回到原文的高风险数字

  • 任意语料的“原始文档数”“最终 Token 数”和过滤保留率;
  • dedup 删除百分比,以及它是按文档、字节还是 Token 计;
  • DCLM、FineWeb、WRAP、MATES、SoftDedup 的作者报告收益;
  • Kimi K2 的 SimpleQA 改写消融;
  • Kimi K2、DeepSeek-V3 / V4 的训练 Token 与 schedule
  • DeepSeek LLM 91 个 Common Crawl dump 的去重率;
  • DeepSeekMath 的 120.2B corpus 和 500B continual-pretraining mixture
  • K3 的四文本域、视觉 taxonomy、原生多模态与长上下文阶段;
  • 任何“X 倍更高效”的分母、模型大小、任务和预算。

7. 已在主代理回查中纠正的风险

  1. K3 没有披露总训练 Token 数。
    2.78T 是模型总参数,不是训练 Token;正式报告只描述数据域、pipeline 和训练阶段。

  2. K3 的 2.5× 不是某个数据技巧的独立收益。
    报告 §3.2 明确说它来自架构、数据和训练变化共同定义的新模型族,并在 held-out OOD scaling curve 上比较。

  3. K2 改写表不是普遍定律。
    23.76 → 27.39 → 28.94 来自 K2 早期 checkpoint、SimpleQA 与三种指定配置;生产中每个 corpus 最多改写两次。

  4. K2 的 WSD 与 K3 的 cosine 不构成简单胜负。
    K3 分别为两种 schedule 独立搜索 peak LR 和 batch 后才报告 cosine 更低;共享超参数会造成不公平比较。

  5. DeepSeek-V3 与 V4 的 packing 边界不同。
    V3 做 document packing 且不使用 cross-sample attention maskV4 沿用 packing,但改为 sample-level attention masking。

  6. DeepSeek 的工业级语料仍是部分黑箱。
    报告公开阶段、部分总量和消融,但没有完整 source-by-source license map、最终 mixture、过滤阈值与 contamination 清单。

  7. “高质量”不能用 benchmark 提升循环定义。
    必须分别记录分类器目标、人工标注协议、保留率、误删率、长尾覆盖与独立验证。

  8. 合成数据会继承生成模型偏差。
    fidelity filter 不能证明事实完全正确,也不能消除风格坍缩、毒性、版权、隐私或污染风险。


8. 从 leads 晋级正式账本的门槛

候选结论至少满足:

  1. 找到稳定的一手入口;
  2. 核对标题、作者、版本与年份;
  3. 读到支持结论的正文 / 表格 / 附录,而不仅是搜索摘要;
  4. 记录实验对象、模型大小、Token 预算、数据与评测协议;
  5. 区分作者报告、独立复现与课程推导;
  6. 明确失败条件与不可外推范围;
  7. 数字能追到表、图、公式或可复现实验;
  8. 无法公开确认的工业细节明确写为“未知”。

这份文件的价值不是“收集得多”,而是把发现阶段与证据阶段永久隔开。