Files
llm-atlas/research/sources/README.md
T

5.7 KiB
Raw Blame History

本地来源缓存

这里用于研究期间缓存论文 PDF、网页快照与文本抽取。二进制和全文缓存默认被 .gitignore 排除;公开仓库只提交 canonical URL、校验信息、研究笔记和允许再分发的原创内容。

当前锚点:

语言模型前史首轮缓存位于 language-model-history/(不提交 PDF/TXT):

  • Shannon 1948 / 1951;
  • Bengio et al. 2003;
  • Morin & Bengio 2005;
  • Mikolov et al. 2010;
  • Luong et al. 2015。

其余已核节点通过 DOI、ACL Anthology、PMLR、ISCA、JMLR、NeurIPS 或官方 arXiv 页面定位, 完整证据边界见 ../LANGUAGE_MODEL_HISTORY_RESEARCH.md。

Alignment 首轮缓存位于 alignment/(不提交 PDF/TXT):

  • Christiano 2017、Ziegler 2019、Stiennon 2020 与 InstructGPT;
  • Natural Instructions、FLAN、T0、HH-RLHF、Constitutional AI 与 Self-Instruct;
  • DPO、RRHF、SLiC-HF、LIMA、RLAIF、UltraFeedback、IPO、KTO、ORPO、RewardBench 与 SimPO。

DeepSeek LLM/V2/V3/R1/V3.2/V4、Kimi K2/K2.5/K3 与 MOPD 复用既有本地缓存。 正式机制、公式、版本边界与 44 节点论文链见 ../ALIGNMENT_RESEARCH.md;Grok 候选线索单独保存在 ../ALIGNMENT_GROK_LEADS.md,不能直接作为正文证据。

Agent 首轮缓存位于 agents/(不提交 PDF/TXT):

  • TextWorld、Jericho、ALFWorld、ScienceWorld、WebShop 等可执行环境前史;
  • WebGPT、SayCan、ReAct、Toolformer、Reflexion、ToolLLM、WebArena、SWE-agent 与 OSWorld;
  • τ-bench / τ²-bench、AgentDojo、ToolSandbox、BFCL、RAGEN、Agent Lightning 与 AgentENV;
  • DeepSeek-V3.2/V4、Kimi K2/K2.5/K3 等模型族报告中的 Agent 数据、harness、验证器与长轨迹系统。

首轮共核验 35 份新增 PDF,其中 BFCL 使用 ICML/PMLR 正式版本;DeepSeek、Kimi 与部分既有节点 复用其他专题缓存。十四张问题账、52 节点论文链、四个交互实验合同与证据边界见 ../AGENTS_RESEARCH.md;Grok Headless 只负责扩展召回,未核验候选永久隔离在 ../AGENTS_GROK_LEADS.md。

原生多模态首轮缓存位于 multimodal/(不提交 PDF/TXT):

  • ResNet、ViT、ALIGN、CLIP、LiT、BLIP、SigLIP 与 NaViT;
  • DeepSeek-VL2、Janus-Pro、DeepSeek-OCR、DeepSeek-OCR2 与 Kimi-VL;
  • Kimi K2.5 与 K3 复用 reasoning/、kimi-k3/ 中的官方技术报告缓存。

本轮本地完整校验 13 份 PDF,并通过官方 arXiv HTML、作者仓库和既有 K2.5/K3 报告核验其余核心节点。 DeepSeek-VL/VL2、Janus、OCR 三分支,Kimi 三代 MoonViT、十六张问题账、55 节点正文链与四实验合同见 ../MULTIMODAL_RESEARCH.md;Grok Headless 候选召回只保存在 ../MULTIMODAL_GROK_LEADS.md,不得作为正式事实来源。

推理服务首轮缓存位于 inference-serving/(不提交 PDF/TXT):

  • Clockwork、Orca、vLLM / PagedAttention、SGLang、Sarathi、Llumnix、Splitwise 与 DistServe;
  • speculative decoding / sampling、SpecInfer、Medusa、EAGLE / EAGLE-2 / EAGLE-3;
  • GPTQ、SmoothQuant、AWQ、KVQuant、KIVI、QServe、FlashInfer 与 Mooncake;
  • DeepSeek-V2/V3/V3.2/V4、Kimi Linear/K3 与 DeepGEMM/FlashMLA/DeepEP 复用既有报告或官方仓库缓存。

本轮完整校验 26 份新增 PDF/TXT;AlpaServe 只以 canonical arXiv 页面定位,未把不完整本地下载 计入全文证据。十八本独立账、62 节点阅读链、DeepSeek 与 Kimi 服务谱系、十五组视觉合同和 四实验合同见 ../INFERENCE_SERVING_RESEARCH.md。Grok Headless 的 70 个候选只保存在 ../INFERENCE_SERVING_GROK_LEADS.md,不能越过一手来源核验进入正文。

评测与安全首轮缓存位于 evaluation-safety/(不提交 PDF/TXT):

  • 指标与套件:BLEU、ROUGE、GLUE、SuperGLUE、MMLU-Pro / Redux、PALOMA 与 RULER;
  • 动态与代码:Dynabench、FreshLLMs、LiveBench、HumanEval、EvalPlus、LiveCodeBench 与 SWE-bench Live;
  • 裁判与偏好:MT-Bench、G-Eval、LLMBar、Length-Controlled AlpacaEval、Arena-Hard 与 Chatbot Arena;
  • 安全与 Agent:RealToxicity、ToxiGen、GCG、HarmBench、StrongREJECT、JailbreakBench、InjecAgent、 Cybench、WildGuard 与 AILuminate;
  • DeepSeek LLM/Math/V2/V3/R1/V3.2/V4 与 Kimi K3 复用既有模型报告缓存。

本轮完整校验 50 份新增 PDF/TXT;Global MMLU 通过 canonical arXiv 导出入口取得,PDF 可读性警告 未影响文本核验。二十二张测量账、80 节点阅读链、DeepSeek/K3 协议谱系、四实验合同与证据边界见 ../EVALUATION_SAFETY_RESEARCH.md。Grok Headless 仅生成教学问题和候选线索,永久隔离在 ../EVALUATION_SAFETY_GROK_LEADS.md,不能作为正式事实来源。

表示、位置与残差首轮缓存位于 representation/(不提交 PDF/TXT/XML):

  • 表示与 token:output embedding / weight tying、ELMo、FFN memories 与 Byte Latent Transformer;
  • 位置与外推:RoPE、ALiBi、xPos、NoPE study、Position Interpolation、YaRN、FIRE 与 LongRoPE;
  • 归一化与深度:LayerNorm、RMSNorm、Pre-LN、Fixup、ReZero、Admin、QK-Norm、NormFormer、DeepNet 与 nGPT;
  • 深度路由与激活:Hyper-Connections、mHC、Attention Residuals、GLU / SwiGLU;
  • DeepSeek-V2/V3/V4 与 Kimi Linear/K3 复用 long-context/、moe/、numerics/ 和 kimi-k3/ 的官方报告缓存。

二十张问题账、66 节点阅读链、DeepSeek / Kimi 对照、公式边界与四实验合同见 ../REPRESENTATION_RESEARCH.md。Grok Headless 只扩展候选召回,未核验线索永久隔离在 ../REPRESENTATION_GROK_LEADS.md,不得直接作为正文证据。