488 lines
38 KiB
Plaintext
488 lines
38 KiB
Plaintext
---
|
||
import BaseLayout from "@/layouts/BaseLayout.astro";
|
||
import { chapters } from "@/data/chapters";
|
||
|
||
const average = Math.round(chapters.reduce((sum, chapter) => sum + chapter.progress, 0) / chapters.length);
|
||
const published = chapters.filter((chapter) => chapter.status === "published").length;
|
||
const researching = chapters.filter((chapter) => ["researching", "drafting"].includes(chapter.status)).length;
|
||
|
||
const workstreams = [
|
||
{ label: "研究框架与规范", value: 83, next: "给 Scaling 与推理专题补逐篇图表/实验精读层级" },
|
||
{ label: "网站设计系统", value: 89, next: "打印样式与更多通用可视化组件" },
|
||
{ label: "Kimi K3 深读", value: 99, next: "设计前向训练变体,并等待 A_log 社区方案的官方裁决" },
|
||
{ label: "语言模型前史", value: 78, next: "逐图精读 Kneser–Ney、LSTM 与 Bahdanau,并加入真实小语料复现" },
|
||
{ label: "Transformer 基础", value: 79, next: "逐图精读多头电路、Pre/Post-LN 与真实 kernel / KV 配置" },
|
||
{ label: "表示、位置与残差高速公路", value: 81, next: "加入真实 hidden-state / norm traces、长上下文位置外推复现与更多深层稳定性消融" },
|
||
{ label: "Scaling Laws", value: 74, next: "加入真实拟合复现、置信区间与更多模型族对照" },
|
||
{ label: "数据工程与预训练配方", value: 73, next: "逐图精读 FineWeb / DCLM,加入真实去重与 mixture traces" },
|
||
{ label: "DeepSeek 专题", value: 99, next: "推进干预式 mediation、SM90 FlashMLA、FP8 / pipeline traces 与 R1-like RL 小模型复现" },
|
||
{ label: "指令微调与人类偏好", value: 75, next: "加入真实偏好分歧样本、RM 长度偏置与 PPO/DPO 小模型复现" },
|
||
{ label: "推理与测试时扩展", value: 76, next: "真实模型采样曲线、PRM 案例与逐篇图表精读" },
|
||
{ label: "工具使用与长程 Agent", value: 74, next: "补真实环境 traces、cross-harness 对照、Agent RL 训练曲线与安全案例" },
|
||
{ label: "原生多模态", value: 76, next: "补真实视觉 Token traces、跨分辨率消融、OCR 失败案例与视觉 Agent 安全轨迹" },
|
||
{ label: "稀疏计算与 MoE", value: 74, next: "补充真实集群 traces 与专家特化案例" },
|
||
{ label: "长上下文专题", value: 72, next: "加入更多论文逐图笔记与真实模型配置对比" },
|
||
{ label: "大规模训练系统", value: 71, next: "补真实集群 traces、故障案例与精确 topology 配置" },
|
||
{ label: "推理服务与低成本部署", value: 78, next: "补真实 GPU kernel / workload traces、功耗与跨框架复现" },
|
||
{ label: "数值精度、优化器与稳定性", value: 75, next: "加入真实 kernel 吞吐、长程训练 traces 与逐图论文精读" },
|
||
{ label: "评测、安全与“到底强不强”", value: 79, next: "补真实 cross-harness 复跑、Judge 元评测与动态污染案例" },
|
||
{ label: "引用与事实检查", value: 57, next: "自动化外链复查与来源等级扩展" },
|
||
{ label: "开源与部署", value: 100, next: "每轮保留不可变镜像、提交与回滚点" },
|
||
];
|
||
---
|
||
|
||
<BaseLayout
|
||
title="持续建设进度"
|
||
description="LLM Atlas 的研究、写作、可视化、引用核验、开源仓库与 k1412 部署实时进度。"
|
||
section="progress"
|
||
>
|
||
<header class="page-hero">
|
||
<div class="page-hero-inner">
|
||
<div>
|
||
<p class="eyebrow"><span>PUBLIC LEDGER</span> BUILD IN THE OPEN</p>
|
||
<h1>庞大工作需要一份<br />公开、可检查的账本</h1>
|
||
<p class="lead">
|
||
这里不把“正在研究”包装成“已经完成”。每个专题显示成熟度、下一检查点和证据边界;
|
||
本地 PROGRESS.md 与网站同步维护。
|
||
</p>
|
||
</div>
|
||
<dl class="page-facts">
|
||
<div><dt>OVERALL</dt><dd>专题平均 {average}%</dd></div>
|
||
<div><dt>READABLE</dt><dd>{published} 个首版可读专题</dd></div>
|
||
<div><dt>ACTIVE</dt><dd>{researching} 个研究/写作中</dd></div>
|
||
<div><dt>UPDATED</dt><dd>2026-07-30 14:42 CST</dd></div>
|
||
<div><dt>MODE</dt><dd>持续迭代,不锁死版本</dd></div>
|
||
</dl>
|
||
</div>
|
||
</header>
|
||
|
||
<section class="section" id="workstreams">
|
||
<div class="section-heading">
|
||
<div>
|
||
<p class="eyebrow"><span>01</span> WORKSTREAMS</p>
|
||
<h2>二十一条工作流同时推进,但不混淆“有页面”和“已核验”</h2>
|
||
</div>
|
||
<p class="section-lead">
|
||
内容首版优先打通全局脉络;随后每轮迭代选择一个专题推进到论文/工程层,并做独立事实复核。
|
||
</p>
|
||
</div>
|
||
|
||
<div class="stream-list">
|
||
{workstreams.map((stream, index) => (
|
||
<article>
|
||
<span>{String(index + 1).padStart(2, "0")}</span>
|
||
<div>
|
||
<h3>{stream.label}</h3>
|
||
<p>下一检查点:{stream.next}</p>
|
||
</div>
|
||
<div class="stream-progress">
|
||
<b>{stream.value}%</b>
|
||
<div class="progress-track"><span style={`width:${stream.value}%`}></span></div>
|
||
</div>
|
||
</article>
|
||
))}
|
||
</div>
|
||
</section>
|
||
|
||
<section class="section" id="done">
|
||
<div class="section-heading">
|
||
<div>
|
||
<p class="eyebrow"><span>02</span> COMPLETED THIS ITERATION</p>
|
||
<h2>当前版本已经落地什么</h2>
|
||
</div>
|
||
<p class="section-lead">下列项目都能在仓库或网站中直接检查,不是计划项。</p>
|
||
</div>
|
||
<div class="check-grid">
|
||
<article><span>✓</span><h3>研究目标已持久化</h3><p>总体路线、完成标准、来源等级与进度账本已写入项目。</p></article>
|
||
<article><span>✓</span><h3>K3 报告已结构化拆解</h3><p>47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。</p></article>
|
||
<article><span>✓</span><h3>17 专题知识图</h3><p>从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。</p></article>
|
||
<article><span>✓</span><h3>编辑式网站系统</h3><p>响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。</p></article>
|
||
<article><span>✓</span><h3>一百一十四个原创交互视图</h3><p>K3 三轴图、八联报告实验、四联开放工件实验与五轮二十五联 AttnRes 独立实验,DeepSeek 四联公式实验、十三联 Base 工件实验、Chat 行为、completion/full-depth、multi-seed、cross-source 与 task-bootstrap CRN 五轮实验,以及语言模型前史、Transformer、表示深度、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。</p></article>
|
||
<article><span>✓</span><h3>十七篇首版长文</h3><p>K3、语言模型前史、Transformer、表示/位置/残差、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。</p></article>
|
||
<article><span>✓</span><h3>语言模型前史深度专题</h3><p>八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。</p></article>
|
||
<article><span>✓</span><h3>Transformer 深度专题</h3><p>十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。</p></article>
|
||
<article><span>✓</span><h3>表示、位置与残差高速公路深度专题</h3><p>二十张问题账、66 个一手节点、DeepSeek/Kimi 双谱系,以及 Token—位置—Norm—Residual/FFN 四联实验。</p></article>
|
||
<article><span>✓</span><h3>DeepSeek 八轮真实权重里程碑</h3><p>把覆盖扩到 HumanEval / GSM8K 各 32 条冻结任务,用显式 SHA-256 uniform tape 驱动四个条件的共同随机数采样:352 条正式输出中 343 条 natural EOS、320 个 unique trajectories;10,000 次选定任务配对 bootstrap 的正确性区间均跨零,长度则揭示 Code 与 Math 的相反方向。新进程十二字段重放 64 / 64 exact。</p></article>
|
||
<article><span>✓</span><h3>Kimi K3 技术报告二轮深读</h3><p>三十二张问题账、Figure 1–16 / Table 1–5 审计、100 节点阅读链,以及 Delta—Decay—AttnRes—LatentMoE—SiTU—QB—MOPD—Cache 八联实验。</p></article>
|
||
<article><span>✓</span><h3>Kimi K3 三轮开放工件里程碑</h3><p>固定官方 revisions,审计 96 个 shards、497,220 个 tensor entries 与真实 KDA / MLA / MoE / MoonViT shapes;四联实验分开显示层型、tensor anatomy、参数范围和复现边界。</p></article>
|
||
<article><span>✓</span><h3>Kimi K3 四轮 AttnRes 独立实验</h3><p>冻结三结构 × 三 seed 的 9 个 2,000-step 格;Full / Block 相对 Baseline 的平均 paired delta 为 −0.01457 / −0.04247 BPC,但核心参数梯度 CV 没有复现论文叙述。指定正式格全新进程八字段 exact,五视图同时展示结果、反证、成本与 claim boundary。</p></article>
|
||
<article><span>✓</span><h3>Kimi K3 五轮梯度定义与深度扩展</h3><p>先确认 Figure 5 没有公开唯一 gradient telemetry 合同,再冻结 16/32 blocks × Baseline/Block × 3 seeds 的 12 个 8,000-step 格。Block 的首尾失衡 6/6 改善但全层 CV 6/6 恶化,两个深度都判为 mixed;指定 32 层格完整重训的模型、优化器与全部冻结字段 exact。</p></article>
|
||
<article><span>✓</span><h3>Kimi K3 六轮尖峰轨迹与反向路径</h3><p>严格复用 Round 05 depth-32 Block 的三个正式格:尖峰在 step 500 后形成,六个位置 3/3 seed 可见,四种 reduction 12/12 格稳健。切断 key/softmax 源梯度没有降低尖峰;uniform value-backward 让 contrast 平均下降 70.2%,只判为全局 backward-rule sensitivity。完整 replay 的 16 组冻结字段 exact。</p></article>
|
||
<article><span>✓</span><h3>Kimi K3 七轮局部路径双向审计</h3><p>冻结 14 个 same-forward mask,把 groups 6+7 的 16 个 depth mixers 同时放进 sufficiency 与 restoration 两个方向。充分性 6/6 过 50%,恢复性却只有 contrast 3/3 通过、peak 0/3 通过,因此正式状态为 one-sided evidence / localization not established。三个正式格、完整 replay、selector 与 forward identity 全部 exact。</p></article>
|
||
<article><span>✓</span><h3>Kimi K3 八轮训练期前向干预</h3><p>四个 forward architecture variants × 三 seed × 8,000 steps,加一格完整 replay;groups 6+7 的 contrast / peak 六格降幅全部超过 20%,BPC 质量门 4/4 通过。13 个 raw、自哈希、historical pairing 与 scientific replay 全部过闸;Grok 结果后复算 blocking error 为 0。结论只限固定缩小协议,不是真实 K3 checkpoint 或 Figure 5(c) 复现。</p></article>
|
||
<article><span>✓</span><h3>FlashKDA RTX 5090 执行闸门</h3><p>隔离 CUDA 13.0 / glibc 2.39 编译 sm_120a wheel;6/6 官方参考逐元素相等,并完成 fixed / varlen、三种 state mode 的 1,800 个 CUDA Event samples。</p></article>
|
||
<article><span>✓</span><h3>Scaling Laws 深度专题</h3><p>九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。</p></article>
|
||
<article><span>✓</span><h3>数据工程深度专题</h3><p>十二张账、31 个一手节点、DeepSeek/Kimi 双谱系与流水线—去重—混合—改写四联实验。</p></article>
|
||
<article><span>✓</span><h3>长上下文深度专题</h3><p>五张成本账、26 篇一手论文、10+ 机制图与 8 策略交互实验室。</p></article>
|
||
<article><span>✓</span><h3>MoE 深度专题</h3><p>六张账、19 篇一手论文、DeepSeek/K3 主线与路由—容量—通信交互实验室。</p></article>
|
||
<article><span>✓</span><h3>推理深度专题</h3><p>八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与三页签互动实验室。</p></article>
|
||
<article><span>✓</span><h3>训练系统深度专题</h3><p>九张账、37 个一手节点、DeepSeek/Kimi 双谱系与显存—网格—气泡—通信实验室。</p></article>
|
||
<article><span>✓</span><h3>数值、优化器与稳定性深度专题</h3><p>十张账、36 个一手节点、K2/K3 与 DeepSeek-V3/V4 双谱系,以及格式—状态—更新—失稳四联实验。</p></article>
|
||
<article><span>✓</span><h3>指令微调与人类偏好深度专题</h3><p>十二张账、44 个一手节点、DeepSeek/Kimi 后训练双谱系,以及 SFT—RM—PPO/DPO—配方四联实验。</p></article>
|
||
<article><span>✓</span><h3>工具使用与长程 Agent 深度专题</h3><p>十四张账、52 个一手节点、DeepSeek/Kimi Agent 双谱系,以及循环—工具契约—可靠性—长程 RL 四联实验。</p></article>
|
||
<article><span>✓</span><h3>原生多模态深度专题</h3><p>十六张账、55 个一手节点、DeepSeek 三分支、Kimi 三代 MoonViT,以及 Token—连接器—光学压缩—视觉闭环四联实验。</p></article>
|
||
<article><span>✓</span><h3>推理服务与低成本部署深度专题</h3><p>十八本账、62 个一手节点、DeepSeek V2→V4 与 Mooncake→K3 双谱系,以及显存—阶段—推测—集群四联实验。</p></article>
|
||
<article><span>✓</span><h3>评测、安全与“到底强不强”深度专题</h3><p>二十二张账、80 个一手节点、DeepSeek/K3 评测协议谱系,以及指标—Judge—污染—系统安全四联实验。</p></article>
|
||
<article><span>✓</span><h3>486 篇关键论文索引</h3><p>新增 DeepSeek-Coder/Coder-V2、ESFT、Prover-V1.5/V2 与 Engram 6 个 DeepSeek 旁支节点。</p></article>
|
||
<article><span>✓</span><h3>公开仓库与自托管发布</h3><p>源码公开到 git.k1412.top,网站由不可变镜像、Compose Manager 与 HTTPS 交付。</p></article>
|
||
</div>
|
||
</section>
|
||
|
||
<section class="section" id="queue">
|
||
<div class="section-heading">
|
||
<div>
|
||
<p class="eyebrow"><span>03</span> NEXT QUEUE</p>
|
||
<h2>下一批按“能闭环的专题”推进</h2>
|
||
</div>
|
||
<p class="section-lead">优先级由 K3 依赖度、初学者断点和论文可验证性共同决定。</p>
|
||
</div>
|
||
<div class="queue-table">
|
||
<div class="head"><b>优先级</b><b>专题</b><b>本轮交付</b><b>完成闸门</b></div>
|
||
<div><span>P0</span><strong>DeepSeek 八轮后续</strong><p>干预式 mediation → SM90 FlashMLA / FP8 / pipeline traces → R1-like RL 小模型复现</p><em>运行证据 + 独立复现</em></div>
|
||
<div><span>P0</span><strong>Transformer 二轮</strong><p>多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照</p><em>逐图笔记 + 实测边界</em></div>
|
||
<div><span>P0</span><strong>表示、位置与残差二轮</strong><p>真实 hidden-state / norm traces → 长上下文位置外推 → mHC / AttnRes 深层稳定性消融</p><em>可复现实验 + 逐图笔记</em></div>
|
||
<div><span>P0</span><strong>语言模型前史二轮</strong><p>Kneser–Ney / LSTM / Bahdanau 逐图 → 真实小语料复现 → tokenizer 公平性</p><em>可复现实验 + 逐图笔记</em></div>
|
||
<div><span>P0</span><strong>Scaling Laws 二轮</strong><p>真实拟合复现 → 置信区间 → 更多模型族与下游任务外推</p><em>可复现实验 + 逐图笔记</em></div>
|
||
<div><span>P1</span><strong>数据工程二轮</strong><p>FineWeb / DCLM 逐图 → 真实去重误伤 → mixture traces 与污染案例</p><em>逐图笔记 + 案例库</em></div>
|
||
<div><span>P1</span><strong>大规模训练系统二轮</strong><p>真实集群 traces → 故障恢复 → 精确 topology / kernel 配置</p><em>案例库 + 实测边界</em></div>
|
||
<div><span>P1</span><strong>数值与稳定性二轮</strong><p>真实 kernel 吞吐 → 长程失稳 traces → optimizer / quantization 逐图复现</p><em>实测边界 + 逐图笔记</em></div>
|
||
<div><span>P1</span><strong>长上下文二轮深化</strong><p>真实模型配置 → 内核细节 → 长上下文评测与失败案例</p><em>配置比较器 + 逐图论文笔记</em></div>
|
||
<div><span>P1</span><strong>MoE 二轮深化</strong><p>真实负载 traces → 专家特化可解释性 → 共享专家语义</p><em>案例库 + 集群证据</em></div>
|
||
<div><span>P1</span><strong>推理二轮深化</strong><p>真实 pass@k 曲线 → PRM 失败案例 → 逐篇图表精读</p><em>案例库 + 真实 traces</em></div>
|
||
<div><span>P1</span><strong>Alignment 二轮深化</strong><p>真实偏好分歧 → RM 长度偏置 → PPO/DPO 小模型复现</p><em>数据案例 + 可复现实验</em></div>
|
||
<div><span>P1</span><strong>Agent 二轮深化</strong><p>真实环境 traces → cross-harness ablation → Agent RL 曲线与提示注入案例</p><em>运行证据 + 安全案例库</em></div>
|
||
<div><span>P1</span><strong>原生多模态二轮</strong><p>真实视觉 Token traces → 跨分辨率 / connector 消融 → OCR 与视觉 Agent 安全失败案例</p><em>运行证据 + 逐图笔记</em></div>
|
||
<div><span>P1</span><strong>推理服务二轮</strong><p>真实 GPU kernel / workload traces → 功耗与成本 → 跨 vLLM / SGLang / TensorRT-LLM 复现</p><em>可复现实测 + 成本账</em></div>
|
||
<div><span>P1</span><strong>评测安全二轮</strong><p>真实 cross-harness / pass@k 复跑 → Judge 元评测 → 动态污染与过拒案例</p><em>可复现实验 + 协议审计</em></div>
|
||
</div>
|
||
</section>
|
||
|
||
<section class="section" id="method">
|
||
<div class="section-heading">
|
||
<div>
|
||
<p class="eyebrow"><span>04</span> QUALITY CONTROL</p>
|
||
<h2>每条结论怎样进入网站</h2>
|
||
</div>
|
||
<p class="section-lead">
|
||
Grok CLI 用于扩大检索覆盖和找遗漏;任何进入正文的机制、数字与时间仍回到原论文、官方仓库或正式文档。
|
||
</p>
|
||
</div>
|
||
<div class="evidence-pipeline">
|
||
<article><span>01 / DISCOVER</span><h3>发现线索</h3><p>K3 references、引用网络、Grok/web 检索、作者仓库。</p></article>
|
||
<i>→</i>
|
||
<article><span>02 / VERIFY</span><h3>打开一手来源</h3><p>核对标题、版本、公式、表格、实验设置和限制。</p></article>
|
||
<i>→</i>
|
||
<article><span>03 / EXPLAIN</span><h3>写四层解释</h3><p>直觉、机制、论文证据、工程代价;简化处显式标注。</p></article>
|
||
<i>→</i>
|
||
<article><span>04 / REVIEW</span><h3>交叉检查</h3><p>链接、数字、先修、图文一致性、移动端与可访问性。</p></article>
|
||
</div>
|
||
</section>
|
||
|
||
<section class="section compact" id="ledger">
|
||
<div class="section-heading">
|
||
<div>
|
||
<p class="eyebrow"><span>05</span> DECISION LEDGER</p>
|
||
<h2>重要决策不会只留在对话里</h2>
|
||
</div>
|
||
<p class="section-lead">更完整的机器可读进度和研究记录位于开源仓库的 ROADMAP.md、PROGRESS.md 与 research/。</p>
|
||
</div>
|
||
<div class="decision-list">
|
||
<div><time>2026-07-28</time><b>命名为 LLM Atlas</b><p>K3 是锚点,范围覆盖完整 LLM 技术史。</p></div>
|
||
<div><time>2026-07-28</time><b>按问题链组织</b><p>现象 → 旧瓶颈 → 关键论文 → 后继桥梁 → K3/DeepSeek 落点。</p></div>
|
||
<div><time>2026-07-28</time><b>优先原创重绘</b><p>架构图做成可缩放 SVG/HTML,明确简化与来源。</p></div>
|
||
<div><time>2026-07-28</time><b>双重开放许可</b><p>代码 MIT,原创文字与图 CC BY-SA 4.0。</p></div>
|
||
<div><time>2026-07-28</time><b>自托管交付</b><p>源码公开到 git.k1412.top,网站部署到 k1412 私有基础设施。</p></div>
|
||
<div><time>2026-07-29</time><b>推理按八张账组织</b><p>把答案、覆盖、选择、过程、预算、优化、分布与系统证据分开核算。</p></div>
|
||
<div><time>2026-07-29</time><b>训练系统按九张账组织</b><p>把模型状态、激活、并行、气泡、通信、专家、上下文、数值与可靠性分开核算。</p></div>
|
||
<div><time>2026-07-29</time><b>Scaling Laws 按九张账组织</b><p>把观测量、模型、数据、算术、配比、配方、外推、经济目标与能力阶段分开核算。</p></div>
|
||
<div><time>2026-07-29</time><b>数据工程按十二张账组织</b><p>把来源、解析、语言、质量、唯一性、污染、混合、变换、Tokenizer、Packing、课程与价值分开核算。</p></div>
|
||
<div><time>2026-07-29</time><b>Grok 数据线索与正式账本永久分离</b><p>1264 行正式研究账本只接受回查一手来源后的结论;203 行 Grok 产物保留为未核验发现队列。</p></div>
|
||
<div><time>2026-07-29</time><b>数值专题按十张账组织</b><p>把格式、缩放、计算、累加、搬运、更新、参数化、观测、恢复与证据经济分开核算。</p></div>
|
||
<div><time>2026-07-29</time><b>低精度结论必须写完整角色合同</b><p>对象、格式、scale 粒度、accumulator、输出与硬件不再被压缩成一个 dtype 标签。</p></div>
|
||
<div><time>2026-07-29</time><b>语言模型前史按八张账组织</b><p>预测单位、概率信息、上下文、稀疏性、分布式表示、循环记忆、序列转导与系统成本不再混成单一架构年表。</p></div>
|
||
<div><time>2026-07-29</time><b>NTP、MTP 与多模态永久分角色</b><p>K3 的统一视觉/文本 next-token objective、one MTP layer 与 EAGLE-3 draft bridge 分开记账;DeepSeek MTP 也不写成取代自回归。</p></div>
|
||
<div><time>2026-07-29</time><b>Transformer 按十张账组织</b><p>信息路径、几何、可见性、多头、位置、局部计算、深度、目标、系统成本与当代映射不再混成一个 Block。</p></div>
|
||
<div><time>2026-07-29</time><b>Attention 权重与因果解释永久分离</b><p>热力图可描述中间权重和提出假设;因果结论必须补消融、patching 或反事实干预。</p></div>
|
||
<div><time>2026-07-29</time><b>Agent 按十四张账组织</b><p>模型、harness、工具契约、环境、评测器、可靠性与安全不再被压成一个 Agent 分数。</p></div>
|
||
<div><time>2026-07-29</time><b>Agent 完成必须回到 final state</b><p>function schema、工具执行、业务状态、策略合规与 pass^k 分层评价;模型自报完成不作为证据。</p></div>
|
||
<div><time>2026-07-29</time><b>原生多模态按五层管道与十六张账组织</b><p>像素、视觉塔、压缩 / connector、主干与输出 / 工具闭环分开定位;“原生”再拆成数据、目标、优化、输入输出与 Agent 五维。</p></div>
|
||
<div><time>2026-07-29</time><b>DeepSeek 多模态永久保留三分支</b><p>VL/VL2 的理解、Janus 的统一生成、OCR 的光学压缩不画成错误的单向代际谱系。</p></div>
|
||
<div><time>2026-07-29</time><b>光学压缩实验分开报告值、教学插值与证据外区域</b><p>DeepSeek-OCR 的 <10× / 20× 锚点标成作者报告;中间只做显式教学插值,超过范围不外推。</p></div>
|
||
<div><time>2026-07-29</time><b>推理服务按十八本账组织</b><p>权重、增长状态、分配、阶段、batch、cache、kernel、推测、网络、路由、故障与经济性不再压成单一 tokens/s。</p></div>
|
||
<div><time>2026-07-29</time><b>DeepSeek 与 Kimi 服务谱系按状态对象重建</b><p>MLA→V4 异构状态与 Mooncake→KDA→K3 混合缓存分开说明;作者报告、精确公式和教学估算使用不同标签。</p></div>
|
||
<div><time>2026-07-29</time><b>表示与深度按二十张账组织</b><p>计算单位、词表接口、上下文化、位置、外推、Norm 对象、拓扑、残差路由与非线性极值不再混成一个 hidden-state 名词。</p></div>
|
||
<div><time>2026-07-29</time><b>K3 Block AttnRes 来源数按原报告重算</b><p>93 层按 12 层形成 8 个 layer blocks(7 个完整块加 1 个尾块);再加 embedding,共 9 个 block-level 来源,废弃早期错误的“2 层一块”读法。</p></div>
|
||
<div><time>2026-07-29</time><b>K3 二轮按三十二张账重建</b><p>从架构组件摘要升级为覆盖预训练、后训练、环境、系统、评测、案例与附录的完整报告因果链。</p></div>
|
||
<div><time>2026-07-29</time><b>K3 原生视觉事实纠错</b><p>MoonViT-V2 从头训练;视觉与文本从训练开始在同一个 NTP objective 中联合优化,不再沿用冻结/解冻式 post-hoc 叙述。</p></div>
|
||
<div><time>2026-07-29</time><b>K3 图表与实验永久分级</b><p>Figure 1–16 / Table 1–5 建立视觉契约;报告事实、原论文、确定性推导与教学模型使用 R/P/D/T 四种身份。</p></div>
|
||
<div><time>2026-07-29</time><b>K3 开放工件按五种证据身份审计</b><p>真实观测 O、确定性推导 D、本机执行 X、合成探针 S 与未决矛盾 U 分开;作者 benchmark 不冒充本站实测。</p></div>
|
||
<div><time>2026-07-29</time><b>A_log 形状冲突保持未决</b><p>checkpoint 的 [128] 与 config / remote code / FlashKDA API 期待的 [96] 并列展示;不宣布权重损坏,也不把 channel-wise 假设写成真实 forward。</p></div>
|
||
<div><time>2026-07-29</time><b>FlashKDA 编译与执行永久分两道闸门</b><p>容器产出 sm_120a wheel 只证明可编译;RTX 5090 的 6/6 official-reference exact suite 通过后,才把证据升级为本机执行 X。</p></div>
|
||
<div><time>2026-07-29</time><b>作者表与 RTX 5090 表永久分账</b><p>H20 / GB200 保持 O;本站只报告独立环境、协议、300 samples/mode 和延迟分布,未跑本机 FLA 就不写本机 speedup。</p></div>
|
||
<div><time>2026-07-30</time><b>K3 权重冲突仍没有官方裁决</b><p>官方 main 仍保留 128↔96 不匹配;社区 #144 把 head 数改成 128,#150 验证尾部全零后按 96 裁入,两案都未合并。真实 K3 forward 继续标为未决。</p></div>
|
||
<div><time>2026-07-30</time><b>AttnRes 缩小实验先冻结、后运行</b><p>三结构共享公共主干、初始化、窗口与优化器;只按三个 paired seed 和预注册 −0.010 BPC 阈值给出本协议内方向判断。</p></div>
|
||
<div><time>2026-07-30</time><b>支持结果与梯度反结果同时进入主视区</b><p>Full / Block 的最终 BPC 同向改善;核心参数 gradient RMS CV 却高于 Baseline,不换指标掩盖。</p></div>
|
||
<div><time>2026-07-30</time><b>正式重放不把 wall time 纳入 exact</b><p>Block / seed-1 的模型、优化器、曲线、历史、诊断和环境八字段 exact;计时受调度影响,单独报告。</p></div>
|
||
<div><time>2026-07-30</time><b>Figure 5 的“梯度”不再靠猜测补合同</b><p>官方未公开 gradient tensor、norm、reduction 与统计代码;本站 activation-gradient 定义只叫 operationalization,不叫论文复画。</p></div>
|
||
<div><time>2026-07-30</time><b>首尾平衡与全层 CV 永久分账</b><p>Block 在 6/6 配对中改善 first/last,却因中后段局部尖峰让 CV 在 6/6 配对中恶化;联合判定保持 mixed。</p></div>
|
||
<div><time>2026-07-30</time><b>绝对梯度尺度必须与归一化谱同屏</b><p>Block mean gradient 约为 Baseline 的 54%–57%;更接近 1 的首尾比不能偷换成各层信号更强。</p></div>
|
||
<div><time>2026-07-30</time><b>32 层完整重放扩到状态哈希</b><p>8,000-step fresh replay 的全部冻结字段以及 model / optimizer state hashes exact;额外 replay bytes 单列,不混入 formal 预算。</p></div>
|
||
<div><time>2026-07-30</time><b>尖峰是定向复查,不是盲发现</b><p>layer 21–25 来自 Round 05;Round 06 先固定目标集合,再检查训练时点、张量位置、reduction 与反向路径。</p></div>
|
||
<div><time>2026-07-30</time><b>最早可见不等于物理起源</b><p>pre-attention input 是六个采样点中最早可见位置;更早 mixer 与跨层回传已经作用,不能写成尖峰从这里注入。</p></div>
|
||
<div><time>2026-07-30</time><b>同一前向只识别反向规则敏感性</b><p>三模式的 logits、loss、activations 与 mixer summaries exact;uniform value-backward 的 70.2% contrast 降幅不是训练变体或因果贡献百分比。</p></div>
|
||
<div><time>2026-07-30</time><b>局部充分性不自动成为双向定位</b><p>groups 6+7 的 sufficiency 6/6 通过,但 restoration peak 0/3 通过;非线性交互让两个方向不同,正式结论保持 localization not established。</p></div>
|
||
<div><time>2026-07-29</time><b>32-token 对照改为同源 16→24</b><p>TNEWS 只有 105/10,000 条达到 32 tokens,强行统一会落入约 1% 极端长尾;24-token eligibility 仍保留 1,609 条中文候选。</p></div>
|
||
<div><time>2026-07-29</time><b>长度敏感性必须成对重采样</b><p>16-token 输入严格是 24-token 输入前缀,2,000 次 bootstrap 共用 prompt indices;结果只描述固定 cohort 的长度敏感性。</p></div>
|
||
<div><time>2026-07-29</time><b>三类 cohort 永久分身份</b><p>自然长度回答本批样本如何路由;matched-16 / 24 回答同一 prompt 多看 8 tokens 后如何变化,不把二者混成内容因果。</p></div>
|
||
<div><time>2026-07-29</time><b>历史边界用单 ID 替换而非删除</b><p>EOS→x / 句点 / 换行保持长度、目标位置、角色标记、mask 与同一 batch;识别一个输入 ID 的干预,不冒充移除了全部回合结构。</p></div>
|
||
<div><time>2026-07-29</time><b>base、Chat 与行为永久分层</b><p>V2-Lite base 的路由 TV 不是回合理解或能力指标;`User:` 仍在,反事实不是官方合法 chat,后续另跑 Chat checkpoint 与生成指标。</p></div>
|
||
<div><time>2026-07-29</time><b>角色词头 direct effect 与 system 调制分开</b><p>`User→Assistant/x` 都直接改变后续路由,但 24 格 system-edge 方向混合,不能偷换成统一强化或削弱。</p></div>
|
||
<div><time>2026-07-29</time><b>目标后改动承担因果负对照</b><p>suffix `Assistant→User` 在 34,488 个目标 ordered top-6 上全 exact;完整输入仍保留 suffix 自身作用。</p></div>
|
||
<div><time>2026-07-29</time><b>BF16 batch content 进入复现合同</b><p>相同 official token IDs 与 32-row shape 不保证深层 route hash 相同;companion rows 的构成也必须记录。</p></div>
|
||
<div><time>2026-07-29</time><b>完整 special inventory 与普通对照分身份</b><p>BOS/EOS 穷尽固定 tokenizer 的两个 special IDs;x/句点只是两个选定普通对照,2-vs-2 只描述四个 ID。</p></div>
|
||
<div><time>2026-07-29</time><b>两-token 角色块按因子分解</b><p>`User:` / `Assistant:` 都是 head + delimiter 两个普通 IDs;head、delimiter、interaction 与直接边分别记账。</p></div>
|
||
<div><time>2026-07-29</time><b>下游目标与完整输入分因果身份</b><p>目标内容只看编辑位置后的精确对齐路由;完整输入包含被编辑 token 自身,只作稳健性账。</p></div>
|
||
<div><time>2026-07-29</time><b>Chat、生成行为与能力永久分层</b><p>完整官方 Chat 权重可以支撑真实生成;成对输出分歧只证明干预传播,没有 evaluator 与足够 completion 就不升级成能力判断。</p></div>
|
||
<div><time>2026-07-29</time><b>completion 是生成实验的首要审计字段</b><p>31 / 128 自然 EOS 与 97 / 128 长度截断同时显示;截断答案不冒充完整回答。</p></div>
|
||
<div><time>2026-07-29</time><b>offload 拓扑进入复现合同</b><p>31.4 GB BF16 权重按 GPU 25 层、CPU 2 层 + norm / lm_head 执行;设备切分不被写成模型结构。</p></div>
|
||
<div><time>2026-07-29</time><b>更长预算统一重跑全部八格</b><p>不选择性续写 97 个截断格;128→512 的 prompt hash 与前 128 generated tokens 必须全 exact。</p></div>
|
||
<div><time>2026-07-29</time><b>停止、终点、可评测与正确分四张账</b><p>自然 EOS 不等于答对;fallback 不冒充 strict completion;HumanEval tests pass 不冒充代码安全。</p></div>
|
||
<div><time>2026-07-29</time><b>全深度比较只保留 exact interior tokens</b><p>1,537 个 content tokens / condition 在八格中 ID exact;56 个跨字符边界 token 排除,不拿不同 token 比隐藏状态。</p></div>
|
||
<div><time>2026-07-29</time><b>表示与路由分叉不是中介因果</b><p>29-stage hidden 与 26-gate route 曲线描述传播;没有干预式 mediation 前不解释输出或能力因果。</p></div>
|
||
<div><time>2026-07-30</time><b>seed 是题内重复,不是任务覆盖</b><p>Round 07 用 16 sources × 4 seeds × 4 cells 保持 256 条预算;所有方向先在 source 内计算,再数四题方向,不把 seed 当独立 benchmark 题。</p></div>
|
||
<div><time>2026-07-30</time><b>任务总数必须展开为逐题矩阵</b><p>Math 与 Code 的四题都从 8/16 跨到 16/16;跨不同 GSM8K gold 的 final-answer frequency 禁止聚合。</p></div>
|
||
<div><time>2026-07-30</time><b>均值与 source 方向同时展示</b><p>English 句点 contrast 均值 −8.5,但 3/4 source 为正;Code 两道题 +1/−1 interaction 在域均值 0 中抵消。</p></div>
|
||
<div><time>2026-07-30</time><b>跨题 sampling 仍要求精确复跑</b><p>R0/R1 63/64 同格分叉;新进程 R0 的 seed、prompt、token、text、stop 与 CPU/CUDA RNG pre-state 八字段 64/64 exact。</p></div>
|
||
<div><time>2026-07-30</time><b>共同随机数必须共享 uniform tape</b><p>仅把生成器 seed 重置为同一个值并不等于 CRN;Round 08 用 SHA-256 逐 task/tape/step 生成显式 u,并让四个条件把同一 u 映射到各自 token CDF。</p></div>
|
||
<div><time>2026-07-30</time><b>bootstrap 的统计单位是任务</b><p>HumanEval 与 GSM8K 各 32 题分开做 10,000 次成对任务重采样;这是冻结题集的敏感性带,不冒充 benchmark 总体或跨 seed 置信区间。</p></div>
|
||
<div><time>2026-07-30</time><b>正确性未定,不等于没有行为效应</b><p>八个正确性 contrast 区间全部跨零;system-at-period 的长度带在 Code 为 −130.9 [−178.7,−83.2],在 Math 为 +25.1 [7.9,44.5],明确显示任务域交互。</p></div>
|
||
<div><time>2026-07-30</time><b>复现合同扩到随机带本身</b><p>64 条新进程重放逐字段核对 uniform hash、token IDs、文本、停止状态与 RNG;十二字段全部 64/64 exact,并公开评分文件提前加载这一流程偏差。</p></div>
|
||
</div>
|
||
</section>
|
||
|
||
<style>
|
||
.stream-list,
|
||
.decision-list {
|
||
max-width: 1050px;
|
||
border-top: 1px solid var(--line);
|
||
}
|
||
|
||
.stream-list article {
|
||
display: grid;
|
||
grid-template-columns: 55px 1fr 220px;
|
||
gap: 24px;
|
||
align-items: center;
|
||
min-height: 115px;
|
||
padding: 20px 8px;
|
||
border-bottom: 1px solid var(--line);
|
||
}
|
||
|
||
.stream-list article > span {
|
||
color: var(--copper);
|
||
font: 0.67rem/1 var(--mono);
|
||
}
|
||
|
||
.stream-list h3 {
|
||
font-size: 1.05rem;
|
||
}
|
||
|
||
.stream-list p {
|
||
margin-top: 8px;
|
||
color: var(--muted);
|
||
font-size: 0.74rem;
|
||
}
|
||
|
||
.stream-progress {
|
||
display: grid;
|
||
grid-template-columns: 46px 1fr;
|
||
gap: 12px;
|
||
align-items: center;
|
||
}
|
||
|
||
.stream-progress b {
|
||
color: var(--muted);
|
||
font: 0.68rem/1 var(--mono);
|
||
}
|
||
|
||
.check-grid {
|
||
display: grid;
|
||
grid-template-columns: repeat(3, minmax(0, 1fr));
|
||
max-width: 1100px;
|
||
border-top: 1px solid var(--line);
|
||
border-left: 1px solid var(--line);
|
||
}
|
||
|
||
.check-grid article {
|
||
min-height: 220px;
|
||
padding: 26px;
|
||
border-right: 1px solid var(--line);
|
||
border-bottom: 1px solid var(--line);
|
||
}
|
||
|
||
.check-grid span {
|
||
display: grid;
|
||
place-items: center;
|
||
width: 28px;
|
||
height: 28px;
|
||
border-radius: 50%;
|
||
background: var(--sage-pale);
|
||
color: var(--sage);
|
||
font-size: 0.75rem;
|
||
}
|
||
|
||
.check-grid h3 {
|
||
margin: 32px 0 12px;
|
||
font-size: 1.08rem;
|
||
}
|
||
|
||
.check-grid p {
|
||
color: var(--muted);
|
||
font-size: 0.78rem;
|
||
line-height: 1.72;
|
||
}
|
||
|
||
.queue-table {
|
||
display: grid;
|
||
max-width: 1100px;
|
||
border-top: 1px solid var(--line);
|
||
border-left: 1px solid var(--line);
|
||
}
|
||
|
||
.queue-table > div {
|
||
display: grid;
|
||
grid-template-columns: 90px 210px 1fr 230px;
|
||
}
|
||
|
||
.queue-table > div > * {
|
||
padding: 17px;
|
||
border-right: 1px solid var(--line);
|
||
border-bottom: 1px solid var(--line);
|
||
font-size: 0.77rem;
|
||
line-height: 1.6;
|
||
}
|
||
|
||
.queue-table .head {
|
||
background: var(--ink);
|
||
color: var(--paper-raised);
|
||
}
|
||
|
||
.queue-table .head b {
|
||
font: 0.61rem/1.5 var(--mono);
|
||
letter-spacing: 0.08em;
|
||
}
|
||
|
||
.queue-table span {
|
||
color: var(--copper);
|
||
font-family: var(--mono);
|
||
}
|
||
|
||
.queue-table p {
|
||
color: var(--muted);
|
||
}
|
||
|
||
.queue-table em {
|
||
color: var(--sage);
|
||
font-style: normal;
|
||
}
|
||
|
||
.evidence-pipeline {
|
||
display: grid;
|
||
grid-template-columns: repeat(3, minmax(150px, 1fr) 24px) minmax(150px, 1fr);
|
||
gap: 10px;
|
||
align-items: center;
|
||
max-width: 1100px;
|
||
}
|
||
|
||
.evidence-pipeline article {
|
||
min-height: 210px;
|
||
padding: 24px;
|
||
border: 1px solid var(--line);
|
||
background: var(--paper-raised);
|
||
}
|
||
|
||
.evidence-pipeline article > span {
|
||
color: var(--copper);
|
||
font: 0.58rem/1 var(--mono);
|
||
}
|
||
|
||
.evidence-pipeline h3 {
|
||
margin: 32px 0 12px;
|
||
font-size: 1.05rem;
|
||
}
|
||
|
||
.evidence-pipeline p {
|
||
color: var(--muted);
|
||
font-size: 0.75rem;
|
||
line-height: 1.7;
|
||
}
|
||
|
||
.evidence-pipeline > i {
|
||
color: var(--muted-light);
|
||
font-style: normal;
|
||
text-align: center;
|
||
}
|
||
|
||
.decision-list > div {
|
||
display: grid;
|
||
grid-template-columns: 120px 230px 1fr;
|
||
gap: 26px;
|
||
padding: 20px 8px;
|
||
border-bottom: 1px solid var(--line);
|
||
}
|
||
|
||
.decision-list time {
|
||
color: var(--copper);
|
||
font: 0.66rem/1.6 var(--mono);
|
||
}
|
||
|
||
.decision-list b {
|
||
font-size: 0.88rem;
|
||
}
|
||
|
||
.decision-list p {
|
||
color: var(--muted);
|
||
font-size: 0.78rem;
|
||
}
|
||
|
||
@media (max-width: 800px) {
|
||
.stream-list article,
|
||
.decision-list > div {
|
||
grid-template-columns: 45px 1fr;
|
||
}
|
||
|
||
.stream-progress {
|
||
grid-column: 2;
|
||
}
|
||
|
||
.check-grid {
|
||
grid-template-columns: 1fr;
|
||
}
|
||
|
||
.queue-table > div {
|
||
grid-template-columns: 68px 1fr;
|
||
}
|
||
|
||
.queue-table > div > p,
|
||
.queue-table > div > em {
|
||
grid-column: 2;
|
||
}
|
||
|
||
.queue-table .head b:nth-child(n + 3) {
|
||
display: none;
|
||
}
|
||
|
||
.evidence-pipeline {
|
||
grid-template-columns: 1fr;
|
||
}
|
||
|
||
.evidence-pipeline > i {
|
||
transform: rotate(90deg);
|
||
}
|
||
|
||
.decision-list p {
|
||
grid-column: 2;
|
||
}
|
||
}
|
||
</style>
|
||
</BaseLayout>
|