12 个独立训练格
ROUND 05 / GRADIENT DEFINITION × DEPTH SCALE
++ 16 / 32 Transformer blocks · Baseline / Block · 3 seeds · 8,000 steps。 + 被测对象是 post-MLP output activation gradient,不冒充论文未公开的 Figure 5 实现。 +
+12 个独立训练格
每格 65,536,000
宽度固定 192
中后段局部尖峰
失衡改善 56%–81%
model + optimizer state
+ Figure 5(c) 只写 “Each transformer block’s gradient magnitude”。 + 官方仓库没有训练代码、checkpoint、统计脚本或原始数组。 +
+同一 diagnostic tensor
每个 Transformer block 一个
FP32 cross entropy
B × T × C 联合 RMS
核心参数梯度:权重收到多大更新信号。
activation gradient:损失对这一深度表示有多敏感。
两种对象都公开;新指标不会覆盖上一轮反结果。
+“这是与 Figure 5 叙述对齐的一种公开 operationalization。”
+ 不能说“论文作者就是这样算的,或本站复画了 Figure 5(c)。”
+竖线是 8 个 AttnRes aggregation groups 的边界;Baseline 也画同位置,方便逐层配对。
+Baseline 的早层整体隆起被削弱。
中后段少数位置形成更尖的峰。
“更均匀”必须拆成至少两个指标。
横轴按六个预注册诊断时点等距排列;标签保留真实 step,不暗示实际时间等距。
+step 2,000:Block 已显著更尖。
同一时点复现恶化方向。
中期反例:Block 此时反而更平。
到 8,000 step 才轻微反转。
同一个 post-MLP 位置计算 output RMS;这里不做 backward,也不改变主判定。
+Block 限制 output magnitude 持续跨深度增长;这一方向与 Figure 5(b) 叙述一致。
粗分隔线是 group boundary;柱高来自当前选择的 checkpoint / seed,不是示意动画。
+Round 05 的主判定只读 activation CV + imbalance;BPC、参数梯度与成本是必须公开的次要结果。
+| Depth | Δ BPC | Activation CV | First/last imbalance | Mean grad scale | Parameter CV | Verdict |
|---|---|---|---|---|---|---|
| 16 | +{formatSigned(depth16.means.block_minus_baseline_bpc, 5)} | +{pct(depth16.means.relative_cv_reduction)} reduction | ++{pct(depth16.means.relative_imbalance_reduction)} | +{pct(depth16.means.block_to_baseline_activation_grad_mean)} of Base | +{depth16.means.baseline_parameter_grad_cv.toFixed(3)} → {depth16.means.block_parameter_grad_cv.toFixed(3)} | +mixed | +
| 32 | +{formatSigned(depth32.means.block_minus_baseline_bpc, 5)} | +{pct(depth32.means.relative_cv_reduction)} reduction | ++{pct(depth32.means.relative_imbalance_reduction)} | +{pct(depth32.means.block_to_baseline_activation_grad_mean)} of Base | +{depth32.means.baseline_parameter_grad_cv.toFixed(3)} → {depth32.means.block_parameter_grad_cv.toFixed(3)} | +mixed | +
6 / 6 配对更接近 1。
6 / 6 配对 CV 更高。
0.416→0.683;0.397→0.772。
6 / 6 配对为负;非同算力。
约 2.55× time · 2.15× memory
约 2.60× time · 2.16× memory
不能写成同 FLOPs、同 wall time,或 K3 生产成本。
8,000 steps from initialization
额外 65,536,000 target bytes
{shortHash(lab.cells.find((cell: any) => cell.depth === 32 && cell.architecture === "block" && cell.seed === 2026073001).hashes.final_model_state)}
{lab.manifest_summary.file_sha256}{lab.manifest_summary.formal_schedule_sha256}{lab.canonical_sha256_without_self}{lab.overall_verdict}ANCHOR REPORT / ROUND 04 KIMI K3 · REPORT → ARTIFACTS → INDEPENDENT PROBE
+ANCHOR REPORT / ROUND 05 KIMI K3 · REPORT → ARTIFACTS → INDEPENDENT PROBE
K3 同时扩展序列、深度、宽度、视觉与 Agent 轨迹。真正值得读的不是 2.8T 这个最大数字, @@ -123,11 +125,11 @@ const paperGroups = [
31 GRADIENT DEFINITION × DEPTH SCALE
++ 第五轮先审计 Attention Residuals 官方论文与仓库:Figure 5(c) 没有公开 gradient tensor、 + norm、reduction、diagnostic batch、AMP / clipping 时点或统计代码。本站因此冻结一个可复现的 + post-MLP output activation-gradient 定义,把深度扩到 16 / 32 blocks、预算扩到 8,000 steps, + 再用三 seed 检查“首尾平衡”和“全层离散度”是否真的同方向。 +
+786,432,000 formal target bytes;两深度、两结构、三 seed。
depth-16 平均 61.0%;depth-32 平均 72.0%。
局部尖峰让 depth-16 / 32 平均相对恶化 10.3% / 60.0%。
指定 32-layer Block 格从零重训 8,000 steps,冻结字段逐项一致。
31 FIGURE & TABLE AUDIT
+32 FIGURE & TABLE AUDIT
47 页报告目录、151 条参考来源和架构/后训练/系统主线已经提取。
从语言模型基础到评测安全,包含先修依赖和三条贯穿案例。
响应式导航、章节模板、侧栏、进度、论文链和证据提示组件。
K3 三轴图、八联报告实验、四联开放工件实验与五联 AttnRes 独立实验,DeepSeek 四联公式实验、十三联 Base 工件实验、Chat 行为、completion/full-depth、multi-seed、cross-source 与 task-bootstrap CRN 五轮实验,以及语言模型前史、Transformer、表示深度、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。
K3 三轴图、八联报告实验、四联开放工件实验与两轮十联 AttnRes 独立实验,DeepSeek 四联公式实验、十三联 Base 工件实验、Chat 行为、completion/full-depth、multi-seed、cross-source 与 task-bootstrap CRN 五轮实验,以及语言模型前史、Transformer、表示深度、长上下文、MoE、推理、Agent、多模态、训练系统、推理服务、Scaling、数据工程、数值、Alignment 与评测安全专题。
K3、语言模型前史、Transformer、表示/位置/残差、DeepSeek、Scaling、数据工程、长上下文、MoE、后训练、推理、Agent、原生多模态、训练系统、推理服务、数值优化与评测安全专题。
八张独立问题账、33 个正式节点、20 段长文与概率—向量—记忆—对齐四联实验。
十张独立问题账、40 个正式节点、21 段正文与 QKV—Mask—多头位置—Block 成本四联实验。
三十二张问题账、Figure 1–16 / Table 1–5 审计、100 节点阅读链,以及 Delta—Decay—AttnRes—LatentMoE—SiTU—QB—MOPD—Cache 八联实验。
固定官方 revisions,审计 96 个 shards、497,220 个 tensor entries 与真实 KDA / MLA / MoE / MoonViT shapes;四联实验分开显示层型、tensor anatomy、参数范围和复现边界。
冻结三结构 × 三 seed 的 9 个 2,000-step 格;Full / Block 相对 Baseline 的平均 paired delta 为 −0.01457 / −0.04247 BPC,但核心参数梯度 CV 没有复现论文叙述。指定正式格全新进程八字段 exact,五视图同时展示结果、反证、成本与 claim boundary。
先确认 Figure 5 没有公开唯一 gradient telemetry 合同,再冻结 16/32 blocks × Baseline/Block × 3 seeds 的 12 个 8,000-step 格。Block 的首尾失衡 6/6 改善但全层 CV 6/6 恶化,两个深度都判为 mixed;指定 32 层格完整重训的模型、优化器与全部冻结字段 exact。
隔离 CUDA 13.0 / glibc 2.39 编译 sm_120a wheel;6/6 官方参考逐元素相等,并完成 fixed / varlen、三种 state mode 的 1,800 个 CUDA Event samples。
九张账、29 个一手节点、DeepSeek/Kimi 双谱系与曲面—部署—复用—涌现四联实验。
十二张账、31 个一手节点、DeepSeek/Kimi 双谱系与流水线—去重—混合—改写四联实验。
对齐论文梯度定义 → 增加 depth / budget → 等待 A_log 官方合同后进入真实 checkpoint forward
尺度复查 + 工件边界对齐 layer 21–25 尖峰、pre-attention / pre-MLP 与 mixer source weights → 等待 A_log 官方合同后进入真实 checkpoint forward
局部机制 + 工件边界干预式 mediation → SM90 FlashMLA / FP8 / pipeline traces → R1-like RL 小模型复现
运行证据 + 独立复现多头电路逐图 → Pre/Post-LN 真实 traces → Flash/KV 配置与 kernel 对照
逐图笔记 + 实测边界真实 hidden-state / norm traces → 长上下文位置外推 → mHC / AttnRes 深层稳定性消融
可复现实验 + 逐图笔记三结构共享公共主干、初始化、窗口与优化器;只按三个 paired seed 和预注册 −0.010 BPC 阈值给出本协议内方向判断。
Full / Block 的最终 BPC 同向改善;核心参数 gradient RMS CV 却高于 Baseline,不换指标掩盖。
Block / seed-1 的模型、优化器、曲线、历史、诊断和环境八字段 exact;计时受调度影响,单独报告。
官方未公开 gradient tensor、norm、reduction 与统计代码;本站 activation-gradient 定义只叫 operationalization,不叫论文复画。
Block 在 6/6 配对中改善 first/last,却因中后段局部尖峰让 CV 在 6/6 配对中恶化;联合判定保持 mixed。
Block mean gradient 约为 Baseline 的 54%–57%;更接近 1 的首尾比不能偷换成各层信号更强。
8,000-step fresh replay 的全部冻结字段以及 model / optimizer state hashes exact;额外 replay bytes 单列,不混入 formal 预算。
TNEWS 只有 105/10,000 条达到 32 tokens,强行统一会落入约 1% 极端长尾;24-token eligibility 仍保留 1,609 条中文候选。
16-token 输入严格是 24-token 输入前缀,2,000 次 bootstrap 共用 prompt indices;结果只描述固定 cohort 的长度敏感性。
自然长度回答本批样本如何路由;matched-16 / 24 回答同一 prompt 多看 8 tokens 后如何变化,不把二者混成内容因果。