feat: add AttnRes gradient scale lab
This commit is contained in:
@@ -19,7 +19,7 @@
|
||||
|
||||
当前里程碑包含 17 专题学习地图、486 篇关键论文索引、Kimi K3 完整导读,
|
||||
语言模型前史、Transformer 基础、表示/位置/残差、DeepSeek 技术谱系、Scaling Laws、数据工程、长上下文、MoE、指令微调与人类偏好、推理、工具使用与长程 Agent、原生多模态、训练系统、推理服务、数值优化,以及评测与安全深度专题,
|
||||
以及 94 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、
|
||||
以及 99 个覆盖核心机制的原创交互视图。K3 二轮导读以 32 张问题账、16 图 / 5 表审计、
|
||||
8 个交互实验和 100 个一手/官方节点,完整覆盖架构、预训练、后训练、系统、评测、案例与附录。
|
||||
第三轮已完成开放工件与首个真实 kernel 里程碑:固定官方模型与 FlashKDA revisions,审计 96 个 checkpoint shards、
|
||||
497,220 个 tensor entries、真实 KDA / MLA / MoE / MoonViT shapes 与小范围参数统计,并用 4 个新视图
|
||||
@@ -39,6 +39,19 @@
|
||||
[K3_ATTNRES_REDUCED_PROTOCOL.md](./research/K3_ATTNRES_REDUCED_PROTOCOL.md)、
|
||||
[K3_ATTNRES_REDUCED_AUDIT.md](./research/K3_ATTNRES_REDUCED_AUDIT.md) 与
|
||||
[AttnRes experiment](./experiments/k3/attnres/)。
|
||||
第五轮先审计 Attention Residuals Figure 5 的公开定义边界,再冻结
|
||||
`llm-atlas-k3-attnres-gradient-scale-v1`:以 post-MLP block output activation gradient
|
||||
为公开 operationalization,把深度扩为 16 / 32 blocks、预算扩为每格 8,000 steps,
|
||||
完成 Baseline / Block × 三 seed 共 12 格、786,432,000 formal target bytes。结果把
|
||||
“更均匀”拆成两个相反方向:Block 在 6 / 6 配对中把首/末四分位失衡改善 56%–81%,
|
||||
却因中后段局部尖峰让全层 CV 在 6 / 6 配对中恶化;两个深度都按预注册联合规则判为
|
||||
mixed / inconclusive。验证 BPC 仍在 6 / 6 配对中更低,但实际 step time 约 2.6×、
|
||||
peak allocated memory 约 2.2×,不冒充同算力优势。指定 depth-32 / Block / seed-1
|
||||
从零重训完整 8,000 steps,全部冻结字段以及 model / optimizer state hashes exact。
|
||||
详见
|
||||
[K3_ATTNRES_GRADIENT_DEFINITION_AUDIT.md](./research/K3_ATTNRES_GRADIENT_DEFINITION_AUDIT.md)、
|
||||
[K3_ATTNRES_GRADIENT_SCALE_AUDIT.md](./research/K3_ATTNRES_GRADIENT_SCALE_AUDIT.md) 与
|
||||
[gradient experiment](./experiments/k3/attnres_gradient/)。
|
||||
DeepSeek 八轮专题以 24 张问题账、10 次技术转向、
|
||||
22 个交互实验和 60 个一手/官方节点,串起 Dense、MoE、MLA、V3 协同、R1 与 V4;
|
||||
并固定官方 V2-Lite revision,在 RTX 5090 上连续执行 7/27 层,记录 3,240 次真实专家选择、
|
||||
|
||||
Reference in New Issue
Block a user