docs: record reasoning deployment

This commit is contained in:
wuyang
2026-07-29 00:43:56 +08:00
parent dce94b283f
commit 8ae2499951
2 changed files with 3 additions and 1 deletions
+2
View File
@@ -39,6 +39,7 @@
- [x] 明确 CoT / verifier / test-time compute、PPO → GRPO、DeepSeek-R1 与 Kimi k1.5 → K3 四条主线。
- [x] 分清 K3 partial rollout 的 off-policy 稳定化与 MOPD 的 student on-policy 逐 Token 蒸馏。
- [x] 完成推理首版:八张账、30 篇一手论文链、DeepSeek/Kimi 双主线与预算—GRPO—MOPD 三页签实验室。
- [x] 推理首版以提交 `dce94b2`、不可变镜像 `20260728T164043Z-dce94b2` 发布;NAS/VPS/HTTPS/生产 Chrome 全链路通过。
- [x] Astro 类型检查、生产构建、9 个内部路由和桌面/移动端视觉检查通过。
- [x] 创建 `wuyang/llm-atlas` 公开仓库,匿名 API 确认 `private: false`
- [x] 本地生产镜像通过健康检查与全部 9 个页面路由烟雾测试。
@@ -69,6 +70,7 @@
| 2026-07-29 | 推理专题按结果、覆盖、选择、过程、预算、优化、分布、系统八张账组织 | 避免把 pass@1、pass@k、搜索收益、RL 能力增长与系统吞吐混成“会思考” |
| 2026-07-29 | K3 partial rollout RL 与 MOPD 在正文中强制并排 | 前者显式容忍跨迭代 stale trajectory,后者由当前 student 采样并接收稠密 teacher signal |
| 2026-07-29 | 推理首版用 30 篇一手论文和三页签实验闭环 | 分开演示预算分配、GRPO 聚合偏置和 K3 九教师 MOPD,不合成伪“总分” |
| 2026-07-29 | 推理首版发布到既有 `llm-atlas` 生产链路 | Compose Manager、NPM host 31 / cert 41、10 路由与公网交互均复核通过 |
## 未决问题
+1 -1
View File
@@ -895,4 +895,4 @@ PDF 与文本只作研究缓存,受 `.gitignore` 排除;公开仓库提交
- [x] 完成 GRPO Bias Lab 或等价交互页签。
- [x] 完成 MOPD 九教师可视化。
- [x] 论文链全部指向一手来源。
- [ ] 类型、链接、anchor、交互、桌面/移动端、容器与生产 Chrome 检查通过。
- [x] 类型、链接、anchor、交互、桌面/移动端、容器与生产 Chrome 检查通过。