feat: publish reasoning deep dive

This commit is contained in:
wuyang
2026-07-29 00:40:09 +08:00
parent 3db826dd4a
commit dce94b283f
18 changed files with 3449 additions and 33 deletions
+1
View File
@@ -378,6 +378,7 @@ const toc = [
On-policy distillation 让学生自己生成当前前缀,再在这个前缀上比较教师和学生对下一个 Token 的概率,
形成稠密 reward。这样训练分布更贴近学生真正会访问的状态,也能自然结合 partial rollout。
</p>
<a class="button primary" href="/reasoning/#k3">进入推理专题:并排理解 partial rollout、reasoning effort 与 MOPD →</a>
<h3>部署约束直接进入后训练</h3>
<p>