feat: publish reasoning deep dive
This commit is contained in:
@@ -378,6 +378,7 @@ const toc = [
|
||||
On-policy distillation 让学生自己生成当前前缀,再在这个前缀上比较教师和学生对下一个 Token 的概率,
|
||||
形成稠密 reward。这样训练分布更贴近学生真正会访问的状态,也能自然结合 partial rollout。
|
||||
</p>
|
||||
<a class="button primary" href="/reasoning/#k3">进入推理专题:并排理解 partial rollout、reasoning effort 与 MOPD →</a>
|
||||
|
||||
<h3>部署约束直接进入后训练</h3>
|
||||
<p>
|
||||
|
||||
Reference in New Issue
Block a user