feat: publish long-context deep dive
This commit is contained in:
@@ -359,6 +359,10 @@ const toc = [
|
||||
这说明长上下文竞争已从单一位置外推转向混合注意力、压缩缓存、残差、优化器和后训练的系统协同。
|
||||
它也解释 K3 报告为何把 V4 列为同代开放基础模型对照。
|
||||
</p>
|
||||
<p>
|
||||
<a href="/long-context/#hybrids">进入长上下文专题</a>,可以把 V4 的 CSA/HCA 与 K3 的
|
||||
KDA/NoPE MLA 放进同一张“计算—缓存—状态容量”账本逐项比较。
|
||||
</p>
|
||||
<div class="warning-note">
|
||||
<b>V4 与 K3 不是同一条注意力路线</b>
|
||||
<p>
|
||||
@@ -402,7 +406,8 @@ const toc = [
|
||||
<a class="paper-row" href="https://arxiv.org/abs/2606.19348"><time>08</time><b>DeepSeek-V4</b><p>从百万上下文成本倒推 CSA/HCA、mHC 与 Muon。</p></a>
|
||||
</div>
|
||||
<div class="hero-actions">
|
||||
<a class="button primary" href="/k3/">回到 K3:看这些技术怎样重新组合 →</a>
|
||||
<a class="button primary" href="/long-context/">精读 MLA、DSA、CSA/HCA 与 KDA →</a>
|
||||
<a class="button" href="/k3/">回到 K3</a>
|
||||
<a class="button" href="/roadmap/">完整课程地图</a>
|
||||
</div>
|
||||
</section>
|
||||
|
||||
Reference in New Issue
Block a user