feat: add inference serving chapter
This commit is contained in:
@@ -120,6 +120,14 @@ native、光学上下文压缩与 vision-in-the-loop 四个独立实验,所有
|
||||
|
||||
KV Cache、PagedAttention/vLLM、连续批处理、推测解码、Prefill/Decode 解耦、前缀缓存、集群调度;Mooncake 与 K3 KDA-aware serving。
|
||||
|
||||
首版已完成:以请求形状、SLO、权重、增长状态、分配、Prefill、Decode、Batch、缓存、Kernel、
|
||||
推测、量化、并行、MoE、网络、路由、故障与经济性十八本账,串起 2019–2026 的 62 个一手节点。
|
||||
正文明确区分吞吐与 SLO goodput、标准 KV 公式与 MLA/KDA 状态、PagedAttention 的内存收益与
|
||||
Transformer FLOPs、作者报告值与教学估算;重点追踪 DeepSeek-V2 MLA → V3 FP8 / MoE 部署 →
|
||||
V3.2 → V4 异构状态,以及 Mooncake → Kimi Linear → K3 的 69 KDA + 24 Gated MLA、page cache、
|
||||
EAGLE-3 draft、cache-aware affinity 与 token-budget admission。配套显存与 KV、Prefill/Decode、
|
||||
推测解码、缓存与集群四个独立实验。
|
||||
|
||||
### 15. 评测、安全与“到底强不强”
|
||||
|
||||
困惑度到 MMLU/GPQA/HLE,SWE-bench、OSWorld、BrowseComp;污染、harness、工具预算、LLM-as-a-judge、选择性报告与网络安全边界。
|
||||
|
||||
Reference in New Issue
Block a user