
1. 架构概览
DeepSeek-V4.1 引入多项架构选择,深刻影响服务栈设计。低比率压缩与滑动窗口注意力(SWA)让每层维护 fp8 滑动窗口缓存(最近 128 位置),同时选定源层生成 fp4 压缩表示用于长程注意力。
流形超连接(mHC)允许子层通过 token 依赖的混合系数读写四条并行残差流。Engram 内存则让第 1 和第 14 层从两个大型 fp8 表中检索 n-gram 哈希键控行。
2. 跨层共享与稀疏检索
四个 KV 源层生成压缩 KV 和索引键,消费者层直接读取最新源,避免重复存储。Layer 20 选出最多 2048 个候选块并发布,后续索引源层在其上选取 top-512。
图 1. 各层角色与跨层共享示意。
3. Engram 优化
Engram 两个 fp8 表共 189 GiB,每步仅读取少量行。SGLang 支持 GPU 或主机内存放置。主机分片布局保留 all-reduce,共享主机布局则消除该通信。
图 2. Engram 放置与 TP4 下的查找通信。
实测在 4x GB300 上,主机卸载使 KV 缓存容量提升 36%,吞吐与 TTFT 相当。
4. SWA 有界重放
编码器侧有界重放保留压缩 KV 与索引键,请求维护 128 位置窗口,命中时仅重算末尾 128 token。解码器侧尾部仅计算让 layers 21-39 仅处理最后 128 token。
图 3. 编码器重建与解码器尾部预填充。
8x H200 上解码器重放将预填充吞吐提升 1.56 倍,AIME 2026 评测 pass@1 保持一致。
5. 内核与执行优化
SGLang 实现 mHC 前驱预混合重叠、FP4 索引 TP 复制、融合 RoPE 与 FP4 量化,同时保留量化语义。单 token 投影与 Engram 融合进一步降低每步解码开销。
6. Miles 中的强化学习
Miles 为 DeepSeek-V4.1 提供 Megatron-Core 插件,使用 SGLang 进行 rollout,支持 DP/TP/SP/EP/PP/CP 并行及量化感知训练,最大限度缩小 trainer 与 rollout 之间的 log-probability 差异。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接