本文整理自AICon深圳2026演讲《百万上下文下的DeepSeek V4:SGLang推理优化实战》(杨雨豪 · RadixArk),通过Ai好记音视频转图文笔记工具进行转录与智能总结,深度解析DeepSeek V4在1M Token上下文下的推理优化挑战与解决方案。


在这里插入图片描述

1.6T参数、1M上下文:推理引擎的"地狱级"挑战

DeepSeek V4 Pro发布时,几乎所有推理引擎团队都倒吸一口凉气:1.6T总参数,单token激活49B,384个路由专家,原生上下文长度1M Token。

这还没完——MoE路由专家权重采用FP4格式,CSA Indexer的QK路径也是FP4。这意味着推理引擎不仅要处理海量参数,还要应对独特的压缩注意力机制。

RadixArk的杨雨豪在AICon深圳的分享中,把DeepSeek V4的推理挑战总结为三个"压力源":

压力源具体表现
参数量与专家计算1.6T参数,384个专家,每次激活6个
百万Token上下文1M Token的KV Cache管理是噩梦
独特的压缩注意力三种注意力混合,KV形态复杂

DeepSeek V4的核心架构变化

HCA:混合残差注意力

传统Transformer的残差状态是一条单向流。DeepSeek V4的HCA(Hybrid Compressed Attention)将它拓展为4条并行残差流

这意味着什么?

  • Hidden state读写压力剧增:从单流变成四流,数据搬运量翻了几倍
  • 入口出口计算复杂:入口需要完成归一化、映射及四路混合;出口需要重新收缩和写回
  • 对Kernel设计提出新要求:传统推理引擎的Kernel无法直接适配

混合注意力:三种注意力类型并存

DeepSeek V4的注意力机制不是单一的,而是三种注意力的混合

注意力类型范围频率说明
SWA(滑动窗口注意力)最近128个token每一层处理局部上下文
CSA(压缩稀疏注意力)每4步压缩一次,选Top-K 1024个token隔层使用处理长距离稀疏依赖
HCA(混合压缩注意力)每128个token压缩,全部KV参与隔层使用处理全局密集依赖

对系统设计的影响

  • HCA主要影响残差计算和Kernel
  • 混合注意力主要影响KV形态、地址及缓存管理

ShadowRadix:统一虚拟缓存管理

传统KV管理的局限性在于:同一段历史可能形成WA、SA和CA三种注意力样式的KV Cache,压缩比例不同、生成时间不同、释放时机不同——一个token不能只对应一个物理槽位。

SGLang的ShadowRadix方案创造性地解决了这个问题:

核心设计

ShadowRadix:按照原始token编号进行索引的虚拟槽位,只记录逻辑上的前缀、前缀位置和token关系,不保存KV数据。Radix在这套连续坐标上进行前缀匹配。

Shadow Mapping映射机制:使用三条Shadow Mapping将虚拟KV slot映射到三个物理池。

以第1000个token为例:

  • 映射回C4(SA池)→ 对应第250个物理条目
  • 映射回C128(CA池)→ 对应第7个token
  • WA中只关心是否位于最近128个token中

状态分离的优势

能力传统方案ShadowRadix
物理页管理一对多映射困难一份逻辑前缀 + 三套独立物理映射
VC释放影响整个前缀只改变对应物理映射
压缩迁移复杂不改变其他两类VC
前缀命中绑定物理地址虚拟前缀 + 映射定位

三级缓存系统:GPU L1 → CPU L2 → 外部存储L3

百万Token上下文的KV Cache量级巨大,GPU显存只能容纳"最热"的一部分。SGLang设计了三级存储层级

层级存储介质容量访问速度作用
GPU L1GPU显存最小最快最热KV
CPU L2主机内存中等中等承接GPU驱逐的页面
外部存储L3远程存储最大最慢冷数据持久化

前缀命中率超90%:在多轮对话、代码仓库等场景中,每次请求会带上系统提示、仓库上下文代码及对话历史,下一轮请求重复上一轮很大一部分。通过三级缓存,前缀命中率可以超过90%,极大减少重复计算。


优化效果总结

优化项解决的问题效果
ShadowRadix三种注意力KV管理混乱统一虚拟缓存,物理层独立管理
Shadow Mapping逻辑地址到物理地址映射三套独立映射,支持动态压缩/释放
三级缓存(HiCache)百万Token KV存不下前缀复用率超90%
状态分离压缩/释放影响其他类型一份逻辑前缀,三套独立物理映射

对推理引擎设计者的启示

DeepSeek V4的架构设计,给推理引擎带来了几个关键启示:

1. 注意力机制的复杂度在增加,不是减少

从单一注意力 → 混合注意力(SWA + CSA + HCA),未来模型可能会引入更多注意力类型。推理引擎需要设计灵活的缓存管理架构来应对。

2. 虚拟化是解决多态KV管理的关键

ShadowRadix的核心思路是**“逻辑与物理分离”**——逻辑上按token编号索引,物理上分池管理。这种设计让缓存管理变得灵活可控。

3. 百万Token不是终点,是起点

1M Token只是开始,未来的模型可能会支持更长上下文(如10M Token)。到那时,三级缓存架构可能成为标配。

4. 前缀复用是成本优化的核心

前缀命中率超90%意味着,90%的KV计算不需要重复做。这直接转化为推理成本的大幅降低。


杨雨豪最后总结了一句话:“DeepSeek V4的推理优化,不是在现有框架上修修补补,而是重新设计了缓存管理架构。ShadowRadix的’虚拟化’思路,可能是未来长上下文推理的标准答案。”


以上内容由Ai好记转录整理。Ai好记是一款支持音视频转录与总结的AI学习助手,支持解析B站、抖音、小宇宙等平台链接及本地/网盘音视频文件,转文字后自动截取PPT关键帧,生成精华速览、思维导图和结构化图文笔记,帮助你把几小时的会议内容变成可搜索、可复习的图文笔记。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐