DeepSeek V4.1-Flash 为什么这么强?CED 与 CSA2 架构全拆解

一句话结论:V4.1-Flash 强在把“参数规模”和“缓存占用”解耦了——读输入时只激活 8B,写输出时才开到 16B,KV Cache 压到 890 字节/token。

一句话回答:它强在“读得便宜,写得精准”

2026 年 9 月 10 日,DeepSeek 发布 V4.1-Flash。官方对它的定位很直接:这不是一个更小的模型,而是一个把参数花在刀刃上的模型(来源:DeepSeek 官方公告,2026-09-10)。

最反直觉的是一组数字:总参数 552B,比上一代 V4-Flash 的 284B 大了近一倍,但 prefill 阶段每 token 只激活 8B,decode 阶段激活 16B。同一份权重,读输入时几乎不花钱,写输出时才把算力开满。

结果就是:1M 上下文下全局 KV Cache 只剩 890 字节/token(V4-Flash 的 1/4),持久化缓存降到 1/8;上下文从 4K 扩到 1M(256 倍),单 token Decode FLOPs 只增加 1/4(来源:V4.1-Flash 技术报告)。

下面拆开讲为什么能做到。


一、CED:Agent 逼着 DeepSeek 把 Transformer 拆成两半

输入输出比被彻底倒过来了

传统 decoder-only 模型是为“聊天”设计的:输入短、输出长。Agent 恰好相反——要连续读网页、解析代码仓库、跑测试日志,输入动辄几十万 token,输出往往只有几十行补丁。

2026 年 4 月,密歇根大学与斯坦福等院校的论文《How Do AI Agents Spend Your Money?》测算:agentic 代码任务中输入与输出的 token 比高达 154:1(来源:凤凰网科技)。而在标准架构下,每一层都要为全部输入 token 生成自己的全局 KV——这意味着绝大部分算力被花在了“读”上。

20+20 拆层:全局记忆只生成一次

CED(Causal Encoder-Decoder,因果编码器-解码器)把 40 层主干切成 20 层编码器 + 20 层解码器。关键改动是:解码器各层的全局 KV 不再从本层隐状态计算,而是直接从编码器最后一层隐状态投影得到(每层用各自的投影矩阵,拿到同一份隐状态的不同线性视图)。

复杂度上,标准架构 prefill 是 O(NL),CED 约为 O(NL/2 + nL/2),其中 n 是滑动窗口大小(128)。长输入场景下 prefill 计算量近乎减半。

需要说明一点:解码器并不是全程闲着——滑动窗口注意力的局部 KV 仍需逐层计算。CED 省掉的是上层重复的全局 KV 计算,而不是全部计算。


二、CSA2:把 KV Cache 沿“层维度”再压一轮

V4 时代的 CSA 已经压过“序列维度”,但缓存里仍有大量冗余:每一层都在存自己的 main KV。

CSA2(Compressed Sparse Attention 2)的解法是把每一层静态指定为三种模式之一:

模式main KVindexer KTop-K 索引含义
Full本层生成本层生成本层重选完整计算路径
Reindex复用上层复用上层本层重选共享缓存、独立选点
Reuse复用上层复用上层复用上层几乎零索引计算

实际排布是典型的“一层干活、五层抄作业”:编码器第 3–20 层分 3 组,每组 1 层 Full + 5 层 Reuse(序列压缩比 m=2);解码器 20 层分 5 组,第一组是 1 层 Full + 3 层 Reuse,其余四组各为 1 层 Reindex + 3 层 Reuse(m=1)。索引器统一为 32 个索引查询头、头维 128,每查询选 Top-512;主注意力为 64 头、头维 512。

需要注意的是,跨层共享的是存储与索引路径,而不是整层计算——每一层仍然要算自己的主查询 Q 和滑动窗口 KV。

层级化稀疏索引器:先缩小搜索域

即使跨层复用了索引,第一个索引层仍要对全部可见上下文打分——超长上下文下这就是主要瓶颈。

V4.1-Flash 的应对是:第一个 Full 层扫描全部可见位置后,额外按“块内最大分”选出一批候选块,构成共享候选池(报告中为 2,048 个块 × 每块 8 个位置 = 16,384 个候选位置)。后续 Reindex 层只在池内打分,各自选出自己的 Top-512,其每查询打分成本从“线性于上下文长度”变成常数(来源:AI Wiki 技术拆解)。

需要注意边界:第一个 Full 层的全量扫描依然存在。准确的说法是“把全量搜索集中在少数层,其余层在有界范围内工作”,而不是索引成本完全与长度无关。


三、FP4 主 KV:从精度维度再乘一个系数

CSA2 压的是层维度,FP4 压的是条目精度维度。

主 KV 改用 MXFP4 体系中的 E2M1 格式,每 16 个通道配一个 E4M3 缩放因子;对精度更敏感的滑动窗口 KV 则保持 FP8。这里有个值得记住的工程细节:量化施加在 RoPE 之后——量化放在 RoPE 之前只有边际精度收益,却会给 decode 引入额外开销。

三个维度相乘:层维度(CSA2 跨层复用)× 序列维度(编码器 m=2)× 精度维度(FP4 相对 FP8 再减半),最终落到 890 字节/token。从初代 DeepSeek-V1 的 389,120 字节一路压到这里,累计压缩约 437 倍。

持久缓存为什么能降到 1/8

上面说的是常驻显存的运行时全局 KV。Agent 还要把状态持久化到 SSD 或主机内存,以便跨请求复用前缀——这部分受硬盘容量与 I/O 带宽约束。

V4.1-Flash 的做法是不再持久化滑动窗口 KV(约省一半),再叠加全局 KV 压到 1/4,两项相乘得到官方给出的 1/8。代价是恢复时需要用 SWA Bounded Replay 重建局部状态:只回放最近一个窗口的 token,而不是逐层完整重算。

值得注意的是,官方报告同时坦承缓存恢复边界仍是需要更多压力测试的环节——这是一个尚未完全收敛的工程点。


四、还有三件容易被忽略的事

  • Engram 条件记忆:约 196B 参数的两个稀疏访问模块,挂在主干第 1 与第 14 层,把事实性知识从“计算”转为“查找”,不增加每 token 的激活成本。
  • Single-Pass mHC + DSpark:残差混合改为单次通过,配合推测解码,把首 token 时延压到约 1.13 秒、输出速度约 214 tokens/s。
  • 原生多模态:这是 V4.1-Flash 新增的能力,视觉编码器 32 层、隐藏维度 1024,文本与图像 token 使用各自独立的负载均衡偏置。

五、一张表看懂:它和 V4-Pro、V4-Flash 差在哪

对比项V4-FlashV4-ProV4.1-Flash
总参数284B1.6T552B
激活参数13B49B8B(prefill)/ 16B(decode)
全局 KV Cache3,514 B/token—890 B/token
原生多模态否否是
架构decoder-onlydecoder-onlyCED(20+20)
官方 API 模型名已下线已切流至 V4.1-Flashdeepseek-flash

数据来源:DeepSeek 官方公告与技术报告(2026-09-10)

一个容易被忽视的信号:官方已宣布逐步下线 V4-Pro。自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求都会被路由到 V4.1-Flash 并按 V4.1-Flash 计费,直至 V4.1-Pro 发布(来源:DeepSeek 官方公告)。


六、FAQ:关于 DeepSeek V4.1-Flash 的高频问题

Q1:它真的比 V4-Pro 更强吗?
A:按官方口径,V4.1-Flash 在性能、费用、速度和任务总用时上全面超越 V4-Pro。但在更广泛的高难度通用推理任务上表现相对一般——它的强项集中在 Agent 执行、代码修复与自动化任务。

Q2:为什么总参数比 V4-Flash 大,成本反而更低?
A:因为参数量和推理成本被解耦了。552B 是“知识储备上限”,8B/16B 才是每次真实计算的规模;再加上 KV Cache 压缩,实际单位成本反而下降。

Q3:API 怎么调用?价格多少?
A:模型名改为 deepseek-flash 即可。高峰/低谷分时定价,低谷为高峰的 50%:低谷时段缓存命中输入 0.02 元、未命中输入 1 元、输出 4 元(每百万 token);高峰时段翻倍为 0.04 / 2 / 8 元(来源:每日经济新闻,2026-09-14)。

Q4:开源吗?可以自部署吗?
A:MIT 协议开源,权重与技术报告已在 HuggingFace 发布,官方表示将与开源社区合作推进推理支持,并支持千卡级部署方案。

Q5:1M 上下文是标配吗?
A:是。V4.1-Flash 的原生上下文为 1M,且上下文从 4K 扩到 1M 时单 token Decode FLOPs 仅增加 1/4。


结语:它强在把“成本函数”重写了

DeepSeek V4.1-Flash 的强,不在参数表上,而在推理成本函数的重构上。

它不是靠堆参数赢,而是靠重新设计模型“怎么读、怎么记、怎么写”:CED 让长输入不必穿过全部层,CSA2 让缓存沿层维度共享,FP4 让每条缓存条目再减半,层级化稀疏索引器让深层索引不再随上下文线性膨胀。四者叠加,才得出 890 字节/token 这个结果。

如果只记三件事:

  1. CED:读输入只激活 8B,写输出才开到 16B;
  2. CSA2:一层干活、五层抄作业,缓存跨层共享;
  3. FP4 + 有界重放:KV Cache 890 字节/token,持久缓存降到 1/8。

如果这篇拆解帮你搞懂了 V4.1-Flash 的架构取舍,欢迎点赞、收藏、转发给正在做 Agent 成本优化的同事;你更想看 CSA2 三种模式的推演,还是 Engram 的实现细节?评论区投票,下一篇按票数展开。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐