【LLM】DeepSeek V4.1-Flash 为什么这么强?CED 与 CSA2 架构全拆解
DeepSeek V4.1-Flash 为什么这么强?CED 与 CSA2 架构全拆解
一句话结论:V4.1-Flash 强在把“参数规模”和“缓存占用”解耦了——读输入时只激活 8B,写输出时才开到 16B,KV Cache 压到 890 字节/token。
一句话回答:它强在“读得便宜,写得精准”
2026 年 9 月 10 日,DeepSeek 发布 V4.1-Flash。官方对它的定位很直接:这不是一个更小的模型,而是一个把参数花在刀刃上的模型(来源:DeepSeek 官方公告,2026-09-10)。
最反直觉的是一组数字:总参数 552B,比上一代 V4-Flash 的 284B 大了近一倍,但 prefill 阶段每 token 只激活 8B,decode 阶段激活 16B。同一份权重,读输入时几乎不花钱,写输出时才把算力开满。
结果就是:1M 上下文下全局 KV Cache 只剩 890 字节/token(V4-Flash 的 1/4),持久化缓存降到 1/8;上下文从 4K 扩到 1M(256 倍),单 token Decode FLOPs 只增加 1/4(来源:V4.1-Flash 技术报告)。
下面拆开讲为什么能做到。
一、CED:Agent 逼着 DeepSeek 把 Transformer 拆成两半
输入输出比被彻底倒过来了
传统 decoder-only 模型是为“聊天”设计的:输入短、输出长。Agent 恰好相反——要连续读网页、解析代码仓库、跑测试日志,输入动辄几十万 token,输出往往只有几十行补丁。
2026 年 4 月,密歇根大学与斯坦福等院校的论文《How Do AI Agents Spend Your Money?》测算:agentic 代码任务中输入与输出的 token 比高达 154:1(来源:凤凰网科技)。而在标准架构下,每一层都要为全部输入 token 生成自己的全局 KV——这意味着绝大部分算力被花在了“读”上。
20+20 拆层:全局记忆只生成一次
CED(Causal Encoder-Decoder,因果编码器-解码器)把 40 层主干切成 20 层编码器 + 20 层解码器。关键改动是:解码器各层的全局 KV 不再从本层隐状态计算,而是直接从编码器最后一层隐状态投影得到(每层用各自的投影矩阵,拿到同一份隐状态的不同线性视图)。
复杂度上,标准架构 prefill 是 O(NL),CED 约为 O(NL/2 + nL/2),其中 n 是滑动窗口大小(128)。长输入场景下 prefill 计算量近乎减半。
需要说明一点:解码器并不是全程闲着——滑动窗口注意力的局部 KV 仍需逐层计算。CED 省掉的是上层重复的全局 KV 计算,而不是全部计算。
二、CSA2:把 KV Cache 沿“层维度”再压一轮
V4 时代的 CSA 已经压过“序列维度”,但缓存里仍有大量冗余:每一层都在存自己的 main KV。
CSA2(Compressed Sparse Attention 2)的解法是把每一层静态指定为三种模式之一:
| 模式 | main KV | indexer K | Top-K 索引 | 含义 |
|---|---|---|---|---|
| Full | 本层生成 | 本层生成 | 本层重选 | 完整计算路径 |
| Reindex | 复用上层 | 复用上层 | 本层重选 | 共享缓存、独立选点 |
| Reuse | 复用上层 | 复用上层 | 复用上层 | 几乎零索引计算 |
实际排布是典型的“一层干活、五层抄作业”:编码器第 3–20 层分 3 组,每组 1 层 Full + 5 层 Reuse(序列压缩比 m=2);解码器 20 层分 5 组,第一组是 1 层 Full + 3 层 Reuse,其余四组各为 1 层 Reindex + 3 层 Reuse(m=1)。索引器统一为 32 个索引查询头、头维 128,每查询选 Top-512;主注意力为 64 头、头维 512。
需要注意的是,跨层共享的是存储与索引路径,而不是整层计算——每一层仍然要算自己的主查询 Q 和滑动窗口 KV。
层级化稀疏索引器:先缩小搜索域
即使跨层复用了索引,第一个索引层仍要对全部可见上下文打分——超长上下文下这就是主要瓶颈。
V4.1-Flash 的应对是:第一个 Full 层扫描全部可见位置后,额外按“块内最大分”选出一批候选块,构成共享候选池(报告中为 2,048 个块 × 每块 8 个位置 = 16,384 个候选位置)。后续 Reindex 层只在池内打分,各自选出自己的 Top-512,其每查询打分成本从“线性于上下文长度”变成常数(来源:AI Wiki 技术拆解)。
需要注意边界:第一个 Full 层的全量扫描依然存在。准确的说法是“把全量搜索集中在少数层,其余层在有界范围内工作”,而不是索引成本完全与长度无关。
三、FP4 主 KV:从精度维度再乘一个系数
CSA2 压的是层维度,FP4 压的是条目精度维度。
主 KV 改用 MXFP4 体系中的 E2M1 格式,每 16 个通道配一个 E4M3 缩放因子;对精度更敏感的滑动窗口 KV 则保持 FP8。这里有个值得记住的工程细节:量化施加在 RoPE 之后——量化放在 RoPE 之前只有边际精度收益,却会给 decode 引入额外开销。
三个维度相乘:层维度(CSA2 跨层复用)× 序列维度(编码器 m=2)× 精度维度(FP4 相对 FP8 再减半),最终落到 890 字节/token。从初代 DeepSeek-V1 的 389,120 字节一路压到这里,累计压缩约 437 倍。
持久缓存为什么能降到 1/8
上面说的是常驻显存的运行时全局 KV。Agent 还要把状态持久化到 SSD 或主机内存,以便跨请求复用前缀——这部分受硬盘容量与 I/O 带宽约束。
V4.1-Flash 的做法是不再持久化滑动窗口 KV(约省一半),再叠加全局 KV 压到 1/4,两项相乘得到官方给出的 1/8。代价是恢复时需要用 SWA Bounded Replay 重建局部状态:只回放最近一个窗口的 token,而不是逐层完整重算。
值得注意的是,官方报告同时坦承缓存恢复边界仍是需要更多压力测试的环节——这是一个尚未完全收敛的工程点。
四、还有三件容易被忽略的事
- Engram 条件记忆:约 196B 参数的两个稀疏访问模块,挂在主干第 1 与第 14 层,把事实性知识从“计算”转为“查找”,不增加每 token 的激活成本。
- Single-Pass mHC + DSpark:残差混合改为单次通过,配合推测解码,把首 token 时延压到约 1.13 秒、输出速度约 214 tokens/s。
- 原生多模态:这是 V4.1-Flash 新增的能力,视觉编码器 32 层、隐藏维度 1024,文本与图像 token 使用各自独立的负载均衡偏置。
五、一张表看懂:它和 V4-Pro、V4-Flash 差在哪
| 对比项 | V4-Flash | V4-Pro | V4.1-Flash |
|---|---|---|---|
| 总参数 | 284B | 1.6T | 552B |
| 激活参数 | 13B | 49B | 8B(prefill)/ 16B(decode) |
| 全局 KV Cache | 3,514 B/token | — | 890 B/token |
| 原生多模态 | 否 | 否 | 是 |
| 架构 | decoder-only | decoder-only | CED(20+20) |
| 官方 API 模型名 | 已下线 | 已切流至 V4.1-Flash | deepseek-flash |
数据来源:DeepSeek 官方公告与技术报告(2026-09-10)
一个容易被忽视的信号:官方已宣布逐步下线 V4-Pro。自 2026 年 9 月 14 日 04:00 UTC 起,所有 deepseek-v4-pro 请求都会被路由到 V4.1-Flash 并按 V4.1-Flash 计费,直至 V4.1-Pro 发布(来源:DeepSeek 官方公告)。
六、FAQ:关于 DeepSeek V4.1-Flash 的高频问题
Q1:它真的比 V4-Pro 更强吗?
A:按官方口径,V4.1-Flash 在性能、费用、速度和任务总用时上全面超越 V4-Pro。但在更广泛的高难度通用推理任务上表现相对一般——它的强项集中在 Agent 执行、代码修复与自动化任务。
Q2:为什么总参数比 V4-Flash 大,成本反而更低?
A:因为参数量和推理成本被解耦了。552B 是“知识储备上限”,8B/16B 才是每次真实计算的规模;再加上 KV Cache 压缩,实际单位成本反而下降。
Q3:API 怎么调用?价格多少?
A:模型名改为 deepseek-flash 即可。高峰/低谷分时定价,低谷为高峰的 50%:低谷时段缓存命中输入 0.02 元、未命中输入 1 元、输出 4 元(每百万 token);高峰时段翻倍为 0.04 / 2 / 8 元(来源:每日经济新闻,2026-09-14)。
Q4:开源吗?可以自部署吗?
A:MIT 协议开源,权重与技术报告已在 HuggingFace 发布,官方表示将与开源社区合作推进推理支持,并支持千卡级部署方案。
Q5:1M 上下文是标配吗?
A:是。V4.1-Flash 的原生上下文为 1M,且上下文从 4K 扩到 1M 时单 token Decode FLOPs 仅增加 1/4。
结语:它强在把“成本函数”重写了
DeepSeek V4.1-Flash 的强,不在参数表上,而在推理成本函数的重构上。
它不是靠堆参数赢,而是靠重新设计模型“怎么读、怎么记、怎么写”:CED 让长输入不必穿过全部层,CSA2 让缓存沿层维度共享,FP4 让每条缓存条目再减半,层级化稀疏索引器让深层索引不再随上下文线性膨胀。四者叠加,才得出 890 字节/token 这个结果。
如果只记三件事:
- CED:读输入只激活 8B,写输出才开到 16B;
- CSA2:一层干活、五层抄作业,缓存跨层共享;
- FP4 + 有界重放:KV Cache 890 字节/token,持久缓存降到 1/8。
如果这篇拆解帮你搞懂了 V4.1-Flash 的架构取舍,欢迎点赞、收藏、转发给正在做 Agent 成本优化的同事;你更想看 CSA2 三种模式的推演,还是 Engram 的实现细节?评论区投票,下一篇按票数展开。
更多推荐


所有评论(0)