2026 年 7 月 31 日,DeepSeek 通过 API 发布日志宣布 V4-Flash 正式版(版本号 V4-Flash-0731)上线公测。最值得玩味的不是它发了什么新模型,而是它"没换什么"——2840 亿总参数、130 亿激活参数的 MoE 架构、100 万 token 上下文,与三个月前的预览版完全一致,唯一的变量是重新做了一遍后训练(Post-Training)。结果却是:9 项 Agent 基准测试全面碾压激活参数大近 4 倍的 V4-Pro 预览版(49B 激活)[来源:DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。

这件事的工程价值在于,它用一组硬数据挑战了"参数即护城河"的行业惯性。衡量 Agent 自主修复代码、处理 GitHub Issue 能力的 DeepSWE,从预览版的 7.3 飙升至 54.4,涨幅 645%;终端操作 Terminal Bench 2.1 拿下 82.7 分,逼近 Opus-4.8 的 85.0,而 V4-Flash 的激活参数只是后者的一个零头[来源:DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。当一家头部厂商公开示范"不堆参数也能跨越式提升",整个赛道关于 scaling 的叙事就需要重写。

本文不停留在"发了什么",而是拆解"换脑不换身"背后的设计决策:后训练为何能产生远超预期的杠杆、DSPark 投机解码如何在架构不变下拿到速度加成、DeepSeek Harness 极简模式怎样定向放大 Agent 能力,以及这套范式自带的局限与代价。所有数据均来自 DeepSeek 官方模型卡与发布日志,并逐条标注来源。

一、事件还原:架构不动,成绩全面翻倍

先把"换脑不换身"这句话坐实。DeepSeek 在发布日志中明确:V4-Flash-0731 的总参数 284B、激活参数 13B、MoE 架构、100 万 token 上下文,与 Preview 版完全一致,仅重新进行了后训练,未涉及底层架构改动[来源:DeepSeek 发布日志经新浪财经报道](https://cj.sina.cn/articles/view/7879996431/1d5af340f06801iw5c)。官方模型卡也印证了这一点:0731 版与自带投机解码模块的 DeepSeek-V4-Flash-DSpark 结构相同,即在原模型基础上挂载了一个推测解码(speculative decoding)模块[来源:DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。

变量只有一个,成绩却全面翻倍。下表是官方模型卡给出的横向对比,注意 V4-Flash-0731(13B 激活)在每一项上都超过了 V4-Pro 预览版(49B 激活):

Benchmark V4-Flash-0731 (13B激活) V4-Flash 预览版 V4-Pro 预览版 (49B激活) GLM-5.2 Opus-4.8
Terminal Bench 2.1 82.7 61.8 72.1 81.0 85.0
NL2Repo 54.2 39.4 38.5 48.9 69.7
Cybergym 76.7 38.7 52.7 - 83.1
DeepSWE 54.4 7.3 12.8 46.2 58.0
Toolathlon-Verified 70.3 49.7 55.9 59.9 76.2
Agents' Last Exam 25.2 15.8 16.5 23.8 25.7
AutomationBench Public 25.1 10.8 12.8 12.9 27.2
DSBench-FullStack † 68.7 37.0 41.8 61.8 71.6
DSBench-Hard † 59.6 25.8 31.1 54.5 71.7

数据来源:DeepSeek 官方模型卡。† 表示 DSBench-FullStack 为内部全栈开发测试集,DSBench-Hard 为内部高难度编码 Agent 测试集,非公开可复现。

最戏剧性的一行是 DeepSWE:预览版仅 7.3,0731 版 54.4,相对自身涨幅 645%;即便对比 49B 激活的 V4-Pro 预览版(12.8),也是 4 倍以上的领先。这条指标衡量的是模型在真实长周期、多步骤编程任务中的自主解决能力,正是 Agent 价值的核心。

二、为什么"换脑"比"换身"更有效:后训练的杠杆效应

要理解这组数据为何反直觉,需要先把两条优化路径的成本结构拆开。

预训练(Pre-Training)是"换身":动的是模型架构、参数规模和训练数据。每多一倍参数,算力、显存、数据量、工程复杂度都近似指数级上升,且收益递减——这是业界熟知的 scaling law 曲线。DeepSeek-V4-Pro 预览版总参 1.6 万亿、激活 49B,预训练数据 33T token[来源:DeepSeek 官方发布与第三方架构分析](https://cloud.tencent.cn/developer/article/2669731),这条路径的边际成本极高。

后训练(Post-Training)是"换脑":模型权重骨架不动,通过监督微调(SFT)、强化学习(RL)、奖励建模等手段重塑模型的行为分布。它的算力开销通常只有预训练的几十分之一到几百分之一,却直接决定模型在特定任务上的"动作选择"。V4-Flash-0731 的案例说明:在 Agent 这类高度依赖"会不会调用工具、能不能坚持多步纠错"的任务上,行为策略的权重远大于知识容量。

为什么 Agent 能力对后训练格外敏感?因为 Agent 任务的本质不是"知道答案",而是"在不确定环境里做一连串决策"。一个编码 Agent 要读懂 Issue、定位文件、改代码、跑测试、根据报错回溯,每一步都是一次选择。预训练给的是"原材料",后训练给的是"工作流"。DeepSeek 官方在 Code Agent 任务中使用了自研的 DeepSeek Harness 极简模式作为测试框架,并以 max 推理强度、temperature=1.0top_p=0.95 的配置评测[来源:DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)——这意味着后训练很可能针对"工具调用循环""失败重试""长程规划"做了大量定向强化,而非泛泛提升。

换句话说,DeepSWE 从 7.3 到 54.4,增量大概率不来自"模型变聪明了",而来自"模型学会了在 Agent 框架里正确地犯错和纠错"。这是一个可复制性极强的信号:对应用层团队而言,把预算砸在后训练的策略工程上,可能比苦等下一个万亿参数模型回报更高。

三、架构不变下的工程加成:DSPark 投机解码

架构不动,不代表工程上没有加码。0731 版最显眼的工程增量是 DSPark 投机解码(speculative decoding)。官方模型卡说明,该版本与 DeepSeek-V4-Flash-DSSpark 结构相同,自带一个推测解码模块,用一个轻量草稿模型并行预测多个 token,再由主模型批量验证,从而在几乎不损失质量的前提下大幅提升推理吞吐。

对 Agent 场景,这点尤为关键:Agent 的"思考-行动-观察"循环天然是多轮、长输出,任何延迟都会被轮数放大。DSPark 让单步生成更快,直接缩短整个任务链的端到端耗时。官方给出的 vLLM 启动命令只多了一个 flag:

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \
  --data-parallel-size 4 --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

命令来源:DeepSeek 官方模型卡。--speculative-confignum_speculative_tokens:7 表示草稿模型一次预测 7 个 token,greedy 表示草稿用贪心采样。注意它运行在单台 4×GB300 节点上,并启用了专家并行(--enable-expert-parallel)和 FP8 KV 缓存——MoE 的稀疏激活加上投机解码,是这条命令能跑得动的组合前提。

SGLang 侧同样一行开启,且无需单独指定草稿模型路径,因为目标权重和草稿权重来自同一个 checkpoint:

sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1

值得强调的是"同一 checkpoint 出草稿与目标"这个设计:它意味着投机解码不是额外维护一个小模型,而是从大模型自身的结构里"长"出一个轻量预测头。这对部署方的工程负担是降级而非升级,也是 0731 版能把它作为默认能力开放的原因。

四、Agent 框架层的定向增强:DeepSeek Harness 与推理强度

前文提到官方用 DeepSeek Harness 极简模式评测,这条信息比看上去更重要。一个模型的 Agent 成绩,从来不是"模型独自跑出来的",而是"模型 + Agent 框架"的联合产物。框架决定了模型能看到什么提示、能调用哪些工具、失败后怎么回退。DeepSeek 自研评测框架,本质是在后训练与评测之间建立了一致的"接口契约"——训练时强化的行为模式,评测时用同一套框架去触发。

reasoning_effort 参数是这种定向增强的另一个出口。官方模型卡将其分为 lowhighmax 三档,控制模型在回答前投入多少"思考"[来源:DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。对复杂 Agent 场景,官方建议用 max 并把最大输出长度设到 384K token。这意味着模型在"想清楚再动手"和"快速响应"之间有了显式旋钮,应用层可以按任务难度动态切换,而不必在两个模型间二选一。

这套机制也体现在编码接口上。0731 版没有提供 Jinja 格式的 chat template,转而给出一个 encoding 文件夹,用 Python 脚本演示如何把 OpenAI 兼容格式的消息编码成模型输入串,以及如何解析模型输出:

from encoding_dsv4 import encode_messages, parse_message_from_completion_text
messages = [
{"role": "user", "content": "hello"},
{"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."},
{"role": "user", "content": "1+1=?"}
]
messages -> string
prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")
string -> tokens
import transformers
tokenizer = transformers.AutoTokenizer.from_pretrained("deepseek-ai/DeepSeek-V4-Flash-0731")
tokens = tokenizer.encode(prompt)

代码来源:DeepSeek 官方模型卡。放弃通用 Jinja 模板、改用显式编码脚本,是为了精确控制思考模式与推理强度的注入位置——这种"把对齐逻辑写进编码层"的做法,比靠模板字符串拼接更可控,也更利于在 Agent 多轮交互中稳定复现行为。

五、开发者生态:Responses API + Codex 适配与性价比

模型再强,接入成本高也推不开。0731 版在工具链上的配套升级,瞄准的正是"迁移摩擦"。正式版原生支持 OpenAI 力推的 Responses API 格式,更适合 Agent 场景的灵活工具调用和多轮交互,开发者无需修改 Base URL 即可切换模型[来源:DeepSeek 发布日志经新浪财经报道](https://cj.sina.cn/articles/view/7879996431/1d5af340f06801iw5c)。

针对 Codex 编程助手,官方做了专项适配,覆盖 CLI、ChatGPT 桌面端、VS Code 扩展,并提供了 Mac 和 Windows 一键配置脚本,让 Codex 客户端自动切换到 DeepSeek 模型。这是一条很"懂开发者"的路径:不要求用户换 IDE,而是把自己塞进用户已有的工作流。

性价比方面,API 定价未上涨,缓存命中时低至 0.2 元/百万 token;输出端非高峰时段约 0.28 美元/百万 token,是同级模型中成本最低的选择之一。有分析指出,V4-Flash 完成单个任务的成本比智能水平相近的 GPT-5.6 Luna 低约 60%[来源:DeepSeek 发布日志经新浪财经报道](https://cj.sina.cn/articles/view/7879996431/1d5af340f06801iw5c)。叠加海外评测机构 Artificial Analysis 的数据——V4-Flash 最高推理档位拿下 50 分,而同类可比模型中位数仅 17 分[来源:DeepSeek 官方日志经搜狐报道](https://m.sohu.com/a/1057502782_122921598/)——"又便宜又能打"并非营销话术,而是有数据支撑的定位。

这种定位在市场端已经兑现。全球最大模型聚合平台 OpenRouter 最新数据显示,DeepSeek V4 Flash 周调用量 6.37 万亿 token,位列全球第二;中国模型整体份额达 63.5%[来源:OpenRouter 公开数据经搜狐报道](https://m.sohu.com/a/1057502782_122921598/)。开源(MIT 协议)、低价(MoE 稀疏激活)、押注 Agent,是中国模型在这条赛道上跑赢的三板斧。需要提醒的是,该榜单只反映海外开源赛道的调用量,国内大厂自有 App 流量与美国大厂封闭 API 流量均未计入,调用量领先不等于技术全面领先。

六、局限性与冷思考

把成绩单捧得越高,越要正视它的边界。

第一,两项核心指标是内部测试集。DSBench-FullStack 与 DSBench-Hard 在官方模型卡中明确标注为内部测试集,非公开可复现[来源:DeepSeek 官方模型卡](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731)。内部集存在选择偏差和过拟合风险,外部团队无法独立验证,成绩的横向可比性要打折。

第二,评测框架自研且尚未开源。Code Agent 任务用的是 DeepSeek Harness 极简模式,官方注明"待发布"(to be released)。在框架开源前,模型成绩与框架实现强耦合,别人用别的 Agent 框架跑同一个模型,未必能复现 54.4 这个数字。这正是前文强调"模型 + 框架联合产物"的应有之义——也是潜在的水分所在。

第三,"仅后训练"不等于"廉价"。架构未动是事实,但后训练本身的算力、数据工程量并未公开。强化学习阶段的训练 token 数、奖励模型规模、环境交互成本都可能很高。把"换脑不换身"理解成"低成本就能 6 倍提升",可能低估了 DeepSeek 在后训练基础设施上的投入。杠杆效应真实存在,但杠杆的支点并不便宜。

第四,与顶级闭源仍有差距。从官方表看,V4-Flash-0731 在 NL2Repo(54.2 vs 69.7)、DSBench-Hard(59.6 vs 71.7)、Cybergym(76.7 vs 83.1)等项上落后 Opus-4.8 明显,Terminal Bench 2.1 只是"逼近"而非"超越"。说"碾压旗舰预览版"成立,说"碾压顶级闭源"则不成立。

第五,能力版图仍是文本单模态,超长上下文(50 万 token 以上)的信息留存仍有衰减。这些是架构层面的问题,后训练无法根治。

结论

DeepSeek-V4-Flash-0731 的真正贡献,不是又刷了几个榜,而是用一份"架构不动、只重做后训练"的对照实验,把后训练的杠杆效应量化了出来:13B 激活的小模型,凭借策略工程就能在 Agent 任务上反超 49B 激活的旗舰预览版。这对行业的启示是具体的——预训练决定模型的天花板,后训练决定模型在真实任务里能摸到多高;当预训练边际收益递减,把资源转向后训练的策略与数据工程,可能是性价比更高的下一站。

对应用层开发者,这意味着与其苦等更大的基座,不如把功夫花在 Agent 框架、奖励设计、工具调用循环的打磨上。模型权重已以 MIT 协议在 HuggingFace 开放(deepseek-ai/DeepSeek-V4-Flash-0731),技术报告见 arXiv:2606.19348,vLLM/SGLang 一行参数即可启用 DSPark 投机解码,迁移成本被压到了最低。

相关项目与持续更新的工程实践笔记,已开源在 https://github.com/wangzifan396-wzf/TW ,欢迎 Star 与交流。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐