近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化
近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化
主要信息源:DeepSeek API 官方更新日志、DeepSeek V4 官方发布页、模型与定价文档、Responses API 文档
关键词:DeepSeek V4、DeepSeek-V4-Flash-0731、AI Agent、Responses API、Codex、上下文缓存、API 迁移
2026 年 7 月 31 日,DeepSeek 将 DeepSeek-V4-Flash 正式版 API 开放公测。调用时仍然使用原来的模型名 deepseek-v4-flash,但该别名目前已经指向 DeepSeek-V4-Flash-0731。
这次更新最容易产生的误解,是把它写成“DeepSeek V4 正式版全面发布”。官方更新日志给出的范围更窄:
- 只升级了
DeepSeek-V4-FlashAPI。 DeepSeek-V4-ProAPI 没有随本次更新改变。- DeepSeek App 和网页端模型没有随本次更新改变。
- V4-Flash-0731 与 Flash Preview 的架构和模型规模相同,变化来自重新后训练。
- DeepSeek-V4-Pro 正式版仍被描述为“即将发布”,官方没有在日志中给出确切日期。
因此,更准确的说法是:DeepSeek V4 系列完成了一次面向 Agent 与代码工作流的 Flash API 更新,而不是整个 V4 家族同时换代。
先把 V4、Flash 和 0731 的关系理顺
DeepSeek V4 Preview 最初于 2026 年 4 月 24 日发布。官方当时给出的两个版本分别是:
| 项目 | DeepSeek-V4-Flash | DeepSeek-V4-Pro |
|---|---|---|
| 总参数量 | 284B | 1.6T |
| 每 Token 激活参数量 | 13B | 49B |
| API 模型名 | deepseek-v4-flash |
deepseek-v4-pro |
| 上下文长度 | 1M Token | 1M Token |
| 最大输出 | 最高 384K Token | 最高 384K Token |
| Responses API | 支持 | 暂不支持,官方称 2026 年 8 月上旬加入 |
| 7 月 31 日更新状态 | 已升级至 V4-Flash-0731 | 本次未更新 |
Flash 并不是 Pro 的简单量化版本。两者总参数量与激活参数量不同,面向的成本和吞吐目标也不同。V4-Flash 的 284B 总参数、13B 激活参数设计,更适合高并发 API 和代码 Agent;V4-Pro 则把更多模型容量留给复杂推理与高难度知识任务。
V4 在结构上使用 Token-wise Compression 与 DeepSeek Sparse Attention(DSA),目标是降低长上下文的计算和内存压力。官方把 1M Token 作为 V4 服务的标准上下文长度,但“窗口能装下 1M”不等于每个任务都应该塞满 1M。长输入仍然会增加首 Token 延迟、缓存依赖和失败重试成本。
这次不是扩模型,而是重新后训练
官方明确说明,V4-Flash-0731 保持了 Preview 的架构和规模,仅进行了重新后训练。
这句话很关键。Agent 能力并不只由预训练阶段的知识量决定,还依赖模型在后训练中学会怎样:
- 将一个长任务拆成可执行步骤。
- 根据工具返回值修正计划。
- 在多个文件和多轮工具调用之间保持任务状态。
- 发现测试失败后继续定位根因,而不是换一种措辞宣布完成。
- 生成符合工具 Schema 的参数,并处理异常、超时和空结果。
同一个底座经过不同的 Agent 轨迹、工具调用数据和强化学习训练,表现可能发生明显变化。这也是为什么 V4-Flash-0731 可以在不改变参数规模的情况下,把主要升级点放在代码 Agent、终端操作和自动化任务上。
官方 Agent 跑分提升了多少
DeepSeek 公布了 V4-Flash-0731 的九项 Agent 相关结果:
| 评测 | 官方成绩 | 主要方向 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 终端环境中的多步任务 |
| NL2Repo | 54.2 | 从自然语言需求生成或修改代码仓库 |
| CyberGym | 76.7 | 网络安全环境任务 |
| DeepSWE | 54.4 | 软件工程 Agent |
| Toolathlon Verified | 70.3 | 多工具调用 |
| Agent Last Exam | 25.2 | 综合 Agent 难题 |
| Automation Bench(Public) | 25.1 | 业务自动化 |
| DSBench-FullStack | 68.7 | 全栈开发,DeepSeek 内部集 |
| DSBench-Hard | 59.6 | 高难度代码 Agent,DeepSeek 内部集 |
官方称这些结果“远超 V4-Pro-Preview”,但更新日志没有在同一张表中列出 Pro Preview 的逐项分数,因此不能从公告直接计算每项提升百分比。
评测条件也需要一起阅读。公开代码 Agent 测试使用尚未发布的 DeepSeek Harness minimal 模式,推理强度为 max,top_p=0.95、temperature=1.0;DSBench-FullStack 和 DSBench-Hard 则是内部测试集。
这带来三个限制:
- Harness 尚未发布时,第三方无法完整复现官方运行方式。
- 内部测试集缺少公开样本和独立提交结果,适合观察方向,不适合直接用于跨厂商排名。
- max effort 的成绩不能代表默认设置下的延迟、Token 消耗和单位任务成本。
对开发团队来说,更可靠的验证方法是准备自己的 20~100 个真实任务,固定代码仓库版本、Prompt、工具权限、超时和最大尝试次数,同时记录一次成功率、平均 Token、测试通过率和人工返工时间。
Responses API 是本次更新的工程重点
V4-Flash-0731 原生支持 Responses API,并针对 Codex 做了适配。使用 OpenAI Python SDK 时,最小调用方式如下:
python -m venv .venv
.venv\Scripts\Activate.ps1
python -m pip install --upgrade openai
$env:DEEPSEEK_API_KEY="你的 API Key"
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions=(
"你是代码分析助手。先定位根因和现有测试,"
"没有获得可复核证据时不要声称任务已经完成。"
),
input="检查任务队列为什么会重复消费,并给出最小修改方案。",
max_output_tokens=4096,
)
print(response.output_text)
print(response.usage)
模型名不需要添加 -0731。继续使用 deepseek-v4-flash,服务端就会路由到当前最新版本。这个方式便于无缝更新,但也意味着生产系统不能只记录模型别名:日志中最好同时保存请求时间、返回的实际模型版本和回归测试结果,否则同一份代码在不同日期可能得到不同表现。
“兼容 Responses API”不等于完整实现所有能力
DeepSeek 官方兼容性表列出了几项容易踩坑的差异:
- API 当前是无状态的,不支持
previous_response_id和conversation。 store固定为false,不提供服务端响应状态存储。- 支持函数工具和服务端网页搜索;Codex 兼容的自定义工具只支持名为
apply_patch的类型。 file_search、code_interpreter、computer_use、mcp等内置工具会被忽略。max_tool_calls会被忽略,应用必须自己限制工具调用次数。- 图片和文件输入尚不支持;传入后不会正常提供视觉或文件内容。
- 超过上下文窗口不会自动截断,而是返回 400 错误。
- 部分不支持的参数会被静默忽略,而不是直接报错。
最后一项尤其需要注意。请求成功只能说明接口接受了参数,不代表每个字段都生效。迁移现有 Responses API 客户端时,应根据官方兼容表逐项检查,而不是把“HTTP 200”当作兼容性测试完成。
流式响应也没有 data: [DONE] 结束标记。客户端应根据 response.completed、response.incomplete 或 response.failed 判断结束状态,并分别处理文本增量、推理内容、函数参数和最终 Usage。
旧模型名已经到迁移节点
V4 Preview 发布时,DeepSeek 宣布旧的 deepseek-chat 和 deepseek-reasoner 将在 2026 年 7 月 24 日 15:59(UTC)后退役。过渡期内,它们分别指向 V4-Flash 的非思考与思考模式。
现在已经超过官方给出的退役时间。新项目应直接使用:
deepseek-v4-flash
deepseek-v4-pro
迁移时不要只做字符串替换,还要检查思考模式、最大输出、工具调用历史和错误处理。V4 同一模型支持思考与非思考模式,官方当前将思考模式列为默认模式;如果旧业务依赖 deepseek-chat 的短响应与较低 Token 消耗,应显式验证新默认行为。
价格很低,但缓存命中率会放大差距
官方价格页当前列出的单价如下,单位均为每 100 万 Token:
| 计费项 | V4-Flash | V4-Pro |
|---|---|---|
| 输入,缓存命中 | 0.0028 美元 | 0.003625 美元 |
| 输入,缓存未命中 | 0.14 美元 | 0.435 美元 |
| 输出 | 0.28 美元 | 0.87 美元 |
| 并发上限 | 2500 | 500 |
V4-Flash 的缓存命中输入价格只有未命中的 1/50。对于代码仓库、固定系统提示词和长工具定义,稳定前缀比反复压缩几百个 Token 更值得优化。
假设一次 Agent 任务使用 20 万输入 Token 和 2 万输出 Token:
| 情况 | 计算 | 估算费用 |
|---|---|---|
| 输入全部未命中缓存 | 0.2 × $0.14 + 0.02 × $0.28 |
0.0336 美元 |
| 输入全部命中缓存 | 0.2 × $0.0028 + 0.02 × $0.28 |
0.00616 美元 |
真实任务通常是部分命中,且工具返回内容、失败重试和推理 Token 都会改变费用。生产环境应记录 input_tokens_details.cached_tokens 和 output_tokens_details.reasoning_tokens,计算“每个成功任务成本”,而不只是每次请求成本。
价格页还预告了峰谷定价:每天北京时间 9:00~12:00、14:00~18:00 的所有计费项将按常规价格的 2 倍计费。但截至本次核对,官方尚未公布生效日期,因此不能把双倍价格写成已经实施。批处理系统可以提前预留调度开关,等官方确认生效后再避开峰值时段。
API 更新与新权重发布要分开看
4 月 24 日的 V4 Preview 公告提供了技术报告和开放权重集合。7 月 31 日的更新日志则明确讨论 DeepSeek-V4-Flash API 公测,并称 0731 版本保持原架构和规模、仅重新后训练。
官方这次没有在更新日志中宣布新的 V4-Flash-0731 权重包。因此,可以确认的是线上 API 已升级,不能仅凭这份公告推导 0731 后训练权重已经同步开放。需要自托管的团队应以 DeepSeek 官方 Hugging Face 仓库中的具体模型卡、提交时间和许可证为准。
升级前可以做一轮小型回归
如果现有服务已经调用 deepseek-v4-flash,代码可能不需要修改,但行为已经可能发生变化。上线前建议至少检查:
- 选取真实的代码修改、终端任务和工具调用轨迹建立固定测试集。
- 分别测试思考与非思考模式,并记录 Token 和延迟。
- 验证 JSON Schema、函数参数和多轮工具结果能否稳定回传。
- 在应用层限制工具次数、总耗时、写入路径和外部副作用。
- 测试超长输入、工具失败、流式中断和 400/429/5xx 的处理。
- 记录实际版本与请求时间,避免模型别名自动更新后无法定位回归。
V4-Flash-0731 的看点不是参数又变大了,而是 DeepSeek 试图用同一底座的后训练升级,换取更强的 Agent 执行能力,并通过 Responses API 进入现有代码代理工作流。
接下来更值得关注的,是 DeepSeek Harness 能否按承诺开放、公开测试能否复现官方成绩、V4-Pro 正式版何时发布,以及 0731 后训练权重是否会同步提供。对开发者而言,在这些信息落地以前,最有价值的动作仍然是用自己的任务集做回归,而不是只根据一张跑分表决定全量迁移。
参考资料
- DeepSeek API:Change Log,DeepSeek-V4-Flash Update,2026-07-31
https://api-docs.deepseek.com/updates - DeepSeek API:DeepSeek V4 Preview Release,2026-04-24
https://api-docs.deepseek.com/news/news260424 - DeepSeek API:Models & Pricing
https://api-docs.deepseek.com/quick_start/pricing - DeepSeek API:Your First API Call
https://api-docs.deepseek.com/ - DeepSeek API:Using the Responses API
https://api-docs.deepseek.com/guides/responses_api - DeepSeek API:Thinking Mode
https://api-docs.deepseek.com/guides/thinking_mode - DeepSeek:V4 官方开放权重集合
https://huggingface.co/collections/deepseek-ai/deepseek-v4
更多推荐


所有评论(0)