近期AI热点006|DeepSeek V4-Flash-0731 更新:Agent 跑分大涨,API 接入有哪些变化

主要信息源:DeepSeek API 官方更新日志、DeepSeek V4 官方发布页、模型与定价文档、Responses API 文档
关键词:DeepSeek V4、DeepSeek-V4-Flash-0731、AI Agent、Responses API、Codex、上下文缓存、API 迁移

2026 年 7 月 31 日,DeepSeek 将 DeepSeek-V4-Flash 正式版 API 开放公测。调用时仍然使用原来的模型名 deepseek-v4-flash,但该别名目前已经指向 DeepSeek-V4-Flash-0731

这次更新最容易产生的误解,是把它写成“DeepSeek V4 正式版全面发布”。官方更新日志给出的范围更窄:

  • 只升级了 DeepSeek-V4-Flash API。
  • DeepSeek-V4-Pro API 没有随本次更新改变。
  • DeepSeek App 和网页端模型没有随本次更新改变。
  • V4-Flash-0731 与 Flash Preview 的架构和模型规模相同,变化来自重新后训练。
  • DeepSeek-V4-Pro 正式版仍被描述为“即将发布”,官方没有在日志中给出确切日期。

因此,更准确的说法是:DeepSeek V4 系列完成了一次面向 Agent 与代码工作流的 Flash API 更新,而不是整个 V4 家族同时换代。

先把 V4、Flash 和 0731 的关系理顺

DeepSeek V4 Preview 最初于 2026 年 4 月 24 日发布。官方当时给出的两个版本分别是:

项目 DeepSeek-V4-Flash DeepSeek-V4-Pro
总参数量 284B 1.6T
每 Token 激活参数量 13B 49B
API 模型名 deepseek-v4-flash deepseek-v4-pro
上下文长度 1M Token 1M Token
最大输出 最高 384K Token 最高 384K Token
Responses API 支持 暂不支持,官方称 2026 年 8 月上旬加入
7 月 31 日更新状态 已升级至 V4-Flash-0731 本次未更新

Flash 并不是 Pro 的简单量化版本。两者总参数量与激活参数量不同,面向的成本和吞吐目标也不同。V4-Flash 的 284B 总参数、13B 激活参数设计,更适合高并发 API 和代码 Agent;V4-Pro 则把更多模型容量留给复杂推理与高难度知识任务。

V4 在结构上使用 Token-wise Compression 与 DeepSeek Sparse Attention(DSA),目标是降低长上下文的计算和内存压力。官方把 1M Token 作为 V4 服务的标准上下文长度,但“窗口能装下 1M”不等于每个任务都应该塞满 1M。长输入仍然会增加首 Token 延迟、缓存依赖和失败重试成本。

这次不是扩模型,而是重新后训练

官方明确说明,V4-Flash-0731 保持了 Preview 的架构和规模,仅进行了重新后训练。

这句话很关键。Agent 能力并不只由预训练阶段的知识量决定,还依赖模型在后训练中学会怎样:

  1. 将一个长任务拆成可执行步骤。
  2. 根据工具返回值修正计划。
  3. 在多个文件和多轮工具调用之间保持任务状态。
  4. 发现测试失败后继续定位根因,而不是换一种措辞宣布完成。
  5. 生成符合工具 Schema 的参数,并处理异常、超时和空结果。

同一个底座经过不同的 Agent 轨迹、工具调用数据和强化学习训练,表现可能发生明显变化。这也是为什么 V4-Flash-0731 可以在不改变参数规模的情况下,把主要升级点放在代码 Agent、终端操作和自动化任务上。

官方 Agent 跑分提升了多少

DeepSeek 公布了 V4-Flash-0731 的九项 Agent 相关结果:

评测 官方成绩 主要方向
Terminal Bench 2.1 82.7 终端环境中的多步任务
NL2Repo 54.2 从自然语言需求生成或修改代码仓库
CyberGym 76.7 网络安全环境任务
DeepSWE 54.4 软件工程 Agent
Toolathlon Verified 70.3 多工具调用
Agent Last Exam 25.2 综合 Agent 难题
Automation Bench(Public) 25.1 业务自动化
DSBench-FullStack 68.7 全栈开发,DeepSeek 内部集
DSBench-Hard 59.6 高难度代码 Agent,DeepSeek 内部集

官方称这些结果“远超 V4-Pro-Preview”,但更新日志没有在同一张表中列出 Pro Preview 的逐项分数,因此不能从公告直接计算每项提升百分比。

评测条件也需要一起阅读。公开代码 Agent 测试使用尚未发布的 DeepSeek Harness minimal 模式,推理强度为 max,top_p=0.95temperature=1.0;DSBench-FullStack 和 DSBench-Hard 则是内部测试集。

这带来三个限制:

  • Harness 尚未发布时,第三方无法完整复现官方运行方式。
  • 内部测试集缺少公开样本和独立提交结果,适合观察方向,不适合直接用于跨厂商排名。
  • max effort 的成绩不能代表默认设置下的延迟、Token 消耗和单位任务成本。

对开发团队来说,更可靠的验证方法是准备自己的 20~100 个真实任务,固定代码仓库版本、Prompt、工具权限、超时和最大尝试次数,同时记录一次成功率、平均 Token、测试通过率和人工返工时间。

Responses API 是本次更新的工程重点

V4-Flash-0731 原生支持 Responses API,并针对 Codex 做了适配。使用 OpenAI Python SDK 时,最小调用方式如下:

python -m venv .venv
.venv\Scripts\Activate.ps1
python -m pip install --upgrade openai
$env:DEEPSEEK_API_KEY="你的 API Key"
import os
from openai import OpenAI


client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions=(
        "你是代码分析助手。先定位根因和现有测试,"
        "没有获得可复核证据时不要声称任务已经完成。"
    ),
    input="检查任务队列为什么会重复消费,并给出最小修改方案。",
    max_output_tokens=4096,
)

print(response.output_text)
print(response.usage)

模型名不需要添加 -0731。继续使用 deepseek-v4-flash,服务端就会路由到当前最新版本。这个方式便于无缝更新,但也意味着生产系统不能只记录模型别名:日志中最好同时保存请求时间、返回的实际模型版本和回归测试结果,否则同一份代码在不同日期可能得到不同表现。

“兼容 Responses API”不等于完整实现所有能力

DeepSeek 官方兼容性表列出了几项容易踩坑的差异:

  • API 当前是无状态的,不支持 previous_response_idconversation
  • store 固定为 false,不提供服务端响应状态存储。
  • 支持函数工具和服务端网页搜索;Codex 兼容的自定义工具只支持名为 apply_patch 的类型。
  • file_searchcode_interpretercomputer_usemcp 等内置工具会被忽略。
  • max_tool_calls 会被忽略,应用必须自己限制工具调用次数。
  • 图片和文件输入尚不支持;传入后不会正常提供视觉或文件内容。
  • 超过上下文窗口不会自动截断,而是返回 400 错误。
  • 部分不支持的参数会被静默忽略,而不是直接报错。

最后一项尤其需要注意。请求成功只能说明接口接受了参数,不代表每个字段都生效。迁移现有 Responses API 客户端时,应根据官方兼容表逐项检查,而不是把“HTTP 200”当作兼容性测试完成。

流式响应也没有 data: [DONE] 结束标记。客户端应根据 response.completedresponse.incompleteresponse.failed 判断结束状态,并分别处理文本增量、推理内容、函数参数和最终 Usage。

旧模型名已经到迁移节点

V4 Preview 发布时,DeepSeek 宣布旧的 deepseek-chatdeepseek-reasoner 将在 2026 年 7 月 24 日 15:59(UTC)后退役。过渡期内,它们分别指向 V4-Flash 的非思考与思考模式。

现在已经超过官方给出的退役时间。新项目应直接使用:

deepseek-v4-flash
deepseek-v4-pro

迁移时不要只做字符串替换,还要检查思考模式、最大输出、工具调用历史和错误处理。V4 同一模型支持思考与非思考模式,官方当前将思考模式列为默认模式;如果旧业务依赖 deepseek-chat 的短响应与较低 Token 消耗,应显式验证新默认行为。

价格很低,但缓存命中率会放大差距

官方价格页当前列出的单价如下,单位均为每 100 万 Token:

计费项 V4-Flash V4-Pro
输入,缓存命中 0.0028 美元 0.003625 美元
输入,缓存未命中 0.14 美元 0.435 美元
输出 0.28 美元 0.87 美元
并发上限 2500 500

V4-Flash 的缓存命中输入价格只有未命中的 1/50。对于代码仓库、固定系统提示词和长工具定义,稳定前缀比反复压缩几百个 Token 更值得优化。

假设一次 Agent 任务使用 20 万输入 Token 和 2 万输出 Token:

情况 计算 估算费用
输入全部未命中缓存 0.2 × $0.14 + 0.02 × $0.28 0.0336 美元
输入全部命中缓存 0.2 × $0.0028 + 0.02 × $0.28 0.00616 美元

真实任务通常是部分命中,且工具返回内容、失败重试和推理 Token 都会改变费用。生产环境应记录 input_tokens_details.cached_tokensoutput_tokens_details.reasoning_tokens,计算“每个成功任务成本”,而不只是每次请求成本。

价格页还预告了峰谷定价:每天北京时间 9:00~12:00、14:00~18:00 的所有计费项将按常规价格的 2 倍计费。但截至本次核对,官方尚未公布生效日期,因此不能把双倍价格写成已经实施。批处理系统可以提前预留调度开关,等官方确认生效后再避开峰值时段。

API 更新与新权重发布要分开看

4 月 24 日的 V4 Preview 公告提供了技术报告和开放权重集合。7 月 31 日的更新日志则明确讨论 DeepSeek-V4-Flash API 公测,并称 0731 版本保持原架构和规模、仅重新后训练。

官方这次没有在更新日志中宣布新的 V4-Flash-0731 权重包。因此,可以确认的是线上 API 已升级,不能仅凭这份公告推导 0731 后训练权重已经同步开放。需要自托管的团队应以 DeepSeek 官方 Hugging Face 仓库中的具体模型卡、提交时间和许可证为准。

升级前可以做一轮小型回归

如果现有服务已经调用 deepseek-v4-flash,代码可能不需要修改,但行为已经可能发生变化。上线前建议至少检查:

  1. 选取真实的代码修改、终端任务和工具调用轨迹建立固定测试集。
  2. 分别测试思考与非思考模式,并记录 Token 和延迟。
  3. 验证 JSON Schema、函数参数和多轮工具结果能否稳定回传。
  4. 在应用层限制工具次数、总耗时、写入路径和外部副作用。
  5. 测试超长输入、工具失败、流式中断和 400/429/5xx 的处理。
  6. 记录实际版本与请求时间,避免模型别名自动更新后无法定位回归。

V4-Flash-0731 的看点不是参数又变大了,而是 DeepSeek 试图用同一底座的后训练升级,换取更强的 Agent 执行能力,并通过 Responses API 进入现有代码代理工作流。

接下来更值得关注的,是 DeepSeek Harness 能否按承诺开放、公开测试能否复现官方成绩、V4-Pro 正式版何时发布,以及 0731 后训练权重是否会同步提供。对开发者而言,在这些信息落地以前,最有价值的动作仍然是用自己的任务集做回归,而不是只根据一张跑分表决定全量迁移。

参考资料

  • DeepSeek API:Change Log,DeepSeek-V4-Flash Update,2026-07-31
    https://api-docs.deepseek.com/updates
  • DeepSeek API:DeepSeek V4 Preview Release,2026-04-24
    https://api-docs.deepseek.com/news/news260424
  • DeepSeek API:Models & Pricing
    https://api-docs.deepseek.com/quick_start/pricing
  • DeepSeek API:Your First API Call
    https://api-docs.deepseek.com/
  • DeepSeek API:Using the Responses API
    https://api-docs.deepseek.com/guides/responses_api
  • DeepSeek API:Thinking Mode
    https://api-docs.deepseek.com/guides/thinking_mode
  • DeepSeek:V4 官方开放权重集合
    https://huggingface.co/collections/deepseek-ai/deepseek-v4
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐