刚刚,DeepSeek-V4-Pro 正式版 API 发布,Agent 能力大幅增强,部分测试成绩已经逼近甚至超越 Claude Fable 5。
8 月 13 日报道。就在刚刚,DeepSeek-V4-Pro 正式版 API 正式上线。相比预览版,正式版最显著的变化是大幅强化了 Agent 能力,在多项 Agent 相关基准测试中实现了性能跃升,部分指标已经追上或超过 Anthropic 的 Claude Fable 5。

DeepSeek-V4-Pro 正式上线
一、正式版性能全面超越预览版,部分测试反超 Fable 5
DeepSeek-V4-Pro 正式版的基准测试成绩显示,其综合能力相比预览版实现了全面提升。在 AI 安全智能体基准测试套件 Cybergym 以及工作流智能体测试 AutomationBench 中,DeepSeek-V4-Pro 正式版的表现均超越了 Claude Fable 5。
其中最引人注目的是长周期、高复杂度真实软件工程编程智能体测试 DeepSWE。在这项测试中,DeepSeek-V4-Pro 正式版的得分从预览版的 12.8 大幅提升至 62.7,涨幅接近 5 倍,展现出在复杂软件工程任务中的显著进步。

DeepSeek V4 Pro 正式版在 Agent 相关评测集上的表现及与其他前沿模型的对比(图源:DeepSeek)
二、API 模型版本已更新,调用方式保持不变
根据 DeepSeek 官方 API 文档,deepseek-v4-pro 模型版本已更新为 DeepSeek-V4-Pro-0813,开发者无需修改调用方式,直接使用 deepseek-v4-pro 即可调用到最新正式版。
DeepSeek-V4-Pro-0813 重点增强了 Agent 能力,新增或完善的支持能力包括:
- JSON 结构化输出
- 工具调用(Tool Calls)
- Responses API
- Anthropic API 兼容
不过需要注意的是,DeepSeek-V4-Pro 正式版的并发限制为 500,低于 DeepSeek-V4-Flash 正式版的 2500。7 月 31 日,DeepSeek 已经发布了 DeepSeek-V4-Flash 正式版 API。

DeepSeek 官方 API 文档中 DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 的功能、价格与并发限制对比(图源:DeepSeek)
三、网页端与 API 调用表现存在差异,用户反馈 API 输出更生硬
在社交平台 X 上,有网友指出,目前网页端与 API 接口调用的 DeepSeek-V4-Pro 在思维链(CoT)表现上存在明显差异。API 输出的回复话术读起来更生硬、语序也更别扭,而网页端的表达则相对自然流畅。
这意味着对于已经接入 DeepSeek-V4-Pro API 的开发者来说,除了关注模型本身的性能提升,还需要在实际使用中对提示词、后处理或输出格式做进一步调优,以获得更接近网页端的体验。

开发者对比 DeepSeek-V4-Pro 网页版与 API 调用的输出结果(图源:X)

开发者对比 DeepSeek-V4-Pro 网页版与 API 调用的推理输出差异(图源:X)
四、API 价格尚未公布,整体调价预期已放出
截至目前,DeepSeek 尚未公布 DeepSeek-V4-Pro 的 API 价格。而在 8 月 6 日,DeepSeek 曾预告计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大。
对于依赖 DeepSeek API 的独立开发者和初创团队而言,价格仍是决定 Agent 项目落地可行性的关键变量之一。模型能力差距正在不断缩小,调用成本的高低很可能成为开发者最终买单的重要考量。
结语:大模型比拼进入智能体决赛圈
DeepSeek-V4-Pro 正式版通过大幅增强 Agent 能力,在性能超越预览版的同时逼近 Claude Fable 5,进一步巩固了其在智能体赛道的竞争力。
DeepSeek 在预览版发布时曾表示,下半年随着昇腾 950 超节点批量上市,Pro 的价格有望大幅下调。如今,成本问题已经成为独立开发者、初创团队落地 Agent 项目的核心瓶颈。各家模型在各大 Agent 基准上的跑分差距正在收窄,谁能把调用成本打下来,谁就更有可能赢得开发者的选择。
9 月 20-21 日,由智东西主办的2026 全球 AI 芯片峰会将在上海举行。峰会设有开幕式,大模型 AI 芯片、Agent 推理芯片、具身智能芯片 3 场高峰论坛,以及 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 5 场技术研讨会。
更多推荐

所有评论(0)