DeepSeek V4 Pro正式版上线,Agent能力逼近Fable 5
8月12日深夜,DeepSeek的API文档悄悄更新了:deepseek-v4-pro对应的模型版本从预览版切换成了DeepSeek-V4-Pro-0813,也就是V4 Pro的正式版。没有发布会,官方更新日志至今没动静,最先发现变化的不是公告,而是文档和实际调用端。据腾讯新闻等媒体报道,几乎同一时间SpaceXAI发布了Grok 4.6,两款主打高性价比的模型在同一天"撞车"。
这次更新到底更新了什么
先说结论:这不是新的基座模型,是V4 Pro从预览版转正的"后训练+工程优化"版本。
V4系列从一开始押注的就是Agent方向——百万级上下文、工具调用、代码工程。据媒体报道援引DeepSeek官方群流出的评测对比表,这次正式版在多项智能体测试中已逼近Anthropic的Claude Fable 5,部分项目甚至反超,相比预览版提升明显。需要说明的是,这些分数目前属于非官方披露,DeepSeek还没有发布正式基准成绩单,看看就好,别当结论。
能力维度上,V4-Pro-0813支持1M上下文、最高384K输出,兼容JSON Output、Tool Calls、Responses API、Anthropic API和FIM补全。对做工程的人来说,支持Anthropic API格式意味着现有的Claude调用代码改个base_url就能切过去,迁移成本被压得很低——这本身就是一种竞争策略。
变与没变:性能在涨,价格窗口在收
没变的是价格。截至更新时,V4 Pro仍是输入每百万token约3元、输出约6元的水平,官方没有因为能力升级而涨价。
变的是官网的一句话。DeepSeek在价格页面明确写着:计划在不久的将来上调API整体价格,预计涨幅较大。翻译成大白话就是——现在是低价窗口,先用先省,后面要涨。
更有意思的是同一天的Grok 4.6。据报道,Grok 4.6在Artificial Analysis的GDPVal-AA v2评测中拿到1753 Elo排名第一,超过GPT-5.6 Sol Max的1728分和Claude Fable 5的1741分;API定价输入每百万token 2美元、输出6美元,约为其他前沿模型的一半。两个"便宜大碗"的模型同一天上线,信号很明确:前沿模型的竞争逻辑正在从"谁的跑分高"转向"性能接近时,谁更便宜、谁的生态更顺滑"。放到更大背景看,据华尔街见闻报道,OpenRouter平台上美国企业调用中国模型的token占比,已从2025年上半年的4.5%一路升到峰值46%,价格驱动的迁移早就开始了。
对普通打工人来说这算好消息:Agent类任务的门槛在降,写代码、跑批处理、做文档这类活,能用上越来越便宜的"能干活的模型",而不是只能对着贵价的聊天模型叹气。
顺带说一句背景:为什么各家都在卷"Agent测试"而不是聊天跑分?因为AI的使用方式变了。以前是"你问我答",现在是把几十万上百万token的任务整个丢给模型跑,按量付费的成本一下就变成了大头,模型"能不能自己把活干完、干对"比"聊得好不好"重要得多。DeepSeek在7月31日发布V4 Flash正式版时披露过一组Agent基准:Terminal Bench 2.1达到82.7、NL2Repo达到54.2、DeepSWE达到54.4、Toolathlon verified达到70.3(据DeepSeek官方更新日志),当时就明确说正式版智能体能力远超V4-Pro预览版。这次V4 Pro正式版继续往Fable 5靠拢,说明DeepSeek在Agent方向的积累正在通过后训练和工程优化转化为实际任务执行能力,而不是只停留在演示层面。
开发者现在能做什么
1. 实测优先,别信榜单。 官方基准还没发布,群里流传的对比表只能当参考。拿自己业务里最典型的Agent任务(工具调用、多步规划、长文档处理)各跑一遍,比看任何Elo都实在。
2. 趁低价窗口做评估。 官网已预告涨价,现在正是把模型接进自己项目、把成本结构算清楚的好时机。调用示例(OpenAI兼容格式):
curl https://api.deepseek.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [{"role": "user", "content": "写一个Python函数:读取CSV并按指定列去重"}],
"reasoning_effort": "medium"
}'
```
`reasoning_effort`可以调节思考强度——简单任务用低档省token,复杂推理再开高档。想切Anthropic格式的,把base_url指向DeepSeek的兼容端点即可,前提是把工具调用和流式输出的差异先测一遍。
**3. 注意几个坑:**
- 涨价预告意味着别把预算按当前价格锁死,API成本要留缓冲;
- - 正式版刚上线,灰度期的稳定性、限流策略都要实测,别直接上生产核心链路;
- - 评测表里的"逼近Fable 5"是Agent方向的特写,不等于全场景全能,通用问答、长文写作该对比还得对比。
## 结尾
一边是DeepSeek V4 Pro正式版"能力升级、价格暂稳",一边是Grok 4.6"半价冲击第一梯队",大模型价格战的下一回合可能刚开始。涨价落地之前,你会切换还是观望?评论区聊聊。
更多推荐


所有评论(0)