凌晨突袭!DeepSeek-V4-Pro-0813 正式版上手:Agent 跑分反超 Fable 5,价格只要它 1/57
凌晨突袭!DeepSeek-V4-Pro-0813 正式版上手:Agent 跑分反超 Fable 5,价格只要它 1/57
这坑我替你踩过了:同一个模型名
deepseek-v4-pro,昨天还不会干的活,今天突然就会了。早上别急着百度报错,先看看你是不是已经被"静默升级"了。
一、问题背景:为什么大半夜不睡觉写这篇
8 月 13 日凌晨,DeepSeek 毫无预兆地把 V4 Pro 从预览版转正了,版本号直白得很——DeepSeek-V4-Pro-0813。
这不是一次挤牙膏。它把 4 月预览版里最拉胯的 Agent 能力,一夜之间从"基本不会做"拉到了"全球第一梯队"。
更戏剧的是,几乎同一时间,马斯克的 Grok 4.6 也发布了对标。两大巨头撞车,火药味拉满。
而我之所以半夜爬起来写这篇,是因为后台好几个读者在问同一件事:
“门主,DeepSeek-V4-Pro-0813 现在在国产里到底啥水平?我要不要把线上的 GLM-5.2 / Kimi K3 换掉?海外那几个 Opus 4.8、Fable 5 还要不要留?”
这问题问得好,但别急着 Ctrl+C / Ctrl+V。
模型选型这事,跑分只是门票,能不能落地、成本扛不扛得住、迁移痛不痛,才是真正要算的账。 今天这篇,我把 0813 的水平、提升点、对接实战一次讲透,顺便把坑也给你标好。
二、场景复现:0813 到底是个啥
先用一张表把规格钉死,省得后面扯皮。
2.1 核心规格
| 项目 | 内容 |
|---|---|
| 模型版本 | DeepSeek-V4-Pro-0813(8 月 13 日凌晨转正) |
| 调用模型名 | deepseek-v4-pro(名称不变,base_url 不变) |
| 架构 | MoE,总参数约 1.6 万亿,激活约 490 亿 |
| 上下文窗口 | 1M token |
| 最大输出 | 384K token |
| 推理模式 | 思考模式 / 非思考模式(思考模式默认开启) |
| API 兼容 | OpenAI 格式 + Anthropic 格式(api.deepseek.com/anthropic) |
| 能力支持 | Tool Calls、JSON Output、Responses API、Codex 接入、FIM 补全(仅非思考模式) |
| 并发限制 | 500(Flash 是 2500) |
| 部署形态 | 仅 API(按量计费) |
2.2 价格(与预览版一致,暂未涨)
| 计费项 | DeepSeek V4 Pro 0813 | DeepSeek V4 Flash |
|---|---|---|
| 输入(缓存命中) | ¥0.025 / 百万 | ¥0.02 / 百万 |
| 输入(缓存未命中) | ¥3 / 百万(≈ $0.435) | ¥1 / 百万 |
| 输出 | ¥6 / 百万(≈ $0.87) | ¥2 / 百万 |
换算成美元,输出 $0.87/百万。这个数字后面要反复用到,先记心里。
2.3 跑分对比(重点来了)
| 评测项 | V4 Pro 预览版 | V4 Pro 0813 | Opus 4.8 | Fable 5 | Kimi K3 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1(终端操作) | 72.1 | 87.9 | 85.0 | 88.0 | 88.3 |
| DeepSWE(软件工程 Agent) | 12.8 | 62.7 | 58.0 | 70.0 | — |
| CyberGym(网络安全攻防) | 52.7 | 83.3 | 78.3 | 83.1 | — |
| AutomationBench(自动化任务) | 12.8 | 31.8 | 27.2 | 29.1 | — |
| DSBench-Hard(全栈开发·困难) | 31.1 | 67.2 | — | — | — |
| NL2Repo(自然语言生成仓库) | 38.5 | 61.5 | 69.7 | — | — |
| HLE(带工具·高难推理) | — | 60.0 | 57.9 | 63.0 | — |
一句话总结这张表:安全攻防、自动化两项,0813 直接反超 Fable 5;终端操作仅差 0.1 逼近 Fable 5;DeepSWE 暴涨近 4.9 倍。
但别飘——超高难度综合推理上,它离 Opus 4.8 / Fable 5 还有差距,NL2Repo 也还略低于 Opus 4.8。 0813 不是六边形战士,它是一个"Agent 长板拉满、推理短板还在补"的偏科生。
另外一个要诚实说的点:Artificial Analysis 的综合智能指数,0813 的第三方更新分数目前还没出(预览版时期是 44 分,低于 GLM-5.2 的 51、Kimi K3 的 57、Opus 4.8 的 56、Fable 5 的 64.9)。现在能确认的是 Agent 专项评测的大涨,综合分数等第三方更新再下结论。先别拿 44 分去否定它,也别拿 Agent 分去吹它通杀——这两头都不老实。
三、根因分析:为什么这次提升这么大
很多人看到跑分暴涨,第一反应是"换基模了?扩参数了?"
没有。 这正是这次最值得琢磨的地方。
3.1 基模没动,后训练动了刀
这里要先打个预防针:0813 官方更新日志尚未发布(爱范儿实测时也提到"连更新日志都还没端上来")。下面的判断是基于 V4 Flash 0731 日志的合理反推——Flash 0731 和 0813 发布间隔不到半个月,业内普遍认为二者共享相近优化思路:
Flash 0731 官方日志:基模在结构、尺寸上保持一致,仅重新进行了后训练。
合理推断:0813 这波提升很可能也主要来自后训练(post-training)阶段对 Agent 能力的专项强化——更海量的工具调用轨迹、更长的多步任务 SFT、更激进的可验证奖励 RL。注意这是推断,不是官方定论,等 0813 日志正式放出再以官方为准。
这解释了一个反直觉现象:
看似能跑,其实已经埋雷——同一个 API 名称,能力却一夜换了个样。
你以为调的还是"昨天那个 V4 Pro",实际上模型权重已经换了。这对线上系统是个隐性风险:昨天稳定通过的 case,今天可能因为模型行为变化而表现不同。版本号 0813 不是装饰,是你要记进变更日志的东西。
3.2 1M 上下文 + 384K 输出:为 Agent 而生
Agent 任务有个死穴:上下文不够,前面干过啥转头就忘。
大型代码库、几十份资料、长时间运行日志、连续工具调用,都会疯狂吃上下文。窗口一顶满,Agent 就只能压缩记忆,压着压着,关键信息就没了。
0813 给到 1M 输入 + 384K 输出,这俩数字对聊天没啥用,对长任务 Agent 是硬刚需。尤其是 384K 输出——意味着它能在一次调用里吐出一整个中型项目的代码,不用你拼拼凑凑。
3.3 Harness:模型之外的另一半
这次还有张暗牌——DeepSeek Harness(5 月立项、8 月 2 日内测、近期公测)。
模型是大脑,Harness 是手脚和神经系统。
光有模型输出文本,没法真正"动手"写代码、改文件、跑测试、调报错。Harness 就是那套执行调度系统。0813 + Harness = 完整智能体栈。 DeepSeek 的竞争,已经从"模型跑分"升级到"智能体栈对抗"。
四、解决方案:多模型对接实战
回答你最关心的那个问题:
对接 GLM-5.2、Kimi K3、Opus 4.8,以及带 fallback 的 Fable 5,DeepSeek-V4-Pro-0813 的优势到底在哪?
先把话说清楚——你说的"带 fallback 的 Fable 5"这个表述非常准。Fable 5 本身就内置了 fallback 机制:遇到网络安全、生物、化学等敏感话题,它会自动回退到 Opus 4.8 响应(平均不到 5% 的会话触发)。
这说明一个趋势:连海外旗舰都在用"主力 + fallback"保可靠性。 那我们做企业级落地,更该这么干。
4.1 优势在哪(先给结论)
| 维度 | DeepSeek V4 Pro 0813 的优势 |
|---|---|
| 价格 | 输出 $0.87,约为 GLM-5.2 的 1/5、Kimi K3 的 1/17、Opus 4.8 的 1/29、Fable 5 的 1/57 |
| Agent 能力 | 安全攻防/自动化反超 Fable 5,终端操作仅差 0.1 逼近,主力干脏活累活完全够格 |
| API 兼容 | 同时兼容 OpenAI + Anthropic 格式,迁移成本极低,可 drop-in 替换 |
| 长任务 | 1M 上下文 + 384K 输出,长链 Agent 友好 |
| 国产合规 | 国内调用稳定,无需折腾网络 |
短板:并发只有 500(Flash 是 2500)、超高难推理仍落后海外旗舰、综合智能指数待更新。
所以最佳姿势不是"换掉谁",而是分层路由:
DeepSeek V4 Pro 0813 当主力(性价比 + Agent 强)→ GLM-5.2 / Kimi K3 当国产备选(开源本地化 / 视觉长程)→ Opus 4.8 / Fable 5 当海外兜底(高难推理 + SOTA)。
4.2 对接实战:Spring AI 多模型 fallback 路由
环境版本:
| 项目 | 内容 |
|---|---|
| JDK | 17 |
| Spring Boot | 3.x |
| Spring AI | 1.0.x |
| 主力模型 | DeepSeek-V4-Pro-0813(OpenAI 兼容) |
| 备选 | GLM-5.2、Kimi K3 |
| 兜底 | Claude Opus 4.8 / Fable 5(Anthropic 原生) |
第一步:配置(OpenAI 兼容方式接 DeepSeek)
# application.yml
spring:
ai:
openai:
base-url: https://api.deepseek.com # DeepSeek 兼容 OpenAI 格式
api-key: ${DEEPSEEK_API_KEY}
chat:
options:
model: deepseek-v4-pro # 0813 正式版,名称不变
temperature: 0.3
划重点:DeepSeek 还提供了 Anthropic 兼容端点
https://api.deepseek.com/anthropic。如果你原来用 Claude SDK / Claude Code,把 base_url 一换、key 一填,就能直接把后端换成 DeepSeek,几乎零迁移。
第二步:多模型 fallback 路由(企业级写法)
/**
* 多模型路由:主力(性价比+Agent强) → 国产备选 → 海外旗舰兜底
* 设计思路呼应 Fable 5 自身的 fallback 机制:贵模型只在必要时兜底。
*/
@Service
@Slf4j
public class MultiModelChatRouter {
/** 路由优先级:从便宜到贵,从国产到海外 */
private static final List<Route> ROUTES = List.of(
new Route("deepseek-v4-pro", "deepseekChatModel", 0.87, "主力:Agent第一梯队+地板价"),
new Route("glm-5.2", "glmChatModel", 4.40, "备选:MIT开源可本地化+编程强"),
new Route("kimi-k3", "kimiChatModel", 15.00, "备选:原生视觉+长程编程"),
new Route("claude-opus-4-8", "anthropicChatModel", 25.00, "兜底:高难推理稳"),
new Route("claude-fable-5", "anthropicChatModel", 50.00, "终极兜底:SOTA(自带fallback)")
);
/** 各模型 ChatModel Bean,按 beanName 注入 */
private final Map<String, ChatModel> chatModels;
public MultiModelChatRouter(Map<String, ChatModel> chatModels) {
this.chatModels = chatModels;
}
/**
* 带降级的对话调用:依次尝试,全部失败才抛异常
*/
public String chat(String prompt) {
for (Route route : ROUTES) {
try {
ChatModel model = chatModels.get(route.beanName());
Assert.notNull(model, "未找到模型 Bean: " + route.beanName());
// 企业级建议:这里加超时、重试、熔断,示例从简
String reply = model.call(prompt);
log.info("路由命中:{}(${}/百万输出)", route.name(), route.cost());
return reply;
} catch (Exception e) {
// 主力挂了别慌,记日志后自动 fallback
log.warn("模型 {} 调用失败,触发降级:{}", route.name(), e.getMessage());
}
}
throw new IllegalStateException("全部模型兜底失败,请检查网络与额度");
}
/** 路由定义:模型名 + Bean名 + 单价 + 用途 */
private record Route(String name, String beanName, double cost, String usage) {}
}
第三步:智能分流(别让 Pro 扛所有流量)
/**
* 按任务复杂度分流:简单任务走 Flash 省钱,复杂任务才上 Pro。
* 0813 并发只有 500,无脑全量上 Pro 迟早限流。
*/
public ChatModel pickModel(Task task) {
return switch (task.complexity()) {
case SIMPLE -> flashModel; // 聊天/轻量问答/日常补全 → Flash(并发2500,便宜3倍)
case AGENT -> deepSeekPro; // 终端操作/代码工程/安全攻防 → Pro 0813
case HARD_RL -> anthropic; // 超高难推理 → Opus 4.8 / Fable 5 兜底
};
}
这一段是灵魂:模型之间的能力梯度,本身就是 Agent 的成本优化空间。 Flash 能干 80%~90% 的活,Pro 只啃硬骨头,海外旗舰只在最难的节点出手。这才是"用得起"的架构。
4.3 备选 / 不推荐方案
| 方案 | 评价 |
|---|---|
| ✅ 推荐:分层路由 | 主力 DeepSeek + 国产备选 + 海外兜底,成本与质量平衡 |
| 🟡 备选:纯国产双模型 | DeepSeek Pro 主力 + GLM-5.2 备选,合规优先、海外不可用时 |
| ❌ 不推荐:全量上 Fable 5 | 输出 $50/百万,是 DeepSeek 的 57 倍,账单会让你怀疑人生 |
| ❌ 不推荐:无脑全量 Pro 0813 | 并发 500,高峰期 + 涨价后会被限流打到怀疑人生 |
👇 三连支持,动力源泉
如果这篇文章帮你省下了踩坑的时间,欢迎:
🔹 点赞 —— 让更多人看到这篇干货
🔹 在看 —— 你的认可是我持续输出的动力
🔹 转发 —— 分享给身边正在做AI Agent的朋友
你的每一个小动作,对我都很重要 ❤️
🙏 关于作者
你好,我是 空门技术栈,一个常年和Bug战斗、持续填坑的Java开发者。
专注分享:
- ✅ Java / Spring Boot / Spring AI Alibaba 企业级实战
- ✅ RAG知识库、AI Agent、多智能体协作落地经验
- ✅ Docker部署、微服务架构、线上问题排查
- ✅ 偶尔聊聊「如何保住头发」这类程序员终极话题 😂
不搞水文,不贩卖焦虑,只写能跑通、能落地、能帮你少加班的实战内容。
关注我,咱们一起少踩坑,多写优雅代码。
📖 更多干货推荐
- 告别手动复制接口文档!Apifox MCP + AI 自动测试让开发效率起飞
- MySQL MCP Server 从零安装到使用实战,AI 直接查询数据库
- Spring Event 用了三年,同事一句话把我问懵了
- Spring AI Alibaba 多智能体(Multi-agent)实战:6 大协作模式 + 完整代码
- Spring AI Alibaba 智能体作为工具实战:别再让主 Agent 当"人肉路由器"了
- 一文搞懂 Spring AI Alibaba Workflow:10 个实战案例带你彻底掌握 AI 工作流编排
- RAG 知识库为什么越更新越乱?一文讲透生产级文档更新方案
- Transformers VS vLLM:大模型部署到底该选谁?从本地运行到生产上线完整解析
- LangChain Agent终于讲透了:短期记忆、Redis持久化、Middleware企业级实战,一篇带你从入门到生产
- LangChain 流式输出终于讲透了:6 种 stream_mode 一篇全搞懂
- Spring AI 流式对话踩坑:SSE 已关闭,为什么大模型还在继续生成?
- LangChain 结构化输出终于讲透了:ProviderStrategy、ToolStrategy、动态 Schema 一篇全会
- [Spring WebFlux 真的比 MVC 快?我用 5 万长连接测出了真相]
(https://mp.weixin.qq.com/s/CNv2U98Mg5cqftidjatP5w)
🤝 项目合作 / 技术咨询
平时工作之余,也会接一些技术项目和咨询,主要方向:
⚔️ 企业级开发
- Java / Spring Boot 项目开发与重构
- 微服务架构设计与落地
- 系统性能调优、线上问题排查
🤖 AI 应用落地(这是我最近的主力方向)
- Spring AI Alibaba / RAG / Agent 应用开发
- 企业私有知识库搭建
- AI能力接入现有业务系统
- 大模型本地化部署与调优
🛠️ 技术顾问 / 疑难Bug排查
- 项目架构评审与方案设计
- 线上疑难问题定位解决
- 技术选型与团队培训
如果你正遇到以下情况,欢迎找我聊聊:
- ✅ 想做AI项目,但技术方案拿不准
- ✅ 项目卡在某个Bug上很久,团队搞不定
- ✅ 想把AI接入现有业务,不知道从哪下手
- ✅ 需要靠谱的开发外包或长期技术顾问
📮 联系渠道(按回复速度排序):
- 最快:私信空门技术栈
一个人踩坑,是事故;一群人踩坑,就是《避坑宝典》。
—— IT 空门,与诸君共修技术大道 😎
更多推荐


所有评论(0)