8月12号到13号,大模型圈发生了一件很有意思的事——两个重量级更新撞在了一起。

一边是 DeepSeek V4 Pro 悄悄转正,模型版本号从预览版跳到了 0813 正式版,没有发布会、没有博客长文,只在 API 文档的表格里改了一行字。

另一边是 xAI(现在叫 SpaceXAI)发布 Grok 4.6,主打长时程 Agent 能力,Artificial Analysis 智力量表直接干到 61 分,追平 GPT-5.6 Sol。

两件事放在一起看,比单独看任何一个都更有信息量。

Agent 赛道的天花板,被从两个方向同时捅破了。

DeepSeek V4 Pro:从"能用"到"平替",只用了四个月

先看 DeepSeek 这边。V4 Pro 四月份刚出来的时候还是预览版,Agent 能力只能说"有那个意思",但离真正干活还有距离。

这次 0813 正式版,变化是质变性的。直接看几个核心数字:

Terminal Bench 2.1:从 72.1 → 87.9,反超 Claude Opus 4.8 的 85.0,离 Fable 5 的 88.0 只差 0.1。

CyberGym:从 52.7 → 83.3,反超 Opus 4.8 的 78.3,也略高于 Fable 5 的 83.1。

DeepSWE:从 12.8 → 62.7——这个最夸张,直接翻了近五倍,超过 Opus 4.8 的 58.0。

AutomationBench:从 12.8 → 31.8,反超 Opus 4.8 的 27.2 和 Fable 5 的 29.1。

数据来源是 DeepSeek 官方 API 文档页和 HN 上的开发者整理 Hacker News。官方文档目前暂时不可访问,但多个独立来源交叉验证了这些数字 Decrypt via AI Coin

如果这些数字经得住第三方实测的话,意味着一件事:开源模型(或者说"准开源"的 API 模型)第一次在 Agent 核心基准上,跟闭源顶级模型站在了同一个量级。

不是追近,是在多个单项上已经反超。

真正可怕的不是分数,是价格

DeepSeek V4 Pro 的定价是:输入 3 元 / 百万 Token,输出 6 元 / 百万 Token,缓存命中输入只要 0.025 元 钱江晚报。折成美元大概是 $0.435 / $0.87 per million tokens。

对标一下:Claude Fable 5 是 $10 / $50。

输入差 23 倍,输出差 57 倍。

这还不是最狠的。如果算上 Agent 编程场景里典型的缓存命中比例——有开发者按照 Opencode 公开的数据算了一笔账:典型的 Agent 编程请求,750 输入 + 290 输出 + 82k 缓存命中,V4 Pro 单次请求成本约 $0.000875,等价 Opus 成本约 $0.052——实际成本差是大约 60 倍 Hacker News

六十倍是什么概念?

就是以前你花 5000 块钱一个月的 API 预算才能干的活,现在 80 多块就搞定了。预算不变的话,你可以把 Agent 的尝试次数翻几十倍,或者把以前不敢碰的长时程任务直接拉满。

当能力差缩小到 5%,价格差拉大到 45 倍,选择就不再是技术问题了,是商业问题。

而且别忘了,官方还挂了一条预警:计划近期整体上调 API 定价,"预计涨幅较大"。现在这个价格,可能是地板价。

Grok 4.6:xAI 也下场了,赛道从单挑变混战

同一天,xAI 的 Grok 4.6 也来了。

Artificial Analysis Intelligence Index 拿到 61 分,跟 GPT-5.6 Sol 打平,仅次于 Claude Opus 5(63)和 Fable 5(62)Artificial Analysis

几个关键看点:

Agent 能力是核心升级。 Grok 4.6 主打长时程 Agent 任务——多步骤研究、跨代码库工作、从产品想法直接生成可用应用。官方说在更长的任务轨迹上,模型会更频繁地自我测试和验证,而不是找到一个差不多的答案就停下来 unite.ai

GDPval-AA v2 Elo 1753。 这个基准测的是"真实经济价值类工作",不是学术题。Grok 4.6 排第三,前面只有两个 Claude Opus 5 变体。比上一代 Grok 4.5 高了大约 200 Elo CoinDesk

价格:$2/$6 per million tokens。 比 DeepSeek 贵,但比 GPT-5.6 Sol($5/$30)和 Claude Opus 5($5/$25)便宜 60% 以上。

有意思的是,Grok 4.6 的核心卖点也不是通用推理,不是 benchmark 刷分,是 Agent、编程、长时程任务

跟 DeepSeek V4 Pro 的主打方向,高度重合。

三个信号,说清楚 Agent 赛道变天了

把这两个发布放在一起看,至少有三个信号值得注意:

第一,Agent 能力正在成为新的主战场。

前两年的模型发布,比的是 MMLU、比的是通用推理、比的是数学题。今年以来,越来越多的旗舰模型把发布重点放在了 Agent 基准上——Terminal Bench、SWE-bench、CyberGym、AutomationBench。

为什么?因为通用推理的边际收益在递减,而 Agent 能力直接决定了模型能不能真正干活、能不能替代真实工作流。

能考高分的模型不稀奇,能自己写代码、自己跑终端、自己查 bug 的模型,才是真的能创造经济价值。

第二,"闭源独一档"的格局正在被打破。

就在半年前,大家还默认一个事实:闭源顶流(GPT、Claude)是第一梯队,开源模型(国内的、Meta 的)差一大截,没得比。

现在呢?DeepSeek 在 Agent 单项上追平甚至反超 Fable 5,Grok 4.6 跟 GPT-5.6 Sol 打平。第一梯队还是第一梯队,但后面的人已经快贴脸了。

而且后面的人,价格是你的十分之一甚至几十分之一。

这不是技术代差,这是商业代差。技术差 5%,价格差 45 倍——对于 90% 的场景来说,怎么选根本不需要想。

第三,双 API 兼容是杀招。

DeepSeek V4 Pro 同时兼容 OpenAI 格式和 Anthropic 格式的 API。这件事看起来小,实际上非常狠。

它意味着什么?意味着你现在用 Claude 的应用,改一行 base URL 就能切到 DeepSeek。迁移成本几乎为零。

以前切换模型的成本是什么?要改 prompt 格式、要调参数、要适配工具调用格式、要重写接入层。现在这些都不用了,直接换。

当模型能力足够接近、API 格式完全兼容、价格差几十倍的时候,用户的迁移阻力,比想象中小得多。

写在最后:Agent 时代的"平替"已经来了

DeepSeek V4 Pro 和 Grok 4.6 撞档发布,不是巧合。

它们代表的是同一件事:大模型的竞争焦点,正在从"谁更聪明"转向"谁更能干活",而干活的性价比,正在被第二梯队以极快的速度追平。

对于开发者和创业者来说,这是个好消息。

以前你想做一个 Agent 产品,算力成本是悬在头顶的达摩克利斯之剑——用户越多亏越多。现在有了 DeepSeek 这种级别的"平替",很多以前不敢想的商业模式,突然就变得可行了。

对于闭源巨头来说,这是个警钟。

靠"我比你聪明 5%"撑着 45 倍的溢价,能撑多久?当第二梯队的模型在 Agent 核心场景已经够用了,溢价的护城河还剩多少?

AI 行业最有意思的阶段,永远不是第一名遥遥领先的时候,而是第二名快追上的时候。

现在,第二名们追上来了。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐