上周还在为DeepSeek峰谷涨价心疼账单,这周可能得重新算了。

英伟达下一代旗舰机柜Vera Rubin NVL72的首测数据昨晚出来了。跑在SemiAnalysis的AgentX基准上,DeepSeek V4-Pro每兆瓦吞吐量比现役主力GB300 NVL72最高涨了30倍,每百万Token成本最低砍到原来的1/35

30倍是什么概念?GB300 NVL72相比上代H200 NVL8,在同一个DeepSeek V4-Pro工作负载上,每兆瓦吞吐量已经高了15倍,每百万Token成本大约是H200的十分之一。Vera Rubin等于在这个基础上又叠了30倍。两代连乘,从H200到Vera Rubin,同一度电干出来的Agent活儿差不多翻了450倍。

这还没完。OpenAI刚公布的自研推理芯片Jalapeño,在Hot Chips上实测每瓦吞吐比GB300高1.9倍,功耗只跑700瓦,对标对手1400瓦。一边是NVDA的换代碾压,一边是OpenAI的侧翼突围,算力成本曲线的斜率正在往同一个方向加速。

不是芯片突破,是整柜协同

Vera Rubin不是某块芯片的突破,是整柜协同的结果——分离式服务、KV感知路由NVFP4量化第六代NVLink四件套叠在一起。NVFP4把权重压到4位精度不掉性能,KV感知路由解决长上下文场景的KV缓存命中率问题,第六代NVLink把机柜内互联带宽再往上推。单看不颠覆,叠起来跑Agent密集请求直接吃出30倍优势。

Agent的账单,不是聊天的账单

SemiAnalysis AgentX测试跑的是真实Agent工作负载——OpenRouter数据显示,一个Agent任务消耗的Token是普通聊天的15倍。上下文能从几万Token一路堆到接近四十万,中间穿插工具调用和子Agent请求。传统8K固定序列的跑分在这个场景下已经没意义了,英伟达这次等于直接宣告旧基准作废。

GB300到Vera Rubin的单位成本降幅大约一个数量级,恰好和上周DeepSeek峰谷涨价的幅度在一个量级上。你辛辛苦苦把批量任务挪到凌晨跑,省下来的钱,可能还没硬件更新一轮降得多。

不是谁独享的红利

而且Vera Rubin不是PPT。微软和英伟达已共同宣布,Vera Rubin平台已经开始装机,微软将成为全球首个大规模部署Vera Rubin的云厂商。印度AM Intelligence签了约9000套NVL72机架的约束性订单,首批2027年Q1交付。商业化落地的时间窗口可能比预期来得更快。更关键的是,Agent任务在MoE架构上的规模效应更明显——测试显示,同样是MoE模型,Kimi K3(2.8T参数)在GB300上相对H200的每兆瓦吞吐提升可达80倍。V4-Flash、混元Hunyuan、智谱GLM这些走长上下文+MoE路线的国产旗舰,在Vera Rubin上同样能吃这一轮硬件代差的红利。

硬件换代周期通常24到36个月。上一轮GB200到GB300过渡期,行业头部模型的每百万Token成本已被压到原来一半以下。Vera Rubin首测数据意味着,DeepSeek上周刚涨上去的价格,大概率撑不到年底。新机柜规模化之后,V4-Pro当前27元/百万Token的高峰输出价,极有可能被压到1元以内——这不是预测,是简单除一下。

涨价是插曲,降价是趋势

算力成本在塌方,中间商的价值在重构。这轮涨价潮之后,API价格会进入新一轮下降通道。模型路由、供应商解耦、成本优化从可选项变成必选项——不是因为你想做,是因为硬件换代的速度已经快过你调代码的速度了。

追价格不如追灵活。DeepSeek涨价、OpenAI降价、NVIDIA换代——无论市场怎么变,EasyAPIEasyAPI一个Key切所有主流模型,切换不改代码,只改配置。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐