上周三晚上,一个叫argofowl的开发者查Claude Code日志时发现了一件事:从2.1.237版本开始,系统把他手动选的"high"推理档,悄悄映射到了原本对应"low"档的数值10上。更新日志里一个字没提。

他debug了整个下午。先怀疑自己代码写错了,再怀疑Mac出了问题,最后翻API日志才抓到"凶手"。科技博主Chubby转发后AI圈炸了,大量用户翻出旧会话逐行对比。更麻烦的是,Anthropic工程师Thariq随后承认,Opus 5的表现"很不稳定",已列为最高优先级解决。

有人把Opus 5和竞品跑同一个任务:Opus 5的xHigh档跑了一小时,换一家15分钟搞定——4倍差距。AMD AI总监Stella Laurenzo亲自翻了她团队6852条Claude Code会话,发现模型思考深度从1月的2200字符暴跌到3月的560字符,降幅75%。同一时期,Claude Code隐藏思考过程的比例从1.5%飙升到100%。

模型变笨了,你还看不见它怎么变笨的。

三条线同时在动

这个八月最后一周,AI行业同时释放了三组信号,分别对应你API账单的三个变量:算力成本、调用效率、模型可靠性。

算力成本:推理芯片正在重写基线

8月25日Hot Chips大会,OpenAI亮出了自研推理芯片Jalapeño。这颗700W的芯片,单卡吞吐量每秒1459个token,对面英伟达GB200是535个——差了2.7倍。端到端延迟1.65秒对5.99秒,3.6倍。功耗只有英伟达旗舰的一半。

更狠的是速度。从设计到流片,9个月。行业常规18到36个月。为什么这么快?OpenAI让自家模型GPT-Astra和Codex参与了芯片设计——AI生成代码比人类专家快1.5到1.8倍。SemiAnalysis创始人Dylan Patel直接说:"被掀翻的不只是Blackwell,连Rubin也被超越了。"

推理占AI全生命周期算力支出的80%到90%。谁把推理成本打下来,谁就在改写所有人的API账单基线。

调用效率:模型以外的变量更重要

8月13日,DeepSeek开源了Harness(dsh),13天GitHub斩获19.5万星。8月19日,OpenAI跟牌开源Codex Harness(Apache-2.0),同一颗GPT-5.6 Sol在ARC-AGI-3上从13.3%飙到38.3%,输出token砍到1/6。NVIDIA的AVO系统在ARC-AGI-3上183道关卡全部满分。

一篇控制变量论文的结论挺直接:固定模型换Harness,跑分差距2.5到5分;固定Harness换模型,差距可以到13分。Harness带来的方差比模型本身大7.8倍。选哪个模型可能没那么重要,重要的是外面那层"壳"。

模型可靠性:信任正在成为变量

同一天,Apple发布首款2nm芯片M6,899美元的Mac Mini,AI性能较M4提升4倍。Perplexity联合NVIDIA推出"Portable Computer",完全本地运行的AI Agent,零token成本,数据不出设备。IBM也发布了Granite 4.2。

当你还在纠结API账单是300美元还是500美元的时候,有人已经用一台游戏本跑290B的MoE模型了。

三个变化正在发生

第一,API成本的底盘在松动。

OpenAI自研芯片不是要卖给你,是要把自家推理成本砍到英伟达方案的一半以下。推理占OpenAI支出的80%以上,省一半电费就是天文数字。这个省下来的成本迟早会传导到API定价——8月21日OpenAI已经把GPT-5.6 Sol降价20%到33%,不是做慈善,是垂直整合的红利。

第二,模型选择正在"去品牌化"。

OpenRouter上周Token消耗量突破93.4万亿,一个匿名模型"牛来"(Ox Alpha)上线三天就和DeepSeek V4 Flash并列第一。六天后揭晓是智谱GLM新版本,立刻开源权重,定价只有Opus 4.8的1/40。同周阿里开源Qwen3.8-Flash,1元/3元每百万token,125B参数只激活6B就超越Claude Opus 4.6。

开发者越来越把模型当零件用,谁性价比高用谁,品牌忠诚度在崩塌。

第三,信任正在成为新的竞争维度。

Claude Opus 5的信任危机不是孤例。一家公司能悄悄改你的推理档位、隐藏思考过程、一天宕机三次——而且99.35%的可用性跌破企业级99.9%的红线——你选择的不只是一个模型,是一份信任契约。

SemiAnalysis把Jalapeño的出现解读为"CUDA护城河可能已死"。但更准确的说法可能是:当模型同质化、价格趋同、Harness成为变量,"可靠性"和"透明度"反而成了最稀缺的东西。

三件能立刻做的事

第一,重新看一下你的路由策略。

别把所有请求都给一家。Reddit上有人实测,85%的简单请求走Haiku级别,只有不到2%才走旗舰,月费从288美元降到60美元。今天又多了两个开源选择——GLM-5.3-Flash和Qwen3.8-Flash——定价分别是Opus 5的1/40和1/60。如果还在用"全量旗舰"模式,每月至少多花70%的冤枉钱。

第二,花时间把Harness跑通。

一篇论文已经证明,换Harness的方差比换模型大7.8倍。DeepSeek Harness开源13天19.5万星,把Claude Code和Codex当插件装进自己的工作流。花一小时跑通dsh或Codex Harness,比你花一周纠结选哪个模型更值得。

第三,给本地模型留一个位置。

Perplexity的Portable Computer跑在RTX显卡上,零token成本。Apple M6的Mac Mini 899美元,4倍AI性能提升。如果80%的调用是重复性的小任务(代码补全、格式检查、文档润色),本地模型零成本、零延迟、零隐私风险。贵的云端API留给那20%真正需要深度推理的任务。这个"80/20混合策略"在2026年已经不是理论,是越来越多开发者在跑的生产配置。

怎么应对这个变化?

这个八月的信号很清楚:模型会继续降价、继续开源、继续同质化。真正的壁垒正在从"谁的参数大"转向"谁的推理成本低、谁的壳更灵活、谁更值得信任"。

如果你现在的API调用还挂在单一平台上,这个月发生的事情应该是一个提醒。EasyAPI做的事情很简单:一个Key接入所有主流模型,兼容OpenAI接口,切换只需要改配置项,不碰业务代码。

也有很多主流大模型可选

无论是DeepSeek涨价、OpenAI降价、还是新模型突然冒出来——你不需要追着每一轮变化改代码。随时切、随时切到最划算的那一家,这是2026年做AI应用的基本功,也是你在模型快速同质化时代保持灵活性的底牌。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐