AI进入“性价比绞杀时代“,谁还在为最贵的模型买单?
7月24日 Claude Opus 5 上线,7月27日 Kimi K3 全面开源,8月1日 DeepSeek V4-Flash 正式版公测。七天之内,三家头部 AI 公司各自甩出一记重拳,指向同一个结论:大模型竞争的焦点,已经从"谁的模型最强"彻底转向"谁的性价比最高"。
这周我没怎么睡觉。
不是因为熬夜刷剧,是因为 AI 圈这七天发生的事情,比过去三个月加起来还密集。三个重磅模型在一周内轮番发布,每一个都在重新定义"性价比"的下限——而最有意思的是,三家打的是完全不同的牌。
先说结论:如果你还在无脑用最贵的模型跑所有任务,你可能正在浪费 80% 以上的预算。
一、七天三炸:时间线还原
|
日期 |
事件 |
核心信号 |
|
7月24日 |
Anthropic 发布 Claude Opus 5 |
Fable 5 的性能,一半的价格 |
|
7月27日 |
月之暗面全面开源 Kimi K3 |
2.8万亿参数权重免费公开,华尔街蒸发3.2万亿 |
|
8月1日 |
DeepSeek V4-Flash 正式版公测 |
只重做后训练,Agent能力暴涨6倍,价格是Claude的1/90 |
|
8月1日 |
OpenAI 全球用户破10亿 + GPT-5.6大降价 |
Luna降价80%,Astra(GPT-6?)曝光 |
四个事件,四个方向,但拧成一股绳:AI 正在从"前沿军备竞赛"变成"性价比绞肉机"。

二、第一炸:Claude Opus 5——"旗舰性能,平价心脏"
Anthropic 这步棋下得很精。
Opus 5 发布后直接登顶 Artificial Analysis 智能指数榜单,61 分,超过自家旗舰 Fable 5(60分)和 OpenAI GPT-5.6 Sol(59分)。但真正的杀手锏不是分数,是价格:
|
维度 |
Claude Fable 5 |
Claude Opus 5 |
差距 |
|
智能指数 |
60 |
61 |
Opus 5 反超 |
|
输入价格 |
$10/M tokens |
$5/M tokens |
便宜一半 |
|
输出价格 |
$50/M tokens |
$25/M tokens |
便宜一半 |
|
SWE-bench Verified |
— |
96.0% |
编程SOTA |
|
Frontier-Bench v0.1 |
33.7% |
43.3% |
Opus 5 大幅领先 |
|
上下文窗口 |
1M tokens |
1M tokens |
持平 |
翻译一下:Opus 5 在多数 benchmark 上跟 Fable 5 打平甚至反超,但价格只有一半。
Anthropic 的定位很明确——Fable 5 留给"不差钱要极致"的场景,Opus 5 才是"90% 日常工作的首选"。这基本是在承认:旗舰模型的溢价,越来越难 justified。
网友的评价最到位:"如果 Opus 5 跟 Fable 5 差不多,那为什么还要花2倍价格用 Fable 5?"
三、第二炸:Kimi K3 全面开源——"免费的才是最贵的"
7月27日,月之暗面正式发布 Kimi K3 的完整模型权重、技术报告,以及三项关键 Infra 技术(MoonEP、FlashKDA、AgentEnv)。
这不是普通的"开源"——这是全球首个 2.8 万亿参数级别的开源模型,任何人都可以下载、部署、商用。
K3 开源后的连锁反应,比模型本身更震撼:
1. 华尔街用真金白银投票
K3 发布后,美股 AI 板块合计蒸发约 4700 亿美元(约合人民币 3.2 万亿元)。17 家华尔街投行连夜下调 AI 芯片企业目标价。高盛合伙人表示:"如果中国低成本的开源模型性能足够优秀,美国 AI 巨头天价资本支出的合理性就不复存在。"
2. 全球开发者用下载量投票
中国开源模型累计下载量已突破 100 亿次,全球第一。全球每 10 次大模型下载中,有 6 次来自中国研发的模型。 在 OpenRouter 等平台上,中国模型已占整体使用量的 60%。
3. 硅谷重新审视竞争格局
加州大学伯克利分校教授伊恩·斯托卡表示,中国开源模型与美国最前沿的差距已从半年缩至 2-3 个月。马斯克在 K3 评测下留言"Impressive"。
K3 的核心数据回顾:
|
维度 |
Kimi K3 |
|
参数规模 |
2.8万亿(全球最大开源模型) |
|
激活参数 |
1040亿(MoE,896选16) |
|
上下文窗口 |
100万 Token |
|
Code Arena 盲测 |
1679分(全球第一) |
|
智能指数 |
57分(全球第三) |
|
输入价格 |
¥20/M(≈$2.8),缓存命中¥2/M |
|
输出价格 |
¥100/M(≈$14) |
|
单任务成本 |
~$0.94 |
|
开源 |
完全开源,可商用 |
关键对比:K3 的单任务成本约 0.94,而 Claude Fable 5 约 1.80——K3 便宜了近一半,而且还能免费本地部署。
四、第三炸:DeepSeek V4-Flash——"后训练碾压参数堆叠"
这是这周最让我细思极恐的一个发布。
8月1日,DeepSeek 上线 V4-Flash 正式版 API。表面上看是一个"廉价版"模型,但深入看数据后你会发现,这次发布挑战的是整个大模型行业的基础假设。
先看硬指标:
|
维度 |
DeepSeek V4-Flash |
|
总参数量 |
2840亿(MoE) |
|
激活参数 |
130亿 |
|
上下文窗口 |
100万 Token |
|
输入价格(缓存命中) |
¥0.2/百万 tokens |
|
输入价格(未命中) |
¥2/百万 tokens |
|
输出价格 |
¥8/百万 tokens |
价格有多便宜?缓存命中后每百万 tokens 只要 0.2 元——大约是 Claude Fable 5 的 1/90。
但价格便宜不是最炸的点。最炸的是性能暴涨的方式:
|
Agent 基准测试 |
V4-Pro 预览版 |
V4-Flash 正式版 |
提升 |
|
DeepSWE |
7.3 |
54.4 |
暴涨6倍+ |
|
Terminal Bench 2.1 |
72.1 |
82.7 |
+10.6分 |
|
Agent 智能体终极测试 |
15.8 |
25.2 |
+60% |
|
Artificial Analysis 智能指数 |
— |
50分 |
同类中位数仅17分 |
Terminal Bench 2.1 拿了 82.7 分,超过了 GLM-5.2(81.0),逼近 Claude Opus 4.8(85.0)。
但真正让整个行业重新思考的是这句话:
"V4-Flash-0731 的模型结构、尺寸与预览版完全一致,仅重新进行了后训练。"
同一个骨架,同一套参数规模,只是后训练策略更精细了——结果 Agent 能力暴涨 6 倍。
这意味着什么?意味着我们过去两年疯狂堆参数的路线,可能不是唯一解。后训练阶段的优化空间,被严重低估了。 不换模型、不加参数,只优化"怎么训练",就能产生质的飞跃。
这个发现对整个行业的启示是颠覆性的。
五、第四炸:OpenAI 的反击——降价 + 10亿用户 + GPT-6 曝光
面对三面夹击,OpenAI 也在同一天打出组合拳:
1. 全球用户破 10 亿
AI 行业历史上第一个达成"10 亿活跃用户"的公司。但促成这一里程碑的关键是两个字:降价。
- GPT-5.6 Luna 价格暴降 80%
- GPT-5.6 Terra 价格下调 20%
2. Astra 模型曝光(疑似 GPT-6)
据 The Information 爆料,OpenAI 正在秘密筹备代号"Astra"的全新模型家族。Astra 在拉丁语中意为"星辰",跟现有的 Sol(太阳)、Terra(地球)、Luna(月亮)完美呼应。
核心突破方向:多智能体长时间协作。过去 ChatGPT 是单智能体交互,遇到复杂长线任务容易"断片";Astra 系列要解决的是让多个 AI Agent 协同完成需要数小时甚至数天的复杂任务。
奥特曼已亲自带着 Astra 赴华盛顿向政策制定者闭门演示。
六、四炸连击背后的趋势:性价比绞杀时代来了
把四个事件放在一起看,趋势非常清晰:
趋势一:模型能力差距正在被"价格差距"取代
|
模型 |
智能指数 |
单任务成本 |
性价比指数 |
|
Claude Fable 5 |
60 |
~$1.80 |
33分/$ |
|
Claude Opus 5 |
61 |
~$0.90 |
68分/$ |
|
GPT-5.6 Sol |
59 |
~$1.04 |
57分/$ |
|
Kimi K3 |
57 |
~$0.94 |
61分/$ |
|
DeepSeek V4-Flash |
50 |
~$0.10 |
500分/$ |
Opus 5 比自家旗舰 Fable 5 便宜一半但分数更高;V4-Flash 的性价比是 Fable 5 的 15 倍。 当能力差距缩小到几个百分点,价格差距却是几十倍的时候,"用最贵的模型"这件事越来越难自圆其说。
趋势二:开源正在改写竞争规则
K3 开源后的连锁反应证明了一件事:开源不再只是"技术慈善",而是商业战略。
- 月之暗面 7月29日完成 F 轮融资,金额超 35 亿美元,投后估值 350 亿美元
- 开源带来的全球开发者生态,是任何闭源模型都无法复制的护城河
- 中国模型在 OpenRouter 占 60% 使用量——这不是靠营销打下来的,是靠开源+性价比
趋势三:后训练 > 参数堆叠
V4-Flash 的发布给行业敲了一记警钟:不换模型骨架、不加参数,只优化后训练,Agent 能力就能暴涨 6 倍。 这意味着过去两年"大力出奇迹"的参数竞赛,可能只是优化空间的一小部分。后训练阶段的 ROI,可能远高于堆参数。
趋势四:多智能体协作是下一个战场
OpenAI 的 Astra、K3 的长程 Agent 能力、V4-Flash 的 Agent 暴涨——三家都在往同一个方向发力。单模型对话的天花板已经到了,多 Agent 协同完成复杂长线任务是下一个竞争焦点。
七、普通开发者怎么应对?三句话
1. 别再无脑用最贵的模型。
Fable 5 在极端复杂任务上确实最强,但 90% 的日常工作,Opus 5、K3 甚至 V4-Flash 都能胜任,成本只有几分之一。先跑中端模型,跑不动再升级。
2. 不同任务用不同模型,别一棵树上吊死。
- 极限编程/大型重构 → Claude Opus 5 或 Fable 5
- 日常编程/Agent 任务 → Kimi K3 或 DeepSeek V4-Flash
- 成本敏感/高并发 → DeepSeek V4-Flash(缓存后 0.2 元/百万 tokens)
- 数据合规/私有部署 → Kimi K3(开源,可本地部署)
3. 模型迭代以周计算,灵活切换比押注更重要。
这周 Opus 5 登顶,下周可能就被反超。K3 今天是开源第一,明天 Qwen3.8 可能就追上来。与其纠结"选哪个",不如把主流模型都接上,按场景动态调度。
这也是我一直在用 星途 AI 的原因。它聚合了 500+ 个 AI 模型——Claude 全系列、GPT 全系列、Kimi K3、DeepSeek、通义千问、GLM 这些主流模型都有,不用分别注册一堆账号、分别充钱、分别管 API key。
传送门:AI Model Hub
最实用的玩法:同一个 prompt 丢给 Opus 5、K3、V4-Flash 三个模型同时跑,横向对比谁更适合你的场景。 榜单分数是平均值,具体到你的业务,哪个好使只有试了才知道。星途上还有 Veo 3.1、Sora 2、Midjourney 这些视频和图像模型,文本+多媒体一站式搞定。
在这个模型一周一变的年代,能最快切换和对比模型的人,就是效率最高的人。
八、写在最后:这一天可能被记住
2026 年 7 月 24 日到 8 月 1 日这七天,未来回看可能是 AI 行业的一个拐点。
不是因为某个模型特别强,而是因为四家公司用四种不同的方式,同时证明了同一件事:AI 的竞争重心,已经从"造最强的模型"转向"造最划算的模型"。
- Anthropic 用 Opus 5 证明:旗舰性能可以半价交付
- 月之暗面用 K3 开源证明:免费的可以跟收费的一样好
- DeepSeek 用 V4-Flash 证明:不堆参数也能暴涨能力
- OpenAI 用降价+10亿用户证明:连行业老大都得跟着卷性价比
高盛说"算力扩张时代或已走到尽头"——这话可能说早了,但方向没错。当模型能力差距缩小到几个百分点,而价格差距是几十倍的时候,"性价比"就不再是次要考量,而是第一决策因素。
对开发者来说,这是好事。模型越来越便宜、越来越强、越来越多样。唯一需要做的,就是别把赌注押在一个模型上。
想一站式体验 Claude Opus 5、Kimi K3、DeepSeek V4-Flash 这些最新模型?去 星途 AI 试试,500+ 模型一个入口,随时切换,按量付费。在这个年代,灵活就是最大的竞争力。
更多推荐


所有评论(0)