7月24日 Claude Opus 5 上线,7月27日 Kimi K3 全面开源,8月1日 DeepSeek V4-Flash 正式版公测。七天之内,三家头部 AI 公司各自甩出一记重拳,指向同一个结论:大模型竞争的焦点,已经从"谁的模型最强"彻底转向"谁的性价比最高"。

这周我没怎么睡觉。

不是因为熬夜刷剧,是因为 AI 圈这七天发生的事情,比过去三个月加起来还密集。三个重磅模型在一周内轮番发布,每一个都在重新定义"性价比"的下限——而最有意思的是,三家打的是完全不同的牌。

先说结论:如果你还在无脑用最贵的模型跑所有任务,你可能正在浪费 80% 以上的预算。


一、七天三炸:时间线还原

日期

事件

核心信号

7月24日

Anthropic 发布 Claude Opus 5

Fable 5 的性能,一半的价格

7月27日

月之暗面全面开源 Kimi K3

2.8万亿参数权重免费公开,华尔街蒸发3.2万亿

8月1日

DeepSeek V4-Flash 正式版公测

只重做后训练,Agent能力暴涨6倍,价格是Claude的1/90

8月1日

OpenAI 全球用户破10亿 + GPT-5.6大降价

Luna降价80%,Astra(GPT-6?)曝光

四个事件,四个方向,但拧成一股绳:AI 正在从"前沿军备竞赛"变成"性价比绞肉机"。


二、第一炸:Claude Opus 5——"旗舰性能,平价心脏"

Anthropic 这步棋下得很精。

Opus 5 发布后直接登顶 Artificial Analysis 智能指数榜单,61 分,超过自家旗舰 Fable 5(60分)和 OpenAI GPT-5.6 Sol(59分)。但真正的杀手锏不是分数,是价格:

维度

Claude Fable 5

Claude Opus 5

差距

智能指数

60

61

Opus 5 反超

输入价格

$10/M tokens

$5/M tokens

便宜一半

输出价格

$50/M tokens

$25/M tokens

便宜一半

SWE-bench Verified

96.0%

编程SOTA

Frontier-Bench v0.1

33.7%

43.3%

Opus 5 大幅领先

上下文窗口

1M tokens

1M tokens

持平

翻译一下:Opus 5 在多数 benchmark 上跟 Fable 5 打平甚至反超,但价格只有一半。

Anthropic 的定位很明确——Fable 5 留给"不差钱要极致"的场景,Opus 5 才是"90% 日常工作的首选"。这基本是在承认:旗舰模型的溢价,越来越难 justified。

网友的评价最到位:"如果 Opus 5 跟 Fable 5 差不多,那为什么还要花2倍价格用 Fable 5?"


三、第二炸:Kimi K3 全面开源——"免费的才是最贵的"

7月27日,月之暗面正式发布 Kimi K3 的完整模型权重、技术报告,以及三项关键 Infra 技术(MoonEP、FlashKDA、AgentEnv)。

这不是普通的"开源"——这是全球首个 2.8 万亿参数级别的开源模型,任何人都可以下载、部署、商用。

K3 开源后的连锁反应,比模型本身更震撼:

1. 华尔街用真金白银投票

K3 发布后,美股 AI 板块合计蒸发约 4700 亿美元(约合人民币 3.2 万亿元)。17 家华尔街投行连夜下调 AI 芯片企业目标价。高盛合伙人表示:"如果中国低成本的开源模型性能足够优秀,美国 AI 巨头天价资本支出的合理性就不复存在。"

2. 全球开发者用下载量投票

中国开源模型累计下载量已突破 100 亿次,全球第一。全球每 10 次大模型下载中,有 6 次来自中国研发的模型。 在 OpenRouter 等平台上,中国模型已占整体使用量的 60%。

3. 硅谷重新审视竞争格局

加州大学伯克利分校教授伊恩·斯托卡表示,中国开源模型与美国最前沿的差距已从半年缩至 2-3 个月。马斯克在 K3 评测下留言"Impressive"。

K3 的核心数据回顾:

维度

Kimi K3

参数规模

2.8万亿(全球最大开源模型)

激活参数

1040亿(MoE,896选16)

上下文窗口

100万 Token

Code Arena 盲测

1679分(全球第一)

智能指数

57分(全球第三)

输入价格

¥20/M(≈$2.8),缓存命中¥2/M

输出价格

¥100/M(≈$14)

单任务成本

~$0.94

开源

完全开源,可商用

关键对比:K3 的单任务成本约 0.94,而 Claude Fable 5 约 1.80——K3 便宜了近一半,而且还能免费本地部署。


四、第三炸:DeepSeek V4-Flash——"后训练碾压参数堆叠"

这是这周最让我细思极恐的一个发布。

8月1日,DeepSeek 上线 V4-Flash 正式版 API。表面上看是一个"廉价版"模型,但深入看数据后你会发现,这次发布挑战的是整个大模型行业的基础假设。

先看硬指标:

维度

DeepSeek V4-Flash

总参数量

2840亿(MoE)

激活参数

130亿

上下文窗口

100万 Token

输入价格(缓存命中)

¥0.2/百万 tokens

输入价格(未命中)

¥2/百万 tokens

输出价格

¥8/百万 tokens

价格有多便宜?缓存命中后每百万 tokens 只要 0.2 元——大约是 Claude Fable 5 的 1/90。

但价格便宜不是最炸的点。最炸的是性能暴涨的方式

Agent 基准测试

V4-Pro 预览版

V4-Flash 正式版

提升

DeepSWE

7.3

54.4

暴涨6倍+

Terminal Bench 2.1

72.1

82.7

+10.6分

Agent 智能体终极测试

15.8

25.2

+60%

Artificial Analysis 智能指数

50分

同类中位数仅17分

Terminal Bench 2.1 拿了 82.7 分,超过了 GLM-5.2(81.0),逼近 Claude Opus 4.8(85.0)。

但真正让整个行业重新思考的是这句话:

"V4-Flash-0731 的模型结构、尺寸与预览版完全一致,仅重新进行了后训练。"

同一个骨架,同一套参数规模,只是后训练策略更精细了——结果 Agent 能力暴涨 6 倍。

这意味着什么?意味着我们过去两年疯狂堆参数的路线,可能不是唯一解。后训练阶段的优化空间,被严重低估了。 不换模型、不加参数,只优化"怎么训练",就能产生质的飞跃。

这个发现对整个行业的启示是颠覆性的。


五、第四炸:OpenAI 的反击——降价 + 10亿用户 + GPT-6 曝光

面对三面夹击,OpenAI 也在同一天打出组合拳:

1. 全球用户破 10 亿

AI 行业历史上第一个达成"10 亿活跃用户"的公司。但促成这一里程碑的关键是两个字:降价。

  • GPT-5.6 Luna 价格暴降 80%
  • GPT-5.6 Terra 价格下调 20%

2. Astra 模型曝光(疑似 GPT-6)

据 The Information 爆料,OpenAI 正在秘密筹备代号"Astra"的全新模型家族。Astra 在拉丁语中意为"星辰",跟现有的 Sol(太阳)、Terra(地球)、Luna(月亮)完美呼应。

核心突破方向:多智能体长时间协作。过去 ChatGPT 是单智能体交互,遇到复杂长线任务容易"断片";Astra 系列要解决的是让多个 AI Agent 协同完成需要数小时甚至数天的复杂任务。

奥特曼已亲自带着 Astra 赴华盛顿向政策制定者闭门演示。


六、四炸连击背后的趋势:性价比绞杀时代来了

把四个事件放在一起看,趋势非常清晰:

趋势一:模型能力差距正在被"价格差距"取代

模型

智能指数

单任务成本

性价比指数

Claude Fable 5

60

~$1.80

33分/$

Claude Opus 5

61

~$0.90

68分/$

GPT-5.6 Sol

59

~$1.04

57分/$

Kimi K3

57

~$0.94

61分/$

DeepSeek V4-Flash

50

~$0.10

500分/$

Opus 5 比自家旗舰 Fable 5 便宜一半但分数更高;V4-Flash 的性价比是 Fable 5 的 15 倍。 当能力差距缩小到几个百分点,价格差距却是几十倍的时候,"用最贵的模型"这件事越来越难自圆其说。

趋势二:开源正在改写竞争规则

K3 开源后的连锁反应证明了一件事:开源不再只是"技术慈善",而是商业战略。

  • 月之暗面 7月29日完成 F 轮融资,金额超 35 亿美元,投后估值 350 亿美元
  • 开源带来的全球开发者生态,是任何闭源模型都无法复制的护城河
  • 中国模型在 OpenRouter 占 60% 使用量——这不是靠营销打下来的,是靠开源+性价比

趋势三:后训练 > 参数堆叠

V4-Flash 的发布给行业敲了一记警钟:不换模型骨架、不加参数,只优化后训练,Agent 能力就能暴涨 6 倍。 这意味着过去两年"大力出奇迹"的参数竞赛,可能只是优化空间的一小部分。后训练阶段的 ROI,可能远高于堆参数。

趋势四:多智能体协作是下一个战场

OpenAI 的 Astra、K3 的长程 Agent 能力、V4-Flash 的 Agent 暴涨——三家都在往同一个方向发力。单模型对话的天花板已经到了,多 Agent 协同完成复杂长线任务是下一个竞争焦点。


七、普通开发者怎么应对?三句话

1. 别再无脑用最贵的模型。

Fable 5 在极端复杂任务上确实最强,但 90% 的日常工作,Opus 5、K3 甚至 V4-Flash 都能胜任,成本只有几分之一。先跑中端模型,跑不动再升级。

2. 不同任务用不同模型,别一棵树上吊死。

  • 极限编程/大型重构 → Claude Opus 5 或 Fable 5
  • 日常编程/Agent 任务 → Kimi K3 或 DeepSeek V4-Flash
  • 成本敏感/高并发 → DeepSeek V4-Flash(缓存后 0.2 元/百万 tokens)
  • 数据合规/私有部署 → Kimi K3(开源,可本地部署)

3. 模型迭代以周计算,灵活切换比押注更重要。

这周 Opus 5 登顶,下周可能就被反超。K3 今天是开源第一,明天 Qwen3.8 可能就追上来。与其纠结"选哪个",不如把主流模型都接上,按场景动态调度。

这也是我一直在用 星途 AI 的原因。它聚合了 500+ 个 AI 模型——Claude 全系列、GPT 全系列、Kimi K3、DeepSeek、通义千问、GLM 这些主流模型都有,不用分别注册一堆账号、分别充钱、分别管 API key。

传送门:AI Model Hub

最实用的玩法:同一个 prompt 丢给 Opus 5、K3、V4-Flash 三个模型同时跑,横向对比谁更适合你的场景。 榜单分数是平均值,具体到你的业务,哪个好使只有试了才知道。星途上还有 Veo 3.1、Sora 2、Midjourney 这些视频和图像模型,文本+多媒体一站式搞定。

在这个模型一周一变的年代,能最快切换和对比模型的人,就是效率最高的人。


八、写在最后:这一天可能被记住

2026 年 7 月 24 日到 8 月 1 日这七天,未来回看可能是 AI 行业的一个拐点。

不是因为某个模型特别强,而是因为四家公司用四种不同的方式,同时证明了同一件事:AI 的竞争重心,已经从"造最强的模型"转向"造最划算的模型"。

  • Anthropic 用 Opus 5 证明:旗舰性能可以半价交付
  • 月之暗面用 K3 开源证明:免费的可以跟收费的一样好
  • DeepSeek 用 V4-Flash 证明:不堆参数也能暴涨能力
  • OpenAI 用降价+10亿用户证明:连行业老大都得跟着卷性价比

高盛说"算力扩张时代或已走到尽头"——这话可能说早了,但方向没错。当模型能力差距缩小到几个百分点,而价格差距是几十倍的时候,"性价比"就不再是次要考量,而是第一决策因素。

对开发者来说,这是好事。模型越来越便宜、越来越强、越来越多样。唯一需要做的,就是别把赌注押在一个模型上

想一站式体验 Claude Opus 5、Kimi K3、DeepSeek V4-Flash 这些最新模型?去 星途 AI 试试,500+ 模型一个入口,随时切换,按量付费。在这个年代,灵活就是最大的竞争力。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐