在这里插入图片描述
P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看, 传送门https://blog.csdn.net/qq_34419312

上个月我还在朋友圈刷到有人晒"财富自由的第一步",这个月 Anthropic 直接给我演示了什么叫一步到位:去年这个时候,它的算力承诺还只有 1-2 GW,11 个月后,这个数字变成了 14.8 GW,还附带一张十年期的账单,合计 5170 亿美元

有人问这算不算冲动消费?我只能说,我冲动消费顶多买双球鞋,人家冲动消费,直接买下了未来十年的电。

1. Claude 的算力饥渴是怎么来的

1.1 两个产品的增长,快把机房吃穷了

一切的起点不是协议本身,而是协议背后的需求:Claude Code 和 Cowork。

Claude Code 是给程序员用的编程助手,Cowork 是给团队用的协同 AI。这俩产品有个共同点:每次请求烧的 token 比聊天多得多,而且粘性极强——一旦你习惯了让 Claude Code 补全代码,就再也回不去了。跟外卖一个道理:习惯了点外卖,就回不去吃泡面了。

Anthropic 自己发布的《Economic Index》报告里写着:2025 年下半年,Claude 的日活请求量出现了阶梯式跃升,时间节点跟 Claude Code 的发布严丝合缝。翻译成人话:程序员们开始把它当生产力工具,而不是聊天玩具。

一个典型的编码会话动不动就是几十次 API 调用:解读需求、生成代码、审查修改、解释原理。一万个开发者每天用,烧掉的算力是纯聊天的十倍起步。我猜 Claude 后台看到最多的请求大概是:“这段代码为什么炸了?”

这里还有个扎心的对比:同样是用户,编码用户是掏钱的,聊天用户很多是白嫖的。付费用户多了收入就涨,收入涨了就要训更大的模型,模型大了就要更多算力。完美的正循环,就是钱包有点疼。

1.2 从"够用就好"到"梭哈",转折点在哪

Anthropic 以前是出了名的保守派。2023 年之前,他们的基建哲学就四个字:够用就好。算力投资永远跟着产品节奏走,绝不提前囤货。这有点像老一辈的理财观:现金为王,落袋为安。

转折点出现在 2025 年 10 月。之后他们密集签下了跟 Amazon、Google、Microsoft 的一堆协议,画风突变。

原因也不复杂:窗口在收窄。OpenAI 那边数据中心呼呼地建,Anthropic 要是还按老节奏慢慢来,就得面对训练排队、推理延迟上升、用户等到骂娘。产品体验一崩,用户就跑,用户一跑,故事就编不下去了。

顺便说一句,14.8 GW 不是拍脑袋拍出来的。它是按 Claude 3.7 和后续版本的性能目标倒推出来的:既要扛住编码场景的指数级增长,又不能让延迟拉胯。也就是说,这是精算过的,不是"先签了再说"。

但我还是想吐槽一句:14.8 GW 是什么概念?我家台式机电源才 750W,也就是说这相当于……算了,我数不清,先不给自己找不痛快。

2. 5170 亿美元,到底买了个啥

2.1 三笔账

这 14.8 GW 的合同,按花钱方式大致分三块:

  • 云算力租赁:约 2800 亿美元
  • 芯片采购:约 1300 亿美元
  • 数据中心及相关基建:约 1070 亿美元

云算力租赁 2800 亿
芯片采购 1300 亿
数据中心 1070 亿

云算力是绝对的大头。原因很朴素:GPU 的使用周期要 5-10 年才能摊销完,短期买断不划算。这就像租房和买房的区别——房东(云厂商)负责装修折旧,你(Anthropic)只负责住,家电坏了还不用你修。唯一的问题是这个房租有点贵。

用结构化的方式看,大概是这么个清单:

{
  "总规模": "14.8 GW(十年期)",
  "云算力租赁": "约 2800 亿美元",
  "芯片采购": "约 1300 亿美元",
  "数据中心": "约 1070 亿美元",
  "部署节奏": "2027-2030 年分批上线"
}

2.2 各家云厂商怎么分猪肉

来看这张"别人家公司的采购单":

  • AWS:约 5 GW,对应 1000 亿美元以上的十年期承诺;
  • Google Cloud + Broadcom 的 TPU 组合:3.5 GW,预计 2027 年起陆续上线,成本约 210 亿美元;
  • Microsoft + NVIDIA:1 GW,规模不大,属于补充配置;
  • AMD:约 2 GW 的新型芯片;
  • SpaceX:最特殊。它不直接卖算力,而是通过 Colossus 数据中心提供物理空间和电力。Anthropic 直接租下了 Colossus 1 的全部容量,里面有超过 22 万张 NVIDIA GPU,H100、H200、GB200 全都有。

22 万张 GPU 是什么概念?就是那种"我从 1 数到 22 万要多久"的数学题,现在直接变成了一家公司的日常库存。

2.3 签约 ≠ 用满

这里有个很容易误会的点:14.8 GW 是合同上限,不代表每年都用满。

真实情况是分阶段部署,大部分在 2027 到 2030 年间陆续上线。Anthropic 没有一次性把数据中心建完,而是通过多轮协议把优先级锁死。说白了就是:先把坑占了,慢慢再填萝卜。

按行业惯例,算力支出和收入的比例通常在 2:1 到 3:1 之间。Anthropic 现在的年化收入约 300 亿美元(有的口径说在逼近 650 亿),也就是说,就算 14.8 GW 全部用满,也得几年时间才能逐步把负载释放出来。

翻译一下:这是一个长达十年的"分期付款"故事,而且首付还没交完。

3. 这不是冲动消费,是算过的账

3.1 收入到底撑不撑得住

5170 亿美元,乍一看像空头支票。但你把它除以十年,每年约 517 亿。再看收入:2026 年 8 月的年化收入已经到了 300 亿美元,超过 OpenAI 同期的 250 亿,是目前全球营收最高的基础模型公司。按这个增速,五年后到 500-600 亿是大概率事件。

关键不是"现在付不付得起",而是"未来的现金流能不能覆盖现在的承诺"。前提是需求曲线别断崖式下跌。什么叫断崖式下跌?大概就是全人类突然集体不用 AI、改回手翻字典查词——我觉得这个概率比中彩票还低。

另外要澄清一下:5170 亿不是已经花出去的钱。大部分是未来十年按需支付的运营费用(OpEx),不是一次性资本支出(CapEx),没用上的容量不会自动产生成本。

这操作有个学名,叫把算力当成期货来管理。散户炒期货容易爆仓,巨头炒算力期货……至少账面好看。

3.2 为什么租不买?因为买了更亏

很多人有个直觉:买设备比租便宜。短周期内没错,但在 AI 算力这个场景里,长期租赁往往更划算。

以 H100 为例,服役周期 3-5 年,之后性能就被新一代产品拉开差距。2024 年买一批,到 2029 年利用率断崖式下滑,要么升级要么砸手里。租的话,设备迭代风险直接甩给云厂商,Anthropic 只需要为实际用掉的算力付钱。GPU 贬值速度,比我手里安卓手机都快。

再算一笔账:5170 亿如果一次性资本化,资产负债表上会多出一座固定资产山,现金流和融资能力都得遭殃。OpEx 模式的好处是支出随收入线性扩张,财务结构轻盈。

说白了就是:全款买车的是勇士,分期租车的是聪明人。虽然租到最后发现租金加起来比全款还多……算了,这题超纲了。

顺手放段代码,帮大家理解这笔账怎么算的:

# 十年合约的年均支出
total = 5170   # 亿美元
years = 10
annual = total / years
print(f"年均支出: {annual} 亿美元")

# 对比当前年化收入
arr_now = 300   # 亿美元
print(f"支出是收入的 {annual / arr_now:.1f} 倍")

# 五年后的乐观估计
arr_future = 550   # 亿美元
print(f"五年后支出占收入比: {annual / arr_future * 100:.0f}%")

输出:年均 517 亿,是现在收入的 1.7 倍,五年后降到 94% 左右。这就是传说中的"用时间换空间",跟房贷一个道理。

3.3 多供应商:不把鸡蛋放一个篮子

Anthropic 的算力版图覆盖四个硬件平台:NVIDIA GPU、AWS Trainium、Google TPU、AMD GPU。

这不是资源分散,是刻意设计的风险对冲。单一供应商的坏处很明显:议价能力弱、供应一断就抓瞎、技术路线被绑死。Anthropic 的做法是把训练和推理负载分散到不同架构上——Claude 已经在超过 100 万枚 Trainium2 芯片上跑过(AWS Rainier 集群),还通过 Google-Broadcom 拿到下一代 TPU 产能,NVIDIA GPU 继续扛推理和高密度训练。

多供应商还有个隐藏福利:议价权。每个云厂商都知道你有备选,谈判桌上说话都硬气。这就跟同时约三家装修公司报价一样,一家比一家低,最后你选了最贵的那家——哦不好意思,那是我们家的情况。

当然代价也有:运维复杂度直线上升。不同硬件要不同的工具链、监控体系、排障流程。Anthropic 的选择是:用工程复杂度换长期供应链安全。典型的"用今天的头秃换明天的头发"。

4. 这场算力军备赛,下一步怎么走

4.1 16 GW vs 30 GW,差在哪

先摆事实:Anthropic 目前锁定约 16 GW(含此前已有的 1-2 GW);OpenAI 的目标规划在 2026-2027 年达到 30 GW 以上,主力合作方是 Microsoft Azure。双方差距大约 10-15 GW。

训练端差距其实不大。当前最强模型的训练算力需求集中在 10-20 EWFLOP 量级,16 GW 和 30 GW 都能覆盖,区别只是冗余度和扩容弹性。真正的差距在推理端——Claude Code 和 Cowork 的用户增长曲线超预期,推理流量指数级膨胀,这时候算力合同的边际成本才是拉开差距的地方。

说白了:训练是考试,推理是日常营业。考试大家都能及格,日常营业才见真章。

4.2 算力算护城河吗?得分情况

如果护城河是指"你能训练出别人复制不了的模型",那算力不够,算法创新、数据质量、训练效率都得跟上。但如果是指"你能用更低的单位成本服务更多用户",那算力合约就是实打实的硬实力。

短期看,模型能力还能靠别的拉开差距:SFT 数据的质量、RLHF 的反馈质量、推理时的工具调用能力,这些都不完全取决于 GPU 数量。OpenAI 从 GPT-4 到 GPT-4o,推理效率的提升幅度远超算力增长幅度——说明算法优化还有肉。

长期看,当头部都锁定了十 GW 级别的产能,新进入者就尴尬了:一是买不到同等合约,二是买得到也得更贵。这就形成了结构性壁垒。

打个比方:早期是"谁都能考大学",现在是"清华北大已经锁了十年自习室"。

4.3 行业的三种活法

路径一:追赶型签约潮。
其他头部实验室在 90 天内公布同等规模的合约。如果 Anthropic 的模式被验证可行,大家会跟进锁产能。这是最直接的响应——跟风虽迟但到。

路径二:生态锁定型竞争。
不比 GPU 数量了,改比绑定深度:独家合作、定制芯片、联合研发。Anthropic 跟 Broadcom 的 Ironwood TPU、跟 AWS 的 Trainium 深度合作,都是这条路的前兆。以后可能满大街都是"联合定制"。

路径三:效率优先型。
承认合约规模卷不过,转头搞模型压缩、推理蒸馏、稀疏架构,用更少的算力干同样的活。这条路适合资源有限但技术强的团队——也就是"我打不过你,但我的代码比你优雅"。

三条路没有绝对优劣,全看家底。但行业最大的变化是:算力合约从运营成本变成了战略资产,签合同的时机比签合同的价格更重要。这年头,连签合同都讲究抢跑了。

尾声:5170 亿的验收标准

说到底,这场军备赛的落点不在谁签的 GW 数最大,而在谁能把合约里的算力变成用户摸得着的产品。Claude Code 的活跃用户、Cowork 的订阅转化,才是这 5170 亿的真正验收标准。

判断标准很简单:如果 2027 年中 Claude 的付费用户突破 5000 万,这就是教科书级的战略预判;如果增长停滞,这就是行业历史上最贵的一次试错。

至于我们这些围观群众,记住一件事就行:下次再看到"AI 要取代程序员"的新闻,先想想是谁在背后给这些 AI 付电费。反正不是我。

P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/qq_34419312

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐