ChatGPT、Claude、Grok 集体宕机近 4 小时,AI 依赖症该治了
9 月 3 日,ChatGPT、Claude、Grok 三家头部 AI 服务几乎在同一时间段出现大规模故障,持续约 3 小时 40 分钟,到北京时间 9 月 4 日凌晨才陆续全部恢复(据报道)。巧的是,OpenAI 当天还在发布新旗舰 GPT-6 Astra——一边发新车,一边路上抛锚,这个时间点有点戏剧性。
事实分析:这不是一次普通的"网站挂了"
先把时间线捋清楚。据故障监测平台 Down Detector 的数据(据报道),故障最早于美东时间 9 月 3 日上午 9 点 23 分左右集中爆发:先是 Claude 系列(Mythos 5.1、Opus、Fable 5.1 等核心模型)错误率飙升;两分钟后 Grok 全端下线;大约一个半小时后,ChatGPT 和编程工具 Codex 也出现大规模访问错误。峰值期间,针对 OpenAI 服务的故障报告超过 3.7 万份,其中 80% 集中在 ChatGPT。同期谷歌 Gemini、微软 Copilot 也收到大量中断反馈,AI 编程工具 Cursor 则直接公告:部分服务因上游大模型故障被迫中断。
关于原因,OpenAI 发言人表示故障源于太平洋时间早 7 点 43 分出现的路由错误,已部署修复(据报道)。三家公司各自排查、各自修复,又先后恢复——截至美东时间当天中午 11 点 16 分,Claude 主要服务率先恢复,随后 ChatGPT、Grok 逐步恢复正常(据报道)。
单看任何一家,模型服务出点故障都不算新鲜。这次真正值得琢磨的是三个特征:
- 同时段、跨厂商。三家竞争关系最直接的对手,差不多同一时间一起挂,说明头部服务之间可能共享了某些基础设施或依赖,任何一家的抖动都可能被放大;
-
- 全链路连坐。Cursor 这类工具自己不坏,坏在上游模型厂商,这是典型的供应链风险——AI 工具链已经是一条供应链,而上游一停,下游全部停摆;
-
- 生产依赖加深。越来越多人的日报、周报、代码、翻译都挂在 AI 上,上游挂三四个小时,等于一批人的下午直接报废。
给运维和架构侧的人提个醒:嘴上说的"多供应商高可用",要看供应商之间的隔离度。如果 A、B 两家都走同一家上游聚合或同一套底层基础设施,那就不是多活,是同一个单点的两个入口。Cursor 因为上游模型故障而中断,就是现成的反面教材。
- 生产依赖加深。越来越多人的日报、周报、代码、翻译都挂在 AI 上,上游挂三四个小时,等于一批人的下午直接报废。
实用部分:怎么给自己留后路
既然 AI 已经成了生产力工具,"AI 不可用"就该像"断网了"一样被当成常态来准备。
对个人,给关键场景配一个备胎。 先盘点自己"离开 AI 就没法干活"的场景:写代码、写文档、翻译、查资料,每个场景至少记一个可替代的入口。国产模型、开源模型的在线服务,甚至本地部署一个开源模型兜底,都行。重要产出随手存档,AI 生成的内容立刻落盘或提交 git,别让三小时的努力存在对话历史里。
对团队,按"接入层收敛"来管。 公司里接了多家模型 API 的,建议统一走一个接入层,把各家 SDK 包成同一个接口,由接入层做超时、重试、熔断和多供应商路由。一个纯逻辑的简化示意(可直接运行):
def pick_provider(status, priority):
for name in priority:
if status.get(name):
return name
return None
status = {"openai": False, "anthropic": False, "zhipu": True, "local": True}
print(pick_provider(status, ["openai", "anthropic", "zhipu", "local"]))
# 输出: zhipu —— openai/anthropic 挂了,自动切到可用的一家
真实落地时,把每家 SDK 封装成统一的 chat(prompt) -> str 接口,再套上健康检查和重试,几分钟的事,但下次再遇到集体宕机,业务不会跟着停。本地兜底也没想象中贵:摘要、分类、简单问答这类对效果要求不高的内部场景,一台带显卡的机器跑个开源小模型就够顶住关键链路,先想清楚"哪些链路必须实时在线",再决定花这个钱值不值。
出事时先判断"是我不行还是它不行"。 先看各家官方状态页,再看 Down Detector 这类第三方监测。如果两家以上同时报错,基本可以断定是上游问题——这时候别浪费时间反复改提示词,该摸鱼摸鱼,该走人工通道走人工通道。
顺便说一句,竞对的动作很快。 当晚智谱就在 X 上发文"We are still up"(我们还在线),并宣布 GLM-5.3-Flash 即日起至 9 月 20 日每晚 23 点到次日 9 点在 Z Code 免费使用、其他 Agent 额度翻倍(据报道)。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型(据报道)。借机获客是常规商业操作,但对普通用户来说,多一个能用的国产备胎,总不是坏事。
给企业的一句话: 把"AI 服务不可用"写进应急预案,关键流程保留人工通道,别把唯一入口绑在单一海外 API 上——这是这次宕机花三小时四十分钟给所有人上的课。
模型能力再强,稳定性跟不上,最先遭殃的还是靠它交差的打工人。你们公司给 AI 留备用方案了吗?评论区聊聊。
更多推荐



所有评论(0)