美国头部AI服务遭遇历史级集体宕机,ChatGPT、Claude、Grok同时中断超3小时
关键词: AI集体宕机 Cloudflare Azure GPT‑6 Astra
北京时间9月3日深夜,美国几乎所有头部AI服务同时陷入瘫痪。OpenAI旗下ChatGPT与Codex、Anthropic旗下Claude、xAI旗下Grok相继宣布服务异常,谷歌Gemini、微软Copilot也收到大量中断报告。这场大规模"宕机"事件持续约3小时40分钟,截至北京时间9月4日凌晨1点10分,所有服务才陆续恢复。据多家媒体报道,这是有报告以来最大规模的AI集体宕机事件。
三大AI巨头同时掉线,Cursor等工具受波及
美东时间9月3日早晨,刚到工位的美国用户发现,主流AI服务几乎"全军覆没"。
据海外实时服务故障监测网站Downdetector数据,美国用户针对OpenAI服务的故障报告超过1.2万份,Claude约1200份,Grok约1000份。三家公司均在各自状态页确认故障并启动修复。

OpenAI状态页显示,ChatGPT共15个组件、Codex共4个组件受到影响,"正在对所列服务进行调查"。Anthropic状态页显示,Claude Mythos 5.1、Fable 5.1、Opus 5、Opus 4.8、Opus 4.6等多模型错误率升高。xAI Grok状态页确认其安卓、iOS、Web端及API均出现模型级中断。

波及范围不止于此。谷歌Gemini与微软Copilot同期亦收到大量中断报告,AI编程工具Cursor表示其部分服务因Claude、ChatGPT和Grok故障受到波及。

原因指向共享底层基础设施
三家AI巨头同期掉线,引发外界对共享底层基础设施的强烈质疑。
Anthropic技术部门员工CJ Avilla在社交媒体透露,事件由"基础设施问题"引发,"我们正在致力于解决问题,但目前还无法给出预计恢复时间。"

有分析指出,此次事件可能与关键互联网底层设施Cloudflare有关。Cloudflare状态页面显示,当天其服务出现两个问题:一是影响R2自定义域名的HTTP/3问题,可能导致部分请求失败或性能下降;二是部分WARP用户地理位置识别错误。
另有业内消息指出,微软Azure同期宕机报告飙升,而OpenAI、Anthropic和xAI三家均以不同形式依赖Azure提供云服务。此前在2024年11月,Cloudflare一次故障曾同时导致xAI和ChatGPT宕机。
OpenAI宕机期间发布GPT-6 Astra
颇具戏剧性的是,就在AI服务集体宕机之际,OpenAI在社交媒体上发布预热视频,正式推出GPT-6 Astra,并称其为"目前全球最智能、且对齐程度最高的模型"。

OpenAI总裁格雷格·布洛克曼表示,人们未来或许会回头将"这个时间、这个模型"视为人工通用智能(AGI)到来的节点,并在发布会最后称:"欢迎进入AGI时代。"
据官方介绍,Astra在计算机操作、网页浏览、软件工程、网络安全、科学研究以及专业工作方面均达到当前最先进水平,使用超过10万块GPU在得州Stargate基地完成训练。该模型能够直接完成一系列过去需要人工操作的软件任务,包括填写在线表格、更新CRM客户记录、整理日历、开展在线研究并生成摘要,甚至可以自主安装和测试软件、根据屏幕反馈排查故障。
与此同时,Astra也是OpenAI首个达到内部"关键"(Critical)网络安全能力门槛的模型,意味着它已经具备发现此前未知漏洞、开发漏洞利用程序的能力。出于安全考虑,OpenAI对其最先进的网络安全能力设置了更严格的访问限制。

这一"反向操作"引发网友集体吐槽:先把机房修好再发布新模型。
单一基础设施依赖风险凸显
此次事故为持续时间最长、影响范围最广的AI大模型集体宕机事件。当ChatGPT、Claude、Grok等已成为全球数百万用户日常工作和编程的依赖工具,三小时以上的集体中断不仅造成效率损失,更暴露出头部AI公司对共享云基础设施的深度依赖风险。
从产业层面看,此次事件也正值海外对RSI(自我递归强化训练)及AI安全讨论热烈之际。当大模型能力越来越接近AGI,其底层基础设施的稳定性与安全性,正成为比模型能力本身更紧迫的命题。
此次宕机事件在资本市场激起涟漪。AI本地化概念股Palantir美股暴涨7.71%,收报182.53美元。有分析指出,大规模云AI服务中断,反而强化了市场对本地化、私有化部署AI解决方案的需求预期。

隔夜美股整体表现强劲,三大指数全线大涨,标普500指数涨1.06%,纳指涨1.4%,道指涨1.18%。大型科技股集体走强,SpaceX大涨超6%,特斯拉大涨超5%,Meta涨超3%,微软涨超2%。