BLOG

同一天:上午 AI 集体宕机,下午 OpenAI 宣布“AGI 时代来了”

Kael Zhang
AIOutageGPT-6
广告 · Advertisement

开场:9 月 3 日,AI 圈在一天里演了两出戏

2026 年 9 月 3 日,AI 圈在一天之内干了两件完全相反的事。

上午,ChatGPT、Claude、Grok 三家头部 AI 服务几乎同时宕机,Downdetector 上 ChatGPT 一个平台的故障报告就冲到近 3.8 万份。下午,OpenAI 发布新一代旗舰模型 GPT-6 Astra,总裁 Greg Brockman 说它”可能最终被视为 AGI 的到来”。

一边是媒体喊的”LLM 史上最黑暗一天”,一边是”欢迎来到 AGI 时代”。我把这两件事的官方状态页、时间线都翻了一遍,然后把问题抛给了 17 年软件从业、7 年 AI 从业经验、现任 AI 技术总监的永亮。

拾闻:同一天,上午集体宕机,下午喊 AGI 时代,你怎么看这一天? 永亮:这一天,比任何一篇论文都更能说明 AI 行业现在的真实状态。 拾闻:行,那你先帮大家把时间线捋清楚——到底先宕机,还是先发布?


Q1:先宕机还是先发布?别被热搜带偏

永亮:先宕机,后发布。这个顺序很重要,很多热搜说反了。

准确时间线是这样的(美东时间 9 月 3 日):

  • 上午 9:26 左右,Claude 率先报告异常,随后 Grok、ChatGPT 相继中断,媒体统计”92 分钟内三家相继失联”
  • OpenAI 官方状态页记录:ChatGPT 和 Codex 高错误率,从上午 10:58 持续到中午 12:55,官方自己标的是 minor(轻微)
  • Anthropic 的记录更早、也更重:从上午 9:26 到中午 12:23,受影响的是 Claude 几个主力模型,官方标 major(重大)

所以真相是:上午先宕机,几小时后 OpenAI 才发布 GPT-6。 不是”刚发布就宕机”。舆论把两件事绑在一起,给 9 月 3 日打了个”LLM 史上最黑暗一天”的标签——这是媒体拼出来的故事,不是事实的因果。

还有一个细节值得你品:同样是”集体宕机”,OpenAI 自己只把它标成 minor,Anthropic 标 major。你翻翻热搜,“历史级瘫痪""史上最大规模”,哪个都不像”轻微”的样子。官方自己的评估,远没有热搜那么夸张。


Q2:一边”最黑暗一天”,一边”AGI 时代”,反差说明了什么?

永亮:说明 AI 行业现在有一个很现实的裂缝——能力叙事跑在前面,基础设施还没跟上。

先说能力这一头。GPT-6 确实强,ARC-AGI-3 这种公认难的基准它拿了 98% 以上,首次用 10 万张 GPU 训练,OpenAI 敢喊”代际跃迁”——这些不全是在吹。

但同一天上午,三家头部 AI 的服务集体挂了。OpenAI 自己承认是”路由错误”——一个路由问题,就能让 ChatGPT 和 Codex 瘫痪近两个小时。

这就像一家公司刚发布了一辆号称能自动驾驶上路的车,结果当天上午加油站集体断供了。

关键不在于”AI 会挂”——任何服务都会挂。关键是:这个行业一边在讲 AGI 的宏大叙事,一边连最基本的服务稳定性都还没焊牢。 模型能力在按季度翻倍,基础设施的可靠性还停留在”偶尔挂一下很正常”。这两个速度是不匹配的。

而且更值得玩味的是,这次”集体”宕机,The Verge 核实下来,没有证据显示三起事故是同一个原因。也就是说,“AI 集体瘫痪”这个画面,很大程度也是媒体拼出来的——三起独立的故障,赶巧落在了同一天上午。


Q3:GPT-6 真到 AGI 了吗?Brockman 的话被夸大了多少?

永亮:被夸大了,而且夸大得很典型。

Brockman 的原话是”可能最终会被视为 AGI 的到来”——注意”最终”和”可能”,这是留了余地的。结果 Axios 标题直接写成”欢迎来到 AGI 时代”,传到国内就成了”人类来到 AGI 时代”。

这中间的差距,就是”宣称”和”事实”的距离。AGI 的定义,OpenAI 自己以前说的是”能完成所有有经济价值的工作、做得跟人一样好甚至更好”。GPT-6 到没到这个程度?显然没有——它连自己服务的稳定性都保证不了,谈什么”所有工作”。

那 OpenAI 为什么要这么喊?因为这是发布会的语言,也是融资和竞争的语言。对手在追、投资人在看,把”最强模型”说成”AGI 时代”是最高效的注意力收割。这招有效,但作为技术从业者,我得提醒你一句:

听发布会的时候,把”宣称”自动降一档,把”数据”单独拎出来看。 98% 的基准分是数据,“AGI 时代”是营销。


Q4:10 万 GPU、recurrent depth、网络安全被限制——这些细节背后,OpenAI 在谨慎什么?

永亮:这些细节恰恰说明,OpenAI 自己比谁都清楚风险。

三个细节连起来看:

第一,recurrent depth 会”遮蔽”推理链。 GPT-6 用了新的推理技术,会把模型的部分思考过程藏起来,不让你看到它是怎么得出答案的。The Information 直接点名这是安全隐患——一个越强、但越”不可审计”的模型,出了问题你怎么查?

第二,网络安全能力被严格限制。 OpenAI 明确说,GPT-6 最强的网络安全能力,先只开放给一小撮通过审核的测试者。为什么?因为一个能力这么强的模型,网络安全这块既可以是”防御的利器”,也可以是”攻击的加速器”。它自己先把这块锁起来,是怕被滥用。

第三,这次发布本来就推迟了。 7 月 OpenAI 在 Hugging Face 上出过事,之后专门延迟了发布、加了安全措施。所以 GPT-6 的”亮相”,背后其实是一路踩着刹车踩过来的。

把这三点和上午的宕机放在一起,结论很清楚:连 OpenAI 自己都知道,能力越强,越不能裸奔。 那你作为一个普通用户、一个把工作押在 AI 上的职场人,凭什么比 OpenAI 还放松?


Q5:模型越来越强,同一天它又集体挂给你看——职场人怎么办?

永亮:三条,都能直接照做。

第一,别把工作焊死在一家 AI 上。 你写方案、写代码、做表格,如果只有 ChatGPT 一个口子,它一挂,你整个下午就废了——9 月 3 日上午那几万人就是活例子。至少备一个替代:主力用一个,备用一个,关键任务别只依赖单一供应商。这不是”多花钱”,是给自己留退路。

第二,关键产出,永远本地留一份。 AI 生成的东西,重要的直接存本地、进自己的文档或笔记,别让它只活在云端对话里。服务恢复是”几小时”,但你丢的产出可能找不回来。

第三,把 AI 当放大器,判断和兜底永远是自己的。 模型越强,越容易让人产生”交给它就行”的错觉。但 9 月 3 日这一天告诉我们:它能强到被喊 AGI,也能因为一个路由错误挂掉。你手里的活,最终拍板、验收、兜底的那个人,必须是你。


尾声

拾闻:最后,用一句话总结这期? 永亮:上午宕机、下午 AGI——这个行业现在最缺的不是更强的模型,是更稳的地基。 拾闻:这句话,送给大家。下期见。


【技术纵深】一个”路由错误”,为什么能放倒 ChatGPT?

有人会问:模型都这么强了,一个”路由错误”怎么会让它挂掉?这里拆一下,你就明白”能力”和”稳定”是两码事。

大模型的服务,不是一个模型在跑,是一套系统在跑。 你发一个请求进去,要先经过路由层,把请求分发到正确的模型实例、正确的机房、正确的 GPU 池子。路由层一旦出错,请求就进不去该去的地方——表现出来就是大面积”高错误率”。这跟模型本身聪明不聪明,一点关系都没有。模型是大脑,路由层是血管;血管堵了,再聪明的大脑也供不上血。

更该警惕的是”集中度风险”。 OpenAI 的主力算力跑在微软 Azure 上,Anthropic 也依赖云厂商,xAI 有自己的数据中心。业内普遍猜测,这次”集体”宕机背后有共同的上游依赖(云服务、CDN 之类),虽然 The Verge 说没证实三起同因——但”少数几家云厂商撑起整个 AI 行业”这个结构本身,就是一个单点风险。哪天某朵云真的出大事,可能不是三家挂,是几十家一起挂。

再说 recurrent depth 的可审计性问题。 推理时用递归深度计算,把中间步骤”折叠”起来,能省成本、更快,但代价是模型的思考过程不可见。对用户来说,你更难判断它为什么这么答;对监管来说,出了问题更难追责。一个越强、越不透明的模型,治理难度是成倍增加的。 这不是要拦着不让用,是要明白:能力上去了,配套的”能看清、能兜底、能追责”还没跟上。

对普通人来说,技术纵深只说明一件事:别因为模型变强就放松警惕,稳定性和可解释性,才是把 AI 用在正事上的前提。


事实核对表

文中说法事实依据
9/3 上午三家 AI 相继宕机,Claude 率先(美东 9:26 起)OpenAI 官方状态页 API(incidents.json)、Anthropic 官方状态页(UTC 13:26 起);“92 分钟内三家失联”为媒体口径
OpenAI 官方:ChatGPT+Codex 高错误率,UTC 14:58~16:55,自评 minorstatus.openai.com/api/v2/incidents.json(“Elevated errors across ChatGPT and Codex”,impact: minor)
Anthropic 官方:多个模型高错误率,UTC 13:26~16:23,自评 majorstatus.anthropic.com/api/v2/incidents.json(“Elevated errors for multiple models”,impact: major)
OpenAI 确认 routing error(路由错误)The Register 引 OpenAI 发言人原话:“A routing error starting around 7:43 am PT…”
三起事故无证据同因The Verge 报道(经腾讯新闻引用)
Downdetector 上 ChatGPT 故障报告峰值近 3.8 万份DownDetector 数据(“Nearly 40,000 users reported issues… according to DownDetector”)
GPT-6 Astra 9/3 发布,limited preview,公众 9/5 开放Wikipedia “GPT-6 Astra” 词条(Release: September 3, 2026 limited preview;Stable release September 5, 2026)
Brockman 说”可能最终被视为 AGI 的到来”Wikipedia 词条引 Greg Brockman 原话
”欢迎来到 AGI 时代”Axios 标题:“Welcome to the AGI era”(非 OpenAI 官方原话)
首次超 10 万 GPU 训练(德州 Stargate)Wikipedia 词条引 OpenAI 研究 VP Aidan Clark:“first time we’ve pretrained on more than 100,000 GPUs at our Stargate site in Texas”
recurrent depth 遮蔽部分推理链、引发可监控性担忧Wikipedia 词条 + The Information 报道
网络安全能力被限制(先给特定测试者)Wikipedia 词条 + CNBC 报道(Daybreak Blue 计划)
7 月 Hugging Face 事件后延迟发布、加安全措施Wikipedia 词条(“Following OpenAI’s Hugging Face incident in July 2026, the company delayed the release”)
ARC-AGI-3 得分 98% 以上不同来源为 98.6%(赢政天下)或 99.9%(觉醒AI),正文取”98% 以上”模糊表述
”别把工作焊死在一家 AI 上”等落地建议嘉宾个人观点,服务其职场定位

【互动引导】 9 月 3 日那天,你正在用 AI 干活时被宕机耽误过吗?你的主力 AI 是哪个、有没有备用的?评论区聊聊,我会挑几条认真回。 觉得有用,点个”在看”和转发,让更多人看到实话。


知乎版差异

  • 标题可换:《OpenAI 喊”AGI 时代”的当天,三大 AI 集体宕机:能力与稳定性的裂缝》(搜索长尾,带关键词)
  • 技术纵深前移:知乎读者吃底层推导,可将【技术纵深】的”路由层/集中度风险”提前到 Q2 之后,并补充企业端单点依赖的成本账(宕机一小时,依赖 AI 的团队损失多少)
  • 增加博弈视角:在 Q3 补一句”发布会语言 vs 事实”的批判——AI 公司为什么普遍爱用”AGI""里程碑”这类词,因为注意力即融资,这解释了为什么每次发布都伴随夸大
  • 结尾加”以上为个人观点,仅供参考”

公众号版排版备注

  • 开场反差句(“上午宕机、下午 AGI”)在首屏加粗突出,保证 3 秒停留
  • 保留全部金句加粗:“能力叙事跑在前面,基础设施还没跟上”、“把宣称降一档、把数据拎出来看”、“连 OpenAI 自己都知道能力越强越不能裸奔”、“最缺的不是更强的模型,是更稳的地基”
  • Q1 时间线可做一张”9/3 当天时间轴”卡片图,方便手机端扫读
广告 · Advertisement