BLOG
GPT-6 号称“AGI 时代”,我拆完 benchmark:强是真的,AGI 是话术
开场:GPT-6 一发布,全网都在喊”AGI 时代来了”
9 月 3 日,OpenAI 发布了新一代旗舰模型 GPT-6 Astra。总裁 Greg Brockman 说它”可能最终被视为 AGI 的到来”,媒体直接翻译成了”欢迎来到 AGI 时代”。
接着就是熟悉的场景:一张张 benchmark 截图刷屏,ARC-AGI-3 拿了 98.6% 的消息满天飞,评论区一半在喊”AGI 来了”,一半在喊”又炒概念”。
拾闻:GPT-6 这波,是真突破,还是发布会语言? 永亮:一句话——强是真的,AGI 是话术。 拾闻:行,那先把”强在哪”和”吹在哪”分开聊。
Q1:GPT-6 到底强在哪?这些强是真的吗?
永亮:强是真的,而且强的地方很具体,不是虚的。
先说几项硬进展,每一项都能在官方页面和第三方测评里查到:
第一,computer use——真的能”用你的电脑”。 这是 GPT-6 主打的招牌能力:你给它一个目标,它能自己操作鼠标键盘、打开软件、填表单、走完一套多步流程。以前这是各家都在吹但落地很糙的方向,这次是真的往前迈了一大步。
第二,agentic coding——写代码的”智能体”能力。 在 DeepSWE v1.1 这个 113 道任务的智能体编程基准上,Astra 拿了 74.1%,超过上一代 GPT-5.6 Sol 的 72.7%。别小看这两个点的差距——这已经是很高的分数段,每涨一点都难。
第三,超长上下文。 1.1M token 的上下文窗口,一口气读进去一本几十万字的内容再干活,不用拆来拆去。
第四,训练规模。 首次用超过 10 万张 GPU 预训练,OpenAI 历史上最大的一次。这是真金白银砸出来的。
OpenAI 官方那张综合对比图里,Astra 59.3%,Claude Opus 5 55.5%,上一代 Sol 53.6%。它是真的变强了,不是换壳。 这一点,我得给 OpenAI 说实话:这波有真东西。
Q2:ARC-AGI-3 拿 98.6%,AGI 真到了吗?
永亮:没到。而且那个 98.6%,本身就有点水分。
先拆那个分数。ARC-AGI-3 这个基准,ARC Prize 官方跑的时候用了两种设置:一种让模型带着完整对话历史去答题,一种只让它带着笔记。结果同一个 GPT-6,一种跑出 99.9%,另一种只跑出 62.7%——同一个基准,换个设置差了 37 分。
这说明什么?说明”98.6%“不是一个客观的能力读数,它是一个特定设置下的数字。你换个 harness,分数就掉一大截。媒体抓的永远是最高那个数,但真实的边界在 62.7% 到 99.9% 之间晃。
再拆 AGI 本身。ARC-AGI-3 到底测的是什么?按 ARC Prize 自己的说法,它测的是”agentic intelligence”——让模型在全新的、抽象的环境里探索、猜目标、建立自己的内部模型。这测的是”会不会在新环境里动脑子”,不是”是不是通用智能”。 拿它当 AGI 的判决书,是偷换概念。
还有 OpenAI 对 AGI 的定义——他们自己以前说的是”能完成所有有经济价值的工作、做得跟人一样好甚至更好”。GPT-6 到没到这个程度?它连自己服务的稳定性都保证不了(发布前一天还集体宕机),离”所有工作”差着十万八千里。
最后说个最容易被忽略的:ARC-AGI-2 时代,GPT-5.4 只拿了 0.26%,人类是 100%。这一代突然跳到 98.6%——这么大的跳跃,本身就值得怀疑是不是针对性刷分。 分是真的,但分背后的”能力含金量”,要打问号。
所以我的结论很直接:强是真的,AGI 是话术。 把”强”说成”AGI”,是发布会的语言,不是技术的语言。
Q3:10 万 GPU、recurrent depth、网络安防被限制、2.5 倍价格——OpenAI 在赌什么、又在怕什么?
永亮:这几个信号摆在一起,说明 OpenAI 一边在赌,一边在怕。
赌什么?赌算力规模。 10 万 GPU 训练、2.5 倍的价格、1.1M 上下文——这是在赌”堆资源换能力”这条路还走得通,而且走通了就能卖最贵。GPT-6 是 OpenAI 史上最贵的公开 API 模型,$10/百万输入 token、$50/百万输出。它赌的不是”够用”,是”最强的人愿意为最强买单”。
怕什么?怕的是能力失控。三个细节:
第一,recurrent depth 会”藏”推理过程。 GPT-6 用了新的推理技术,会把模型的思考链部分遮起来,不让你看它怎么得出答案。The Information 直接点名这是安全隐患——模型越强,越不让你看它怎么想的,这本身就值得警惕。
第二,网络安防能力被锁起来。 GPT-6 在 ExploitBench 这类安全基准上拿了 100%,任意代码执行率也大幅超过上一代。听起来是好事?但一个能这么快写攻击代码的模型,如果敞开给人用,就是现成的攻击工具。所以 OpenAI 把最强的那块网络安全能力,先只开放给一小撮通过审核的测试者。它自己先踩了刹车。
第三,这次发布本来就推迟了。 7 月 OpenAI 在 Hugging Face 上出过安全事件,之后专门延迟了发布、补了安全措施。GPT-6 能今天见人,是一路踩着刹车踩过来的。
把这些放一起,你就明白 OpenAI 的真实处境了:它想让你相信 AGI 到了(为了估值和竞争),但它自己很清楚,能力越强越要收着用。 这俩心态,同时存在于同一家公司身上。
Q4:模型都喊”AGI”了,职场人真正该焦虑的是什么?
永亮:绝大多数人焦虑错了方向。
模型一发布,评论区最常见的声音是”完了,AGI 来了,我是不是要被替代了”。但你看清楚了吗——GPT-6 强,不代表用 GPT-6 的人强。
同一把刀,厨师用它切出满汉全席,普通人用它还是切到手。AI 也是这个道理:模型能力上去了,只是把上限抬高了;你能不能摸到那个上限,取决于你自己的能力。
所以职场人真正该焦虑的,不是”模型太强”,是这三件事:
第一,你只会”用”,不会”判断”。 让 AI 写个方案、写段代码,你敢不敢说”这段能用、这段不能用”?AI 越强,越需要有人把关——敢下判断、能兜底的人,反而更值钱了。
第二,你的能力”证明不了”。 面试官问你”会用 AI 吗”,你说”会”,然后呢?说不出一套东西,就露馅了。“我好像会 AI”是最危险的状态。
第三,你还在刷碎片。 东看一个教程、西看一个视频,收藏夹里几百条,脑子里不成体系。碎片化学习在 AI 时代是最低效的——因为模型本身就能给你碎片,你缺的不是碎片,是体系。
一句话:模型越强,职场人之间的差距,越会从”谁会用工具”变成”谁能证明自己会用、谁能用它解决真问题”。
Q5:模型越来越强,职场人该怎么学、怎么证明自己会用 AI?
永亮:三条,照着做就行。
第一,别追最新模型,追”可证明的能力”。 GPT-6 出来了,下个月可能还有 GPT-6.5。你追版本永远追不上,也没必要追。真正该追的,是”我能不能用 AI 把我这个岗位的活儿,从头到尾完整做下来”——能做下来,就是能力;做不下来,模型再新也白搭。
第二,把碎片整理成体系。 与其刷 100 个零散教程,不如完整跟完一条学习主线:从”AI 能干什么”到”我岗位上的具体场景怎么落地”,最后能回答一个问题——“这套东西在我手上怎么用起来”。你整理过的、能讲出来的,才是你自己的。
第三,让技能变得可验证、可交付。 这个我建议系统学一遍、拿个认证。注意,认证的价值不是那张纸,是它逼你把零散经验逼成体系——学完你能说清”我学了什么、能做什么、在什么场景下验证过”,而不是”我刷过很多教程”。简历上写”熟练使用 AI”,不如一条能查证的认证来得实在;对用人单位来说,“有体系、能验证”就是敲门砖和简历加分项。
别把考证理解成”考了就涨薪”——那是骗人的。把它理解成”给自己一次把能力整理成体系的硬约束”,这才是它真正的价值。
尾声
拾闻:最后,用一句话总结这期? 永亮:模型离 AGI 还有距离,但你离”会用 AI”的距离,比你以为的近——关键不是追最新模型,是把你会的,变成可证明的。 拾闻:这句话,送给大家。下期见。
【技术纵深】为什么 benchmark 分数不能全信?
这期反复在说”拆分数”,那就把这个技术问题说透——为什么同一个模型,分数能差这么多?
第一,harness 口径。 同一个 ARC-AGI-3,模型带不带完整对话历史、允许带多少”草稿纸”,都会改变结果。GPT-6 的 62.7% 和 99.9%,就是这种口径差异的产物。“分数”从来不是一个客观常数,它是一个特定实验设置下的输出。 媒体只报最高分,就等于只报了你最好看的那个角度。
第二,overfit(刷分)。 公开基准的问题在于,模型团队知道考题方向,就可以针对性训练。ARC-AGI-2 当年多难?GPT-5.4 只有 0.26%。结果不到一年,ARC-AGI-3 直接冲到 98.6%。能力真涨了这么多吗?部分是真的,但很大一部分是”模型学会了这张考卷的套路”。所以圈子里已经在喊”需要新的、封闭的基准”。
第三,基准会”饱和”,所以一直在换。 ARC-AGI-2 被刷到接近满分,才出了 ARC-AGI-3 换考法。你今天看到的 98.6%,大概率明年就会被新的基准重新”打回原形”。分数是追着基准跑的,不是追着”智能”跑的。
对普通人来说,记住一条就够:看一个模型好不好,别看它 headline 那个最高分,看它在你自己的真实任务上表现怎么样。 你让 GPT-6 帮你写周报、做表格、查资料——它顺手不顺手,比任何 benchmark 都准。
事实核对表
| 文中说法 | 事实依据 |
|---|---|
| GPT-6 Astra 9/3 发布 limited preview,公众 9/5 开放 | Wikipedia “GPT-6 Astra” 词条 |
| 首次超 10 万 GPU 训练(德州 Stargate) | Wikipedia 引 OpenAI 研究 VP Aidan Clark 原话 |
| 1.1M token 上下文窗口 | llm-stats.com / ComputingForGeeks 等 |
| 价格 $10/M input + $50/M output,约 2.5 倍于 Sol | OpenAI 官方 + overchat.ai(Sol 为 $4/M) |
| 综合对比 59.3%(Astra)vs 55.5%(Opus 5)vs 53.6%(Sol) | OpenAI 官方发布页 |
| DeepSWE v1.1:Astra 74.1% vs Sol 72.7% | Vellum(引 OpenAI 官方 Coding 表) |
| ARC-AGI-3 同一基准跑出 62.7% 与 99.9% 两种分数(harness 口径) | ofox.ai / ARC Prize 官方 |
| ARC-AGI-3 测”agentic intelligence”(探索新环境、推断目标) | arcprize.org 官方说明 |
| ARC-AGI-2 时代 GPT-5.4 仅 0.26%(人类 100%) | happycapyguide 引 ARC 数据 |
| Brockman 说”可能最终被视为 AGI 的到来” | Wikipedia 词条 |
| ”欢迎来到 AGI 时代” | Axios 标题(非 OpenAI 官方原话) |
| recurrent depth 遮蔽部分推理链、引发可监控性担忧 | Wikipedia + The Information |
| 网络安全能力被限制(Daybreak Blue 测试者) | Wikipedia + CNBC |
| ExploitBench 100%、任意代码执行率大幅高于上一代 | gptunnel / OpenAI 官方发布页 |
| 7 月 Hugging Face 事件后延迟发布 | Wikipedia 词条 |
| 考证”简历加分、敲门砖、体系学习”,非”包过/涨薪” | 嘉宾个人观点,符合合规口径 |
知乎版差异
- 标题可换:《GPT-6 的 98.6% 有水分吗?拆穿”AGI 时代”的 benchmark 陷阱》(搜索长尾,带关键词)
- 技术纵深前移:知乎读者吃底层推导,可将【技术纵深】的”harness 口径 / overfit / 基准饱和”提到 Q2 之后,并补充”闭源基准为何难防刷分”的方法论讨论
- 增加批判视角:在 Q2 补一句”发布会语言 vs 技术语言的本质”——AI 公司为什么普遍爱用 AGI、里程碑这类词,因为注意力即融资,这解释了每次发布必伴随夸大
- 结尾加”以上为个人观点,仅供参考”
公众号版排版备注
- 开场金句”强是真的,AGI 是话术”在首屏加粗突出,保证 3 秒停留
- 保留金句加粗:“模型越强,越不让你看它怎么想的”、“敢下判断、能兜底的人反而更值钱”、“认证的价值不是那张纸,是它逼你整理成体系”
- Q1 的四个”强”可做一张”GPT-6 真本事清单”卡片图,Q2 的”62.7% vs 99.9%“可做对比图,方便手机端扫读