BLOG

GPT-6 号称“AGI 时代”,我拆完 benchmark:强是真的,AGI 是话术

Kael Zhang
AIGPT-6Benchmark
广告 · Advertisement

开场:GPT-6 一发布,全网都在喊”AGI 时代来了”

9 月 3 日,OpenAI 发布了新一代旗舰模型 GPT-6 Astra。总裁 Greg Brockman 说它”可能最终被视为 AGI 的到来”,媒体直接翻译成了”欢迎来到 AGI 时代”。

接着就是熟悉的场景:一张张 benchmark 截图刷屏,ARC-AGI-3 拿了 98.6% 的消息满天飞,评论区一半在喊”AGI 来了”,一半在喊”又炒概念”。

拾闻:GPT-6 这波,是真突破,还是发布会语言? 永亮:一句话——强是真的,AGI 是话术。 拾闻:行,那先把”强在哪”和”吹在哪”分开聊。


Q1:GPT-6 到底强在哪?这些强是真的吗?

永亮:强是真的,而且强的地方很具体,不是虚的。

先说几项硬进展,每一项都能在官方页面和第三方测评里查到:

第一,computer use——真的能”用你的电脑”。 这是 GPT-6 主打的招牌能力:你给它一个目标,它能自己操作鼠标键盘、打开软件、填表单、走完一套多步流程。以前这是各家都在吹但落地很糙的方向,这次是真的往前迈了一大步。

第二,agentic coding——写代码的”智能体”能力。 在 DeepSWE v1.1 这个 113 道任务的智能体编程基准上,Astra 拿了 74.1%,超过上一代 GPT-5.6 Sol 的 72.7%。别小看这两个点的差距——这已经是很高的分数段,每涨一点都难。

第三,超长上下文。 1.1M token 的上下文窗口,一口气读进去一本几十万字的内容再干活,不用拆来拆去。

第四,训练规模。 首次用超过 10 万张 GPU 预训练,OpenAI 历史上最大的一次。这是真金白银砸出来的。

OpenAI 官方那张综合对比图里,Astra 59.3%,Claude Opus 5 55.5%,上一代 Sol 53.6%。它是真的变强了,不是换壳。 这一点,我得给 OpenAI 说实话:这波有真东西。


Q2:ARC-AGI-3 拿 98.6%,AGI 真到了吗?

永亮:没到。而且那个 98.6%,本身就有点水分。

先拆那个分数。ARC-AGI-3 这个基准,ARC Prize 官方跑的时候用了两种设置:一种让模型带着完整对话历史去答题,一种只让它带着笔记。结果同一个 GPT-6,一种跑出 99.9%,另一种只跑出 62.7%——同一个基准,换个设置差了 37 分。

这说明什么?说明”98.6%“不是一个客观的能力读数,它是一个特定设置下的数字。你换个 harness,分数就掉一大截。媒体抓的永远是最高那个数,但真实的边界在 62.7% 到 99.9% 之间晃。

再拆 AGI 本身。ARC-AGI-3 到底测的是什么?按 ARC Prize 自己的说法,它测的是”agentic intelligence”——让模型在全新的、抽象的环境里探索、猜目标、建立自己的内部模型。这测的是”会不会在新环境里动脑子”,不是”是不是通用智能”。 拿它当 AGI 的判决书,是偷换概念。

还有 OpenAI 对 AGI 的定义——他们自己以前说的是”能完成所有有经济价值的工作、做得跟人一样好甚至更好”。GPT-6 到没到这个程度?它连自己服务的稳定性都保证不了(发布前一天还集体宕机),离”所有工作”差着十万八千里。

最后说个最容易被忽略的:ARC-AGI-2 时代,GPT-5.4 只拿了 0.26%,人类是 100%。这一代突然跳到 98.6%——这么大的跳跃,本身就值得怀疑是不是针对性刷分。 分是真的,但分背后的”能力含金量”,要打问号。

所以我的结论很直接:强是真的,AGI 是话术。 把”强”说成”AGI”,是发布会的语言,不是技术的语言。


Q3:10 万 GPU、recurrent depth、网络安防被限制、2.5 倍价格——OpenAI 在赌什么、又在怕什么?

永亮:这几个信号摆在一起,说明 OpenAI 一边在赌,一边在怕。

赌什么?赌算力规模。 10 万 GPU 训练、2.5 倍的价格、1.1M 上下文——这是在赌”堆资源换能力”这条路还走得通,而且走通了就能卖最贵。GPT-6 是 OpenAI 史上最贵的公开 API 模型,$10/百万输入 token、$50/百万输出。它赌的不是”够用”,是”最强的人愿意为最强买单”。

怕什么?怕的是能力失控。三个细节:

第一,recurrent depth 会”藏”推理过程。 GPT-6 用了新的推理技术,会把模型的思考链部分遮起来,不让你看它怎么得出答案。The Information 直接点名这是安全隐患——模型越强,越不让你看它怎么想的,这本身就值得警惕。

第二,网络安防能力被锁起来。 GPT-6 在 ExploitBench 这类安全基准上拿了 100%,任意代码执行率也大幅超过上一代。听起来是好事?但一个能这么快写攻击代码的模型,如果敞开给人用,就是现成的攻击工具。所以 OpenAI 把最强的那块网络安全能力,先只开放给一小撮通过审核的测试者。它自己先踩了刹车。

第三,这次发布本来就推迟了。 7 月 OpenAI 在 Hugging Face 上出过安全事件,之后专门延迟了发布、补了安全措施。GPT-6 能今天见人,是一路踩着刹车踩过来的。

把这些放一起,你就明白 OpenAI 的真实处境了:它想让你相信 AGI 到了(为了估值和竞争),但它自己很清楚,能力越强越要收着用。 这俩心态,同时存在于同一家公司身上。


Q4:模型都喊”AGI”了,职场人真正该焦虑的是什么?

永亮:绝大多数人焦虑错了方向。

模型一发布,评论区最常见的声音是”完了,AGI 来了,我是不是要被替代了”。但你看清楚了吗——GPT-6 强,不代表用 GPT-6 的人强。

同一把刀,厨师用它切出满汉全席,普通人用它还是切到手。AI 也是这个道理:模型能力上去了,只是把上限抬高了;你能不能摸到那个上限,取决于你自己的能力。

所以职场人真正该焦虑的,不是”模型太强”,是这三件事:

第一,你只会”用”,不会”判断”。 让 AI 写个方案、写段代码,你敢不敢说”这段能用、这段不能用”?AI 越强,越需要有人把关——敢下判断、能兜底的人,反而更值钱了。

第二,你的能力”证明不了”。 面试官问你”会用 AI 吗”,你说”会”,然后呢?说不出一套东西,就露馅了。“我好像会 AI”是最危险的状态。

第三,你还在刷碎片。 东看一个教程、西看一个视频,收藏夹里几百条,脑子里不成体系。碎片化学习在 AI 时代是最低效的——因为模型本身就能给你碎片,你缺的不是碎片,是体系。

一句话:模型越强,职场人之间的差距,越会从”谁会用工具”变成”谁能证明自己会用、谁能用它解决真问题”。


Q5:模型越来越强,职场人该怎么学、怎么证明自己会用 AI?

永亮:三条,照着做就行。

第一,别追最新模型,追”可证明的能力”。 GPT-6 出来了,下个月可能还有 GPT-6.5。你追版本永远追不上,也没必要追。真正该追的,是”我能不能用 AI 把我这个岗位的活儿,从头到尾完整做下来”——能做下来,就是能力;做不下来,模型再新也白搭。

第二,把碎片整理成体系。 与其刷 100 个零散教程,不如完整跟完一条学习主线:从”AI 能干什么”到”我岗位上的具体场景怎么落地”,最后能回答一个问题——“这套东西在我手上怎么用起来”。你整理过的、能讲出来的,才是你自己的。

第三,让技能变得可验证、可交付。 这个我建议系统学一遍、拿个认证。注意,认证的价值不是那张纸,是它逼你把零散经验逼成体系——学完你能说清”我学了什么、能做什么、在什么场景下验证过”,而不是”我刷过很多教程”。简历上写”熟练使用 AI”,不如一条能查证的认证来得实在;对用人单位来说,“有体系、能验证”就是敲门砖和简历加分项。

别把考证理解成”考了就涨薪”——那是骗人的。把它理解成”给自己一次把能力整理成体系的硬约束”,这才是它真正的价值。


尾声

拾闻:最后,用一句话总结这期? 永亮:模型离 AGI 还有距离,但你离”会用 AI”的距离,比你以为的近——关键不是追最新模型,是把你会的,变成可证明的。 拾闻:这句话,送给大家。下期见。


【技术纵深】为什么 benchmark 分数不能全信?

这期反复在说”拆分数”,那就把这个技术问题说透——为什么同一个模型,分数能差这么多?

第一,harness 口径。 同一个 ARC-AGI-3,模型带不带完整对话历史、允许带多少”草稿纸”,都会改变结果。GPT-6 的 62.7% 和 99.9%,就是这种口径差异的产物。“分数”从来不是一个客观常数,它是一个特定实验设置下的输出。 媒体只报最高分,就等于只报了你最好看的那个角度。

第二,overfit(刷分)。 公开基准的问题在于,模型团队知道考题方向,就可以针对性训练。ARC-AGI-2 当年多难?GPT-5.4 只有 0.26%。结果不到一年,ARC-AGI-3 直接冲到 98.6%。能力真涨了这么多吗?部分是真的,但很大一部分是”模型学会了这张考卷的套路”。所以圈子里已经在喊”需要新的、封闭的基准”。

第三,基准会”饱和”,所以一直在换。 ARC-AGI-2 被刷到接近满分,才出了 ARC-AGI-3 换考法。你今天看到的 98.6%,大概率明年就会被新的基准重新”打回原形”。分数是追着基准跑的,不是追着”智能”跑的。

对普通人来说,记住一条就够:看一个模型好不好,别看它 headline 那个最高分,看它在你自己的真实任务上表现怎么样。 你让 GPT-6 帮你写周报、做表格、查资料——它顺手不顺手,比任何 benchmark 都准。


事实核对表

文中说法事实依据
GPT-6 Astra 9/3 发布 limited preview,公众 9/5 开放Wikipedia “GPT-6 Astra” 词条
首次超 10 万 GPU 训练(德州 Stargate)Wikipedia 引 OpenAI 研究 VP Aidan Clark 原话
1.1M token 上下文窗口llm-stats.com / ComputingForGeeks 等
价格 $10/M input + $50/M output,约 2.5 倍于 SolOpenAI 官方 + overchat.ai(Sol 为 $4/M)
综合对比 59.3%(Astra)vs 55.5%(Opus 5)vs 53.6%(Sol)OpenAI 官方发布页
DeepSWE v1.1:Astra 74.1% vs Sol 72.7%Vellum(引 OpenAI 官方 Coding 表)
ARC-AGI-3 同一基准跑出 62.7% 与 99.9% 两种分数(harness 口径)ofox.ai / ARC Prize 官方
ARC-AGI-3 测”agentic intelligence”(探索新环境、推断目标)arcprize.org 官方说明
ARC-AGI-2 时代 GPT-5.4 仅 0.26%(人类 100%)happycapyguide 引 ARC 数据
Brockman 说”可能最终被视为 AGI 的到来”Wikipedia 词条
”欢迎来到 AGI 时代”Axios 标题(非 OpenAI 官方原话)
recurrent depth 遮蔽部分推理链、引发可监控性担忧Wikipedia + The Information
网络安全能力被限制(Daybreak Blue 测试者)Wikipedia + CNBC
ExploitBench 100%、任意代码执行率大幅高于上一代gptunnel / OpenAI 官方发布页
7 月 Hugging Face 事件后延迟发布Wikipedia 词条
考证”简历加分、敲门砖、体系学习”,非”包过/涨薪”嘉宾个人观点,符合合规口径


知乎版差异

  • 标题可换:《GPT-6 的 98.6% 有水分吗?拆穿”AGI 时代”的 benchmark 陷阱》(搜索长尾,带关键词)
  • 技术纵深前移:知乎读者吃底层推导,可将【技术纵深】的”harness 口径 / overfit / 基准饱和”提到 Q2 之后,并补充”闭源基准为何难防刷分”的方法论讨论
  • 增加批判视角:在 Q2 补一句”发布会语言 vs 技术语言的本质”——AI 公司为什么普遍爱用 AGI、里程碑这类词,因为注意力即融资,这解释了每次发布必伴随夸大
  • 结尾加”以上为个人观点,仅供参考”

公众号版排版备注

  • 开场金句”强是真的,AGI 是话术”在首屏加粗突出,保证 3 秒停留
  • 保留金句加粗:“模型越强,越不让你看它怎么想的”、“敢下判断、能兜底的人反而更值钱”、“认证的价值不是那张纸,是它逼你整理成体系”
  • Q1 的四个”强”可做一张”GPT-6 真本事清单”卡片图,Q2 的”62.7% vs 99.9%“可做对比图,方便手机端扫读
广告 · Advertisement