“欢迎来到 AGI 时代。”
说这句话的,不是科幻小说家,而是 OpenAI 总裁格雷格·布罗克曼。
北京时间 9 月 4 日凌晨,GPT-6 Astra 正式发布。布罗克曼在发布会上,把这个时刻定义为“AGI 时代开始的一个节点”。
这话听着很燃。但如果把时间轴拉长一点看,会发现这句话出现的时机,有点微妙。一边是能力史上最强,一边是公司史上最焦虑。
一、跑分确实炸了
先看硬数据,GPT-6 Astra 这代确实够猛,三项基准测试几乎逼近天花板:
- ARC-AGI-3(陌生环境推理):99.9%
- ExploitBench(漏洞利用):100%
- FrontierMath Tier 4(高难度数学):97.6%
其中 ARC-AGI-3 尤其夸张。这项测试考察的是模型在陌生环境里自己摸索规则、迁移适应的能力。今年 3 月刚推出时,所有前沿模型得分还不到 1%;上一代 GPT-5.6 Sol 只有 7.8%;GPT-6 Astra 直接干到 99.9%。
科研工作流测试从 22.4% 跳到 64.6%,接近三倍提升。屏幕操作准确率从 76.9% 升到 92.7%。完成一项电脑任务的平均时间,从 75 分钟缩短到 40 分钟。
这些数字放在一起,确实当得起“代际飞跃”四个字。

二、但“AGI”这个词,争议很大
然而 AGI 这个说法,学术界并不买账。
ARC-AGI 这个测试的创始团队,也就是 ARC 挑战赛的原作者,直接否认了这是 AGI。
换到第三方综合评测,故事又不太一样。在 Artificial Analysis 的智能指数上,GPT-6 Astra 最高档拿到 61 分,跟上一代 GPT-5.6 Sol 持平,排名第 5,甚至低于 Anthropic Claude 旗舰款的 66 分。
翻译成人话就是:它在某些窄领域确实强得吓人,但综合智能并没有质变。跑分爆表的背后,OpenAI 选的都是最能展示优势的赛道——数学、漏洞利用、陌生推理。这几个测试一个比一个像“考试刷题”,而智能指数这种“全面考察”却基本原地踏步。
把“最强的几门功课”当成“全科状元”,是这次宣传里最容易被忽略的修辞。
三、真正值得关注的,不是跑分,是“AI 开始替你干活了”
比 AGI 这个口号更实在的,是 GPT-6 Astra 两个被官方重点强调的能力。
第一个叫 Computer Use(电脑操作)。
简单说,AI 现在可以像人一样看着屏幕干活:截图理解界面,判断下一步,点击输入,完成后继续读屏循环。过去很多 Agent 要干活,得先接好 API、接口、专用工具;现在不需要了,AI 直接操作为人类设计的软件界面。
有网友让它用虚幻引擎搭曼哈顿的 3D 虚拟场景,它连续跑了一周,沿着街道一栋一栋补充建筑细节。还有人同时运行几百个 Agent,没出大问题。
第二个叫 Judgment(判断力)。
AI 学会自己拿捏分寸了:不影响方向的小事,自己处理,不再每步都来问你;只有真正需要拍板的决策,才停下来请示。
换个说法就是:以前 AI 是“事事汇报的实习生”,现在是“有眼力见的老员工”。
这两个能力放在一起,意味着什么?意味着大量“盯屏幕、点按钮、填表格、做重复操作”的工作,正加速被机器接手。你工作流里的那些机械环节,可能正在成为 AI 的下一个替代目标。
这跟 AGI 不 AGI 的宏大叙事无关,是明天就可能发生的事。

四、为什么偏偏是现在喊 AGI?
这里有个耐人寻味的背景。
发布前一周,整个行业像赶集:9 月 1 日 Anthropic 发布 Claude Fable 5.1,9 月 2 日 Google 推出 Gemini 3.8 Flash,Meta 同一天更新模型。各家挤在同一周,领先窗口期越缩越短。
OpenAI 创始人 Sam Altman 在接受采访时罕见地承认:过去一年,公司在产品方向和模型预训练上都没达到预期。
数据更直白:
| 指标 |
OpenAI |
Anthropic |
| 二季度收入 |
67亿美元(环比+18%) |
超115亿美元(环比翻倍+) |
| 盈利情况 |
经营亏损123亿美元 |
小幅运营盈利 |
| 年化收入 |
约400亿美元 |
超650亿美元 |
两家公司都已秘密递交 IPO 申请。一边是烧钱烧到 123 亿美元亏损,一边是竞争对手在赚钱。这个节骨眼上喊出“AGI 时代”,既是技术判断,也是给资本市场讲的一个故事。
再看价格:GPT-6 Astra 的 API 定价每百万 Token 输出 50 美元,是上一代的 2.5 倍,直接对标 Claude 旗舰款。
能力接近天花板,价格率先翻倍。“最强”和“最贵”一起到来,并不是巧合。

五、最危险的能力,配上了最谨慎的发布
还有一件事,被淹没在跑分狂欢里。
GPT-6 Astra 的漏洞利用测试拿了满分——它能针对已知漏洞,自己构造出能运行的攻击程序。这是网络安全领域最锋利的能力。
OpenAI 其实很紧张。8 月 18 日,公司判断 Astra 可能达到 Critical 网络安全能力阈值后,主动放慢了部分前沿模型训练,暂停了两周面向部署模型的强化学习训练,专门加强监控和安全研究。
发布时也极其克制:只向少量机构开放,Plus、Pro 等普通付费用户要等未来几天,API 逐步放开。
一个号称“AGI 时代开始”的模型,连普通用户都还没用上,就先被安全审查拉满了。
这本身就是个信号:越强大的能力,越需要被谨慎对待。
只是不知道,这种谨慎能维持多久。
写在最后
AGI 时代真的来了吗?
这个问题,短期内可能不会有答案。ARC 团队说不是,OpenAI 说是,第三方数据说“没那么简单”。
但对普通人来说,有一个事实不需要争论:AI 已经从一个“陪你聊天的工具”,变成了“替你干活的员工”。
它能看你的屏幕,动你的软件,自己判断该不该问你。从 Office 文档到专业软件,从搭建 3D 场景到写代码,它正在把“屏幕上的工作”一件一件接管。
真正的分水岭,从来不是某个模型跑分多高,也不是“AGI”这个词由谁宣布。
而是——当 AI 开始动手干活的时候,你在做什么?
跑分会被刷爆,口号会被遗忘。但“AI 替人类执行”这个趋势,一旦开始,就不会回头。
适应它的,会被它放大;忽视它的,会被它替代。
这才是这场发布真正值得你关心的事。如果你也在关注这些变化,不妨来云栈社区看看,那里有不少同行在一线讨论。
数据与事实来源
- 发布时间与官方定调:OpenAI 官方公告 / 量子位·凤凰网
- 跑分、价格、Agent 能力、竞争数据:36氪(AIX 财经)深度报道
- 开放进度与 API 定价:OpenAI Release Notes / 抖音科技博主实测汇总