找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4718

积分

0

好友

614

主题
发表于 2 小时前 | 查看: 4| 回复: 0

“欢迎来到 AGI 时代。”

说这句话的,不是科幻小说家,而是 OpenAI 总裁格雷格·布罗克曼。

北京时间 9 月 4 日凌晨,GPT-6 Astra 正式发布。布罗克曼在发布会上,把这个时刻定义为“AGI 时代开始的一个节点”。

这话听着很燃。但如果把时间轴拉长一点看,会发现这句话出现的时机,有点微妙。一边是能力史上最强,一边是公司史上最焦虑。

一、跑分确实炸了

先看硬数据,GPT-6 Astra 这代确实够猛,三项基准测试几乎逼近天花板:

  • ARC-AGI-3(陌生环境推理):99.9%
  • ExploitBench(漏洞利用):100%
  • FrontierMath Tier 4(高难度数学):97.6%

其中 ARC-AGI-3 尤其夸张。这项测试考察的是模型在陌生环境里自己摸索规则、迁移适应的能力。今年 3 月刚推出时,所有前沿模型得分还不到 1%;上一代 GPT-5.6 Sol 只有 7.8%;GPT-6 Astra 直接干到 99.9%。

科研工作流测试从 22.4% 跳到 64.6%,接近三倍提升。屏幕操作准确率从 76.9% 升到 92.7%。完成一项电脑任务的平均时间,从 75 分钟缩短到 40 分钟。

这些数字放在一起,确实当得起“代际飞跃”四个字。

GPT-6 Astra 基准测试成绩接近满分

二、但“AGI”这个词,争议很大

然而 AGI 这个说法,学术界并不买账。

ARC-AGI 这个测试的创始团队,也就是 ARC 挑战赛的原作者,直接否认了这是 AGI。

换到第三方综合评测,故事又不太一样。在 Artificial Analysis 的智能指数上,GPT-6 Astra 最高档拿到 61 分,跟上一代 GPT-5.6 Sol 持平,排名第 5,甚至低于 Anthropic Claude 旗舰款的 66 分。

翻译成人话就是:它在某些窄领域确实强得吓人,但综合智能并没有质变。跑分爆表的背后,OpenAI 选的都是最能展示优势的赛道——数学、漏洞利用、陌生推理。这几个测试一个比一个像“考试刷题”,而智能指数这种“全面考察”却基本原地踏步。

把“最强的几门功课”当成“全科状元”,是这次宣传里最容易被忽略的修辞。

三、真正值得关注的,不是跑分,是“AI 开始替你干活了”

比 AGI 这个口号更实在的,是 GPT-6 Astra 两个被官方重点强调的能力。

第一个叫 Computer Use(电脑操作)。

简单说,AI 现在可以像人一样看着屏幕干活:截图理解界面,判断下一步,点击输入,完成后继续读屏循环。过去很多 Agent 要干活,得先接好 API、接口、专用工具;现在不需要了,AI 直接操作为人类设计的软件界面。

有网友让它用虚幻引擎搭曼哈顿的 3D 虚拟场景,它连续跑了一周,沿着街道一栋一栋补充建筑细节。还有人同时运行几百个 Agent,没出大问题。

第二个叫 Judgment(判断力)。

AI 学会自己拿捏分寸了:不影响方向的小事,自己处理,不再每步都来问你;只有真正需要拍板的决策,才停下来请示。

换个说法就是:以前 AI 是“事事汇报的实习生”,现在是“有眼力见的老员工”。

这两个能力放在一起,意味着什么?意味着大量“盯屏幕、点按钮、填表格、做重复操作”的工作,正加速被机器接手。你工作流里的那些机械环节,可能正在成为 AI 的下一个替代目标。

这跟 AGI 不 AGI 的宏大叙事无关,是明天就可能发生的事。

人机协作示意:AI 正在操作电脑界面

四、为什么偏偏是现在喊 AGI?

这里有个耐人寻味的背景。

发布前一周,整个行业像赶集:9 月 1 日 Anthropic 发布 Claude Fable 5.1,9 月 2 日 Google 推出 Gemini 3.8 Flash,Meta 同一天更新模型。各家挤在同一周,领先窗口期越缩越短。

OpenAI 创始人 Sam Altman 在接受采访时罕见地承认:过去一年,公司在产品方向和模型预训练上都没达到预期。

数据更直白:

指标 OpenAI Anthropic
二季度收入 67亿美元(环比+18%) 超115亿美元(环比翻倍+)
盈利情况 经营亏损123亿美元 小幅运营盈利
年化收入 约400亿美元 超650亿美元

两家公司都已秘密递交 IPO 申请。一边是烧钱烧到 123 亿美元亏损,一边是竞争对手在赚钱。这个节骨眼上喊出“AGI 时代”,既是技术判断,也是给资本市场讲的一个故事。

再看价格:GPT-6 Astra 的 API 定价每百万 Token 输出 50 美元,是上一代的 2.5 倍,直接对标 Claude 旗舰款。

能力接近天花板,价格率先翻倍。“最强”和“最贵”一起到来,并不是巧合。

AI 商业竞争与资本压力示意

五、最危险的能力,配上了最谨慎的发布

还有一件事,被淹没在跑分狂欢里。

GPT-6 Astra 的漏洞利用测试拿了满分——它能针对已知漏洞,自己构造出能运行的攻击程序。这是网络安全领域最锋利的能力。

OpenAI 其实很紧张。8 月 18 日,公司判断 Astra 可能达到 Critical 网络安全能力阈值后,主动放慢了部分前沿模型训练,暂停了两周面向部署模型的强化学习训练,专门加强监控和安全研究。

发布时也极其克制:只向少量机构开放,Plus、Pro 等普通付费用户要等未来几天,API 逐步放开。

一个号称“AGI 时代开始”的模型,连普通用户都还没用上,就先被安全审查拉满了。

这本身就是个信号:越强大的能力,越需要被谨慎对待。

只是不知道,这种谨慎能维持多久。

写在最后

AGI 时代真的来了吗?

这个问题,短期内可能不会有答案。ARC 团队说不是,OpenAI 说是,第三方数据说“没那么简单”。

但对普通人来说,有一个事实不需要争论:AI 已经从一个“陪你聊天的工具”,变成了“替你干活的员工”。

它能看你的屏幕,动你的软件,自己判断该不该问你。从 Office 文档到专业软件,从搭建 3D 场景到写代码,它正在把“屏幕上的工作”一件一件接管。

真正的分水岭,从来不是某个模型跑分多高,也不是“AGI”这个词由谁宣布。

而是——当 AI 开始动手干活的时候,你在做什么?

跑分会被刷爆,口号会被遗忘。但“AI 替人类执行”这个趋势,一旦开始,就不会回头。

适应它的,会被它放大;忽视它的,会被它替代。

这才是这场发布真正值得你关心的事。如果你也在关注这些变化,不妨来云栈社区看看,那里有不少同行在一线讨论。

数据与事实来源

  • 发布时间与官方定调:OpenAI 官方公告 / 量子位·凤凰网
  • 跑分、价格、Agent 能力、竞争数据:36氪(AIX 财经)深度报道
  • 开放进度与 API 定价:OpenAI Release Notes / 抖音科技博主实测汇总



上一篇:C++虚表只有函数指针?GCC汇编拆出vptr[-2]前两个关键槽
下一篇:OpenAI宣布终止与Cursor合作:马斯克收购后60天内断供,开发者如何应对
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-6 07:51 , Processed in 1.495085 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表