找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

5954

积分

0

好友

760

主题
发表于 4 天前 | 查看: 8| 回复: 0

今天,人类正式进入 AGI 时代。

OpenAI 刚刚官宣下一代旗舰模型 GPT-6 Astra,官方将其定义为「世界上最智能、对齐程度最高」的模型。它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新 SOTA。

OpenAI 官宣 GPT-6 Astra 推文截图

发布会上,总裁 Greg Brockman 更是直接宣布:

OpenAI 已经实现了 AGI!Welcome to the AGI era!

他还补充,世界正式步入 AGI 时代,也就是 AI 的综合智力已经彻底超越人类。

Sam Altman 宣布 GPT-6 Astra 推文截图

从 5 到 6,GPT-6 Astra 不仅是版本号的一次跨越,更是 OpenAI 史上最具里程碑意义的跃迁。

直接划重点,GPT-6 Astra 的核心升级包括:

  • 各项天花板级基准被「打爆」:FrontierMath Tier 4 得分 97.6%,逼近 98% 饱和线;ARC-AGI-3 达到 99.9%;ExploitBench 漏洞利用拿下 100% 满分。
  • 「计算机使用」代际飞跃:Astra 可以完成你在电脑上能做的任何事,而且速度飞快。
  • 训练史上最大算力:OpenAI 动用了迄今规模最大的训练任务,超 10 万块 GPU
  • AI 亲自训练 AI:这是 OpenAI 首款在训练监督中由先前 AI 模型发挥重要作用的模型。
  • 价格:输入 10 美元每百万 Token,输出 50 美元每百万 Token。

GPT-6 Astra 主要基准测试成绩表

一点小遗憾,GPT-6 Astra 还得再等等。Sam Altman 表示,团队正在努力尽快让 Astra 进入每个人的手中。

Sam Altman 回应 GPT-6 Astra 开放时间推文截图

GPT-6 Astra 震撼登场

在各项基准测试中,OpenAI 官博多次重用了同一个词——「饱和」(saturate)。这足以证明 GPT-6 Astra 在多个领域的绝对统治力,榜单已经测不出它的上限。

OpenAI 介绍 GPT-6 Astra 官方截图

总榜上,刚刚上线的 Claude Fable 5.1 已经没有什么优势可言。GPT-6 Astra 直接把 Claude 5.1 全方位压制。

GPT-6 Astra 与主要模型基准对比表

先看 ARC-AGI-3,Astra 直接拿下 99.9%,暴击 Claude Opus 5 的 30.2%。这个测试考的是 Agent 在陌生交互式任务里边玩边学的能力,人类测试者平均只有 48%。OpenAI 估算,在同样的 responses API 评测框架下,Sol 只有 30% 左右,而 Astra 直接刷爆。

Greg Brockman 发布 ARC-AGI-3 饱和推文

ARC-AGI-3 分数对比柱状图

数学上,Astra 在 FrontierMath Tier 4 v2 达到 97.6%,接近 98% 饱和分。这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。

在测试生物、化学和物理领域研究生级科学推理的 GPQA Diamond 上,Astra 同样刷新历史新高。即便在较低算力成本设置下,也能跑出 94.9%,超过 GPT-5.6 Sol 的 94.6%,同时 API 预估成本下降约 37%。

FrontierMath Tier 4 v2 成本与准确率趋势

GPQA Diamond 成本与准确率趋势

编程第一,Fable 5.1 惨败

编程依然是 Astra 的主战场。OpenAI 自述,GPT‑6 Astra 是迄今为止最适合软件工程的模型。

Terminal-Bench 4.0 上,Astra 拿到 57.7%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。DeepSWE v1.1 上,Astra 达到 74.1%;内部数据库迁移任务达到 63.9%,相比 Sol 的 42.7% 提升明显。

Terminal-Bench 4.0 成本与准确率趋势

DeepSWE v1.1 输出 token 与得分趋势

比跑分更关键的升级,藏在 Codex 的上下文管理里。过去,长任务一旦塞满上下文窗口,模型会把历史压缩成摘要。每压缩一次,都可能丢掉一些细节:某次修复为何失败、一个模块有什么特殊行为、用户最初设下了哪些限制。

这一次,Astra 新增了跨上下文窗口的笔记与检索机制。它会保存一路积累的关键信息,早期窗口也保持可搜索。即使某条测试结果没有被写进摘要,模型仍能从过去的消息和工具输出中把它找回来。

OpenAI 开始给长时间运行的智能体补上一套外部记忆:重点内容主动记,完整历史需要时再搜。对持续数小时、跨越大量文件的重构任务,这种能力可能比单次代码生成得分更重要。

Epoch AI 发布 GPT-6 Astra ECI 169 分推文截图

全球最强「计算机使用」模型

真正让 Astra 与上一代模型拉开距离的,是「计算机使用」能力。

OpenAI 把 Astra 称为世界上最好的计算机使用模型。奥特曼之前反复强调,下一代最让他兴奋的就是这一功能。他直言:Astra 的计算机使用能力,已达人类水平。

如今,GPT-6 Astra 已彻底进化成一个坐在电脑前、手握键鼠的「超级专家」。

OpenAI 放出一段 15 秒浓缩视频:Astra 在 KiCad 里做 PCB 布局。它打开 KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的 PCB。电路板布局长期依赖工程师手工调整,一个位置、一根铜线出错,都可能把问题带进后续打样。现在,这类工作第一次被放进了通用模型的任务范围。

GPT-6 Astra 在 KiCad 中完成 PCB 布局

它还填了一份美国 1040 报税表,给法律文件排了版,在 Power BI 里做报表,给一个网站跑了前端 QA。

GPT-6 Astra 填写美国税务表格界面

OpenAI 产品页面与开发任务面板截图

Power BI 报表界面示例

Agents' Last Exam 测真实软件里的专业任务,从财务建模到工程制图。Astra 得分 59.3%,赶超 Claude Opus 5 的 55.5% 和 GPT-5.6 Sol 的 53.6%。在最高分设置下,它使用的输出 Token 还比 Opus 5 少约 65%。

OSWorld 2.0 模拟真人操作电脑。上一代 GPT-5.6 Sol 一个任务平均要 75 分钟,Astra 仅 40 分钟,分数还从 65.7% 涨到 72.6%。性能更高,单项任务耗时缩短约 47%。配合新版 Codex harness,在 Mind2Web 上,网页任务比 Sol 快 1.9 倍。

Agents Last Exam 成本与准确率趋势

OSWorld 2.0 Offline 成本与准确率趋势

画 CAD、建网站,一次交付

在知识型工作上,GPT-6 Astra 又是一次重大变革。

Astra 接受过针对办公与专业环境的训练,可以执行多步骤工作流,并直接生成文档、表格和演示文稿。在 AutomationBench 上,它从 GPT-5.6 Sol 的 18.1% 跃升至 41.4%,也超过 Claude Fable 5.1 的 31.4%。

BenchCAD 要求模型根据多视角渲染图,用代码重建 3D 物体。Astra 配合工具拿到 95.9% 的几何重合度,GPT-5.6 Sol 为 83.3%,Claude Fable 5.1 为 84.3%。按照 OpenAI 给出的测试配置,Astra 的估算 API 成本比 Sol 低约 43%,比 Fable 5.1 低约 86%。

BenchCAD 模型几何重建对比

Astra 对企业模板的理解也更强了。给它几页公司既有 PPT,Astra 可以延续版式、语气和叙事结构,把后面的整套演示文稿补出来。文档和表格也一样:它会抓取真正相关的上下文,尽量删掉无关复述,让结果贴近企业原有的写作与视觉规范。

GPT-6 Astra 生成企业演示文稿与文档

GPT‑6 Astra 还为其构建的网站、游戏、应用程序和渲染图带来更强的视觉判断力。Astra 先在 Blender 里搭出一栋房子,再把它送进 Unreal Engine 5,变成可以自由行走的场景。通过 ChatGPT 中的 Sites 功能,Astra 可以直接根据提示词创建、托管和分享网站、网页应用及游戏。

GPT-6 Astra 搭建并渲染室内场景

这里还有一个容易被忽略的变化:Astra 更会判断什么时候该问人。指令里只缺少常规细节,它会结合上下文补齐;某个选择足以改变结果,它会提出一个聚焦的问题。

在 Codex 中,它可以异步询问,同时继续完成不依赖答案的部分。用户暂时没回复,它会在低风险环节采用合理假设;碰到关键决策,则停下来等人确认。

GPT-6 Astra 与 GPT-5.6 Sol 网站生成对比

GPT-6 Astra 与 GPT-5.6 Sol 预算建议对话对比

攻入科研,改写两个素数世界纪录

Astra 在科研上的进展同样凶猛。

它之前已经帮人类解决了十个「菲尔兹奖级别」的数学难题,这次 OpenAI 又顺手放出两个关于「素数间隙」的新结果。

第一个研究「相邻素数可以有多近」。十多年来,已知结论是存在无穷多对素数,间距不超过 246。数学家 Julia Stadlmann 近期把它改进到 240,Astra 又进一步推到 186。

第二个研究「素数之间可以有多远」。Astra 改进了一个 80 多年没有变化的界中项。

GPT-6 Astra 改进素数间隙至 186 的论文截图

科研的另一个变化,是推理能力开始与「计算机使用」合流。Astra 直接进入专业科学软件,检查测序质量、可视化遗传变异、跟踪细胞运动。它既给出判断,也完成数据探索所需的具体操作。

Multiqc 生物信息分析报告截图

GPT-6 Astra 追踪细胞运动 Jupyter Notebook 界面

OpenAI 首个「Critical」级模型

GPT-6 Astra 这次没有直接放出来,与它强大的 网络安全 能力有非常紧密的联系。

按照 OpenAI 的 Preparedness Framework,Astra 已经达到网络安全的「Critical」阈值。这是 OpenAI 史上第一个被正式判定达到 Critical 网络安全能力的模型。

Critical 意味着,模型能在基本无人协助的情况下,自己找出加固过的系统里的未知漏洞,并写出能用的利用代码。内部测试中,OpenAI 甚至发现了两个此前未知的 day0 漏洞,因此最强的网络安全能力暂时不会完全开放。

目前 Astra 先向 Daybreak Access 少量机构开放,ChatGPT Plus、Pro、Business、Enterprise 和 API 用户将在未来几天可用。

十万块 GPU 训练,AI 递归自我改进

最值得看的,是 GPT-6 Astra 训练背后的豪华配置。GPT-6 Astra 这头巨兽已经强到没有任何对手,正是因为 OpenAI 为它动用了迄今规模最大的训练任务,在得州「星际之门」超算使用超 10 万块 GPU。

OpenAI Astra 使用超 10 万块 GPU 训练说明

而且,这一次的训练方式也有所不同。OpenAI 训练副总 Aidan Clark 透露,这是 OpenAI 首款由此前模型在训练监督(Training Supervision)中发挥重要作用的前沿模型。

到 Astra 训练后期,系统可以自主连续运行大半天;即便出现问题,AI 往往几秒后就能让训练继续推进。这也是 OpenAI 史上第一次,AI 开始参与维护训练 AI 的系统。

这一刻,可以称之为「递归式自我改进」(RSI)的雏形。一旦这条链路继续扩大,模型迭代速度的限制,就会从人类工程团队的工作时长,转向算力、实验设计和安全验证。如果这条路跑通,Astra 就不只是一座 AGI 里程碑。从它开始,OpenAI 将迈向 ASI 的真正拐点。

要认识到,Astra 根本不是终点,仅仅是个开端。毫不夸张地说,今天才是真正意义上 AI 诞生的第一天。大模型已经全面进入 RSI 竞争时代。

Matt Shumer:AI 新时代推文截图

就像《2001 太空漫游》里穿越星际之门降临的「星孩」,AGI 终于在人类的注视下破茧而出。图灵跨越半个多世纪的终极梦想,也在这一刻彻底成真。对这类模型动态与开发者工具的后续进展,云栈社区 会持续跟进讨论。

参考资料: https://x.com/OpenAI/status/2095595741528125780




上一篇:孩子第一台电脑装 Linux 还是 Windows?我更愿意让他从 Linux 入门
下一篇:Claude Mythos扫描281个开源项目:2.3万条漏洞线索超2.1万条无人复核
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-10 16:02 , Processed in 0.820124 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表