找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4573

积分

0

好友

593

主题
发表于 4 小时前 | 查看: 6| 回复: 0

GPT-6 Astra 正式亮相:从“回答问题”到“完成工作”

9月4日,OpenAI 新一代旗舰模型 GPT-6 Astra 正式亮相。官方将它定义为“目前全球最智能、且对齐程度最高的模型”。

GPT-6 Astra 最核心的变化,是不再满足于生成一段文字或代码,而是朝“直接完成工作”迈出了一大步。

给它一个目标,比如“整理一份财务分析并做成演示文稿”,或者“开发一个游戏原型并测试能否正常运行”,Astra 会自主拆解任务、调用工具、持续执行,最终交付可直接使用的文档、表格、演示文稿、网站,甚至完整的工程项目。

具体来说,它既能自主填写网络表单、更新 CRM 客户记录、整理日历,也能完成网络搜索和邮件总结;更进一步,它还能分析科学数据、生成图表、搭建网站,甚至自主安装测试软件,并根据屏幕上出现的问题排查故障。

多项测试逼近满分

  • 高阶数学(FrontierMath Tier 4):97.6%,较 GPT-5.6 Sol 的 83% 大幅提升,据称还协助解决了数学领域的一个长期开放性问题。
  • 抽象推理(ARC-AGI-3):99.9%,接近满分。而上一代 GPT-5.6 Sol 在这项被称为“AGI 终极考卷”的测试中只拿到 7.8%。
  • 网络安全(ExploitBench):100% 满分,Astra 也是首个跨过 OpenAI 内部“关键级”网络安全能力门槛的模型。

此外,在编程测试 Terminal-Bench 4.0 上,Astra 拿下 57.7%,远超 GPT-5.6 Sol 的 37.3%;科学问答 GPQA Diamond 也达到 96%。

更快完成任务

能力提升的同时,效率也在提升。OSWorld 2.0 测试中,Astra 得分 72.6%(GPT-5.6 Sol 为 65.7%),完成单项任务的平均耗时从约 75 分钟降至 40 分钟,减少近 47%。

实际案例更能体现这种变化:法律科技公司 Legora 用 Astra 做财务报表审阅,几分钟内审阅 41 份文件并发现 4 处人为埋设的错误,效率提升约 40%;游戏公司 Playco 将其用于原型开发,人工修复工作量减少 50%。

从“回答问题”到“完成工作”,从 7.8% 到 99.9%——GPT-6 Astra 的发布,是 AI 发展史上一个值得记录的节点。至于“AGI 时代是否已经到来”,或许见仁见智,但一个能自主操作电脑、拆解复杂任务、多项测试逼近满分的模型,已经真实地摆在了所有人面前。

布罗克曼的态度则更直接:“我认为,现在说我们已经进入 AGI 时代,并不是一种不合理的看法。”




上一篇:VMware Workstation与Fusion曝虚拟机逃逸漏洞,攻击者可直接执行宿主机代码
下一篇:AI Native 研发流程解析:从 Anthropic AI-Native SDLC 到可落地的 Agent 工作流
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-6 08:41 , Processed in 0.798746 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表