找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

5881

积分

0

好友

720

主题
发表于 4 天前 | 查看: 3| 回复: 0

GPT-6 Astra 来了

GPT-6 Astra 来了!感觉这像是带着漫天星辰而来~~ 哈哈

GPT-6 Astra 发布宣传图

当地时间9月3日,OpenAI 正式发布 GPT-6 Astra,并将其定义为“新一代智能”。Astra 在拉丁语中,意思是“星辰、群星”。ChatGPT 官方在发布前曾预告:“The stars are almost aligned(星星几乎排列好了)。”

OpenAI 称,Astra 是“当今世界智能水平最高、对齐表现最好的模型”!

OpenAI 总裁格雷格·布罗克曼(Greg Brockman)表示,人们未来或许会回头将这个时间、这个模型视为 AGI 到来的节点,并称:“欢迎进入 AGI 时代。”

OpenAI CEO 山姆·奥特曼(Sam Altman)发文表达期望,希望 Astra 能够开启“新一代的创业、科学发现与创造”,并认为 Astra 在电脑操作、专业工作、科学研究、编程、网络安全等诸多领域,都是“最强的模型”。

GPT-6 Astra 神经网络与数据可视化概念图

这是否就意味着,Astra 将在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域实现 AGI 的进一步突破。

GPT-6 Astra Coding 能力

我也算半个程序猿,比较看重这块。

编程能力仍然是 GPT-6 Astra 的重要卖点,也是很重要的战场。

OpenAI 称,Astra 是其迄今为止“最强的软件工程模型”。我记得上次说“迄今最强”,还是 Claude Code 才回来那会儿~

在 Terminal-Bench 4.0 中,Astra 拿到 57.7%,GPT-5.6 Sol 为 37.3%,Claude Fable 5.1 为 55.8%。

Terminal-Bench 4.0 基准测试结果

在 DeepSWE v1.1 中,Astra 达到 74.1%,GPT-5.6 Sol 为 72.7%;内部数据库迁移任务达到 63.9%,相比 Sol 的 42.7% 提升明显。

DeepSWE v1.1 基准测试对比图

在 FrontierCode 1.1 Extended 中,Astra 为 64.5%,GPT-5.6 Sol 为 60.6%;在内部数据库迁移任务中,Astra 为 63.9%,GPT-5.6 Sol 为 42.7%。

FrontierMath Tier 4 v2 基准测试结果

OpenAI 此次还改进了 Astra 处理超长编程任务的方式。

在过去的长时间编码任务中,当上下文窗口被占满时,模型通常需要对此前的工作进行压缩总结。这样做虽然可以继续工作,但一些细节可能在压缩过程中丢失。

Astra 在 Codex 中引入了新的上下文保存机制,可以跨上下文窗口保留之前的笔记,并在之后检索此前的需求、测试结果以及工具输出。

GPT-6 Astra 的编程能力强是很强的,是不是如官方说的那样呢?我们大家还是多实践下,毕竟刚出的 Claude Fable 5.1 也是蛮 6 的~

GPT-6 Astra 其他性能

在电脑操作方面,Astra 可以自主填写网络表单、更新 CRM 客户记录、整理日历,也可以进行网络搜索、在邮件或文档编辑器中撰写总结。

Astra 还可以分析科学数据、生成图表、创建网站等。对于软件开发任务,Astra 可以自主安装和测试软件,并根据屏幕上出现的问题进行排查,运行前端质量测试

与传统聊天机器人不同,用户可以向 Astra 直接给出一个目标。例如,“帮我整理一份财务分析并做成演示文稿”,或者“开发一个游戏原型并测试它是否能正常运行”。模型自己拆解任务、调用不同工具、持续执行,再把最终结果交付出来。

在 OSWorld 2.0 测试中,模拟真人操作电脑。上一代 GPT-5.6 Sol 一个任务平均要 75 分钟,Astra 仅 40 分钟,分数还从 65.7% 涨到 72.6%,性能更高。OpenAI 据此称Astra 完成任务所需时间比 GPT-5.6 约减少 47%

OSWorld 2.0 离线场景基准测试

在 Mind2Web 测试中,结合更新后的 Codex harness 后,Astra 的任务完成速度达到当前 GPT-5.6 Sol 体验的 1.9 倍

Agents’ Last Exam 测试中,Astra 的Agent基准得分显著高于前代的 GPT-5.6。测真实软件里的专业任务,从财务建模到工程制图,Astra 得分 59.3%,赶超 Claude Opus 5(55.5%)和 GPT-5.6 Sol(53.6%)。在最高分设置下,它使用的输出 Token 还比 Opus 5 少约 65%。

Agents Last Exam 基准测试对比

OpenAI 公布的 Professional 评测中,Astra 在 AutomationBench 取得 41.4%,GPT-5.6 Sol 为 18.1%;差距尤其明显。

AutomationBench 自动化任务评测结果

在 BenchCAD 中分别为 95.9% 和 83.3%;在 BrowseComp 中分别为 91.5% 和 90.4%。

BenchCAD Python 工具模型对比

这些指标分别覆盖自动化任务、计算机辅助设计以及网络信息检索等不同工作场景。这表明 Astra 正在被用于更加接近真实生产流程的任务。

科学研究也是此次 GPT-6 升级的重要方向。OpenAI 称,Astra 已经帮助解决一些长期存在的数学开放问题,并公布了关于质数间隔的新结果。

OpenAI 称,Astra 在数学和科学领域取得新的纪录。在 FrontierMath Tier 4(v2)中,Astra 得分 97.6%。

BenchCAD Python 工具 OpenAI 结果展示

在 ARC-AGI-3 中,OpenAI 给出的成绩为 99.9%;在 GPQA Diamond 中为 96.0%。

ARC-AGI-3 模型得分柱状图

GPQA Diamond 准确率与成本对比

在科学和健康相关评测中,Astra 在 GeneBench Pro 中取得 37.8%,MedChemBench 为 49.3%,LifeSciBench 为 60.3%,HealthBench Professional 为 63.4%。

OpenAI 还强调,Astra 可以将科学推理和电脑操作结合起来,直接进入专业软件检查数据、探索结果,帮助研究人员分析证据,并决定下一步值得研究什么。

奥特曼在接受外媒采访时表示,Astra 在主观体验上与此前任何模型都非常不同,这是第一个让他觉得可以放心让用户直接“试一试”的模型。

用户可以让 Astra 构建复杂互动软件、开发电脑游戏、进行 DIY 电子工程、运行科学模拟,甚至制作财务模型并同步生成 PPT 演示文稿。

OpenAI 表示,Astra 将复杂推理与多步骤工作流结合起来,可以直接生成和处理与任务相关的信息。

写在最后

前两天,Anthropic 才宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1 模型,号称这两款模型为“全球最先进的编程与知识工作模型”。

现在,OpenAI 发布 GPT-6 Astra,被称做是“当今世界智能水平最高、对齐表现最好的模型”!

大家仔细对比下,Claude 和 GPT 的竞争非常激烈,发布新模型的时机上也是很有意思!!!新模型发布前后脚按着来,就怕用户不知道去对比新出的模型似的~~

究竟是 Claude Fable 5.1 独领风骚,还是 GPT-6 Astra 更胜一筹呢?欢迎大家自行测试,这里的云栈社区也有不少技术同好在讨论,欢迎把你的评价留在评论区吧!




上一篇:GPT-6 Astra与AGI之争:技术突破亮眼,通用智能仍远
下一篇:Agent 发布如何避免用户报错?从版本混跑到可恢复体验的落地拆解
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-10 16:02 , Processed in 1.384039 second(s), 42 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表