Fable 5.1 刚刚登上模型榜单前列,OpenAI 的新一轮发布已经进入倒计时。

Sam Altman 近日透露,OpenAI 下一款模型将在不久后推出。代号为 Astra 的模型已经完成训练,在能力和安全对齐方面均有明显提升。不过,团队仍在处理发布前的安全问题,并为此留出了更多测试时间。

Altman 坦言,面对能力快速提升的 AI,“没有人完全理解”它可能产生的影响。OpenAI 团队对此既期待,又保持着明显的谨慎。
目前,Astra 是否会以 GPT-6 的名称发布,官方尚未确认。产品名称、发布时间、参数规模、上下文长度、多模态能力和价格等信息也没有公开。但从现有评测和产品定位看,它将成为 OpenAI 下一阶段的旗舰模型,并与 Fable 5.1 等前沿模型展开竞争。
网络安全能力首次触及 Critical
Astra 尚未正式亮相,OpenAI 先更新了它的安全评估结果。
按照 OpenAI《Preparedness Framework》的划分,Astra 在网络安全领域被评为“Critical”,即关键级能力。这是 OpenAI 首次将旗下模型列入这一等级。

该评级只针对网络安全专项,不能直接用来判断模型是否达到 AGI,也无法代表它在其他任务中的综合水平。
在 OpenAI 的评估标准中,达到 Critical 级别的模型能够发现未知漏洞,并针对经过加固的系统开发可用的零日攻击。在获得相应工具和权限后,模型不需要人类逐步指导,仅凭一个概括性的目标,便可以自行分析环境、规划步骤并尝试组合攻击路径。
公开基准 ExploitBench 主要用于测试模型能否针对已披露漏洞编写出真正可用的攻击代码。Astra 完成了其中的全部任务。
不过,公开题库可能被模型的训练数据覆盖,满分只能说明 Astra 解决了这套已知测试,不能据此认定它可以攻破所有现实系统。为了降低数据污染带来的影响,OpenAI 又安排了一轮内部评估。
这套内部测试收录了 20 个在 2026 年 6 月至 8 月披露的高危 V8 漏洞。Astra 在任意代码执行任务上的表现明显超过 GPT-5.6 Sol,完成任务所需的输出 Token 也大幅减少。
OpenAI 安全工程人员 Fouad Matin 表示,Astra 在攻击能力和 Token 效率上均领先于 GPT-5.6 Sol,但官方暂未公布具体的成功率和 Token 数据。
评估期间,Astra 还找到了两个此前未被发现的零日漏洞,并将它们组合成一条完整的攻击链。

随后,研究人员把模型放入受控的浏览器和操作系统环境。在浏览器测试中,Astra 从一个 HTML 文件入手,成功构造攻击链、逃离沙箱并在宿主机上执行命令;在操作系统测试中,它发现并串联多个漏洞,将自身权限从普通用户提升至 root。
上述结果均来自受控实验,而且测试中的 Astra 拥有 Daybreak Blue 提供的高级权限和工具。未来面向普通用户的产品版本,不会默认获得相同的操作条件。
攻击能力提升,防线也在收紧
会发现漏洞、编写利用代码,并不代表模型会对所有相关请求照单全收。
OpenAI 公布的网络安全越狱测试显示,Astra 对违规请求的拒绝率达到 91.5%,GPT-5.6 Sol 的拒绝率为 59%。OpenAI 因此将 Astra 称为公司目前“对齐程度最高的模型”。
这项改进来自预训练阶段的安全干预,以及强化学习过程中更加谨慎和一致的评分标准。模型在网络安全任务上获得了更强的执行能力,同时对请求目的和授权范围表现出更高的敏感度。
安全团队还参考此前发生的 Hugging Face 攻击事件设计了一组“蜜罐”测试。当模型遇到难度较高或无法完成的任务时,测试环境会故意留下可供绕过正常流程的捷径。
在没有部署生产级防护的模拟环境中,GPT-5.6 Sol 有 56% 的测试会尝试接触这些目标,Astra 则没有出现同类行为。即使正常操作被自动审查机制拒绝,Astra 也没有继续尝试绕过限制,而是通过合规方式完成了部分任务。

这些数据来自特定的实验环境,无法覆盖真实部署中的全部情况。为应对模型上线后的复杂风险,OpenAI 还准备了多层防护,包括模型拒绝机制、系统分类器、跨会话监控和离线检测。
被系统判断为高风险的账户将面对更加严格的使用边界。监控机制也会结合多个会话的行为,识别单次请求中难以察觉的潜在滥用。
此前发现的越狱手段会被纳入回归测试,新发现的问题则进入全天候响应流程。安全团队既要防止恶意用户利用 Astra 实施攻击,也要监控模型在自主运行过程中是否出现未经授权的操作。
虽然此前针对 Hugging Face 的攻击与 Astra 本身无关,OpenAI 仍一度暂停训练约两周,对训练环境隔离、网络访问控制、行为监测和安全对齐标准进行加固。Astra 的发布进度也受到安全评估影响。
循环深度或成能力提升关键
除安全评估外,Astra 采用的底层技术也受到关注。
据 The Information 援引知情人士的说法,Astra 可能引入了一项名为“循环深度”的技术,也被称为“循环 Transformer”。OpenAI 尚未对这一消息作出回应,因此目前仍属于未经官方证实的信息。
传统 Transformer 生成下一个 Token 时,信息会依次经过固定数量的网络层。循环 Transformer 则允许同一份信息多次通过相同的网络层,在输出结果前对当前问题进行多轮内部处理。
通俗来说,就是让同一组神经网络针对一个问题多思考几次,再生成答案。
这种设计可以提高每个 Token 获得的内部计算量,同时不必按照相同比例扩大模型参数。较小规模的模型由此可能获得接近大型模型的能力,并减少部分内存和带宽压力。
OpenAI 提到的“减少输出 Token”,指模型完成任务时生成的文字更少;循环深度增加的是每个 Token 在模型内部经历的计算。两者属于不同环节,最终能否降低推理成本和延迟,还要结合模型规模、循环次数及部署方式判断。
循环次数增加,也会带来新的安全监控难题。
目前,研究人员可以通过模型输出的部分推理内容,观察它是否存在欺骗、越权或绕过规则的倾向。如果更多分析过程停留在不可直接读取的内部数值状态中,人类能够检查的推理线索可能随之减少。
报道显示,OpenAI 对 Astra 使用循环深度的范围进行了限制。模型仍会生成可供检查的推理过程,研究人员认为现阶段能够对其进行有效监控。
Astra 正式上线时还将配备额外的推理监测机制,并结合模型行为和工具调用记录判断其是否偏离任务。单独查看可读的思维过程,无法覆盖模型全部的内部判断。
首批用户或面临更多限制
OpenAI 计划在 Astra 上线初期采取相对严格的开放策略,待安全机制和误报情况逐步稳定后,再扩大使用范围。
在 ChatGPT 或 Codex 中,部分高风险操作可能要求用户确认后才能继续。通过 API 运行的自动化任务一旦触发安全规则,则可能被直接终止。

模型最先进的网络安全能力将先向少量 Alpha 测试者开放,随后再通过 Daybreak Blue 向获得授权的防御人员扩大使用范围。普通用户接触到的版本预计会受到更严格的权限限制。
从 Fable 5.1 和 Astra 已经披露的信息看,前沿模型的竞争标准正在发生变化。榜单分数依然重要,但模型能否长时间执行任务、能够获得多大权限、需要多少 Token、配备哪些监控措施,以及向哪些用户开放,都会影响实际体验。
下一代模型已经具备发现零日漏洞、构造攻击链和调用工具执行任务的能力。厂商需要证明的,也不再只有模型能完成多少工作,还包括它能否在授权范围内稳定运行。
Astra 究竟会不会以 GPT-6 的名称出现,目前还没有答案。可以确认的是,OpenAI 的下一款旗舰模型距离发布已经越来越近,而安全评估正成为决定其何时上线、如何开放的重要环节。关于这类前沿 AI 安全议题,在云栈社区也有不少开发者持续关注和讨论。
参考来源:GPT-6 真的要来了,奥特曼:后果不敢想