从 9 月 3 号 GPT-6 发布至今已经接近一周,热度不仅没有消退,国内外讨论反而越来越多。考虑到今年大模型版本迭代如此密集,这确实是个相当积极的信号。
此前能拥有这么高热度的模型版本,大多带有跨时代意义,且几乎没有一个是今年的——ChatGPT、GPT-4、DeepSeek R1 都是如此。
当然,这种热度和 OpenAI 自身的内容策略密不可分。发布之后不断有新剧情放出,这篇文章就来复盘一下:OpenAI 到底靠什么把讨论热度维持了一整周。
多说一句,虽然不少方面仍有争议,但市场共识是 computer use = more CPU,这一点我们此前也专门讨论过:
GPT-6 最核心的特点和最利好的板块
先讲安全,再讲能力
9 月 2 日,OpenAI 在 X 上放出 Astra 的安全预览,重点强调这是 Preparedness Framework 体系下,首个触及 Critical 网络安全能力阈值的模型。这条动态最终收获了约 317 万次浏览。

从传播的角度看,这条预告提前给 Astra 贴上一个标签——它不仅更强,而且强到了需要全新安全防护的程度。安全限制、内部隔离、分阶段开放,这些原本琐碎的工程细节,反而成了整个发布叙事的组成部分。
双重效果由此产生。一方面,Critical 评级拔高了外界对模型能力的想象空间;另一方面,它也顺理成章地解释了为什么 Astra 不会像普通功能更新那样立刻对所有人开放。安全声明未必是刻意制造稀缺,但它客观上给后续的等待提供了一个合理的解释。
继续预热:展示“它能做什么”
9 月 3 日,OpenAI 又发布了一条 12 秒短片,播放量超过 1,100 万。随后 “Put That There” 等电脑操作演示也陆续放出。

这类内容和基准测试的传播思路完全不同。ARC-AGI 或 FrontierMath 这类榜单,读者得先弄懂测试方法才能理解分数含义;而电脑操作几秒钟就能看明白。看到模型能操作界面、理解空间关系、完成任务,用户立刻就有了直观印象。
正因如此,OpenAI 没有把传播口径完全押在“比竞品高多少分”上,而是把 Astra 包装成一个能直接处理电脑任务的工作系统。模型的定位从“回答问题的工具”转向了“替用户完成事情的代理”。
这还给用户提供了模仿模板——你不必复述技术指标,只要展示 Astra 完成了什么就够了。
分阶段开放延长了发布周期
9 月 5 日,OpenAI 宣布 Astra 已经向 Pro、Enterprise 和 Business Premium 用户开放,同时说明 Plus 和部分 Business 用户还得再等几天。同一天官方又确认,ChatGPT 中的 GPT-6 Pro 由 Astra 驱动。
这直接让用户开始追着一串实际问题讨论:Astra 到底在哪个入口能用?不同套餐分别对应什么版本?API、Codex、ChatGPT Work 与普通聊天之间有何差别?
最早拿到权限的用户开始发体验,没开放的用户只能继续等,已经用上的人则讨论额度、速度和实际效果。不同人群在不同时间节点进入话题,发布周期自然被拉长了。
这背后可能同时受两类因素驱动:一是 OpenAI 有意让用户分批进入讨论场,二是 Astra 的计算成本、安全测试和部署条件确实不允许一次性全面铺开。可以确定的是,分阶段开放显著延长了讨论周期;至于是否主要为制造稀缺,现有公开证据还不足以给出结论。
争议也成为发布的一部分
同样是 9 月 5 日,OpenAI 出面解释所谓的 “wiki incident”,即智能体在多个互联网网站留下内容的问题,并提议建立更清晰的 misalignment incident 披露标准。这条帖子大约获得 148 万次浏览。
内容本身并没有直接吹 Astra 的性能,却把发布后的讨论从“模型到底有多强”引向了模型是否会越界、智能体该如何监控、公司又如何披露风险。
OpenAI 没有躲开争议,反而把它纳入了安全和治理的公开讨论。这么做能提升透明度,但也让更多用户意识到模型仍然存在边界。争议对热度的作用从来都是双向的:它确实拉长了讨论时间,可不一定能改善品牌在公众眼中的评价。
用户内容的传播
Astra 发布之后,X 上迅速涌现大量用户演示:让模型操作电脑下单、做游戏、搭交互式教材,甚至调用多个软件协调完成任务。
这些内容比官方跑分更容易扩散,因为它们自带具体场景。读者不需要理解模型是怎么训练的,只需要判断一件事:这个任务以前是不是得自己做?现在能不能交给模型?
用户演示还具备很强的可复制性。看到有人让 Astra 完成 PCB 设计,其他人自然会去测试自己的工作流;看到有人用它做小游戏,更多用户也会用同样的方式去试。官方给出能力方向,用户则贡献出海量变体。
但反作用也随之而来。印刷错误、代码质量问题、复杂任务失败,以及不同测试环境下的性能差异,同样会快速传播。用户基数越大,独立验证就越多,官方宣传被反向检验的概率也就越高。
纳维–斯托克斯事件制造第二个高潮
发布后的第六天,OpenAI 抛出一个重磅消息:一组智能体使用能力显著强于 GPT-6 Astra 的下一代内部模型,给出了纳维–斯托克斯千禧年问题的解决方案,整个过程调用约 1 万个协作智能体、耗时 88 小时。
这条主帖收获超过 5,000 万浏览、3 万次转发和 10 万次点赞,远远甩开官方账号同期大多数 Astra 更新。

单看传播效果,这无疑构成了第二波高潮。Astra 刚以旗舰模型的身份亮相,OpenAI 紧接着又展示了一个能力更强、还没有对外开放的内部系统。话题也随之从“新模型好不好用”升级成“AI 能不能参与科学发现”。
不过这条消息并非没有风险。证明是否真的成立,需要数学界和独立研究者进一步核验;而“下一代模型显著强于 Astra”的说法主要来自 OpenAI 自己。把科研成果塞进产品发布周期里传播,也容易让公众把还没经过同行验证的结果直接当成定论。
更稳妥的判断是:OpenAI 选择在 Astra 热度尚未退坡时公布此事,客观上把产品发布挂接到了一个更大的未来叙事上。
Tibo 的实时运营
除了官方账号,Codex 和 ChatGPT 负责人 Tibo Sottiaux 也在 X 上持续更新 Astra 的进展。他的角色和正式公告不同,更像一个实时解释产品状态的运营窗口。

他发的不少内容同样带有争议,但有争议就有流量:


热度最后要回到产品体验
综合来看,Astra 的热度来自多重因素叠加:发布前的安全预热、发布时的强能力定位、分阶段开放拉长的讨论周期、官方对争议的正面回应、大量用户演示与反向测评,以及几天后突如其来的科研叙事。
这套打法成功把单日发布延展成了一连串连续事件,但也把公司置于更高的验证压力之下。额度长期紧张,可能会让“供不应求”变成“交付不足”;数学成果一旦被质疑,科研叙事就可能反过来侵蚀产品可信度;如果用户实测持续低于官方演示,UGC 网络也很容易从传播渠道变成打假阵地。

GPT-6 的热度能走到哪一步,最终还是要回到产品体验上来。类似 云栈社区 这样的开发者社区,最近关于 Astra 实际能力与额度的讨论也相当活跃——热度褪去之后,真实口碑才是决定这波叙事能否持续的关键。