
就在 Argon 还没向大多数人敞开大门的时候,Business Insider 的记者已经挖到了更新的东西。
据报道,Google 内部员工正在 Jetski(内部编程平台 Antigravity 的另一个称呼)上测试一个名为 Carbon 的 Gemini 4 新检查点(checkpoint),信源包括多份内部文件和截图。有员工在测试后的感受很直接:Carbon 的编程体验「感觉像是 Opus 5.5」。

Claude Opus 5.5 是目前第一梯队的编程模型,尤其擅长大型项目开发、复杂代码修改、Bug 排查和长时间自主编程,部分测试成绩甚至超过了 Fable 5.1。

与此同时,Antigravity 近期还披露了一个此前代号为「Concierge」的功能,现已更名为「Chief of Staff」——一个具备自主任务委派能力的 agent 系统。围绕这套 agent 开发 方向,Google 显然不止想做聊天助手,而是在尝试让模型自己去调度任务。
上一代还没用上,新一代已经进了视野
十天前,Google 发布了 Argon,定位是处理持续时间更长、步骤更复杂的工作,包括软件工程、法律与金融领域的知识任务,以及网络安全防御。

Argon 已经通过 Fairwind Program 向经过筛选的安全合作伙伴开放。面向更广泛开发者和消费者的发布则采取分阶段方式。Google 表示,付费 API 客户和 Google AI Ultra 订阅者会是后续开放的优先人群,但没有给出确切日期。
Google 对外解释了这个节奏背后的考虑:一个具备较强漏洞发现、验证和修复能力的模型,同样可能增加滥用风险,公司需要在安全测试、外部评估和防护机制之间留出缓冲期。
不过从现在的情况看,Argon 的开放时间可能就在这几天。

长期跟踪应用更新的 TestingCatalog 发现,Antigravity 的测试版本里已经出现了 Gemini 4 Argon 的选择入口,以及 256K、512K、900K 等上下文配置。后两档被标注为消耗更多使用额度,约为普通配置的 1.3 倍和 1.8 倍。

10 月 9 日前后,《Business Insider》记者 Hugh Langley 报道,Google 员工近来在名为 Jetski 的内部编程环境中试用新的 Gemini 4 检查点。内部文件出现了 Argon、Barium、Carbon 等多个代号,其中被选作公开版 Argon 的,实际是一个叫作 Barium-B 的内部版本。
Carbon 可能是 Argon 的后续更新,也可能在 Gemini 4 家族里以另一种身份出现,甚至有可能始终留在内部。报道中有内部员工说,Carbon 的编程表现让他想起 Opus 5.5。早期 Argon 虽然总体受到内部欢迎,仍有测试者觉得它在某些编码任务上落后于 Claude Opus 5。
据官方基准数据,Argon 在综合智能指数与知识工作榜单中名列前茅,幻觉率大幅降低,在部分网络安全与推理测试上超越了主要竞争对手。但它在 FrontierSWE v2、Terminal-bench 等几个编程评测项目上仍落后于领先者。
随着 Carbon 曝光,我们也隐约摸到了 Google 给新模型命名的规律。

Argon 是元素周期表中的第 18 号元素,一种无色无味的惰性气体,化学性质几乎不与任何物质反应。Barium 是第 56 号碱土金属,Carbon 是第 6 号,几乎一切有机生命的基础。
据此推断,下一个检查点的代号很可能是 Dysprosium,元素符号 Dy,原子序数 66,一种镧系金属。它的名字来源于希腊语「难以得到」——发现者当年花了 30 次尝试,才最终将它从混合矿物中分离出来。
Google 在用自己的模型设计和调试下一代模型?
Argon 9 月底刚刚公布,十月上旬又有内部新版本的消息。我们还无法判断这些检查点之间相隔多少训练周期,更无法推断 Carbon 必然采用了全新架构。
即便如此,Google 一边准备公开发布、一边推进内部升级的状态,仍然让我们好奇:模型进步本身,是不是正在反过来改变模型自己的开发方式?

路透社 8 月在谈及 Google 人事与研发调整时曾提到,联合创始人 Sergey Brin 对递归自我改进有着浓厚兴趣,并推动资源向相关方向倾斜。

到了 9 月,Google 研究人员公开了论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》。
论文的核心论点是,递归自我改进不必发生在基础模型训练层面,而可以在 Agent 系统层面实现。在冻结基础模型的前提下,通过迭代优化 prompt 设计、控制流、工具选用、记忆机制和上下文管理策略,系统可以持续提升在具体任务上的表现。

有人据此猜测,Google 正在用自己的模型来设计和调试下一代模型。如果 Google 的模型真的已经在某种程度上加速自身迭代,那就能解释为什么从 Argon 宣布到 Carbon 内测泄露,前后不过十天。
说回 Carbon 的下一步。Google 可能选择在 Argon 公测后悄然替换内部检查点,让用户感受到持续改善;也可能把它整理成更明确的 Gemini 4 版本,单独发布性能、价格与安全说明。如果公开测试发现它的收益不足以抵消推理成本或风险,它也可能停留在实验阶段。
对于 Google 而言,Carbon 即使最终没有成为商品,也可能是一个有价值的中间结果。

Gemini 3 的推出让 Google 一度追上了前沿,但结构性问题的惯性很快又让进展放缓。这个起伏在过去一两年里已经重复了不止一次。
前沿模型的竞争,越来越难靠单次发布来概括。「最强」这个定语在这个行业里的保鲜期,也越来越短。