找回密码
立即注册
搜索
发回帖 发新帖

5285

积分

0

好友

681

主题
发表于 2 小时前 | 查看: 6| 回复: 0

APPSO 灵感指南 AI 时代

就在 Argon 还没向大多数人敞开大门的时候,Business Insider 的记者已经挖到了更新的东西。

据报道,Google 内部员工正在 Jetski(内部编程平台 Antigravity 的另一个称呼)上测试一个名为 Carbon 的 Gemini 4 新检查点(checkpoint),信源包括多份内部文件和截图。有员工在测试后的感受很直接:Carbon 的编程体验「感觉像是 Opus 5.5」。

Business Insider 独家报道 Google 新 AI 模型

Claude Opus 5.5 是目前第一梯队的编程模型,尤其擅长大型项目开发、复杂代码修改、Bug 排查和长时间自主编程,部分测试成绩甚至超过了 Fable 5.1。

AI 模型实力对比漫画 Fable 5.5 与 Claude 及 Gemini

与此同时,Antigravity 近期还披露了一个此前代号为「Concierge」的功能,现已更名为「Chief of Staff」——一个具备自主任务委派能力的 agent 系统。围绕这套 agent 开发 方向,Google 显然不止想做聊天助手,而是在尝试让模型自己去调度任务。

上一代还没用上,新一代已经进了视野

十天前,Google 发布了 Argon,定位是处理持续时间更长、步骤更复杂的工作,包括软件工程、法律与金融领域的知识任务,以及网络安全防御。

Gemini 4 Argon 标志

Argon 已经通过 Fairwind Program 向经过筛选的安全合作伙伴开放。面向更广泛开发者和消费者的发布则采取分阶段方式。Google 表示,付费 API 客户和 Google AI Ultra 订阅者会是后续开放的优先人群,但没有给出确切日期。

Google 对外解释了这个节奏背后的考虑:一个具备较强漏洞发现、验证和修复能力的模型,同样可能增加滥用风险,公司需要在安全测试、外部评估和防护机制之间留出缓冲期。

不过从现在的情况看,Argon 的开放时间可能就在这几天。

Logan Kilpatrick 推文确认 Argon 即将到来

长期跟踪应用更新的 TestingCatalog 发现,Antigravity 的测试版本里已经出现了 Gemini 4 Argon 的选择入口,以及 256K、512K、900K 等上下文配置。后两档被标注为消耗更多使用额度,约为普通配置的 1.3 倍和 1.8 倍。

Antigravity 界面中的 Gemini 4 Argon 与上下文长度选项

10 月 9 日前后,《Business Insider》记者 Hugh Langley 报道,Google 员工近来在名为 Jetski 的内部编程环境中试用新的 Gemini 4 检查点。内部文件出现了 Argon、Barium、Carbon 等多个代号,其中被选作公开版 Argon 的,实际是一个叫作 Barium-B 的内部版本。

Carbon 可能是 Argon 的后续更新,也可能在 Gemini 4 家族里以另一种身份出现,甚至有可能始终留在内部。报道中有内部员工说,Carbon 的编程表现让他想起 Opus 5.5。早期 Argon 虽然总体受到内部欢迎,仍有测试者觉得它在某些编码任务上落后于 Claude Opus 5。

据官方基准数据,Argon 在综合智能指数与知识工作榜单中名列前茅,幻觉率大幅降低,在部分网络安全与推理测试上超越了主要竞争对手。但它在 FrontierSWE v2、Terminal-bench 等几个编程评测项目上仍落后于领先者。

随着 Carbon 曝光,我们也隐约摸到了 Google 给新模型命名的规律。

网友吐槽 Google Gemini 命名规则混乱

Argon 是元素周期表中的第 18 号元素,一种无色无味的惰性气体,化学性质几乎不与任何物质反应。Barium 是第 56 号碱土金属,Carbon 是第 6 号,几乎一切有机生命的基础。

据此推断,下一个检查点的代号很可能是 Dysprosium,元素符号 Dy,原子序数 66,一种镧系金属。它的名字来源于希腊语「难以得到」——发现者当年花了 30 次尝试,才最终将它从混合矿物中分离出来。

Google 在用自己的模型设计和调试下一代模型?

Argon 9 月底刚刚公布,十月上旬又有内部新版本的消息。我们还无法判断这些检查点之间相隔多少训练周期,更无法推断 Carbon 必然采用了全新架构。

即便如此,Google 一边准备公开发布、一边推进内部升级的状态,仍然让我们好奇:模型进步本身,是不是正在反过来改变模型自己的开发方式?

Vedant Misra 推文引用 Business Insider 关于 Carbon 的报道

路透社 8 月在谈及 Google 人事与研发调整时曾提到,联合创始人 Sergey Brin 对递归自我改进有着浓厚兴趣,并推动资源向相关方向倾斜。

Business Insider 报道 Brin 推动递归自我改进方向

到了 9 月,Google 研究人员公开了论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》。

论文的核心论点是,递归自我改进不必发生在基础模型训练层面,而可以在 Agent 系统层面实现。在冻结基础模型的前提下,通过迭代优化 prompt 设计、控制流、工具选用、记忆机制和上下文管理策略,系统可以持续提升在具体任务上的表现。

Google Research RRSI 论文摘要

有人据此猜测,Google 正在用自己的模型来设计和调试下一代模型。如果 Google 的模型真的已经在某种程度上加速自身迭代,那就能解释为什么从 Argon 宣布到 Carbon 内测泄露,前后不过十天。

说回 Carbon 的下一步。Google 可能选择在 Argon 公测后悄然替换内部检查点,让用户感受到持续改善;也可能把它整理成更明确的 Gemini 4 版本,单独发布性能、价格与安全说明。如果公开测试发现它的收益不足以抵消推理成本或风险,它也可能停留在实验阶段。

对于 Google 而言,Carbon 即使最终没有成为商品,也可能是一个有价值的中间结果。

Jimmy Apples 推文称 Google 员工认为 RSI 是当前进展关键

Gemini 3 的推出让 Google 一度追上了前沿,但结构性问题的惯性很快又让进展放缓。这个起伏在过去一两年里已经重复了不止一次。

前沿模型的竞争,越来越难靠单次发布来概括。「最强」这个定语在这个行业里的保鲜期,也越来越短。




上一篇:MiniMax-H3 视频生成加速:A100 上 SGLang 6 步 24 秒与 SeedVR2 高清流程
下一篇:AI黑话鉴赏:Claude、Fable说穴居语,还有说人话的模型吗
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-11 11:27 , Processed in 0.064087 second(s), 40 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表