Google 已正式发布新一代前沿 AI 模型 Gemini 4 Argon,并通过 Fairwind 项目向一批可信网络防御者分阶段开放。按照官方说法,该模型可以在无人工协助的情况下自主定位、验证并修复关键软件漏洞;后续 Google 还会向这些防御者以及内部团队提供移除网络安全护栏的版本。
开发者、企业以及普通消费者仍需等待后续开放。首批推送对象是付费 API 客户与 Google AI Ultra 订阅用户。Google 强调,这一能力等级的模型必须采用分阶段发布策略,才能有效控制风险;目前团队仍在根据早期测试者的反馈调整安全护栏,并已参与美国政府推出的模型预发布自愿接入流程。
在大范围开放前,Google 正在进一步加固安全防护机制,重点防止模型被滥用于网络攻击以及化学、生物、放射性、核等领域的恶意活动。目前,内部与外部 红队(即专门通过攻击系统查找弱点的团队)已经完成了相关防护测试。

Google 还部署了配套监控机制,可全程跟踪 Argon 的推理过程与操作行为,必要时能直接中止运行。
Part 01:输出上限提至百万 token
Google 把 Argon 的单次响应输出上限从 6.4 万 token 提升到了 100 万 token。官方表示,充足的输出空间可以支撑模型在单次运行中完成数十万 token 级别的思考与内容生成。
云安全公司 Wiz 正通过旗下 Scan for Good 项目使用 Argon,该项目主要面向关键公共基础设施,免费扫描高风险暴露面并协助修复相关问题。Google 称,Argon 在一款全球医院广泛使用的医疗软件中发现了一处会泄露敏感个人信息的关键漏洞,此前的前沿模型均未发现该漏洞。官方没有公开软件名称,也没有说明漏洞目前是否已修复。
这些 Argon Agent 已在 Google 全数据中心落地内存优化方案,累计释放超过 300 TiB 内存。它们还把 libgav1 视频解码器中的 3.2 万行 SIMD 代码替换为 Rust 代码——Rust 是专为避免内存错误而设计的编程语言。重写后的解码器视频输出效果与原版本完全一致,运行速度达到此前 Rust 移植版本的 2.7 倍。
其他 Agent 正在将 C 和 C++ 代码重写为 Rust 代码,涉及 Fuchsia Zircon 内核的 80 多万行代码。目前这些重写工作仍处于审核、仿真测试与评审阶段,尚未正式上线生产环境。
Part 02:多项基准测试排名居首
从 Google 公布的基准测试数据来看,Argon 在三类通用能力测试中表现突出:在长软件工程任务测试集 DeepSWE v1.1 上得分 77.9%,处于业界领先水平;在 Zapier AutomationBench 自动化测试中得分 51.3%,排名第一;在长视频测试集 LVBench 上得分 91.7%,同样居于业界领先位置。
在专门评估安全漏洞修复能力的 CWE-bench v1 测试中,Argon 得分 68%,与其他模型并列第一。
漏洞挖掘相关的测试结果来自 Google 内部,测试覆盖了 20 种编程语言编写的复杂代码库。
云安全公司 Wiz 还开展了一项黑盒渗透测试,要求模型在完全无源代码的情况下,对真实运行的 Web 系统进行探测。结果显示,Argon 在攻击面梳理、漏洞发现、生成概念验证证据三个环节的表现,均优于 3.8 Flash Cyber。
Part 03:Argon 公布上线定价方案
Argon 上线初期将执行优惠定价:每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元;缓存输入 token 的价格比普通输入 token 低 95%。
优惠期结束后,价格将翻倍至每百万输入 token 4 美元、每百万输出 token 20 美元。
参考来源: Google says Gemini 4 Argon can find and patch critical software flaws