找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖
Claude、GPT 海外模型 API 接入Claude skills 从入门到精通 吴恩达亲授 AI Agent 核心技能2026 瞪哥公务员考试全攻略 行测申论一站式系统备考
Agent 文心智能蒸馏模型实战 90G 课程智泊 AI 大模型训练营 基于 LangChain 的 RAG 与提示工程实战构建企业级 AI 大脑:大模型微调与 RAG / Agent 全栈实战

6115

积分

0

好友

775

主题
发表于 前天 01:50 | 查看: 0| 回复: 0

蛙池AI不间断渗透Agent挑战宣传海报

9月7日上午10点,“赛博司机计划:100小时不间断Agent渗透测试挑战”在斗象科技旗下漏洞盒子平台及众多白帽社群同步开播。

此后整整100小时,国内主流的白帽客户端“蛙池AI Desktop”搭载长程任务专用框架Sonic Harness,在高难度渗透评测靶场 VulnHouse 上持续作战。从读取任务、分析目标环境、调用工具、构造利用方案,到提交攻击证据,核心渗透过程全部由 Agent 自主推进。

4天4夜之后,首次 Agent 自主渗透直播的最终战报定格如下:

100小时Agent自主渗透挑战RECAP数据总结

从基础 Web 题型,到真实 CVE 复现,再到复杂攻击链、白盒源码审计和内存安全 PoC 构造,AI Agent 在这100小时内走完了从“标准路径”到“自主破局”的多轮检验。

靶场底座:VulnHouse如何评测Agent自主渗透

连续100小时不间断给 Agent 供题、阅卷、记录,对渗透评测靶场本身就是一场工程压力测试。VulnHouse 正是以系统化能力,稳住了这场长时程评测的节奏。

(一)VulnHouse定位:对标国际前沿Benchmark,为AI量身打造的训练场

在 AI 漏洞挖掘领域,伯克利大学发布的 CyberGym、斯坦福人工智能实验室发布的 BountyBench、伊利诺伊大学香槟分校的 CVE-Bench 等前沿 Benchmark,已经提供了具有代表性的标准化测试基准。

以 CyberGym 为例,它主要从 Google OSS-Fuzz 历史漏洞中取材,把真实漏洞封装成统一实例,重点考察 Agent 分析源码和构造 PoC 的能力,并通过差分崩溃判定结果。

VulnHouse 与 CyberGym 有共同的基础:两者都使用真实漏洞环境,都要求 Agent 完成“分析—验证”全流程,也都通过环境结果对提交的答案做独立判定。区别主要体现在平台目标和使用方式上:

VulnHouse与CyberGym安全评测平台对比

CyberGym 提供的是统一公共标尺,适合比较不同系统在相同条件下的表现。VulnHouse 更强调训练过程的可配置性,团队可以根据 Agent 的能力短板调整题目组合、提示等级和验证方式,再借助每次运行留下的数据寻找后续优化方向。

打个比方:CyberGym 接近统一命题、统一判卷的标准化考试;VulnHouse 则是一座长期开放的 Agent 训练与测评中心,既能组织规模化测试,也能按训练目标调整题目,并完整记录每次执行过程。

这正是100小时直播选用高难度评测靶场 VulnHouse 的核心原因。长程 Agent 评测需要的远不止一套题目,还要有能够持续供题、部署环境、独立验真和记录全过程的基础设施。VulnHouse 承担的,正是这部分训练与验证工作。出题、编排、执行、验证、观测、复盘,这三项能力共同构成训练闭环。VulnHouse 既看最终成绩,也记录成绩产生的全过程——包括 Agent 用了哪些方法、在哪些环节调整策略,以及不同版本的能力变化。

(二)渗透评测体系:多类型覆盖,三级难度,数百道题

截至目前,VulnHouse 已上架数百道题目,涵盖两大主要方向:

VulnHouse题目分类:Web应用与二进制利用

难度分布上,VulnHouse 的题目分为简单、中等、困难三个等级,整体呈现“中间厚两头薄”的橄榄型分布。这主要源于真实漏洞在利用条件、攻击路径和环境依赖上的复杂度差异。

平台上有两类风格截然不同的靶机:

  • 黑盒 Web 渗透题:经典 CTF 风格,如 SQL 注入绕过、XSS 跨站系列、SSRF 多容器联动、JWT 算法篡改、PHP 反序列化、SSTI 模板注入等。这类题目通常以 Flag 捕获作为验证策略。

  • 白盒内存安全审计题:来源于真实开源项目的安全审计,覆盖 libxml2、Wireshark、ImageMagick、OpenCV、PHP、cURL、HarfBuzz、nDPI、llama.cpp 等数十个项目。Agent 需要分析源码、理解漏洞成因、构造 PoC 触发崩溃。这类题目以 PoC 崩溃为验证策略,部分采用双容器差分判定。

此外,题库中还包括 Apache Struts2、Spring Cloud Gateway、WebLogic、Shiro 和 JBoss 等知名组件的 CVE 复现任务,用来考察 Agent 对漏洞情报、目标版本和实际运行环境的综合判断能力。

(三)独立判分:四种验证策略与验证引擎

不同类型的漏洞,对“完成任务”的定义并不一样。读取敏感文件、执行系统命令、触发程序崩溃和改变业务状态,各自需要适合的判定方法。VulnHouse 为此设置了四种验证策略:

VulnHouse四种漏洞验证策略

Flag 捕获(flag_capture) 是最经典的 CTF 模式,用于 Web 渗透与信息读取类题目。平台在容器指定路径写入随机 Token,Agent 必须通过漏洞利用读出来并提交,支持精确、包含、正则三种匹配方式。

效果证明(effect_proof) 适用于需要在目标环境产生可观测变化的题目,由出题者定义一组检查命令与预期输出,验证时逐项比对实际环境变化。

PoC 崩溃(poc_crash) 是最接近 CyberGym 判定逻辑的策略,用于源码审计与内存安全题目。Agent 构造的输入必须让目标程序触发崩溃(由 ASan 等工具检测),并支持单容器检测与“vul 崩、fix 不崩”的双容器差分判定。

Oracle 校验(oracle) 则最灵活,由出题者提供自定义验证脚本、输出 JSON 判定结果,支持操作前后双阶段对比,主要处理业务逻辑与复杂攻击链类题目。

题目有没有做对,不由 Agent 自己说了算。VulnHouse 内置了一套完整的 Verification Engine(VE,验证引擎),负责全流程判定工作。每次判定都经过“证据采集—证据比对—裁决—证据链封装”四步流水线,并生成基于哈希的防篡改校验值持久化。对于 Flag 捕获类题目,返回给 Agent 的信息还会做脱敏处理,防止它通过验证接口反向套取答案。

Sonic Harness:蛙池AI Desktop为何装载这个Harness参赛

支撑本次长程任务挑战的,是蛙池 AI Desktop 装载的 Sonic Harness。

Sonic Harness长程任务架构

相比短时任务,长程执行更容易出现上下文膨胀、结果缺乏独立核验、进程中断后难以续跑等问题。Sonic 的思路,是把漫长的任务链拆成一个个可以交接、复核和恢复的任务回合,再通过 MEA(Manager/Executor/Auditor)三角循环架构,将规划、执行和审计交给三个彼此隔离的角色。

Manager 负责拆解目标和调整策略,Executor 每轮使用全新上下文执行任务,Auditor 则通过只读工具独立复核结果,避免 Agent“自己执行、自己证明”。与此同时,Harness 作为唯一的状态写入方,持续保存每一轮的任务合约、执行结果、证据和审计记录,让整个过程有据可查。

即使运行过程中出现接口异常、进程退出等情况,Sonic 也能从最近一次有效状态继续执行。相比依赖一段持续膨胀的超长会话,Sonic 通过一轮轮可复核、可追踪、可恢复的任务回合推进长程执行,更适合100小时这类持续运行场景,也为后续进入实际安全任务打下了基础。

完成本次100小时挑战后,Sonic Harness 将作为官方严选 Harness,于10月正式上架“蛙池AI-蛙伴市场”,面向广大白帽子开放使用。

战报总览:464题、233次验证通过、19340分

100小时Agent渗透挑战核心数据指标

先说口径:464 道是任务集总量,并非“应做尽做”的分母,其中 167 道在 100 小时窗口内未进入有效执行。因此更公允的两个数字是:对“实际跑完验证”的 297 道,通过率 78.5%;对全部 464 道任务,通过率 50.2%。后期题目逐步进入复杂攻击链、源码审计和内存安全验证,难度上升,阶段成功率与最终累计通过率不宜直接混用。

(一)100小时过程拆解:高位运行与难度爬升

挑战前 72 小时,Agent 完成 217 道题目的阶段统计,其中 197 道成功,累计成功率达到 90.8%。9月8日的高效推进阶段,Agent 每小时处理 5 至 6.25 道题,按此速度折算,峰值日处理量约为 120 至 150 道。

随着题目不断推进,Agent 面对的目标也在变化。前期任务更多集中在利用路径相对明确的 Web 漏洞和已知 CVE,后续逐渐进入复杂攻击链、源码审计和内存安全验证。前 72 小时的高成功率并非因为题目简单,而是 Agent 在标准路径明确、工具链匹配度高的任务上形成了稳定吞吐。

100小时Agent渗透挑战直播界面

直播完成画面

后 28 小时单体命中率的回落并不意外。它对应的正是 CyberGym 类评测中 Level 降低、信息减少后成功率自然下降的规律。题目越接近“真实世界的零信息发现”,对 Agent 的长程推理、环境适应与工具自制能力要求越高,这种落差本身就是一份关于“能力边界随难度移动”的量化样本。

(二)关键案例:54秒通关与33分钟自主破局

1. 最快通关:CWE-200信息泄露,54秒一次提交通过

CWE-200 信息泄露任务是本次挑战的最快通关纪录。从环境启动、任务分析、证据提交到验证通过,全程仅用 54 秒,且一次提交即通过。

这道题集中体现了 Agent 在“三要素高度匹配”时的速度优势:目标明确(进程列表信息直接暴露在 HTTP 响应中)、漏洞入口可直接访问(GET 请求即可触发信息泄露)、Flag 内容可见(读取 Flag 文件的命令行及其 stdout 内容被直接渲染到 HTML)。当这三者对齐时,“分析—执行—验证”可以在一分钟内形成闭环,几乎不需要试错。

54 秒这个数字的意义不在于“快”,而在于它标定了蛙池 AI 在“标准化可解题”上的吞吐上限。

Agent任务完成直播画面

Agent 任务完成画面

2. 复杂破局:标准路线受阻,Agent从本地环境找到突破口

如果说 CWE-200 展示的是“顺风局”,JBoss 反序列化任务展示的则是“逆风局”下 Agent 如何工作。

任务执行过程中,Agent 确认漏洞入口后发现环境中既没有 Java,也缺少生成序列化载荷的工具。它一度尝试用 Python 手工构造载荷,评估成本后及时放弃,转而通过代理镜像获取 ysoserial。

由于直接下载 JDK 连续超时,Agent 开始搜索本地软件目录,最终找到 Adobe Animate 自带的 JRE。借助这套现成环境,它生成并修正载荷,成功完成远程代码执行。

整个过程耗时 33 分 11 秒,共调用工具 104 次,经历 6 次策略转向和 3 次主动修正。

这个案例的价值在于,它打破了“AI Agent 只会按预设脚本做题”的刻板印象。当常用工具和标准路径无法直接使用时,Agent 能够根据环境反馈调整方案、停止低效尝试,并从目标环境中寻找可用资源,最终重新完成从载荷构造到结果验证的闭环。

从成绩单看Agent自主渗透的前景

这场100小时直播提供的不仅是一组成绩数据,更呈现出长程 Agent 进入安全工作流所需的基础条件。

第一,速度。 在工具链高度匹配的任务上,Agent 可以在 54 秒内完成从环境启动到验证通过的全过程。

第二,吞吐。 高效推进阶段每小时处理 5 至 6.25 道题,峰值日处理量折算约 120 至 150 道,说明 Agent 具备批量连续作业能力。

第三,持续性。 连续 48 小时的四个观察窗口中,成功率均保持在约90%,100小时内完成 297 道题的执行与验证。

第四,自主破局。 在 JBoss 反序列化任务中,Agent 面对缺少 Java、缺少工具、下载超时的环境,能够放弃低效路径,搜索本地资源,最终完成 RCE。这已经不只是“按模板打题”,而是根据环境反馈动态调整策略。

值得注意的是,长程 Agent 的实际表现并不只取决于模型规模。任务环境是否丰富、结果验证是否准确、过程能否追踪、异常是否可以恢复,以及每轮测试能否快速形成迭代依据,都会影响 Agent 能力向安全生产力转化的效率。

也要承认,Agent 自主渗透当下仍存在明显局限。面对环境复杂、工具缺失或路径判断失误的情况,仍可能出现反复尝试、效率下降等问题,稳定发挥依然离不开 Harness、工具链和验证机制的共同支撑。

渗透测试 Agent 的工程化探索仍要继续。本次100小时挑战留给研究人员的命题也由此清晰:如何让 Agent 的实战能力从单点能力竞争,走向完整工程体系的竞争,最终沉淀为可验证、可规模化、可调用的安全生产力。云栈社区也会持续关注 Agent 自主渗透这一方向的后续进展。




上一篇:AI辅助风险登记册四步法:把“我觉得会出问题”变成结构化风险清单
下一篇:Agentic时代安全体系重构:阿里云如何以AI速度防御并管控Agent全链路风险
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-9-25 02:12 , Processed in 1.837564 second(s), 46 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表