AI 驱动的自动化渗透测试,正在成为今年安全行业最受关注的赛道之一。
从厂商到开源社区,各类工具轮番上场,Agent 在短周期、单目标任务中的能力也在快速提升。但任务一旦进入长周期、多轮次、需要持续决策的复杂场景,绝大多数方案会暴露出三个致命短板:
上下文越滚越大,模型延迟和成本失控;Agent“自说自话”式地声称任务完成,没有独立的核查通路;进程一崩,全盘归零。
这也从侧面反映了一个行业现状:公开的 Agent 评测仍大多集中在分钟级或小时级,持续数天、全流程公开的自主渗透检验依然少见。
9 月 7 日上午 10 点,一场填补这种稀缺的试验即将开始。
由斗象科技旗下漏洞盒子平台“赛博司机计划”发起的“蛙池 AI 100 小时不间断 Agent 渗透测试挑战”,将把长程 Agent 的真实能力放进一场持续 4 天 4 夜的公开测试。
作为网络安全行业首个超长时、可围观、可互动的 Agent 极限渗透直播,蛙池 AI 将搭载 Sonic Harness,在 vulnHouse 自研靶场上持续自主攻坚,从基础题型一路冲到高难度复合漏洞关卡。

本次挑战还将获得「白帽 Token Plan」的全程 Token 算力支持。该计划由斗象科技与 MiniMax 联合发起,为 Agent 持续决策、反复验证和多轮攻坚提供稳定的资源保障。
4 天 4 夜,100 小时,全天候不间断、无暂停、无剪辑
你看到的每一次通关、每一次重试、每一次策略切换,都是 Agent 在当下实时做出的决策。没有剧本,没有彩排,甚至没有人知道它最终能走到哪一步。
PART.01 一场 100 小时直播,靠什么不翻车?
支撑本次不间断直播挑战的,是蛙池 AI 搭载的 Sonic Harness。
Sonic Harness 把漫长的任务链拆成许多个可以交接、复核和恢复的任务回合,再通过 MEA(Manager/Executor/Auditor)三角循环架构,把规划、执行和审计交给三个彼此隔离的角色。
Manager(规划者):负责拆解目标、制定策略、判断方向。跨轮复用会话以沉淀规划记忆,但没有环境访问权限,不碰任何工具,只读文本做决策。它只能三选一:执行合约、宣布完成、或报告阻塞。
Executor(执行者):每轮用全新上下文去干活。接到任务合约后,在限定预算内执行具体操作,不背负冗长的历史日志。
Auditor(审计者):与 Executor 不共享会话,看不到对方的推理过程,只能使用只读工具独立检查证据,给出“验证通过”“证据不足”或“结果被证伪”的裁决。
这套设计的关键在于:审计独立于执行,不是靠自觉,而是靠架构硬性隔离。
Executor 说自己完成了任务,无法直接改变系统状态。Auditor 必须通过独立检查确认结果;一旦证据与执行报告冲突,相关记录就会被标记并完整留痕。三方通过结构化对象通信,Harness 是唯一的状态写入方。
Agent 对自己的描述,不能代替真实环境中的验证结果。这就从根上堵死了“模型自说自话”这条路。
PART.02 进程崩溃,如何断点续跑?
即便有了 MEA 三角的隔离机制,任务长时间连续运行仍然面临一个现实问题:进程崩溃怎么办?
Sonic 的策略是原子化落盘与断点续跑。
每轮产生的任务合约、执行报告、审计报告和整体状态,都会采用“临时文件写入+原子替换”的方式保存。系统在任何时刻读取到的,要么是更新前的完整状态,要么是更新后的完整状态,不会得到只写了一半的文件。
如果运行途中遭遇接口异常、进程退出或其他意外中断,Sonic 可以从最近一次有效状态恢复。此前保存的合约、执行报告、证据与审计记录将全部保留,系统根据会话编号恢复 Manager 的跨轮规划记忆,并为 Executor 与 Auditor 创建新的上下文,继续下一轮任务。
持续运行长时间任务,依赖的并不是一段无限增长的超长会话,而是由许多个边界清晰、逐轮留痕、可以复核和恢复的短任务回合连续组成。
PART.03 为什么这场直播值得看?
这场直播不是一场秀,是一次公开的极限测试。
目前,大量 Agent 评测集中在分钟级或小时级任务,Agent 究竟能稳定工作多久,在安全行业还需要一场足够真实的检验来回答。
直播将同步呈现蛙池 AI 工作台、靶场状态与关键运行数据。你可以看到它正在处理哪一关,运行了多久,失败了多少次,什么时候调整了方向。
24 小时、48 小时、72 小时、100 小时,四个节点是这场试炼的关键坐标。它可能快速突破,也可能在某道题前反复卡住。每一次停滞和重新选择,都是观察长程 Agent 能力边界的真实样本。
如果你对长程 Agent 的工程实现感兴趣,也可以顺着 人工智能 相关资源进一步了解 Agent、强化学习与长任务规划等方向。
挑战的终点,不是“Agent 赢了”或“Agent 输了”这么简单。
即使它在某个节点反复卡住,乃至被“锁死”,同样能提供有价值的经验:它会告诉我们当前 Agent 渗透能力的真实边界在哪里,哪些环节还离不开人的判断。
PART.04 「白帽 Token Plan」为 100 小时正式加电
本次直播挑战由斗象科技与 MiniMax 联合发起的「白帽 Token Plan」提供全程 Token 算力支持。
对于一线安全研究人员而言,大模型 API 调用和算力成本,已经成为开展模型漏洞研究、AI 红蓝对抗和持续验证的一道现实门槛。很多值得探索的安全问题,需要经历多轮测试、复现和推翻,Token 消耗贯穿整个研究过程。
「白帽 Token Plan」将通过面向白帽群体定制的 Token 资源支持,为 AI 安全研究输送更充足的“弹药”,帮助研究人员把更多精力放在漏洞发现、风险验证和修复推动上。
这场 100 小时 Agent 渗透直播,既是 Sonic 长程能力的极限测试,也标志着「白帽 Token Plan」正式开启加电模式。
PART.05 直播信息与参与方式
直播时间:9 月 7 日上午 10 点起,持续 100 小时
直播平台:漏洞盒子、FreeBuf、斗象科技视频号

解说体系:
- 每日 15:00-17:00|技术主题场:漏洞盒子平台专家结合当日进展,拆解安全技术和 Agent 操作逻辑。
- 每日 20:00-21:00|白帽大咖黄金档:白帽专家解析关键攻坚过程,分享漏洞利用与防御思路,并进行互动答疑。
- 夜间时段|AI 自动播报:持续播报运行时间、当前关卡、通关进度、失败重试和阶段状态。
硬核福利大奖:
参与贯穿赛程的多轮互动,有机会获得:
- 福利双响炮:每日 10:00-21:00 不定时开启红包雨,黄金档加码抽奖送出蛙池 AI 邀请码、蛙池 AI Token 等好礼。
- 里程碑福利:每日关键节点开启大额红包雨,与全网观众共同见证 Agent 长程攻坚进度。
- 百小时终极竞猜:围绕 24 小时、48 小时和 100 小时三个阶段预测 Sonic 累计得分,综合结果最接近者可从 ROG 夜魔键盘、Beats 耳机或 1000 元现金红包中任选一项。
9 月 7 日上午 10 点,锁定漏洞盒子、FreeBuf、斗象科技直播间,一起看 AI Agent 能有多持久。
对于关注 渗透测试 与安全工具实战的朋友来说,这场持续 100 小时的公开测试,也是观察长程自主攻击能力的一次难得窗口。