你的 AI 到底安不安全?最近我碰上了两个挺头疼的问题,正好借这个机会跟大家聊聊。
第一个问题:我自己的 Agent 工具里装了不少 Skill,还连了好几个 MCP 服务器。问题是,我根本不清楚这些 Skill 背后到底执行了什么操作,有没有藏着可疑代码。以前闲下来还会翻翻源码,但效率低得可怜,而且看也不一定看得出来。
第二个问题:手头有一个项目接了公司资料库的 Agent,马上要上线了。我很想知道这类 Agent 会不会失控、有没有安全隐患,却一直没找到靠谱的验证办法。全靠自己想几个刁钻问题手动去试,测得很不全面。
直到最近,我在 GitHub 上发现了一个叫 AI-Infra-Guard(后面简称 AIG)的开源项目,正好解决了我这两个痛点。
GitHub 地址:https://github.com/Tencent/AI-Infra-Guard

翻了一遍项目文档和源码,发现它来自腾讯朱雀实验室的开源,而且我还拿自己的项目实际测了一把。下面分享几个我觉得真正有意思的地方。
A.I.G 是什么
AIG 算是一套全栈 AI 红队安全平台,支持 OpenClaw 安全扫描、Agent 扫描、Skills 扫描、MCP 扫描、AI 基础设施扫描,以及对大模型越狱评测。
简单一句话:AI 安全领域我们能想到的场景,它基本都覆盖了。
如果不想部署整个平台,AIG 也提供了一个 aig-agent-redteam 安全检测 Skill,安装命令就一行:
npx skills add https://github.com/Tencent/AI-Infra-Guard.git --skill aig-agent-redteam

装完之后,只需要用大白话说清楚要干什么就行。
比如让它检查我装的 Skill、MCP 有没有问题,或者对项目外部 Agent 的安全性做一次检测。它会自动触发 AIG Skill 进行扫描,背后调用的就是 AIG 的审计能力,不需要额外装东西,也不用背命令。
对 Agent 自身体检
我先拿它对自己安装的 Agent 做测试,只说了一句:“帮我对自身进行安全检测”。

它会先梳理当前 Agent 连了哪些工具、暴露了哪些攻击面,自己选择测试路径去跑,跑完后在本地生成一份报告。
报告里不是简单打个分,而是带有完整的证据链——具体是哪条 payload 触发了问题、Agent 当时给出了什么响应,再配一条对应的修复建议。

这个粒度对我来说挺关键的。如果只有风险等级,我根本不知道具体该往哪改。毕竟 Agent 一旦失控,不是报错那么简单,它是真的会执行到底。
整个过程中的数据都在本机跑,不会往外部服务器传。这点我在实测之前专门确认过——拿自己 Agent 的权限配置去做体检,数据要是传出去了反而更不安全。

自动化诱导,获取系统提示词
回到开头说的第二个问题,我最在意的就是提示词泄露。靠自己手动试问法太不靠谱了,特别容易漏。
于是调用这个 Skill,把我们资料库 Agent 的接口给到 WorkBuddy,同时把 Chrome 抓包导出的 HAR 文件也一并发给 Agent。
这一步主要是让模型知道我们系统的对话接口长什么样、怎么调用。

仅仅 10 分钟,它就输出了一份完整的安全评估报告,还真发现了不少漏洞。
而且不是传统漏洞——像系统提示词泄漏、间接注入,这些是 AI 时代特有的安全问题。
仔细看了下运行过程,它其实是生成一批诱导性的问法去“套”。如果只跑单轮还不够,它内置了几种更狠的多轮套话方式。
比如先在上下文里堆一堆看起来「正常问答」的假样本,把模型的警惕心先降下来,再抛出真正想问的东西;或者让攻击模型跟目标模型一轮一轮过招,每次根据上一轮的回应调整问法,一步步逼近目标。
这几种方式跑一遍,比我憋十个刁钻问题做靶向测试全面多了。

另外,它还会用多个方法去获取提示词,然后交叉验证最终确认。后来我跟业务沟通,系统提示词确实对上了。
跑完这次安全检查,我才算真正对 Agent 会不会「被套话」有底了——不是靠感觉,是实测数据撑着的。
其他能力,简单提一下
上面聊的功能只是 AIG 的冰山一角,还有很多模块我没细测,简单说几个:
- 维护了一个 AI 组件的漏洞库,可以对内网 AI 基础设施做安全检查,vLLM、Ollama 这类服务本身的已知漏洞,覆盖了 1900 多个 CVE;
- MCP、SKILL 扫描模块,专门检查 MCP 和 SKILL 的安全;
- Agent Scan 针对 Dify、Coze 这类多智能体工作流做整体安全评估;
- 大模型安全检测模块,可以对单个模型做提示词越狱之类的安全测试。
这些如果刚好匹配到你的使用场景,可以直接去官方文档看对应用法。还有一点,这些能力不是非要绑在一起用。
像前面提到的 Skill 扫描、MCP 扫描,都可以单独拆出来当命令行工具装,不用把整个平台跑起来,想测哪块就装哪块。
另外这个项目是完整开源的,就连前后端和扫描端都开源了。如果你想把这些检测能力接进自己现有系统里,或者按自己的需求改界面,也都留了空间。

实话实说,项目也有一些局限。平台跑起来得配一个 LLM 的 API Key,因为它本质上是基于 Agent 做安全检测的。审计本身还得靠模型去理解代码语义,不是完全确定性的静态扫描,偶尔会有误报或漏报,我自己跑的时候也遇到过一次判断偏严的情况。
另外,如果想用完整平台的 Web 界面,官方说得很清楚:这是给企业或个人内部用的红队工具,目前没有鉴权机制,别往公网上部署。
写在最后
一个强大的 Agent,来自它能连更多工具、处理更多上下文、完成更多动作。风险也正来自这些能力。
没权限的 AI 最多只会给出错误的建议,可一旦给它赋予了权限又失控,带来的安全麻烦就多多了:可能发错邮件、错误审批、错误改数据库,或者把内部提示词和数据交给了不该给的人。
出了问题之后再排查,成本远比想象中高。所以与其等上线后出事再翻日志复盘,不如先自己动手测一遍。
GitHub 项目地址:https://github.com/Tencent/AI-Infra-Guard
今天的分享就到这,感谢大家抽空阅读,Respect!