攻击者正在冒充 OpenAI、Anthropic、DeepSeek 等主流 AI 厂商的网络爬虫,对公开网站发起扫描,目标直指暴露的凭据与敏感配置文件。这些攻击的一类重点对象,正是那些存在配置错误服务器问题的公网服务,一旦命中往往会直接泄露云密钥、API Token、数据库密码和私钥。

伪造 AI 爬虫身份,目标直指敏感配置
GreyNoise 观察到一个更大规模的攻击集群,一次使用了来自 8 家公司的 13 个 AI 爬虫身份。这些扫描器会主动请求 /.env、/.aws/credentials、私钥位置和密码存储等文件。其中 /.env 文件通常包含应用程序机密,例如数据库密码、云访问密钥和 API Token。
这套攻击方式依赖一种简单却有效的欺骗手法:伪造 HTTP User-Agent 头。网络爬虫通过这个标头标识自己,例如 Googlebot、ClaudeBot 或 GPTBot。但客户端可以随意伪造该标头,它根本无法证明请求真的来自标头所声称的组织。
问题在于,一些组织会仅凭爬虫名称授予访问权限、绕过部分控制,甚至抑制安全告警。攻击者可以逐字符复制官方爬虫字符串,让基于 User-Agent 的检测彻底失效。如果连“来的是不是真爬虫”都无法判断,那后面的访问控制又从何谈起?
824 个 IP、795 个网段:扫描规模有多大?
GreyNoise 识别出六个伪造的 AI 爬虫名称,分别冒充 Anthropic、OpenAI、Google 和 Perplexity。在 2026 年 7 月 28 日至 8 月 23 日期间,这些名称都对应同一个 HTTP 客户端指纹,来自 824 个不同 IP 地址。
这个指纹在过去 90 天里使用了超过 1500 个 User-Agent 字符串,其中大多数声称自己是普通浏览器。与此相关的六类爬虫活动几乎全部集中在 8 月,8 月 23 日当天的数量达到最高。
研究人员还发现,这些活动分布在 795 个不同的 /24 网段。这个数字意味着什么?简单封禁单个托管服务商或少量 IP 段已经很难阻止它,网络封禁的性价比会迅速下降。

各 User-Agent 的会话数,2026 年 7 月 28 日至 8 月 23 日。ClaudeBot 为琥珀色;其他三个以爬虫命名的 User-Agent 字符串体量更大。
GreyNoise 表示,这 824 个源地址与上述合法爬虫已公布的 IP 段没有任何匹配。他们比对过 Anthropic、OpenAI、Google、Perplexity 和 Amazon 的官方列表,未发现重叠。
一个关键指标是请求模式。合法的搜索爬虫和 AI 爬虫通常会先检查 /robots.txt,这个文件告诉自动化客户端网站允许访问哪些路径。但在这次活动中,六个伪造爬虫身份从未请求过 /robots.txt。相反,它们直接尝试访问暴露的机密文件和云凭据,请求路径包括:/.env、/app/.env、/api/.env、/backend/.env、/.env.production、/.env.bak 和 /.aws/credentials。
GreyNoise 将可疑活动与 Anthropic 合法的 ClaudeBot 在同期流量进行了对比。真实爬虫请求 /robots.txt 的频率超过任何其他路径,占其流量的 12%,并且从不请求凭据文件。
这个差异很关键:合法 AI 爬虫的目标是抓取公开网络内容,用于索引、搜索或引用相关功能。它没有理由去请求环境文件、云凭据存储或私钥。反之,一上来就翻 /.env 的“爬虫”,基本可以判定不怀好意。
怎么防?身份验证不能只看 User-Agent
组织绝不应把 User-Agent 字符串当作爬虫身份的可靠证据。任何允许爬虫访问或为其设置豁免的服务,都应该依据厂商官方发布的爬虫 IP 段来验证源 IP 地址。
安全团队还应针对 /.env、/.aws/credentials、/.git/config 等敏感路径的请求进行调查并产生告警。这些文件绝不应通过公共 Web 服务器暴露,任何一次异常请求都不是小事。
Web 管理员要确保 .env 和 .git 目录、云凭据文件以及私钥位于 Web 根目录之外。如果云密钥能通过公共 URL 访问,应立即轮换。为什么?因为暴露本身就应当被视为潜在失陷,而不是等看到异常登录再反应。
这次活动并不能证明攻击者已经从特定受害者处成功获取文件。但它提醒我们,威胁行为者可以轻易滥用人们对知名 AI 品牌的信任,把凭据收集扫描藏在普通 Web 流量里。若没有更严格的校验机制,这类伪装会继续大行其道。
参考来源:Hackers Pose as OpenAI, Anthropic and DeepSeek to Steal Credentials and Secrets