今天上午主机吧论坛”站长交流”区一则帖子火了,发帖人 ID 是 zhujibcom——也就是主机吧创始人本人(31 级楼主)。标题很直白:
《目前的 AI 绝对是毁了网站》

帖子原文如下:
不说别的,单 AI 的爬虫就够网站受的了。
除非你全面禁止 AI,否则几乎无法避免会被 AI 爬取,并不是说 AI 抓取你网站内容训练,而是 AI 智能体会根据用户提问抓取你网站内容。
不仅给你网站展示,而且对你服务器造成了极大的消耗。
目前很多网站经常遭到大量全国各地的 IP 请求,跟 CC 攻击一样,其实根本不是 CC 攻击,而是 AI 智能体搞的鬼,只要你网站的内容涉及到某个用户的自动化任务,AI 几乎每天都来。
这个观察极其敏锐——很多站长误以为是”被 CC 攻击”,其实背后的真凶是 AI 智能体(AI Agent)爬虫。今天这篇文章就拆解这个新现象,告诉你怎么识别、怎么防御。
一、什么是”AI 智能体爬虫”?
跟传统搜索引擎爬虫(Googlebot、Baiduspider)和商用爬虫(GPTBot、ClaudeBot)不同,AI 智能体爬虫是新一代的”按需抓取”行为:
| 维度 | 传统爬虫 | AI 训练爬虫 | AI 智能体爬虫 |
|---|---|---|---|
| 抓取模式 | 周期性全站抓取 | 一次性大规模抓取 | 按用户指令按需抓取 |
| 触发方式 | 自带定时任务 | 模型训练触发 | 用户提问触发 |
| 抓取频率 | 可控、稳定 | 一次性高峰 | 不可预测、瞬时高峰 |
| 抓取范围 | 全站或按 sitemap | 重点页面 | 某个具体问题对应的页面 |
| User-Agent | 公开声明 | 公开声明 | 通常伪装成普通浏览器 |
⚠️ 关键区别:AI 智能体爬虫会伪装成普通浏览器(Chrome、Edge、Safari 都有),User-Agent 看起来人畜无害,但请求频率和模式完全不同——这就是为什么很多站长误以为是普通用户访问,其实是 AI 智能体在干活。
二、AI 智能体爬虫的 3 大危害
危害 1:服务器资源被掏空
AI 智能体每抓取一个页面,要做的工作远多于普通用户: – 解析 HTML 全文(用户只看标题,它要看全文); – 抓取嵌套的子页面(用户问一个话题,它顺着链接深挖); – 解析 JavaScript 渲染后的内容(很多 AI 智能体用 headless 浏览器); – 多轮对比抓取(同一问题不同实现,多次访问)。
结果:1 个 AI 智能体相当于 100~1000 个普通用户的资源消耗。
危害 2:内容被”白嫖”展示给 AI 用户
zhujibcom 帖子里说得很准——“不仅给你网站展示”。
AI 智能体抓取你网站内容后,会在回答用户时直接引用你网站的内容(带或不带来源链接),用户根本没访问你网站,流量全部沉淀在 AI 那边。
更狠的是:用户问”中国最好的服务器厂商是哪家?”,AI 智能体会去抓取你的评测网站 → 整合答案 → 用户从 AI 那里得到答案就走了,你网站 0 访问。
危害 3:CC 攻击假象掩盖真凶
很多站长一看到大量 IP 短时间高频访问,第一反应是”被 CC 了”。
但事实是:AI 智能体在按需抓取。它可能是: – 用户在 ChatGPT 里问”中国主机怎么样” → ChatGPT 让智能体去抓取你网站 → 一次请求; – 同一个用户反复问相似问题 → 智能体多次抓取 → 看像 CC; – 多个用户都问类似问题 → 多个智能体并发抓取 → 看起来像大规模 CC。
本质上:这是 AI 自动化任务的副产品,不是恶意攻击。 但服务器压力是真实的。
三、怎么识别 AI 智能体爬虫?
识别 1:User-Agent 特征
| 已知 AI 智能体 UA | 说明 |
|---|---|
Mozilla/5.0 ... Chrome/... Safari/... 后面带 GPTBot |
OpenAI 爬虫(较新) |
Mozilla/5.0 ... (compatible; ClaudeBot/1.0; +...) |
Anthropic 爬虫 |
Mozilla/5.0 ... AppleWebKit/... (KHTML, like Gecko) ... PerplexityBot |
Perplexity 爬虫 |
Mozilla/5.0 ... HeadlessChrome/... |
无头浏览器(智能体常用) |
Mozilla/5.0 ... Chrome/... Safari/... 但 IP 是云厂商(AWS、Azure、GCP) |
高度可疑 |
⚠️ 很多 AI 智能体直接伪装成 Chrome 真实用户,UA 没有任何特征——这时需要看下面 2、3 点。
识别 2:IP 来源分布
- 真用户 IP:集中在某几个运营商(中国电信/联通/移动),地理位置有规律(你家小区用户一般不会从 10 个不同城市来);
- AI 智能体 IP:分散在云厂商 IP 段(AWS、Azure、GCP、阿里云、腾讯云、华为云、各种代理池),全国乃至全球都有,但单个 IP 请求量不大(避免被单 IP 限速)。
重点排查:
– AWS 整个 IP 段(3.*.*.*、13.*.*.*、18.*.*.* 等);
– Azure(20.*.*.*、40.*.*.*、52.*.*.*);
– GCP(34.*.*.*、35.*.*.*);
– 各种云函数 IP(很多 AI 智能体用 serverless 部署);
– 住宅代理 IP(IP 库显示是 ISP,但实际是数据中心)。
识别 3:行为模式
| 维度 | 真人 | AI 智能体 |
|---|---|---|
| 访问页面 | 多样化、有兴趣点 | 按链接深挖,结构化 |
| 停留时间 | 30 秒 ~ 几分钟 | < 5 秒 |
| JS 执行 | 完整 | 不执行或只执行关键 JS |
| 鼠标/键盘事件 | 有 | 无(headless 浏览器) |
| Cookie/LocalStorage | 有 | 通常没有 |
| 请求头 | 完整 Referer、Accept-Language | 可能缺失 |
| 请求频率 | 不规则 | 高频、规律 |
核心识别点:没有鼠标移动、没有滚动事件、停留时间极短——这一组合基本就是 AI 智能体。
四、5 步防御方案
第 1 步:robots.txt 显式声明
在网站根目录的 robots.txt 中显式拒绝所有 AI 爬虫:
# 拒绝主流 AI 训练爬虫
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: Claude-Web
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
# 兜底拒绝所有其他爬虫
User-agent: *
Disallow: /
⚠️ 注意:robots.txt 只能约束守规矩的 AI 爬虫。对于按需抓取的 AI 智能体,robots.txt 基本无效——它们根本不读。
第 2 步:Nginx 拦截已知 AI UA
server {
# 拦截已知 AI 智能体 UA
if ($http_user_agent ~* "GPTBot|ChatGPT-User|ClaudeBot|Claude-Web|anthropic-ai|PerplexityBot|Google-Extended|CCBot|Bytespider|HeadlessChrome") {
return 403;
}
}
第 3 步:拦截云厂商 IP 段(按需)
如果你的网站不需要海外用户访问,可以直接封掉 AWS / Azure / GCP 整个 IP 段。常用 IP 段列表可以从 ipinfo.io、bgp.he.net 获取。
# 封 AWS
include /etc/nginx/blocklists/aws.conf;
# 封 Azure
include /etc/nginx/blocklists/azure.conf;
# 封 GCP
include /etc/nginx/blocklists/gcp.conf;
⚠️ 风险:可能误伤真实用户(用 AWS 跑代理的人)。建议先观察日志,确认是 AI 智能体后再封。
第 4 步:开启 WAF CC 防护 + JA4 指纹识别
最有效的方案是让 WAF 帮你识别——云端 WAF 可以基于:
- IP 信誉库(云厂商 IP、住宅代理 IP);
- JA4 指纹(TLS 握手特征,比 UA 更难伪造);
- 行为分析(单位时间请求数、URL 深度、Cookie 完整性);
- JS 挑战(headless 浏览器无法执行 JS,挑战失败直接拦);
第 5 步:推荐百度云防护的”精准自定义 CC”
针对 AI 智能体爬虫,最稳的方案是百度云防护的精准自定义 CC 规则:
匹配条件:URI 前缀匹配 /
统计信息:JA4 指纹
频率阈值:60 秒 / 50 次
处置动作:JS 挑战 3600 秒
- JA4 指纹:能识别 headless 浏览器、爬虫工具、自定义 HTTP 客户端,比 UA 精准 10 倍;
- JS 挑战:headless 浏览器不会执行 JS,直接被拦;
- 处置时长 3600 秒:1 小时内同 IP/同指纹的请求直接拒绝,减少重复挑战消耗。
具体配置教程参考主机吧之前的文章:百度云防护如何添加防 CC 攻击和恶意爬虫规则?精准自定义 CC 实战教程
五、写在最后
主机吧创始人 zhujibcom 的吐槽,反映了整个中小站长群体的真实困境——AI 智能体爬虫正在以一种”看起来像 CC 攻击”的方式,无声无息地消耗着我们的服务器和内容价值。
更可怕的是:AI 智能体爬虫没有”恶意攻击”的主观故意——它们只是在执行用户的合法任务。但客观上,每一次抓取都是真实的服务器开销,每一次内容引用都是一次流量损失。
站长能做的,就是:
- robots.txt 声明——挡住守规矩的 AI 训练爬虫;
- WAF CC 防护——挡住按需抓取的 AI 智能体;
- JA4 + JS 挑战——精准识别和拦截伪装成浏览器的 AI 智能体;
- 合理限速——给真人用户留出访问带宽;
- 关注主机吧最新方案——AI 爬虫在进化,防御方案也要跟着升级。
💡 最后给主机吧 zhujibcom 站长点个赞:作为 31 级老站长,能够站出来喊出”AI 毁了网站”这种得罪 AI 圈的话,需要勇气。但事实就是事实——AI 智能体爬虫就是新时代的”CC 攻击”,只是这次的攻击者不是黑客,是用户的自动化任务。
