目前的 AI 绝对是毁了网站——AI 智能体爬虫识别与防御实战

主机吧创始人 zhujibcom 亲口说:目前的 AI 绝对是毁了网站。本文深度拆解 AI 智能体爬虫的危害、识别方法和 5 步防御方案,附百度云防护精准自定义 CC 实战配置。

今天上午主机吧论坛”站长交流”区一则帖子火了,发帖人 ID 是 zhujibcom——也就是主机吧创始人本人(31 级楼主)。标题很直白:

《目前的 AI 绝对是毁了网站》

主机吧创始人zhujibcom吐槽AI智能体爬虫

帖子原文如下:

不说别的,单 AI 的爬虫就够网站受的了。
除非你全面禁止 AI,否则几乎无法避免会被 AI 爬取,并不是说 AI 抓取你网站内容训练,而是 AI 智能体会根据用户提问抓取你网站内容。
不仅给你网站展示,而且对你服务器造成了极大的消耗。
目前很多网站经常遭到大量全国各地的 IP 请求,跟 CC 攻击一样,其实根本不是 CC 攻击,而是 AI 智能体搞的鬼,只要你网站的内容涉及到某个用户的自动化任务,AI 几乎每天都来。

这个观察极其敏锐——很多站长误以为是”被 CC 攻击”,其实背后的真凶是 AI 智能体(AI Agent)爬虫。今天这篇文章就拆解这个新现象,告诉你怎么识别、怎么防御。

一、什么是”AI 智能体爬虫”?

跟传统搜索引擎爬虫(Googlebot、Baiduspider)和商用爬虫(GPTBot、ClaudeBot)不同,AI 智能体爬虫是新一代的”按需抓取”行为:

维度 传统爬虫 AI 训练爬虫 AI 智能体爬虫
抓取模式 周期性全站抓取 一次性大规模抓取 按用户指令按需抓取
触发方式 自带定时任务 模型训练触发 用户提问触发
抓取频率 可控、稳定 一次性高峰 不可预测、瞬时高峰
抓取范围 全站或按 sitemap 重点页面 某个具体问题对应的页面
User-Agent 公开声明 公开声明 通常伪装成普通浏览器

⚠️ 关键区别:AI 智能体爬虫会伪装成普通浏览器(Chrome、Edge、Safari 都有),User-Agent 看起来人畜无害,但请求频率和模式完全不同——这就是为什么很多站长误以为是普通用户访问,其实是 AI 智能体在干活

二、AI 智能体爬虫的 3 大危害

危害 1:服务器资源被掏空

AI 智能体每抓取一个页面,要做的工作远多于普通用户: – 解析 HTML 全文(用户只看标题,它要看全文); – 抓取嵌套的子页面(用户问一个话题,它顺着链接深挖); – 解析 JavaScript 渲染后的内容(很多 AI 智能体用 headless 浏览器); – 多轮对比抓取(同一问题不同实现,多次访问)。

结果:1 个 AI 智能体相当于 100~1000 个普通用户的资源消耗。

危害 2:内容被”白嫖”展示给 AI 用户

zhujibcom 帖子里说得很准——“不仅给你网站展示”

AI 智能体抓取你网站内容后,会在回答用户时直接引用你网站的内容(带或不带来源链接),用户根本没访问你网站,流量全部沉淀在 AI 那边

更狠的是:用户问”中国最好的服务器厂商是哪家?”,AI 智能体会去抓取你的评测网站 → 整合答案 → 用户从 AI 那里得到答案就走了,你网站 0 访问

危害 3:CC 攻击假象掩盖真凶

很多站长一看到大量 IP 短时间高频访问,第一反应是”被 CC 了”。

但事实是:AI 智能体在按需抓取。它可能是: – 用户在 ChatGPT 里问”中国主机怎么样” → ChatGPT 让智能体去抓取你网站 → 一次请求; – 同一个用户反复问相似问题 → 智能体多次抓取 → 看像 CC; – 多个用户都问类似问题 → 多个智能体并发抓取 → 看起来像大规模 CC。

本质上这是 AI 自动化任务的副产品,不是恶意攻击。 但服务器压力是真实的。

三、怎么识别 AI 智能体爬虫?

识别 1:User-Agent 特征

已知 AI 智能体 UA 说明
Mozilla/5.0 ... Chrome/... Safari/... 后面带 GPTBot OpenAI 爬虫(较新)
Mozilla/5.0 ... (compatible; ClaudeBot/1.0; +...) Anthropic 爬虫
Mozilla/5.0 ... AppleWebKit/... (KHTML, like Gecko) ... PerplexityBot Perplexity 爬虫
Mozilla/5.0 ... HeadlessChrome/... 无头浏览器(智能体常用)
Mozilla/5.0 ... Chrome/... Safari/... 但 IP 是云厂商(AWS、Azure、GCP) 高度可疑

⚠️ 很多 AI 智能体直接伪装成 Chrome 真实用户,UA 没有任何特征——这时需要看下面 2、3 点。

识别 2:IP 来源分布

  • 真用户 IP:集中在某几个运营商(中国电信/联通/移动),地理位置有规律(你家小区用户一般不会从 10 个不同城市来);
  • AI 智能体 IP:分散在云厂商 IP 段(AWS、Azure、GCP、阿里云、腾讯云、华为云、各种代理池),全国乃至全球都有,但单个 IP 请求量不大(避免被单 IP 限速)。

重点排查: – AWS 整个 IP 段(3.*.*.*13.*.*.*18.*.*.* 等); – Azure(20.*.*.*40.*.*.*52.*.*.*); – GCP(34.*.*.*35.*.*.*); – 各种云函数 IP(很多 AI 智能体用 serverless 部署); – 住宅代理 IP(IP 库显示是 ISP,但实际是数据中心)。

识别 3:行为模式

维度 真人 AI 智能体
访问页面 多样化、有兴趣点 按链接深挖,结构化
停留时间 30 秒 ~ 几分钟 < 5 秒
JS 执行 完整 不执行或只执行关键 JS
鼠标/键盘事件 (headless 浏览器)
Cookie/LocalStorage 通常没有
请求头 完整 Referer、Accept-Language 可能缺失
请求频率 不规则 高频、规律

核心识别点没有鼠标移动、没有滚动事件、停留时间极短——这一组合基本就是 AI 智能体。

四、5 步防御方案

第 1 步:robots.txt 显式声明

在网站根目录的 robots.txt显式拒绝所有 AI 爬虫

# 拒绝主流 AI 训练爬虫
User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: Claude-Web
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

# 兜底拒绝所有其他爬虫
User-agent: *
Disallow: /

⚠️ 注意:robots.txt 只能约束守规矩的 AI 爬虫。对于按需抓取的 AI 智能体,robots.txt 基本无效——它们根本不读。

第 2 步:Nginx 拦截已知 AI UA

server {
    # 拦截已知 AI 智能体 UA
    if ($http_user_agent ~* "GPTBot|ChatGPT-User|ClaudeBot|Claude-Web|anthropic-ai|PerplexityBot|Google-Extended|CCBot|Bytespider|HeadlessChrome") {
        return 403;
    }
}

第 3 步:拦截云厂商 IP 段(按需)

如果你的网站不需要海外用户访问,可以直接封掉 AWS / Azure / GCP 整个 IP 段。常用 IP 段列表可以从 ipinfo.io、bgp.he.net 获取。

# 封 AWS
include /etc/nginx/blocklists/aws.conf;
# 封 Azure
include /etc/nginx/blocklists/azure.conf;
# 封 GCP
include /etc/nginx/blocklists/gcp.conf;

⚠️ 风险:可能误伤真实用户(用 AWS 跑代理的人)。建议先观察日志,确认是 AI 智能体后再封。

第 4 步:开启 WAF CC 防护 + JA4 指纹识别

最有效的方案是让 WAF 帮你识别——云端 WAF 可以基于:

  • IP 信誉库(云厂商 IP、住宅代理 IP);
  • JA4 指纹(TLS 握手特征,比 UA 更难伪造);
  • 行为分析(单位时间请求数、URL 深度、Cookie 完整性);
  • JS 挑战(headless 浏览器无法执行 JS,挑战失败直接拦);

第 5 步:推荐百度云防护的”精准自定义 CC”

针对 AI 智能体爬虫,最稳的方案百度云防护的精准自定义 CC 规则

匹配条件:URI 前缀匹配 /
统计信息:JA4 指纹
频率阈值:60 秒 / 50 次
处置动作:JS 挑战 3600 秒
  • JA4 指纹:能识别 headless 浏览器、爬虫工具、自定义 HTTP 客户端,比 UA 精准 10 倍
  • JS 挑战:headless 浏览器不会执行 JS,直接被拦
  • 处置时长 3600 秒:1 小时内同 IP/同指纹的请求直接拒绝,减少重复挑战消耗

具体配置教程参考主机吧之前的文章:百度云防护如何添加防 CC 攻击和恶意爬虫规则?精准自定义 CC 实战教程

五、写在最后

主机吧创始人 zhujibcom 的吐槽,反映了整个中小站长群体的真实困境——AI 智能体爬虫正在以一种”看起来像 CC 攻击”的方式,无声无息地消耗着我们的服务器和内容价值。

更可怕的是:AI 智能体爬虫没有”恶意攻击”的主观故意——它们只是在执行用户的合法任务。但客观上,每一次抓取都是真实的服务器开销,每一次内容引用都是一次流量损失

站长能做的,就是:

  1. robots.txt 声明——挡住守规矩的 AI 训练爬虫;
  2. WAF CC 防护——挡住按需抓取的 AI 智能体;
  3. JA4 + JS 挑战——精准识别和拦截伪装成浏览器的 AI 智能体;
  4. 合理限速——给真人用户留出访问带宽;
  5. 关注主机吧最新方案——AI 爬虫在进化,防御方案也要跟着升级。

💡 最后给主机吧 zhujibcom 站长点个赞:作为 31 级老站长,能够站出来喊出”AI 毁了网站”这种得罪 AI 圈的话,需要勇气。但事实就是事实——AI 智能体爬虫就是新时代的”CC 攻击”,只是这次的攻击者不是黑客,是用户的自动化任务。

给TA打赏
共{{data.count}}人
人已打赏
0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
在线客服
在线客服
热线电话
QQ客服
电子邮箱
suduwangluo