AI 蜘蛛不是爬虫,是”读者”。传统爬虫(Googlebot / Baiduspider)抓 HTML 是为了建索引;AI 蜘蛛(GPTBot / ClaudeBot / Google-Extended)抓内容是为了喂给大模型推理。理解它们的访问规律,是 GEO 的第一步。
AI 蜘蛛与搜索引擎爬虫的区别
| 维度 | 搜索引擎爬虫 | AI 蜘蛛 |
|---|---|---|
| 目的 | 建索引 | 知识抽取 |
| 抓取频率 | 高频全量 | 低频精选 |
| 关注内容 | HTML 结构 | 正文语义 |
| User-Agent | Googlebot | GPTBot / ClaudeBot |
| robots 控制 | 标准 robots.txt | 标准 + Google-Extended |
核心差异:搜索引擎要”全”,AI 蜘蛛要”精”。它们更像在”读”你的站点,而不是”扫”你的站点。
识别 3 大 AI 蜘蛛
GPTBot(OpenAI)
OpenAI 的官方抓取机器人,服务于 ChatGPT 的检索增强和训练语料。
# UA 特征
User-agent: GPTBot
# 反向解析验证
reverse DNS: *.openai.com
特点:抓取有礼貌,严格遵守 robots.txt,频率稳定,偏爱结构化文档和博客。
ClaudeBot(Anthropic)
Anthropic 的抓取机器人,服务于 Claude。
User-agent: ClaudeBot
reverse DNS: *.anthropic.com
特点:抓取深度高,偏爱长文和白皮书,对页面内链跟随积极。
Google-Extended(Google AI)
Google 的 AI 训练抓取,服务于 Gemini 和 AI Overviews。
# 注意:Google-Extended 是控制 token,不是独立 UA
# 它通过 Googlebot 抓取,用 robots.txt 的 Google-Extended 规则控制是否用于 AI
User-agent: Google-Extended
Disallow: /private/
特点:抓取量大且分散,覆盖全站,难以单独从 Googlebot 流量里拆分——必须靠 robots 规则反向推断。
访问规律分析
跑了一周的 nginx 日志,3 大 AI 蜘蛛的访问规律差异明显:
| 蜘蛛 | 日均请求 | 偏好内容 | 高峰时段 | 平均深度 |
|---|---|---|---|---|
| GPTBot | 320 | 博客 / 文档 | 凌晨 2-5 点 | 2.4 |
| ClaudeBot | 180 | 案例页 / 白皮书 | 工作日白天 | 3.8 |
| Google-Extended | 240 | 全站均衡 | 分散 | 2.1 |
关键发现:AI 蜘蛛对 /llms.txt 和 /blog/* 的抓取占比超过 60%,对图片 / CSS 等静态资源几乎不碰——印证了”读者”属性。ClaudeBot 的抓取深度最高,说明它更愿意顺着内链深读。
搭建日志分析看板
第 1 步:日志采集
从 nginx 访问日志抽取 AI 蜘蛛请求:
# 提取 AI 蜘蛛访问记录
grep -E "GPTBot|ClaudeBot|Google-Extended" /var/log/nginx/access.log \
| awk '{print $7, $9, $14}' \
> ai_spider_raw.tsv
第 2 步:UA 归一与去重
原始 UA 字符串五花八门(大小写、空格变体),统一归一到 3 个标准标签,再去掉同 IP 同 URL 当天的重复抓取,避免一个页面被刷爆统计。
第 3 步:指标计算与可视化
按蜘蛛 / URL / 状态码 / 时段四个维度聚合,输出看板:
dashboard:
panels:
- name: 日均抓取量
metric: count(requests) group by spider
- name: 抓取深度
metric: avg(depth) group by spider
- name: 状态码分布
metric: count(*) group by status, spider
- name: Top 抓取路径
metric: count(*) group by url limit 20
- name: 抓取热力图
metric: count(*) group by hour, spider
从看板到行动
看板不是终点,行动才是。三个典型动作:
- 抓取量突降:检查 robots.txt 是否误封、llms.txt 是否失效、站点是否有大面积 5xx
- 抓取深度浅:AI 蜘蛛只抓首页,说明内链结构有问题,给重点页面加显式链接和 llms.txt 索引
- 状态码 4xx/5xx 多:AI 蜘蛛遇到死链会降低站点信任分,每周修复一批 404
某 B2B 客户搭好看板后发现 ClaudeBot 的抓取深度只有 1.2(基本只抓首页),调整内链和 llms.txt 索引后,抓取深度提升到 3.8,两个月后 Claude 回答里品牌出现频率翻倍。
识别 AI 蜘蛛只是起点,读懂它们的”阅读习惯”,才能真正把站点改造成 AI 爱读的知识源。