AI 蜘蛛不是爬虫,是”读者”。传统爬虫(Googlebot / Baiduspider)抓 HTML 是为了建索引;AI 蜘蛛(GPTBot / ClaudeBot / Google-Extended)抓内容是为了喂给大模型推理。理解它们的访问规律,是 GEO 的第一步。

AI 蜘蛛与搜索引擎爬虫的区别

维度搜索引擎爬虫AI 蜘蛛
目的建索引知识抽取
抓取频率高频全量低频精选
关注内容HTML 结构正文语义
User-AgentGooglebotGPTBot / ClaudeBot
robots 控制标准 robots.txt标准 + Google-Extended

核心差异:搜索引擎要”全”,AI 蜘蛛要”精”。它们更像在”读”你的站点,而不是”扫”你的站点。

识别 3 大 AI 蜘蛛

GPTBot(OpenAI)

OpenAI 的官方抓取机器人,服务于 ChatGPT 的检索增强和训练语料。

# UA 特征
User-agent: GPTBot
# 反向解析验证
reverse DNS: *.openai.com

特点:抓取有礼貌,严格遵守 robots.txt,频率稳定,偏爱结构化文档和博客。

ClaudeBot(Anthropic)

Anthropic 的抓取机器人,服务于 Claude。

User-agent: ClaudeBot
reverse DNS: *.anthropic.com

特点:抓取深度高,偏爱长文和白皮书,对页面内链跟随积极。

Google-Extended(Google AI)

Google 的 AI 训练抓取,服务于 Gemini 和 AI Overviews。

# 注意:Google-Extended 是控制 token,不是独立 UA
# 它通过 Googlebot 抓取,用 robots.txt 的 Google-Extended 规则控制是否用于 AI
User-agent: Google-Extended
Disallow: /private/

特点:抓取量大且分散,覆盖全站,难以单独从 Googlebot 流量里拆分——必须靠 robots 规则反向推断。

访问规律分析

跑了一周的 nginx 日志,3 大 AI 蜘蛛的访问规律差异明显:

蜘蛛日均请求偏好内容高峰时段平均深度
GPTBot320博客 / 文档凌晨 2-5 点2.4
ClaudeBot180案例页 / 白皮书工作日白天3.8
Google-Extended240全站均衡分散2.1

关键发现:AI 蜘蛛对 /llms.txt/blog/* 的抓取占比超过 60%,对图片 / CSS 等静态资源几乎不碰——印证了”读者”属性。ClaudeBot 的抓取深度最高,说明它更愿意顺着内链深读。

搭建日志分析看板

第 1 步:日志采集

从 nginx 访问日志抽取 AI 蜘蛛请求:

# 提取 AI 蜘蛛访问记录
grep -E "GPTBot|ClaudeBot|Google-Extended" /var/log/nginx/access.log \
  | awk '{print $7, $9, $14}' \
  > ai_spider_raw.tsv

第 2 步:UA 归一与去重

原始 UA 字符串五花八门(大小写、空格变体),统一归一到 3 个标准标签,再去掉同 IP 同 URL 当天的重复抓取,避免一个页面被刷爆统计。

第 3 步:指标计算与可视化

按蜘蛛 / URL / 状态码 / 时段四个维度聚合,输出看板:

dashboard:
  panels:
    - name: 日均抓取量
      metric: count(requests) group by spider
    - name: 抓取深度
      metric: avg(depth) group by spider
    - name: 状态码分布
      metric: count(*) group by status, spider
    - name: Top 抓取路径
      metric: count(*) group by url limit 20
    - name: 抓取热力图
      metric: count(*) group by hour, spider

从看板到行动

看板不是终点,行动才是。三个典型动作:

  • 抓取量突降:检查 robots.txt 是否误封、llms.txt 是否失效、站点是否有大面积 5xx
  • 抓取深度浅:AI 蜘蛛只抓首页,说明内链结构有问题,给重点页面加显式链接和 llms.txt 索引
  • 状态码 4xx/5xx 多:AI 蜘蛛遇到死链会降低站点信任分,每周修复一批 404

某 B2B 客户搭好看板后发现 ClaudeBot 的抓取深度只有 1.2(基本只抓首页),调整内链和 llms.txt 索引后,抓取深度提升到 3.8,两个月后 Claude 回答里品牌出现频率翻倍。

识别 AI 蜘蛛只是起点,读懂它们的”阅读习惯”,才能真正把站点改造成 AI 爱读的知识源。