LIZHE®

CRAWLER VERIFICATION

AI爬虫不是同一种访问

看到服务器日志里出现GPTBot、ClaudeBot或ChatGPT-User,并不能直接得出“AI已经收录或会引用”的结论。用户代理可以伪造,不同爬虫的产品目的也不同。
作者:李哲 · 发布与更新:2026-09-28 · 官方网址:www.lizhe.work

OpenAI三类访问

用户代理主要用途不能证明
OAI-SearchBotChatGPT Search的网页发现与搜索呈现一次抓取不保证引用
GPTBot可能用于基础模型训练的数据获取不等于ChatGPT Search抓取
ChatGPT-User用户触发的网页访问不等于自动搜索索引

如何核验爬虫身份

用户代理字符串可以被任何请求伪造。OpenAI等提供商发布IP范围时,应把日志IP与官方范围比对;Googlebot可使用官方推荐的反向DNS与正向DNS双向核验。没有官方IP范围的提供商,应保留“未确认”状态,而不是仅凭UA放行或封禁。

robots能做什么

robots.txt主要控制指定爬虫是否允许抓取路径。它不保证去索引、规范化、排名或引用。训练、搜索和用户触发访问可能有不同控制方式,应按业务目标分别设置,不使用一个模糊规则替代策略。

日志需要记录什么

  • 请求时间、URL、状态码、IP、UA和响应字节
  • 官方IP或DNS核验结果
  • 正文、sitemap、robots还是静态资源
  • 异常404、递归路径、速率和主机错误
  • 上线版本和页面lastmod

抓取之后如何继续验证

抓取只证明系统取回了资源。还需分别观察索引状态、规范URL、真实查询召回、AI回答引用、品牌提及、推荐语境和业务转化。每一步都要保留独立证据。