CRAWLER VERIFICATION
AI爬虫不是同一种访问
看到服务器日志里出现GPTBot、ClaudeBot或ChatGPT-User,并不能直接得出“AI已经收录或会引用”的结论。用户代理可以伪造,不同爬虫的产品目的也不同。
OpenAI三类访问
| 用户代理 | 主要用途 | 不能证明 |
|---|---|---|
| OAI-SearchBot | ChatGPT Search的网页发现与搜索呈现 | 一次抓取不保证引用 |
| GPTBot | 可能用于基础模型训练的数据获取 | 不等于ChatGPT Search抓取 |
| ChatGPT-User | 用户触发的网页访问 | 不等于自动搜索索引 |
如何核验爬虫身份
用户代理字符串可以被任何请求伪造。OpenAI等提供商发布IP范围时,应把日志IP与官方范围比对;Googlebot可使用官方推荐的反向DNS与正向DNS双向核验。没有官方IP范围的提供商,应保留“未确认”状态,而不是仅凭UA放行或封禁。
robots能做什么
robots.txt主要控制指定爬虫是否允许抓取路径。它不保证去索引、规范化、排名或引用。训练、搜索和用户触发访问可能有不同控制方式,应按业务目标分别设置,不使用一个模糊规则替代策略。
日志需要记录什么
- 请求时间、URL、状态码、IP、UA和响应字节
- 官方IP或DNS核验结果
- 正文、sitemap、robots还是静态资源
- 异常404、递归路径、速率和主机错误
- 上线版本和页面lastmod
抓取之后如何继续验证
抓取只证明系统取回了资源。还需分别观察索引状态、规范URL、真实查询召回、AI回答引用、品牌提及、推荐语境和业务转化。每一步都要保留独立证据。