
为什么要公开这份数据
「AI 搜索时代,官网还有人看吗?」——我们的答案是:看官网的主体正在从人变成 AI 爬虫。AI 回答「硅基员工多少钱」这类问题时,先去抓谁的网站,决定了它引用谁。
市面上讲 GEO(生成式引擎优化)的文章很多,但几乎没人公开自己的一方实测数据。我们把自家官网的爬虫日志按月公开,既是方法论的自证,也给同行一个可对照的参照系。
首月观测数据(2026-07-25 → 08-27)
口径说明:数据来自本站 nginx 一方访问日志,按 User-Agent 识别;「User」类(ChatGPT-User / Claude-User)代表真实用户在 AI 对话中触发了对本站的实时访问——这是比爬虫更接近「被引用」的信号。
| 爬虫 / 访问源 | 来访次数 | 所属 | 备注 |
|---|---|---|---|
| Googlebot | 592 | 谷歌 | 传统搜索,仍在深度抓取文章页 |
| GPTBot | 336 | OpenAI | 训练/索引爬虫,AI 阵营最勤快 |
| OAI-SearchBot | 134 | OpenAI | ChatGPT 搜索专用爬虫 |
| Claude-User | 115 | Anthropic | Claude 用户触发的实时抓取 |
| ChatGPT-User | 88 | OpenAI | ChatGPT 用户触发的实时抓取 |
| Baiduspider | 55 | 百度 | 仅抓首页层级,文章页待收录 |
| Bytespider | 49 | 字节跳动 | 豆包背后的爬虫 |
| Applebot | 44 | Apple | Siri/Spotlight 与 Apple Intelligence |
| PerplexityBot | 41 | Perplexity | AI 答案引擎 |
| ClaudeBot | 39 | Anthropic | Claude 索引爬虫 |
| bingbot | 9 | 微软 | 抓取量明显偏低 |
三个值得记住的发现
- AI 爬虫比传统搜索更勤快:OpenAI 系(GPTBot+SearchBot+User)合计 558 次,已接近 Googlebot 的 592 次——而新站冷启动期百度只来了 55 次。
- 「用户触发型抓取」是真实需求信号:ChatGPT-User + Claude-User 合计 203 次,意味着真实用户在向 AI 提问时,AI 实时访问了我们的页面找答案。
- 站长平台验证直接影响抓取深度:完成 Search Console 提交后 Googlebot 从几乎不来变为深度抓取文章页;百度因站长验证卡在人机验证环节,至今仍只抓首页——收录通道的开通状态直接写在爬虫行为里。
这份数据对你的企业意味着什么
如果你的官网还没被这些爬虫访问,你在 AI 搜索里就是「不存在」。自查方法很简单:让运维查 access.log 里的 GPTBot / OAI-SearchBot / ClaudeBot / PerplexityBot / Bytespider 记录,零记录 = AI 时代的隐形人。
让爬虫抓得到只是第一步;让它「读得懂、愿意引用」靠的是内容工程:结构化问答、TL;DR 直接答案、对比表格、FAQPage 结构化数据——本站 150 余篇内容全部按此规范建设,这份月报就是效果的持续追踪。
更新机制
本页数据每月初随日志分析自动更新(页面顶部日期为最近校准时间)。历史月份的核心数字会在正文中保留对比,形成时间序列。需要原始口径说明或合作引用,请联系 aicoast@foxmail.com。