先说结论:站点上线 9 天,访问记录里收录类程序共到访 1,724 次,其中属于 AI 检索的只有三家——ClaudeBot、GPTBot 与 OpenAI 的检索程序;豆包一侧 9 天零到访。本文是《实验记录:如何确认一篇内容被 AI 搜索收录》所提方法的第一次完整落地:把服务器访问记录按收录程序逐条拆开,看清这段时间里有哪些检索方来过、读取了什么、留下了什么信号,并给站点留一份基线数据,供第 2 轮复测对照。
方法与数据来源
- 时间范围:2026-09-02 13:30 至 2026-09-11 00:36,含建站当日,已合并全部轮转归档
- 请求总量:16,764 条
- 识别方式:按访问方标识逐行匹配常见收录程序名单,同一条请求只计一次;不含样式表、脚本、图片等静态资源
- 局限:访问方标识可以被伪造,本轮的绝对数字只作趋势参照;站内统计页对可疑来源另有单列口径
观察
一 收录类程序到访总表(9 天累计)
- ClaudeBot —— 321 次,多数日期恒定 24 次(9-05 为 4 次、9-06 为 20 次)
- bingbot —— 266 次,每天 17–52 次,栏目覆盖最全
- GPTBot —— 184 次,9-02 共 90 次、9-06 共 78 次两轮集中,其余每天 2 次
- Amazonbot —— 75 次,9-04 至 9-06 集中全站走查,此后基本停止
- OAI-SearchBot —— 62 次,每天 6–12 次,全部落在 robots.txt
- Baiduspider —— 46 次,只有首页 11 次
- Googlebot —— 34 次,首页 10 次、robots.txt 14 次
- Sogou / 360Spider / Applebot / DotBot / SemrushBot —— 42 次,零散
- AhrefsBot 632 次、MJ12bot 55 次为工具方访问,不属 AI 检索,单独统计、不并入上表
从未出现:豆包一侧(Bytespider)、PerplexityBot、Google-Extended、meta-externalagent、花瓣(PetalBot)、YisouSpider。
二 访问方读取了哪些地址
robots.txt 253 次、站点地图各 110 次以上、首页 124 次;六篇文章每篇 11–30 次;关于页 36 次、联系页 25 次、分类页 2–30 次。响应结果:正常 1,474 次、规范化跳转 225 次、找不到 22 次、被拒 3 次。
三 ChatGPT 的实时浏览代理来过
7 次访问集中在 9-03,其中 11:12 的一次会话连续读取了首页、关于页和《实验记录:如何确认一篇内容被 AI 搜索收录》。这是上线第二天就有真实会话通过 AI 入口打开本站的记录——比收录本身更值得留意的一类信号。
四 llms.txt 的读者
上线以来 22 次访问。读取方是 AI 客户端与代理工具(通义桌面客户端 3 次,agentcensus、piperic、allorigins 等),主流检索程序一次都没有读它。
结论
- 放行不等于被收录。robots 里放行了 8 个 AI 检索程序,9 天里实际上门的只有 3 个。
- 新站的第一次入库更像批量取件,而不是持续蹲守。GPTBot 只在 9-02 和 9-06 各做了一轮集中读取,其余日期各 2 次。首页保持可访问、站点地图提交到位,比每天更新更重要。
- 只读 robots.txt 而正文取用为零,是被登记但尚未入库的状态。OAI-SearchBot 的 62 次访问全部落在 robots.txt。
- 节奏差异明显。ClaudeBot 每天恒定 24 次属固定配额;bingbot 每天走查全部栏目,覆盖最全;中文一侧的 Baiduspider 目前只碰了首页。
- 死链会被踩到。22 次找不到的记录里,站点地图地址猜错占 11 次(对方按 /sitemap_index.xml 去找,本站实际用的是 /wp-sitemap.xml)。
- 中文 AI 一侧起点为零。9 天里没有出现豆包一侧的收录程序访问记录,百度一侧 46 次基本只落在首页。站内内容在中文 AI 问答中的可见度目前是起点状态,第 2 轮把这里作为观察重点。
常见问题
放行了 AI 收录程序,为什么 9 天里只来了 3 家?
放行只是允许进入,不等于会被收录。9 天里 robots.txt 共被读取 253 次,其中 92 次来自 ClaudeBot、62 次来自 OAI-SearchBot,但后者的访问全部落在 robots.txt,一次正文都没有取用。数据来源:本站服务器访问记录,2026-09-02 13:30 至 09-11 00:36。
新站大概多久能被 AI 搜索收录?
本轮观察显示,首次收录更像批量取件而不是持续蹲守:GPTBot 只在 9-02 和 9-06 各做了一轮集中读取,其余日期每天 2 次。更关键的是首页保持可访问、站点地图提交到位。数据来源:同上。
豆包和元宝现在能查到站内内容吗?
目前不能。9 天里没有出现豆包一侧(Bytespider)的访问记录,百度一侧(Baiduspider)46 次访问基本只落在首页。站内内容在中文 AI 问答中的可见度还处于起点状态,这是第 2 轮复测的重点。数据来源:同上。
llms.txt 对 AI 收录到底有没有用?
本轮 22 次访问里,读取方是 AI 客户端与代理工具(通义桌面客户端 3 次,agentcensus、piperic、allorigins 等),主流检索程序一次都没有读取。它更像面向 AI 代理的说明文件,而不是收录的必经入口。数据来源:同上。
下一步
- 补掉被猜错的站点地图地址,或在该地址给出明确指向
- 中文 AI 一侧的可见度动作:站外分发与外链同步(公众号、知乎)
- 第 2 轮复测安排在 4 周后(10 月上旬),与本轮的次数、覆盖面逐项对照
- 待补录:搜索后台的收录条数(本轮未取到)