GEO 工具
页面可引用性检查
贴一个网址。这里检查两件事:回答问题的那些抓取器能不能读到这一页,以及读到之后能不能把结论抽出来。本工具不执行 JavaScript,凡是因此受影响的行都会写明。
页面网址
一个页面,不是整站。该页需要返回 200 且是 HTML。
填了这项,开头直答那一行才会对着它检查;不填时那一行显示「不适用」,不会算成未通过。
仅展示行不计入结论:训练类抓取器的放行与 /llms.txt 都不决定这一页能否被回答引用。
这项检查不做什么
- 不执行 JavaScript。正文只在 hydration 之后才出现的页面,会被报成「HTML 里没有正文」——因为不渲染的抓取器看到的就是这样。
- 只读一个页面,外加该站的 robots.txt 与 llms.txt。不爬全站,也不去抓 canonical 指向的那一页。
- 不涉及排名、流量,也不代表任何模型真的引用过这一页。它描述的是页面,不是市场。
- 训练类抓取器与 /llms.txt 只展示、不计入,因为两者都不决定这一页能否被回答引用。
- 有两行是模式匹配而不是理解语义:开头直答与限定条件量化。它们带标记,值得去看一眼,但不必照办。
- 它只读页面的前一段。文档超出这个范围时,凡是要报「不存在」的检查都改说「读不到」。
关于这项检查
- 全部通过就代表模型会引用这一页吗?
- 不代表。这些行说的是访问与形态:抓取器是否被放行、正文是否在 HTML 里、一条结论能否被抽出来。模型是否真的用你的页面回答,取决于被问的问题以及网上还有什么,本工具从不声称能替你判断这件事。
- 为什么 GPTBot 只展示不计分?
- GPTBot 与 Google-Extended 管的是训练语料采集。真正为了回答而去抓取页面的是 OAI-SearchBot、ChatGPT-User、PerplexityBot 与 ClaudeBot,计入结论的就是这四行。禁掉 GPTBot 不会让你无法被引用。
- 为什么没有 robots.txt 反而算通过?
- RFC 9309 规定:robots.txt 不可得(404)等于完全放行,所以没有这个文件的站点并没有拦谁。robots.txt 读不到(例如 500)是另一回事——该站的规则未知,那一行会如实写「读不到」,而不是猜。
- 页面在我浏览器里正常,为什么 HTML 那行没通过?
- 你的浏览器会执行 JavaScript,本检查不会,多数抓取器第一次取页面时也不会。如果正文只在 hydration 之后才存在,这一行告诉你的正是「不渲染的读者会收到什么」。
接下来去哪
这项检查只回答关于一个页面的一个问题,其余的在别处。