受限内链抓取到底能证明什么

用公开内链抓取正确理解已观测到的 HTML 路径、候选孤岛页面,以及仍然需要人工复核的结构问题。
内链审计的价值,在于把一个结构问题缩小到可复核的范围。它不能替代完整爬虫、Search Console 属性数据或编辑判断。更有用的问题是:本次请求实际观察到了哪些公开 HTML 路径,接下来应该由谁检查什么?
这个边界会让结果保持可执行。公开审计可以在明确预算内采集页面、同源 HTML 链接,以及可获取的 Sitemap URL;它应展示关系图,而不是假装已经掌握整个网站。
先看已观测路径,不承诺全量覆盖
Google 的说明指出,可抓取链接帮助其发现页面,而锚文本能帮助用户和 Google 理解内容。因此,审计应记录真实遇到的来源页、目标页和锚文本,而不是只给出一个数量。可参考 Google 的链接最佳实践。
GenGrowth 的 Tech Agent 只读取同源静态 HTML,不设置日常检测次数配额或固定的前台页数额度,并在一次在线运行中尽可能采集可发现页面。处理时长、请求与响应体积、重定向、并发、私网访问和主机访问节奏仍受服务端安全边界保护;大型网站可能只得到部分覆盖,因此报告会直接列出本次实际采集范围和停止原因,而不会把技术边界包装成免费额度或质量评分。
| 已观测到的现象 | 可以支持的判断 | 不能支持的判断 |
|---|---|---|
| 页面 A 指向页面 B 的链接被采集 | 本次请求中存在这条静态 HTML 路径 | 网站所有版本都一定如此链接 |
| Sitemap URL 没有通过已观测链接抵达 | 这是一个值得复核的候选孤岛 | 该 URL 不存在于任何导航或 JavaScript 界面中 |
| 页面距离首页有四跳观测路径 | 样本关系图到该页路径较长 | Google 的精确抓取优先级或 PageRank 数值 |
因此,它尤其适合用于网站迁移、导航改版、URL 重构或大批量发布之后:检查你预期存在的公开路径是否仍能在一次真实请求里出现。
把“候选孤岛”当成复核队列
Sitemap 是站长认为重要的 URL 列表。Google 说明它可以帮助发现页面,尤其适合较大或较复杂的网站,但它不保证 URL 一定会被抓取或收录;相反,内部链接完善的网站也能让重要页面被发现。参见 Google 的Sitemap 概览。
因此,受限审计中“候选孤岛”的合适定义是:URL 出现在 Sitemap 中,但本次静态 HTML 抓取没有通过已观测的站内链接到达。它是检查提示,不是“立刻补一条链接”的命令。
可以按以下顺序处理:
- 这个页面还应该公开存在吗? 重复、过期或内容薄弱的页面,可能应该合并或下线。
- 它是否通过其他合理方式可达? 检查分页、语言版本、客户端渲染导航和对应模板。
- 哪一个来源页能自然地把读者带过去? 只在目标页真正回答下一个问题时加入上下文链接。
- 如何验证改动? 再跑一次受限抓取,复核编辑过的来源 URL、目标 URL 和锚文本。
让 JavaScript 与 robots 边界保持可见
静态 HTML 抓取刻意保持保守。只有在 JavaScript 运行后才出现的链接,可能不在采集文档中。对于重度渲染应用里的异常发现,应先视为待验证假设,再到浏览器和产品自身导航中确认。
工具也会尊重 robots.txt。该文件告诉爬虫哪些 URL 可以请求,并不能保证 URL 永远不出现在搜索中;Google 的robots.txt 指南说明了这一点。如果一个路径在审计中无法获取,正确结论是“未检查”,而不是“页面有问题”或“没有被收录”。
把报告变成一个可审核的改动
选择一个同时有明确来源页和目标页的结构发现,把拟加入的链接放回真实编辑语境,记录目标为什么值得被看到,并设置复查窗口。目标不是增加链接数量,而是让重要路径对读者更清楚,也让维护过程更可观察。
当你有一个公开网站需要检查时,可以运行 Tech Agent。运行需要已验证的 GenGrowth 账号,但无需 Search Console 或站点所有权验证;Agent 只读取公开静态 HTML,本次营销站运行不会保存到 App 项目。它的输出是瞬时且受限的,应作为决策证据,而不是自动修改清单。
把方法用在你的网站上
先从一个可验证的 SEO 信号开始
SEO 与 Tech Agent 需要已验证账号,只检查公开 HTML,无需 Search Console 或站点所有权验证;本次营销站运行不会保存到 App 项目。
GenGrowth Team
增长自动化工程师
我们构建帮助产品团队自动化增长实验的工具。