最常见的误操作来自四个误解:把 robots.txt 当成收录开关、把提交站点地图当成收录保证、把 HTTPS 当成收录与排名的通行证、把“页面已发布”当成“页面已被抓取”。这四种误解都会让人做出错误动作,比如屏蔽整站、反复提交同一批链接、把时间花在改证书上,而真正该处理的抓取与索引问题被搁置。判断标准只有一个:到搜索引擎的抓取与索引状态里核对,而不是凭感觉推断。
robots.txt 控制的是抓取,不是索引。用 Disallow 挡住一个页面后,搜索引擎可能仍会通过外链或其他信号知道这个 URL,并在没有抓到内容的情况下把它放进索引,只是展示形式不同。更危险的是误写 Disallow: /,这会让整站抓取停摆,而你可能以为只是“暂时隐藏几个页面”。
适用条件:只有在确实不希望被抓取时才用 robots.txt;如果目标是让某个已收录页面从结果中消失,应使用页面级的移除机制,而不是抓取限制。检查项:打开 robots.txt 路径,确认没有误伤整站或整目录的规则。验收信号:抓取统计中目标目录的抓取请求恢复正常,且索引状态不再出现“已屏蔽但已索引”一类提示。
站点地图是发现链接的辅助手段,不是收录承诺。它只能帮助搜索引擎更快知道 URL 存在,是否抓取、是否索引仍取决于页面质量、重复程度、服务器响应和抓取预算。把几百个低质页面一次性塞进站点地图,往往不会提高收录率,反而让真正重要的页面更难被优先处理。
可执行做法:站点地图只放返回 200 状态、内容可访问、允许被抓取的规范 URL;每个 URL 用 lastmod 反映真实更新时间,不要每次生成都刷新全部时间。检查项:站点地图中的 URL 数量与实际有效页面数量是否一致,是否混入了重定向、404 或禁止抓取的地址。验收信号:抓取统计里这些 URL 开始出现请求,索引报告中的“已发现但未抓取”数量逐步下降。
HTTPS 解决的是传输加密,不保证站点没有漏洞,也不保证收录和排名。常见误操作是:页面无法访问时先怀疑证书,反复更换证书,而实际原因是服务器返回 5xx、页面被误设 noindex,或者移动端与桌面端返回不同内容。
适用条件:当抓取出现证书错误、混合内容警告或跳转异常时,才把 HTTPS 配置列入排查。检查项:用抓取工具查看目标 URL 的最终状态码、跳转链和响应头;确认 http 到 https 只有一次跳转,没有循环;确认页面源码里没有指向 http 的资源。验收信号:目标 URL 返回 200,跳转链不超过一跳,抓取错误中的证书类提示消失。
发布只代表内容存在于服务器上。如果新页面没有任何内链指向,也没有出现在站点地图或导航中,抓取程序可能很久都发现不了它。另一种误操作是给新页面加 noindex 做“测试”,上线后忘记移除,结果页面一直不进索引。
可执行步骤:新页面上线后,先从首页或栏目页加一条可点击的内链;确认页面返回 200、没有 noindex、没有 canonical 指向别的地址;再通过抓取工具查看该 URL 的抓取状态。检查项:页面是否在站点地图中、是否有至少一条站内链接、canonical 是否指向自身。验收信号:抓取记录中出现对该 URL 的请求,索引状态从“已发现”变为“已抓取”或“已索引”。
先做一次全站抓取限制与 noindex 排查,因为这两类误操作的破坏范围最大,修复成本最低。顺序是:检查 robots.txt 是否误伤整站,检查重要页面是否被加了 noindex,检查 canonical 是否指向错误地址,最后再整理站点地图。这三项确认无误后,再去看抓取统计和索引报告,才能判断问题是抓取不足还是索引被拒。
下一步:选一个当前未收录的重点页面,按上面的检查项逐条核对状态码、robots 规则、noindex 标签和站内链接,把结果记录下来,再决定是改技术配置还是补内链。