上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引版本与线上版本一致。最容易被忽略的是“能访问”不等于“能抓取”,“能抓取”也不等于“会索引”,这三层要分别验证。
不要等上线后再想哪些页面该收录。准备阶段先分两类:
同时确认每个页面的规范地址(canonical)指向自己,而不是统一指向首页或另一个不相关页面。如果同一内容有多个URL可访问,先决定保留哪一个作为规范版本。
这两项经常被混为一谈,但作用不同:
robots.txt 控制爬虫能否抓取某个路径。写法是禁止抓取,不是禁止索引。被禁止抓取的页面如果外部有链接,仍可能被索引,只是没有内容摘要。<meta name="robots" content="noindex"> 控制页面能否被索引。它要求爬虫先能抓到页面,才能读到这条指令。因此有一个常见矛盾:如果既在robots.txt里禁止抓取,又指望noindex生效,结果是爬虫根本读不到noindex,页面反而可能被索引。正确做法是:想让页面不被索引,就允许抓取、加上noindex;想彻底不让抓取,就不要指望noindex起作用。
上线后不要只看“页面能打开”。按下面顺序验证:
你的域名/robots.txt,确认没有误封整站或关键目录,并确认sitemap地址可访问。noindex,确认不该出现的页面没有这条指令。site:你的域名 做粗略抽查,但要知道它只是抽样,不能作为收录量的精确依据。假设一个场景:某产品页需要被索引,但robots.txt里误写了 Disallow: /product/。此时页面能正常访问,URL检查工具却显示“已被robots.txt阻止”。判断结果是:抓取被阻断,索引配置再正确也无法生效,应先修改robots.txt再重新提交。
抓取与索引配置不是一次性任务。每次改版、换域名、调整URL结构、批量修改模板时,都要重新核对。建议把上述检查项写成一份上线清单,由执行改动的人在发布前逐项确认,而不是等流量下降后再排查。维护阶段重点看两类信号:关键页面是否从索引中消失,以及robots.txt和noindex是否被误改。
下一步:挑出你网站最重要的三个内容页,分别用URL检查工具提交,记录“抓取”和“索引”两项当前状态,再对照本文清单修正不一致的配置。