上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终呈现的地址与内容一致。具体做法是拿一份待上线页面清单,逐项检查robots.txt、页面级robots元标签、canonical、sitemap和状态码,再用抓取工具模拟访问,看返回结果是否符合预期。
没有清单就无法核对。上线前应整理出所有需要被抓取的URL,至少包含首页、栏目页、内容页和需要保留的旧地址。清单里建议标出每类页面的预期状态:正常返回、跳转、还是明确不索引。龙岩网站开发项目中常见的问题是测试域名和正式域名混用,清单要写清以哪个域名为准。
robots.txt控制的是抓取范围,页面级<meta name="robots">控制的是索引与跟进。两者作用不同,不能互相替代。检查时先直接访问/robots.txt,确认没有误写Disallow: /这类全站屏蔽规则,再看是否声明了sitemap地址。
随后抽查页面源码,确认没有把noindex留在正式页面上。测试环境为了防止被收录加上noindex是合理的,但迁移到正式环境时必须移除。判断结果很简单:如果robots.txt允许抓取、页面又没有noindex,这个页面才具备被索引的前提。
这三项经常各自正确、合在一起却矛盾。例如页面canonical指向A地址,sitemap里写的却是B地址,搜索引擎会收到混乱信号。核对方法是抽一批URL,把页面canonical、sitemap记录、实际可访问地址三者放在一起比对,应当指向同一个规范地址。
状态码方面,正常页面返回200;旧地址若已迁移,应返回301并指向新地址;已彻底下线的页面可返回410或404。要避免的是用302做永久跳转,或让多个地址都返回200却内容相同。适用条件是站点做过改版或换域名,此时跳转链不宜过长,最好一步到位。
配置写完不等于生效。可以用搜索引擎官方提供的抓取测试工具,或本地用命令行请求页面,观察返回的头部和正文。以下命令只做示例,域名替换为实际待检查地址:
curl -I https://example.com/
重点看状态码和是否出现意外的跳转。若返回301,继续跟进目标地址是否可达;若返回403或503,说明服务器层面可能拦截了抓取,需要检查防火墙、CDN或访问频率限制。这里要区分“可能原因”和“已定位原因”:返回403可能是防护规则,也可能是权限配置,需结合服务器日志确认,不能只凭现象下结论。
上线前的核对应由开发、内容和运维共同确认:开发负责状态码与跳转,内容负责页面是否该索引,运维负责服务器不误拦抓取。验收标准可以量化为:清单内所有应索引页面返回200、无noindex、canonical自洽、已写入sitemap;所有旧地址跳转正确且无死链。满足这些条件,才进入提交sitemap和观察抓取数据的阶段。
下一步:拿这份清单在预发布环境完整跑一遍,把不符合预期的URL逐条记录并修复,再正式上线。