最小修复试验的做法是:先确认“没被收录”的具体表现,再只改一个可能影响抓取或索引的变量,用同一批页面做前后对照,看百度是否开始抓取或收录。假设有一个由二十个产品页组成的小栏目,其中五个页面在百度搜索完整标题时找不到,其余十五个正常;这时不要全站改版,而应把这五个页面作为试验组,从抓取、内容、链接三个方向逐一排查。
“网站被百度收录”在实际排查中至少对应三种情况:百度没有抓取过该网址;抓取过但未建索引;已收录但搜索完整标题找不到。三者的修复方向不同。判断方法可以按下面顺序执行:
site: 加具体网址进行查询,结果仅作参考,不能当作收录量的精确统计。<meta name="robots" content="noindex">,这类标签会阻止索引,与 robots.txt 的抓取限制不是一回事。只有先确定是“没抓取”还是“抓取了没索引”,后面的试验才有意义。若日志里根本没有百度蜘蛛记录,优先查抓取入口;若蜘蛛来过且返回 200,却长期没有索引,优先查页面质量和重复内容。
假设某站点有二十个产品页,结构相同,其中五个页面的标题、正文和价格都正常,但在百度搜索完整标题时找不到。此时可以这样安排最小修复试验:
这个例子的关键不是“加内链一定有效”,而是用对照把猜测变成可观察的结果。常见错误是同时改标题、正文、内链和模板,最后即使页面被收录,也无法知道是哪一项起了作用。另一个错误是拿五个页面分别改五个不同变量,样本太少且互相干扰,结论不可靠。
试验应从成本低、影响面小的变量开始,顺序建议如下:
每一轮只动一层里的一个变量,并保留至少一个不改动的对照 URL。若站点流量很小,百度蜘蛛访问频率低,试验周期要相应拉长,不能因为三天没变化就判定失败。HTTPS 只能说明传输层加密,不保证页面安全无漏洞,也不保证被收录或获得更好排名。
试验结束后,按下面标准判断:试验组被抓取且进入索引,对照组未变化,可以把该变量作为候选原因,再扩大到更多同类页面;试验组和对照组都无变化,说明该变量不是当前瓶颈,回到日志和页面状态重新定位;试验组被抓取但仍未索引,问题更可能在内容质量或重复度,而不是抓取入口。
下一步,先选一个具体栏目,写出五个页面的 URL 清单和当前状态,再从中挑两个页面做单变量修改,同时保留对照页面。记录修改日期和日志变化,等百度蜘蛛再次访问后再决定是否扩大修复范围。