确定影响范围的核心方法,是把“异常”拆成可核对的页面清单,再逐层对比:先确认是整站、某个目录,还是少数页面;再判断是抓取、索引还是展现环节。不要凭一次搜索结果就下结论,也不要先改 robots.txt 或批量提交。下面用一个假设例子说明步骤。
假设某站点有 500 个产品页,其中 120 个页面在百度搜索“品牌词 + 产品名”时找不到,但首页、栏目页和其他 380 个产品页正常。时间和人手有限时,不要先全站排查,而应先把这 120 个页面按目录、模板、发布时间、是否有站内链接分组。
如果 120 个页面全部来自同一个目录,优先怀疑该目录的抓取或索引设置;如果分散在不同目录但共用同一模板,优先怀疑模板输出或内容相似;如果只是最近发布的页面,优先怀疑抓取和发现速度,而不是惩罚。分组后,影响范围会从“全站收录异常”缩小到“某目录或某批页面”。
常见错误是只看首页是否被收录,就判断“全站被K”。首页正常不能证明内页正常,内页异常也不能直接推出整站异常。另一个错误是把 robots.txt 的抓取限制当成索引移除手段:它可能阻止抓取,但不等于页面会从索引中消失,也不适合作为临时修复范围的手段。
从异常组和正常组各抽 10 个页面,逐项对比:
robots.txt 或页面级 noindex 限制。如果差异只出现在 canonical 指向其他页面,影响范围可能是“被合并的重复页面”;如果差异是状态码异常,范围是“返回错误的 URL”;如果差异是缺少站内链接,范围是“孤岛页面”。站点地图不保证收录,所以“已提交站点地图”不能作为页面正常的证据。
时间和人手有限时,按以下顺序处理:先修复返回错误状态码的 URL,因为这类问题会直接阻断抓取;再处理被 noindex 或 robots 限制的目录,但要先确认是否确实希望这些页面被索引;然后处理孤岛页面,补充站内链接;最后才考虑内容质量和更新频率。若异常页面只占少数且不影响核心业务,可以放入观察清单,不必立即全站改动。
判断结果的标准是:修复后异常组与正常组的差异条件是否消失。例如,假设异常页面全部返回 503,修复后日志中百度蜘蛛能拿到 200,且抽样页面重新可搜,才能说明范围已收敛。若修复后仍搜不到,需要重新分组,而不是继续重复同一操作。
马上做一张表,列 URL、目录、模板、状态码、canonical、站内链接数、最近抓取时间、抽样搜索结果。先填 20 个异常页面和 20 个正常页面,用同一套字段对比。表填完后,影响范围通常会从模糊的“百度收录问题”变成具体的目录、模板或状态码,后续处理也就有了优先级。