判断采集是否遗漏,核心不是看总量,而是把“应有内容”与“实际采到内容”做集合比对。你需要先确定一份可核对的基准清单,再用同一口径逐项对照,缺失的条目就是遗漏。对a5seo诊断这类分析工作来说,起点是拿到基准、采集结果和字段映射三份资料,终点是给出缺失清单和复核结论。
没有基准就无法判断遗漏。基准可以来自站点自身的列表页、分类页、站点地图,或后台导出的内容清单。判断标准是:这份清单必须覆盖你关心的全部对象,且每一条都有稳定唯一的标识,例如URL、内容ID或标题加发布时间的组合。
如果基准本身不完整,后面的比对只会得出“看起来没漏”的假象。第一次接触时,先问自己:我要检查的是整站,还是某个栏目、某段时间的内容?范围定得越清楚,遗漏判断越可靠。
采集结果通常包含多条记录。你需要把它整理成与基准相同的字段结构,至少保留唯一标识、标题、发布时间、来源地址。整理时注意两点:
这一步的产物是一张对照表,而不是一堆原始文件。只有字段对齐,后面的差集才有意义。
把基准清单减去采集结果,得到的差集就是候选遗漏项。操作上可以这样执行:
这里的关键判断是:数量接近不代表没有遗漏,数量差异大也不一定全是遗漏。只有逐条匹配,才能区分“真的没采到”和“采到了但标识对不上”。
发现缺失后,不要立刻下结论。同一现象可能有多种解释:
要区分“可能原因”和“已经定位的原因”,方法是对缺失项做抽样复现:手动打开对应来源,确认该内容是否存在、是否在预期位置、采集时是否触发了相同条件。只有复现成功,才能把原因从“可能”升级为“已定位”。
一份可交付的遗漏判断结论,至少包含:基准范围说明、采集结果口径、缺失条目清单、每条缺失的复核状态,以及仍无法确认的存疑项。验收标准是:任意一条缺失项都能追溯到具体来源和具体匹配过程。
如果缺失项无法复现,就保留为存疑,不要强行归因。下一步是选取缺失清单中占比最高的一类,回到采集规则或来源页面,验证该类别是否被系统性跳过,再决定是调整采集范围还是补充规则。