判断采集是否遗漏,不能只看“收录量”一个数字。更可靠的做法是:先确定一份应当被采集的URL清单,再用站内日志、站内搜索与抓取记录交叉比对,找出“存在但从未被抓取”“被抓取但未进入索引”“进入索引但内容缺失”三类差异。只有差异能复现、能定位到具体URL,才算完成判断。
“采集遗漏”可能指三种不同情况,混在一起会得出错误结论:
适用前提是:你必须先有一份“应被采集清单”,例如商品库导出表、文章发布表或站点地图。没有基准清单,任何数量对比都只是估算,无法证明遗漏。第三方估算流量、搜索引擎报告与站内统计的口径不同,不能互相替代,也不能单凭某一指标还原采集逻辑。
具体可执行的步骤:
判断结果分三种:日志中无访问记录,属于抓取遗漏,优先检查入口链接与站点地图;日志中有访问但不可检索,属于索引遗漏,优先检查页面状态码、规范标签与内容重复;可检索但内容不符,属于内容遗漏,优先检查分页、筛选参数与异步加载。
单看日志只能证明“来过”,不能证明“收下”。单看站内搜索只能证明“现在能搜到”,不能证明“曾经被抓”。把两者按URL对齐,才能定位遗漏环节。核对时关注这些检查项:
假设某商品页在站内搜索中搜不到,日志显示抓取程序只访问了列表页,没有访问详情页。此时可判断为抓取遗漏,原因是详情页入口仅存在于脚本生成的链接中。把入口改为可抓取的普通链接后,再观察日志是否出现详情页访问记录,这就是验收信号。
完成调整后,判断遗漏是否修复,看四个信号:基准清单中的URL在日志中出现访问记录;站内搜索能返回对应页面;页面返回内容与源数据一致;规范标签指向自身而非其他页面。四个信号不必同时立刻出现,但缺少任何一个,都不能认定遗漏已解决。
常见误判需要排除:把“未被当前搜索词命中”当成“未被采集”,实际可能只是查询词不匹配;把“第三方估算收录量下降”当成“采集遗漏”,实际可能只是统计口径变化;把“新发布页面暂未出现”当成“遗漏”,实际可能只是抓取周期未到。区分“可能原因”与“已经定位的原因”,是避免误判的关键。
下一步:从你的内容库导出最近一批已发布URL,按栏目分层抽取样本,逐条记录“日志是否访问、站内搜索是否可检索、内容是否一致”,先形成一份可复核的遗漏清单,再针对清单中的具体类型逐项修复。