要区分访问抓取与索引结果,最直接的办法是分别看“服务器是否收到请求”和“搜索引擎是否把该网址作为可展示结果”。抓取成功只说明爬虫来过并拿到了响应,索引成功则要看该网址能否被搜索到,或是否出现在站点查询工具的已编入索引报告中。两者可能一个成立、另一个不成立,排查时必须分开记录。
在服务器访问日志中筛选搜索引擎爬虫的 User-Agent,观察目标网址的请求记录。重点看三列信息:请求时间、HTTP 状态码、返回字节数。状态码 200 且字节数接近正常页面,说明抓取请求已成功返回内容;404、500、403 表示抓取受阻或失败。若日志里完全没有该网址的请求记录,说明问题还在抓取之前,比如内链没有指向、站点地图未提交或 robots.txt 挡住了路径。
这里要分清“可能原因”和“已经定位的原因”。日志没有记录,可能是爬虫尚未发现该页,也可能是它被其他规则挡在门外,不能只凭一项现象下结论。需要结合 robots.txt 和页面链接入口一起判断。
抓取成功不等于已收录。判断索引结果可以用两种方式:一是在搜索引擎中用 site: 加完整网址查询,看该页是否作为独立结果出现;二是在站点查询工具中查看该网址的索引状态。若显示“已抓取,尚未编入索引”,说明抓取已完成,但索引环节被推迟或拒绝;若显示“已编入索引”,才说明它进入了可展示范围。
还要注意,不同搜索引擎的抓取与索引是各自独立的。在一个引擎中已收录,不代表另一个引擎也已处理。核查时应对每个目标搜索引擎分别执行同样的检查。
这张表的作用是缩小范围,不是替代具体核查。每个现象都可能对应多个解释,例如“搜索不到”既可能是未索引,也可能是索引了但排名极低,需要结合站点查询工具的报告判断。
如果定位在抓取环节,先确认 robots.txt 没有误封目标路径,再检查页面是否至少有一条可爬取的内链指向,并确认站点地图中的网址返回正常状态码。站点地图不保证收录,它只是帮助发现网址的线索,不能替代内链和页面质量。
如果定位在索引环节,检查页面是否有 noindex 指令、规范标签是否指向了其他网址、内容是否与站内其他页面高度重复。修正后不要期待立即变化,复查时至少对比三项:服务器日志中该网址的最近抓取时间、站点查询工具中的索引状态、以及 site: 查询结果是否出现。只有这三项都向目标方向变化,才能判断改进生效。
若页面涉及登录、付费或敏感内容,还要确认它是否本来就适合被索引。robots.txt 的抓取限制不等于可靠的索引移除:被禁止抓取的网址仍可能因外部链接而被索引,只是搜索引擎看不到页面内容。需要彻底阻止展示时,应使用 noindex,并确保该页允许被抓取,否则指令无法被读取。
挑一个当前未被收录的具体网址,先查服务器日志确认是否被抓取,再用站点查询工具确认索引状态,把结果记成“已抓取未索引”或“未抓取未索引”,然后只针对对应环节做一处修改,几天后复查同一组指标。