抓取、索引、排名是三个先后发生但彼此独立的环节:抓取是搜索引擎发现并读取页面,索引是把读取到的内容存入可检索的数据库,排名是用户搜索时从索引中挑选并排序结果。一个页面被抓取不等于被索引,被索引也不等于有排名。多人协作时,把这三件事分开记录和交付,能避免把“没排名”误判成“没收录”,从而减少返工。
要查的是搜索引擎有没有来读取过这个页面。可以用服务器访问日志查看搜索引擎爬虫的请求记录,也可以使用各搜索引擎提供的站长验证工具查看抓取统计。判断结果分三种:日志中完全没有该页面的爬虫请求,说明尚未被抓取,常见原因是缺少入口链接或robots规则拦截;有请求但状态码是5xx,说明抓取失败,需要先修服务器;有请求且返回200,说明抓取成功,可以进入下一步检查。注意,抓取成功只是“读到了”,不代表内容已经入库。
要查的是页面是否已成为可被搜索到的候选结果。最直接的检查方式是用站内搜索语法查询该页面的完整标题或URL特征,看是否出现在结果中;也可以在站长工具里查看已索引页面数量与具体URL状态。判断结果分三种:查询不到,且工具显示“已发现但未编入索引”,说明抓取到了但未入库,常见原因包括内容质量不足、与已有页面高度重复、被标记为noindex;查询不到,工具显示“已排除”,需要看具体排除理由;能查询到,说明已索引,可以进入排名检查。这里要区分网页搜索与平台推荐、付费广告,后两者不是同一套索引逻辑,不能用来判断自然索引状态。
要查的是在具体查询词下,该页面出现在自然结果的第几位。检查时必须固定三个条件:查询词、搜索入口(网页搜索而非其他垂直频道)、设备与地区,否则结果不可比。判断结果分三种:目标词下完全没有该页面,说明未被索引或竞争不足;出现在第2页及以后,说明已索引但相关性或权重不够;出现在首页,说明该词已获得可见排名。多人协作时,建议把“查询词+入口+设备+地区+日期”一起记录,避免不同成员用不同条件得出矛盾结论。
下面每一项都包含要查什么、怎么查、结果说明什么,可直接用于任务交接。
<meta name="robots" content="noindex">;存在则不会被索引,需确认是否为有意设置。“页面打不开”可能是抓取失败,也可能是服务器临时故障,不要只归为一种原因。“搜不到”可能是未索引,也可能是查询词与页面主题不匹配,需要先用页面标题原词验证。“排名掉了”可能是索引被移除,也可能只是排名波动,应先复查索引状态再判断。以上方法适用于自建博客的自然搜索场景;如果页面主要靠站内推荐或付费投放获得流量,应单独用对应后台的数据判断,不能套用抓取、索引、排名的检查链路。下一步,挑一个目标页面,按清单四项逐条记录当前状态,作为后续协作的基准。