上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能拿到页面、拿到的是正确版本、愿意把有效页面放进索引。做法不是再看一遍设计稿,而是用抓取工具、HTTP状态、robots规则、canonical与站点地图逐项验证,并保留证据,便于出问题时定位。
抓取指搜索引擎爬虫请求并下载页面;索引指搜索引擎把页面内容存入可供检索的数据库。页面能被抓取,不等于会被索引;被索引,也不等于会获得排名。上线前核对时,应把这两步分开记录,避免把“没收录”简单归因于“没抓取”。
判断依据可以看服务器访问日志、抓取工具返回的状态码,以及搜索结果中的站点查询结果。若日志里没有爬虫请求,优先查robots.txt、防火墙或访问频率限制;若已有请求但状态码异常,优先查重定向、服务器配置和页面模板。
Disallow: /屏蔽整站,也没有把CSS、JS资源目录整体屏蔽。若确实需要屏蔽,应写明路径和适用范围。<meta name="robots">,确认没有误写noindex或none。测试环境模板最容易把这类标签带到正式环境。这些项目之间会互相影响。例如页面被robots.txt屏蔽后,爬虫可能仍看到外链,但无法读取内容;此时即使canonical写得正确,也无法完成索引判断。因此核对顺序建议是:先看能否抓取,再看抓到的版本,最后看是否允许索引。
选首页、栏目页、详情页、分页和带参数页各一个作为样本,用抓取工具或命令行请求头检查。以命令行请求头为例:
curl -I https://example.com/page
观察返回的HTTP状态码、Location和Content-Type。若状态码是301,继续跟踪跳转终点;若返回200但内容为空,检查模板是否输出了错误占位。对需要登录或地区限制的页面,还要确认爬虫是否被额外拦截。
假设某详情页在测试环境设置了noindex,上线时忘记移除。抓取工具会显示该页可访问,但meta robots为noindex。处理方式是移除该标签,重新发布,再请求抓取或等待下次抓取。这里不能保证固定多久生效,只能通过复查确认状态已改变。
上线后复查应围绕可核对的结果展开:服务器日志中爬虫是否请求了目标地址;抓取工具返回的状态码是否与预期一致;页面源码中的robots、canonical是否已更新;站点地图是否可访问且包含新地址。若使用搜索平台的站点验证工具,应以工具实际显示的数据为准,不把“提交了”当成“已收录”。
若发现异常,按“现象—可能原因—已定位原因”记录。例如“日志无爬虫请求”可能是robots屏蔽、防火墙拦截或外链不足,不能直接断定是某一项。先排除最明确的配置错误,再观察后续请求,才能把问题收敛到具体原因。
下一步:把上述检查项整理成上线清单,每次发布前对样本页面执行一次抓取请求,并保存状态码、robots与canonical截图或日志记录,作为后续排查的对照依据。