上线前核对抓取与索引配置,核心是把“能被发现”和“能被收录”分开检查:先确认搜索引擎可以正常抓取页面,再确认页面返回的是可索引状态,最后用实际请求验证结果。对黄石网站建设这类本地业务站,重点检查首页、栏目页、服务页和联系方式页是否都能被抓到,而不是只盯着首页。
不要凭感觉检查。打开站点地图或栏目结构,把页面分成三类:核心业务页、辅助信息页、无需收录页。核心业务页包括首页、服务项目页、案例页、联系页;辅助信息页包括关于我们、常见问题;无需收录页包括后台、测试页、重复筛选页。
清单建好后,给每个页面标注预期状态:可抓取且可索引、可抓取但不可索引、不可抓取。这个标注是后面验证的依据。如果连预期都没有,看到 noindex 或 robots.txt 拦截时,就无法判断是配置错误还是有意为之。
robots.txt 决定爬虫能不能访问路径,页面级 meta robots 和 HTTP 响应头决定已抓取的页面能不能进入索引。两者作用不同,必须分别核对。
域名/robots.txt,确认没有误屏蔽 /、/css/、/js/ 或核心栏目路径。<meta name="robots" content="noindex">。X-Robots-Tag: noindex,这种写法不会出现在页面源码里,容易漏掉。这里有一个常见分歧:有人主张上线前彻底放开抓取,有人主张先屏蔽测试环境、上线后再放开。适用条件是——如果测试站与正式站共用同一套内容且能被外部访问,应先屏蔽测试站;如果正式站已经完成内容替换,则应在上线时同步放开核心路径。判断结果看两点:正式域名下核心页返回 200,测试域名下返回 403 或 404。
配置写完不等于生效。最关键的一步是模拟搜索引擎请求,而不是只用浏览器打开页面。浏览器会执行 JavaScript、携带登录状态,看到的可能和爬虫不同。
curl -I https://你的域名/,看返回状态码是否为 200,是否带有意外的 noindex 头。canonical 标签,确认指向的是当前页面的正式地址,而不是测试域名或带参数的地址。假设某服务页返回 200,但 canonical 指向首页,那么即使它能被抓取,也可能不被当作独立页面索引。这就是“可抓取”与“可索引”不一致的典型情况。发现后应把 canonical 改回该页自身地址,再重新请求验证。
上线当天的配置正确,不代表一周后仍然正确。主题模板更新、插件调整、伪静态规则改动,都可能重新引入 noindex 或错误的 canonical。建议把下面几项列入上线后检查:
判断索引是否正常,应看搜索引擎给出的实际收录结果和抓取记录,而不是只看自己提交了什么。提交站点地图只表示告知,不保证收录;能否收录还取决于内容质量、重复程度和抓取预算。黄石网站建设涉及本地服务时,尤其要避免多个页面使用同一套介绍文案,否则即使抓取配置正确,也可能因为内容重复而影响索引效果。
下一步:按上面的页面清单逐条请求核心 URL,记录状态码、robots 指令和 canonical 指向,把不符合预期的项改完后重新验证一次。