上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、索引后看到的标题与内容符合预期。建议在正式切换域名或发布前,用可公开访问的测试地址完成一轮检查,再在上线后复查一次。多人协作时,把检查项写成清单并指定一人复核,能减少返工。
抓取与索引是两道不同的门。robots 文件或页面上的 noindex 只影响其中一道,配置错误时常见现象是页面能打开却搜不到,或搜到的是旧标题。
robots.txt 是否误写了 Disallow: /,测试站尤其容易保留屏蔽规则。<head> 中是否有 <meta name="robots" content="noindex">,模板批量输出时容易全站带上。robots.txt 中引用的 sitemap 地址可访问,且返回的是 XML 而不是错误页。判断方法:在浏览器中直接打开 robots.txt 和 sitemap 地址,确认状态码为 200;再看页面源代码,确认没有 noindex。若测试环境必须屏蔽,交付时应单独列出上线前要删除的规则。
页面在浏览器里显示正常,不代表搜索引擎拿到的是同一份内容。前端渲染、登录跳转、CDN 缓存都可能让抓取结果不同。
curl 请求目标 URL,查看返回的 HTML 源码。假设一个六安企业的产品页在浏览器中能看到参数表,但抓取源码里只有加载动画的占位标签,这说明内容依赖客户端渲染,搜索引擎可能读不到。此时应改为服务端渲染或预渲染,再复查源码。适用条件是页面内容对收录有价值;如果只是交互组件,可以不强求。
同一内容如果有多个可访问地址,索引信号会被分散。常见重复来源包括带与不带 www、http 与 https、带与不带结尾斜杠、参数版本。
判断结果:如果同一标题在搜索结果中出现多个版本,或抓取工具显示 canonical 与页面实际地址不一致,就属于需要处理的情况。处理后再用抓取工具复查一次,确认 canonical 已更新。
上线切换后,抓取与索引配置可能因环境变量、缓存或部署脚本而变化,所以复查不能省。
robots.txt,确认测试期的屏蔽规则已移除。如果复查发现页面仍未被索引,先排除抓取被拒、noindex、canonical 指向他页这几项,再考虑内容质量和外链因素。索引与排名没有固定见效时间,也不应作为交付验收的唯一标准。
下一步建议:把上述检查项整理成一页上线核对表,在发布前由非开发成员按清单逐项确认,重点核对 robots、meta robots、canonical 和状态码四项,确认无误后再执行正式切换。