上线前核对抓取与索引配置,核心是确认两件事:搜索引擎能顺利抓到页面,且只把该收录的页面放进索引。实际操作中,最容易被忽略的是robots.txt、meta robots、canonical和sitemap之间的相互矛盾。建议在正式切换域名或开放访问前,用“本地或预发布环境检查配置 + 上线后小范围验证”两步走,而不是等上线后再补救。
抓取与索引配置不是技术参数的堆砌,而是先有收录策略,再写规则。准备阶段建议做一份页面清单,按三类标记:
这份清单是后续所有检查的判断依据。没有它,很容易出现“该收录的被屏蔽、不该收录的进了索引”这类问题。
抓取与索引涉及四个层面,它们的作用不同,不能互相替代:
robots.txt:控制抓取,不控制索引。被禁止抓取的页面仍可能因外部链接出现在索引里。<meta name="robots" content="noindex">:控制索引。想阻止页面进入索引,应该用noindex,而不是只靠robots.txt。canonical:告诉搜索引擎哪个URL是首选版本,用于处理重复内容。sitemap:列出希望被收录的URL,帮助发现页面,但不保证收录。关键一步是检查这四者是否冲突。常见错误包括:页面已被robots.txt禁止抓取,却同时设置了noindex——搜索引擎抓不到页面,就看不到noindex,页面反而可能被索引;或者sitemap里提交了被noindex的URL,造成信号矛盾。核对时逐个URL比对,确保“想收录的页面可抓取、可索引、canonical指向自身、出现在sitemap中”。
配置写好后,需要实际验证,而不是凭感觉判断。可以按以下步骤操作:
curl -I查看目标URL返回的状态码,确认正常页面返回200,已删除页面返回404或410,不要用200伪装错误页。X-Robots-Tag,确认没有意外的noindex。它和meta robots作用类似,但通过HTTP头传递,容易被忽略。meta name="robots"和rel="canonical",确认内容与预期一致。/robots.txt,逐条核对Disallow规则,确认没有误伤需要收录的目录。如果条件允许,可以在上线后用搜索引擎提供的URL检查工具提交单个页面,观察抓取和索引状态。不同搜索引擎的处理节奏不同,验证结果应以实际抓取记录为准,不要预设固定见效时间。
抓取与索引配置不是一次性的。上线后如果调整了URL结构、增加了筛选参数、更换了内容模板,都可能让原有配置失效。建议在以下时机复查:
维护时保留一份配置变更记录,写明改了什么、为什么改、预期效果是什么。这样出问题时能快速定位,而不是靠回忆猜测。
实际工作中常遇到两种做法:一种是在预发布环境完成全部核对再上线,另一种是先上线再逐步调整。前者适合页面数量多、URL结构复杂、有明确收录策略的站点,能减少上线后的反复修改;后者适合页面少、结构简单、需要快速验证的情况,但要求上线后立即执行验证步骤。判断标准是:如果配置错误会导致大量页面无法被抓取或索引,就应选择预发布核对;如果站点规模小、调整成本低,可以先上线再验证,但不能跳过验证。
下一步建议:从页面清单中挑出5到10个代表性URL,按上面的验证步骤逐项走一遍,记录每项的检查结果和发现的问题,再决定是否需要调整配置。