上线前核对抓取与索引配置,核心不是看页面能不能打开,而是确认三件事:搜索引擎能否抓到、抓到后是否被允许索引、索引后返回的规范地址是否唯一。对太原本地项目来说,服务器、域名和内容常在同一次上线中变动,最容易出问题的恰恰是“页面正常显示,但抓取和索引被挡住”。
很多人把“浏览器打开正常”当成上线检查通过。实际上,浏览器访问和搜索引擎抓取走的是不同判断路径。页面能打开,只说明网络和服务器响应正常;搜索引擎还可能因为robots.txt、页面meta、HTTP响应头、登录限制或服务器区域策略而抓不到或不愿索引。
另一个误解是“提交了就会收录”。提交只是把地址告知搜索引擎,是否抓取、何时抓取、是否索引仍由对方决定。上线核对的目标是排除自己这边能控制的障碍,而不是保证结果。
robots.txt是抓取阶段的第一道门。它不控制索引,但会直接影响搜索引擎能否访问页面。常见错误包括:测试环境遗留的Disallow: /、把整站目录写进禁止规则、规则路径与实际上线路径不一致。
判断结果:如果目标页面被规则明确禁止,抓取阶段就会失败,后续索引无从谈起。此时应先修正规则,再重新检查。
页面能否被索引,取决于页面自身和HTTP响应头中的指令。常见写法是<meta name="robots" content="noindex">,也可能出现在响应头中。测试环境为了防收录常加noindex,上线时忘记移除,是高频问题。
检查时不要只看首页。列表页、详情页、分页、搜索结果页和由模板批量生成的页面都要抽查。尤其注意:
判断结果:如果页面返回noindex,即使被抓取也不会进入索引。若canonical指向了另一个地址,当前地址可能被视为重复版本而不被单独索引。
同一个页面可能通过多个地址访问,例如带www与不带www、http与https、带尾斜杠与不带尾斜杠、带参数与不带参数。如果这些版本都能打开且没有统一规范,搜索引擎可能选择一个你并不期望的版本作为索引地址。
处理方式是有条件的:
判断结果:如果canonical指向的地址无法访问或本身被禁止索引,规范信号会失效,页面可能长期处于未索引或重复状态。
在正式开放抓取前,可以用搜索引擎提供的抓取测试工具或日志检查。这里不依赖某个平台的固定界面,而是看返回结果中的关键信息:
如果日志中大量出现403,可能是防火墙或安全策略拦截了爬虫;如果出现5xx,则要先解决服务器稳定性,再谈索引。注意区分“可能原因”和“已定位原因”:403可能是爬虫被拦,也可能是权限配置错误,需要结合日志和规则逐项排除。
核对不是上线一次就结束。上线后应观察目标页面是否被抓取、是否进入索引、索引地址是否为规范地址。若发现页面被抓取但未索引,先检查内容质量、重复度和内部链接,而不是反复提交。若发现索引地址与预期不符,优先检查301和canonical是否一致。
下一步:选取网站中最重要的3到5个页面,按“robots.txt—页面索引指令—canonical—抓取测试—日志状态”的顺序逐项核对,记录每个页面的实际返回结果,再决定是否需要调整配置。