核对抓取限制,目标是确认搜索引擎能抓到什么、抓不到什么,以及限制是人为设置还是技术故障。多人协作时,把“谁查、查什么、结果代表什么”写清楚,能减少返工。下面按检查项给出可执行清单,每项包含要查什么、怎么查、结果说明什么。
要查什么:目标页面路径是否被 Disallow 规则挡住,规则是否误伤整站或整目录。
怎么查:打开站点根目录下的 robots.txt,逐条读 User-agent 与 Disallow。用搜索引擎官方提供的 robots.txt 测试工具,输入具体 URL 验证。不要只看文件开头,通配符和结尾规则往往在后面。
结果说明什么:若测试显示“被屏蔽”,说明抓取限制来自 robots 规则,需要改规则后重新验证。若显示“允许”,robots 不是原因,继续查下一项。注意:robots.txt 只约束合规抓取,不等于页面一定被收录。
要查什么:页面 HTML 里是否有 <meta name="robots" content="noindex"> 或 nofollow;HTTP 响应头是否带 X-Robots-Tag。
怎么查:查看页面源代码的 <head> 部分,搜索 robots。用命令行查看响应头,例如 curl -I 页面地址,看是否返回 X-Robots-Tag: noindex。模板批量生成时,重点查页头模板和服务器配置。
结果说明什么:出现 noindex 表示该页被明确要求不进入索引,属于主动限制。若只有 nofollow,页面仍可能被抓取,但链接权重传递受限。响应头与元标签冲突时,更严格的一方通常生效,需以实际抓取测试为准。
要查什么:目标内容是否必须登录、付费或特定地区 IP 才能看到。
怎么查:用未登录浏览器、无痕窗口访问同一 URL,对比登录后的内容差异。若页面主体在登录后才出现,抓取工具看到的往往是登录墙或空壳。地域限制可用不同地区的网络环境测试,但要注意合规。
结果说明什么:若未登录状态只能看到提示文字,说明抓取受到访问权限限制。此时要判断:是内容本就不该公开,还是应该给搜索引擎提供可抓取的公开版本。后者需要产品与开发共同决定,不是单靠 SEO 改标签能解决。
要查什么:服务器是否返回 403、429、503,或对同一 IP 限速。
怎么查:用 curl -I 或浏览器开发者工具看状态码。429 表示请求过多,403 表示拒绝访问,503 表示服务暂不可用。查看服务器访问日志中搜索引擎爬虫的响应分布,统计 2xx、3xx、4xx、5xx 比例。
结果说明什么:大量 429 或 503 说明抓取被频率或稳定性限制,可能是防护策略过严或服务器容量不足。403 可能是防火墙、CDN 或安全插件拦截。要区分“已经定位的原因”和“可能原因”:日志显示某爬虫全部 403,才能说拦截已定位;只看到少量 403,还需继续排查。
要查什么:把上述检查结果整理成一份可交接的记录,避免不同人重复排查。
怎么查:按以下步骤执行:
结果说明什么:如果同一 URL 在多项检查中都显示允许,但抓取测试仍失败,问题可能在服务器稳定性、DNS 或 CDN 层,需要开发介入。记录中要写清适用条件,例如“该结论仅对未登录桌面版有效”。
下一步:挑一个代表性 URL,按上面五项做成表格,交给开发或运维确认可改动范围。改动前后对比时,考虑季节、搜索需求变化和数据采集差异,不要用单日数据下结论。