核对百度抓取限制,核心是确认百度蜘蛛是否被 robots.txt、页面 meta 标签、服务器状态或访问频率挡住。假设一个场景:你的栏目页三个月前还能被百度收录,最近搜索标题只出现首页,这时要比较“改 robots.txt 放行”和“先查日志再决定”两种方案。前者快但可能误放无关目录,后者慢却能定位真实原因。判断依据是百度搜索资源平台里的抓取诊断、抓取频次和 robots 检测结果,而不是凭感觉改文件。
一类是明确禁止,比如 robots.txt 写了 Disallow: /,或页面头部有 <meta name="robots" content="noindex">。另一类是隐性限制,比如服务器频繁返回 503、百度抓取频次被压到很低、页面需要登录才能看到正文。明确禁止可以直接核对文件;隐性限制必须看日志和平台反馈。常见错误是把“收录慢”直接当成“被屏蔽”,结果改了 robots.txt 却没有解决服务器超时。
假设某站点产品栏目 /chanpin/ 过去有收录,最近百度只保留首页。第一步,在百度搜索资源平台的 robots 检测里输入该栏目 URL,看是否被禁止抓取。第二步,查看服务器访问日志中百度蜘蛛的返回码:如果大量 404、403 或 503,说明限制在服务器或权限层。第三步,检查页面 HTML 的 meta robots 和 canonical,确认没有误写 noindex 或指向其他页面。第四步,对比抓取频次曲线,看是整体下降还是只针对该目录。只有这四步都排除了,才考虑调整 robots.txt 放行。
如果两种现象同时存在,优先处理服务器返回码,再处理 robots.txt。因为百度蜘蛛连页面都拿不到时,放行规则没有意义。
https://你的域名/robots.txt,确认没有误写 Disallow: / 或屏蔽目标目录。noindex,canonical 指向自身而非其他页面。如果抓取诊断返回 200 且 HTML 完整,但索引量仍低,问题可能在内链或内容质量,不在抓取限制。如果返回 403 或 503,先联系运维排查防火墙、CDN 或访问频率规则。核对完成后,下一步是固定每周查看一次抓取频次和 robots 检测结果,把异常返回码和误屏蔽规则记录在同一张表里,避免重复修改。