核对抓取限制,核心是确认搜索引擎到底能不能访问你要靠它带来流量和收入的页面。最直接的方法是:用搜索引擎官方提供的抓取测试工具或日志,逐项检查 robots.txt、页面 meta 指令、HTTP 状态码和登录/付费墙这几层限制,而不是只看某一处设置。下面从一个假设例子展开。
假设你运营一个靠广告和会员订阅赚钱的内容站,最近发现某批文章的自然流量下降。你怀疑是抓取出了问题,于是按以下顺序核对。
Disallow 挡住了整站或某个目录。<meta name="robots"> 是否写成了 noindex 或 nofollow。假设你发现 robots.txt 里写的是 Disallow: /,那整站都会被挡在门外,流量下降就有了合理解释。但如果没有这一条,问题可能在别处,不能只凭一个现象下结论。
robots.txt 是放在站点根目录的纯文本文件,用来告诉爬虫哪些路径可以抓、哪些不可以。核对时重点看三件事:
Disallow: /member/ 只挡会员目录,写成 Disallow: / 会挡全站。常见错误是把测试环境的 robots.txt 直接同步到了线上,或者复制模板时忘了改路径。改完后要重新用工具请求一次,确认返回内容已经更新。
robots.txt 之外,每个页面还能用 meta 指令单独控制。核对时打开页面源代码,搜索 robots,看是否有 noindex。如果某个页面需要被收录,却写了 noindex,它就不会出现在搜索结果里。
同时看 HTTP 状态码:
200:正常返回,可以继续检查内容。301 或 302:跳转,要确认跳转目标是否是你想被收录的页面。404:页面不存在,爬虫不会收录。403:被服务器拒绝,可能是防火墙或权限设置挡住了爬虫。5xx:服务器错误,需要先解决服务端问题。如果状态码是 200 但内容为空,可能是页面靠 JavaScript 渲染,而爬虫没有执行脚本,这时要检查渲染方式。
靠会员或订阅赚钱的网站,常把核心内容放在登录之后。搜索引擎爬虫一般不会登录,所以这部分内容很难被抓取。核对时要区分:
如果希望这些页面带来搜索流量,可以考虑提供可被抓取的摘要或公开部分内容,但要以实际业务和用户体验为准,不能为了抓取牺牲付费价值。
另外,服务器可能对爬虫设了频率限制。如果日志里爬虫请求频繁返回 429 或 503,说明抓取被限速或拦截,需要检查防火墙、CDN 或安全插件的规则。
把上面几项整理成一份可执行的检查清单:
/robots.txt,确认没有误挡重要目录。noindex。判断结果时要注意:一次改动前后比较,要考虑季节、搜索需求变化和数据采集差异,不能把流量波动全归因于抓取设置。如果多项检查都正常,问题可能出在内容质量、竞争环境或索引更新节奏上,需要另找方向。
下一步,选一个你希望带来收入的具体页面,按上面的清单逐项核对,把发现的问题记录下来再决定改哪里。