搜索引擎的抓取工具在抵达一个站点时,第一件事就是去服务器根目录寻找名为robots.txt的纯文本文件。这份文件就像是给爬虫的一份“访问须知”,明确告诉它们哪些区域可以自由浏览,哪些区域必须绕行。如果这份须知写得含糊或者有误,轻则浪费服务器带宽,重则让核心页面在搜索结果中销声匿迹。掌握其配置逻辑,是网站运营者不可回避的基础功课。
这个文件没有复杂的格式,它的规则体系主要包含两大块内容:规则适用的对象(即某个特定的爬虫名称),以及具体被限制的路径。配置时,每条指令都需要单独占据一行。
让我们看一个最基础的配置范本:
User-agent: *
Disallow: /private/
上面的例子中,User-agent行指定了规则的作用范围,这里的星号代表对所有爬虫生效;Disallow行则明确指出了禁止访问的目录路径。除了Disallow之外,Allow指令用于针对某些路径解除限制,Sitemap指令则用来主动向爬虫指明站点地图的位置。把这几项指令融会贯通,才能为不同场景制定出合适的访问策略。
需要特别留意的是,Disallow后方的路径必须是完整的目录或文件路径,而不是随意填写的关键词。
互联网上活跃着众多搜索引擎,它们的爬虫标识各不相同,例如Googlebot、Bingbot、Baiduspider等。面对不同的爬虫,网站管理者有时需要区别对待,要么是为了向某个引擎开放特定资源,要么是为了应对某个引擎过度的抓取行为。
即便对指令了如指掌,日常操作中还是容易在细节上栽跟头。以下这些高频错误,值得逐一核验,以免文件形同虚设:
将配置文件上传至服务器后,工作并未真正结束。通过查看服务器的访问日志,或利用百度搜索资源平台、Google Search Console等站长工具中的“抓取统计”功能,我们能够直观地看到爬虫的来访记录,从而验证配置是否达到了预期效果。
并非强制要求。Sitemap指令只是顺带告知爬虫地图文件的存放位置,属于辅助性内容。即便不写这一行,爬虫依然可以通过robots.txt生成站点地图,或通过其他途径发现新的URL。不过建议填写,这能加快新页面的发现速度。
这不是实时生效的机制。搜索引擎的爬虫通常按照固定周期重新抓取该文件,短则几小时,长则数天。更新后无需频繁刷新,耐心等待一个抓取周期即可看到变化。
可以,但结果不一定符合预期。该文件仅能阻止爬虫“抓取”页面,如果这个页面已经获得了一些外部链接,它仍可能被当成孤立页面收录进索引。若要严格杜绝收录,最稳妥的办法是在页面的head区域添加noindex标签。
robots.txt是控制搜索引擎抓取行为的重要工具,但它的规则并不复杂——核心在于理解指令含义、区分不同爬虫、规范路径书写并养成查看日志的习惯。建议你根据本指南,先对照自己的站点现状做一次全面检查,优先修正大小写混乱、误屏蔽静态资源等基础问题,再着手为不同搜索引擎配置精细化的访问策略。记住,保持文件简洁、逻辑清晰,才能让网站资源发挥出最大的抓取价值。