robots.txt 是网站根目录下一个纯文本协议文件,用以向搜索引擎爬虫声明站内哪些路径可抓取、哪些需避开。正确配置它并非为了阻止恶意访问,却能在保护隐私目录、节约抓取配额以及减轻服务器负载方面发挥关键作用。掌握其语法与部署要点,是每位站点管理者的必备技能。
这份协议文件的结构简明直观,核心是几个关键指令的组合。理解下述三个核心概念,大部分配置逻辑便能理清。
易错点:每条 User-agent 声明之后至少需附带一条 Disallow 或 Allow 指令,否则该组规则会被忽略。同时,robots.txt 仅针对搜索引擎蜘蛛生效,对普通用户访问毫无约束力,因此切勿将其作为保护敏感信息的唯一手段。
无论网站规模如何,都建议从一个清晰简洁的初始文件入手。以下步骤可帮助您快速完成部署。
User-agent: *
Disallow: /cgi-bin/
Disallow: /tmp/
Sitemap: https://www.example.com/sitemap.xml
校验与注意事项:部署后可在浏览器地址栏直接输入 您的域名/robots.txt 访问查看,显示内容即代表发布成功。一个常见严重错误是误写 Disallow: /,它会阻碍整站被索引,影响力极大。另外,漏写目录末尾的斜杠也会让规则变形,例如 Disallow: /admin 无法正确匹配 /admin/ 整个目录。
当站内结构日益繁杂,单纯的屏蔽或者放开就显得不够灵活,此时 Allow 指令便成为有力的补充工具。一个典型情境是:您想隐藏某个图片资源库,但需要保留其中一张品牌 LOGO 图用于搜索结果展示。
User-agent: *
Disallow: /assets/img/
Allow: /assets/img/logo.png
实用策略:搜索引擎在判定时,通常对更具体的路径匹配给予更高优先级。因此上述规则能够识别出 Allow 特别指出的文件,并放行爬虫抓取该资源。值得注意的是,不同搜索引擎对 Allow 的支持程度略有差异,若站点主要依赖某一搜索渠道,可查阅其官方站长文档确认细节。
对于使用动态参数的网站,如电商或资讯平台,URL 中常带有 sessionid、sort 等追踪参数,它们会生成大量重复页面,浪费抓取预算。此时可借助通配符处理这些地址。
User-agent: *
Disallow: /*?*sort=
Disallow: /*&page=
防坑建议:过度使用通配符或书写错误的正则表达式,可能导致误伤正常页面。建议先在一小部分路径上测试,观察搜索引擎站长后台的抓取报告,再逐步扩大应用范围。同时,务必定期检查文件中是否残留已失效的旧规则,保持文件精简是减少解析错误的基础。
有。搜索引擎通常建议文件大小控制在 500KB 以内,且包含的规则条目不宜过多。超过限制后,部分爬虫可能中止读取后续规则,导致设置无法完全生效,因此应保持文件精简。
多数主流搜索引擎(如百度、谷歌)的站长平台均提供了 robots 测试工具。您可以输入某个具体的页面 URL,工具会根据当前文件内容模拟爬虫的抓取权限,帮助辨别规则是否存在意外屏蔽。
这取决于搜索引擎的抓取周期,一般从几分钟到数天不等。搜素引擎会定期重新抓取该文件以获取变动,无需重启服务器或提交特殊请求,耐心等待即可。
配置 robots.txt 的核心在于明确区分“可抓取”与“不可抓取”的边界,并保持规则的清晰与精简。建议从禁止少量低价值目录开始,定期结合站长工具的抓取报告审视规则效果,避免因误设 Disallow: / 造成整站失联。同时务必记得,真正敏感的数据必须依赖登录验证或服务器端权限控制,绝不能仅靠此文本文件完成保护。合理运用 Allow、通配符以及 Sitemap 声明,能让您站点的抓取效率更上一层楼。