搜索引擎的爬虫访问你的网站时,通常会先看一眼根目录下的 robots.txt 文件。这份纯文本文件并不复杂,却直接关系到哪些页面会被抓取和收录、哪些会被拒之门外。配置得当,它能保护后台数据和敏感路径,同时引导爬虫把抓取额度花在真正重要的内容上,对网站收录表现有实实在在的影响。
robots.txt 必须放置在站点根目录下,比如 https://yourdomain.com/robots.txt,文件编码建议使用 UTF-8,每条规则单独占一行,路径区分大小写。一份基本配置主要包含以下指令:
以下是一个常见的配置示例:
User-agent: *
Disallow: /admin/
Allow: /admin/public/
Sitemap: https://yourdomain.com/sitemap.xml
这段配置的含义是:所有爬虫可以抓取全站,唯独 /admin/ 目录被排除,不过该目录下的 /admin/public/ 子目录又被单独放行。需要留意的是,如果某个爬虫不识别 Allow 指令,即使你写了放行规则,它仍然会遵循 Disallow 屏蔽整个目录,最后的结果可能是某些公开子页面也无法被收录。
不同类型的站点对抓取的控制需求不一样,下面这几种常见场景可以给你提供思路,实际操作时请结合自身情况判断。
对于内容型网站或刚上线的新站,通常希望所有页面尽快被搜索引擎索引。此时只需要将 Disallow 留空,或者干脆不写这一行:
User-agent: *
Disallow:
这里最容易犯的错误是手误写成 Disallow: /,一旦发生,所有爬虫都会认为整站都被禁止访问,收录工作随即停止。提交配置前务必检查冒号后面是否有意外的空格或多余字符。
如果你不想让某一家搜索引擎收录你的站点,可以只针对它的爬虫设置规则,不影响其他搜索引擎正常访问:
User-agent: Bingbot
Disallow: /
这样 Bingbot 会被完全拒绝,而 Googlebot 等其余爬虫不受影响。这里要特别核对爬虫名称的准确拼写,比如百度的 Baiduspider、搜狗的 Sogou spider,如果拼写有误,规则就会失效,对方照样会来抓取。
对于用户上传文件、临时目录、测试页面这类需要保留但不宜被索引的资源,可以通过精确路径加以限制:
User-agent: *
Disallow: /uploads/private/
Disallow: /temp/
建议在 Disallow 的路径末尾统一加上斜杠,表示屏蔽整个目录,避免漏掉目录下所有子路径。另外,尽量避免对单个文件做过多逐条屏蔽,路径写得太琐碎反而容易出错,也不便于后期维护。
配置 robots.txt 过程中,有几个高频问题值得特别留意,它们会让你的规则失效或产生意外后果。
配置完成后,可以通过浏览器直接访问你的域名下的 robots.txt 地址检查内容是否生效,也可以使用搜索引擎的抓取测试工具来验证每条规则是否按预期工作,这样可以及时发现遗漏或错误。
robots.txt 不是一成不变的静态文件,随着网站结构调整或目录变动,你需要同步更新并持续观察抓取情况。
推荐的检查频率是:每次网站目录或 URL 结构有改动时,顺手复查一次 robots.txt;如果发现搜索资源平台中出现异常抓取报告或收录骤降的情况,第一时间检查该文件是否被误改或误删。
更新文件后,最好直接在浏览器打开 robots.txt 地址,逐行核对规则内容是否与预期一致。如果网站有多个子域名或语言版本,记得为每个独立站点分别配置对应的 robots.txt,并在文件中正确标注各自的 Sitemap 地址。
最后提醒一下,不要把 robots.txt 当作阻止不良爬虫的工具——不守规矩的爬虫不会理会这个文件。对于重要的后台路径,请务必依靠密码保护和访问权限来兜底,robots.txt 只是第一道提示性关卡。
没有固定时间,通常几分钟到几天不等,取决于搜索引擎重新抓取这个文件的频率。如果你急需让新规则立即生效,可以在搜索资源平台中提交该文件或使用抓取测试工具触发同步,部分平台还能看到更新状态。
最直接的方式是在浏览器访问 https://yourdomain.com/robots.txt 查看内容是否与预期一致,再结合搜索资源平台提供的抓取测试功能,输入某个 URL 检查它是否被该规则允许或拒绝。若平台提示规则解析异常,说明文件中存在语法格式问题,需要逐行排查。
能。robots.txt 只是阻止搜索引擎抓取页面内容,但外链可能会把 URL 本身索引下来(仅收录 URL,没有页面内容)。如果你希望页面完全不出现在搜索结果中,还需配合使用 noindex 标签,或者为页面设置登录权限。
robots.txt 的配置并没有想象中复杂,关键在于理解每条指令的适用范围和边界。建议你从全站放开的配置开始,随着网站内容增多,再逐步加入必要的 Disallow 规则,确保敏感路径被隔离,同时让爬虫把资源集中在有收录价值的内容上。每次修改后,养成用浏览器和平台工具双重验证的习惯,就能避开绝大多数常见问题。