Apache服务器robots.txt配置?apache robots.txt文件设置教程,一文讲透
这类故障在运维中很常见,原因通常集中在几个固定点。
robots.txt是放在网站根目录的纯文本文件,搜索引擎爬虫来抓站时先读这个文件,根据里面的规则决定哪些页面能抓、哪些不能抓。文件必须命名为robots.txt全小写,放在域名根目录下,通过https://你的域名/robots.txt能直接访问到才算生效。
基础语法就三条。User-agent指定针对哪个爬虫,写*代表所有搜索引擎。Disallow后面跟不允许抓取的路径,写/代表屏蔽整站。Allow用来单独放行某个目录或文件,通常和Disallow配合使用,比如屏蔽整个后台目录但放行某个公开接口。
标准写法示例:User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Disallow: /wp-includes/ Disallow: /?s= Sitemap: https://你的域名/sitemap.xml。这段规则屏蔽了后台、核心目录、搜索结果页,同时提交了站点地图地址。
百度蜘蛛的User-agent是Baiduspider,谷歌是Googlebot,想单独针对百度做规则就写User-agent: Baiduspider,下面跟Disallow或Allow。不同爬虫规则分开写,互不影响,*的规则对所有没单独配置的爬虫生效。
注意robots.txt只是协议不是强制,正规搜索引擎会遵守,但恶意爬虫不会理它。敏感内容不能靠robots.txt保护,该加密码加密码,该做IP限制做IP限制。已经被收录的页面,光靠robots.txt屏蔽不会从索引里删除,还要在搜索资源平台提交死链。
按这个顺序走一遍,问题基本都能解决。

更新时间:2026-08-26 20:40:08
上一篇:Word审计记录修改日期修改?word审计记录修改日期怎么改,完整解答