robots.txt针对Googlebot配置?robots.txt googlebot谷歌爬虫,一文讲透
碰到这个问题别慌,按下面的步骤走,几分钟就能定位。
robots.txt是放在网站根目录的纯文本文件,搜索引擎爬虫来抓站时先读这个文件,根据里面的规则决定哪些页面能抓、哪些不能抓。文件必须命名为robots.txt全小写,放在域名根目录下,通过https://你的域名/robots.txt能直接访问到才算生效。
基础语法就三条。User-agent指定针对哪个爬虫,写*代表所有搜索引擎。Disallow后面跟不允许抓取的路径,写/代表屏蔽整站。Allow用来单独放行某个目录或文件,通常和Disallow配合使用,比如屏蔽整个后台目录但放行某个公开接口。
标准写法示例:User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Disallow: /wp-includes/ Disallow: /?s= Sitemap: https://你的域名/sitemap.xml。这段规则屏蔽了后台、核心目录、搜索结果页,同时提交了站点地图地址。
通配符$代表路径结束,比如Disallow: /*.php$屏蔽所有以.php结尾的URL。*代表任意字符,Disallow: /?*屏蔽所有带参数的动态链接。用通配符时注意别误封正常页面,配完用百度搜索资源平台的robots检测工具验证。
修改robots.txt后不是立即生效,搜索引擎下次来抓取时才会读取新规则。想加速生效就去百度搜索资源平台、Google Search Console手动提交robots.txt更新,一般几小时内生效。
核心思路就是从易到难、从配置到代码,别跳步。

更新时间:2026-08-27 11:36:26
上一篇:网站打不开图片不显示_图片路径错误或权限不足_修复步骤