我的知识记录

移动端网站robots.txt配置?移动端网站robots.txt设置,一文讲透

这个问题的根因往往不在表面,逐层往下查就能找到。

robots.txt是放在网站根目录的纯文本文件,搜索引擎爬虫来抓站时先读这个文件,根据里面的规则决定哪些页面能抓、哪些不能抓。文件必须命名为robots.txt全小写,放在域名根目录下,通过https://你的域名/robots.txt能直接访问到才算生效。

基础语法就三条。User-agent指定针对哪个爬虫,写*代表所有搜索引擎。Disallow后面跟不允许抓取的路径,写/代表屏蔽整站。Allow用来单独放行某个目录或文件,通常和Disallow配合使用,比如屏蔽整个后台目录但放行某个公开接口。

标准写法示例:User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Disallow: /wp-includes/ Disallow: /?s= Sitemap: https://你的域名/sitemap.xml。这段规则屏蔽了后台、核心目录、搜索结果页,同时提交了站点地图地址。

通配符$代表路径结束,比如Disallow: /*.php$屏蔽所有以.php结尾的URL。*代表任意字符,Disallow: /?*屏蔽所有带参数的动态链接。用通配符时注意别误封正常页面,配完用百度搜索资源平台的robots检测工具验证。

修改robots.txt后不是立即生效,搜索引擎下次来抓取时才会读取新规则。想加速生效就去百度搜索资源平台、Google Search Console手动提交robots.txt更新,一般几小时内生效。

解决后建议记录一下根因,同类问题下次直接套用。

移动端网站robots.txt配置?移动端网站robots.txt设置,一文讲透

标签:

更新时间:2026-08-26 21:53:39

上一篇:中国数据虚拟主机宝塔面板证书续签_bt命令解决

下一篇:阿里云ECS数据库无法启动_启动与连接