我的知识记录

robots.txt Disallow语法详解?robots.txt disallow语法规则,一文讲透

这类故障在运维中很常见,原因通常集中在几个固定点。

robots.txt是放在网站根目录的纯文本文件,搜索引擎爬虫来抓站时先读这个文件,根据里面的规则决定哪些页面能抓、哪些不能抓。文件必须命名为robots.txt全小写,放在域名根目录下,通过https://你的域名/robots.txt能直接访问到才算生效。

基础语法就三条。User-agent指定针对哪个爬虫,写*代表所有搜索引擎。Disallow后面跟不允许抓取的路径,写/代表屏蔽整站。Allow用来单独放行某个目录或文件,通常和Disallow配合使用,比如屏蔽整个后台目录但放行某个公开接口。

标准写法示例:User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Disallow: /wp-includes/ Disallow: /?s= Sitemap: https://你的域名/sitemap.xml。这段规则屏蔽了后台、核心目录、搜索结果页,同时提交了站点地图地址。

WordPress默认会自动生成一个虚拟的robots.txt,内容只有Disallow: /wp-admin/和Allow: /wp-admin/admin-ajax.php。想自定义就在根目录手动建一个robots.txt文件,真实文件优先级高于虚拟生成的,上传后自动覆盖。

注意robots.txt只是协议不是强制,正规搜索引擎会遵守,但恶意爬虫不会理它。敏感内容不能靠robots.txt保护,该加密码加密码,该做IP限制做IP限制。已经被收录的页面,光靠robots.txt屏蔽不会从索引里删除,还要在搜索资源平台提交死链。

解决后建议记录一下根因,同类问题下次直接套用。

robots.txt Disallow语法详解?robots.txt disallow语法规则,一文讲透

标签:

更新时间:2026-08-26 20:59:33

上一篇:FTP中bin文件夹作用_可执行文件目录与命令程序

下一篇:虚拟主机升级PHP版本前备份网站_虚拟主机实用教程