中国数据虚拟主机robots.txt 不生效_禁止抓取目录不误封正文
robots.txt 不生效的标准写法:User-agent: Baiduspider 针对百度蜘蛛,User-agent: * 针对所有蜘蛛。Disallow: /admin/ 禁止抓取后台目录,Disallow: /? 禁止抓取带问号的动态 URL,Allow: / 允许抓取全站。规则按顺序匹配,先匹配到的先生效。
robots.txt 完整示例:User-agent: * 下 Disallow: /admin/、Disallow: /install/、Disallow: /?、Disallow: /*?*、Disallow: /temp/、Allow: /。Sitemap: http://域名/sitemap.xml。禁止后台、安装目录、动态参数 URL、临时目录,允许其余内容,末尾提交 sitemap 地址。
配置参考(robots.txt 标准示例): ``` User-agent: * Disallow: /admin/ Disallow: /install/ Disallow: /temp/ Disallow: /*?* Disallow: /*?page= Allow: /
User-agent: Baiduspider Disallow: /admin/ Disallow: /*?s=
Sitemap: https://域名/sitemap.xml ```
robots.txt 写完用百度站长平台的 robots 检测工具验证,输入要检测的 URL,看是否被允许抓取。也可以用访问日志分析直接访问 http://域名/robots.txt 确认内容正确。robots.txt 文件必须放在根目录,编码 UTF-8 无 BOM,文件名全小写,否则蜘蛛不识别。
百度蜘蛛流量大但收录少,通常是抓取了大量低价值页面。优化方向:robots.txt 禁止搜索结果页、筛选页、分页参数、标签云;页面加 canonical 指向主版本;sitemap 只提交高质量页面。蜘蛛抓取配额集中到正文页后,收录量和排名都会提升,流量反而下降。

更新时间:2026-09-02 15:44:31
上一篇:IIS ThinkPHP隐藏index.php方法_IIS常用程序伪静态规则教程详解