我的知识记录

西部数码虚拟主机百度蜘蛛占用流量_robots.txt 不生效解决

robots.txt 是搜索引擎抓取的规则文件,放在网站根目录,文件名必须小写。robots.txt 不生效时在 robots.txt 里写 User-agent 和 Disallow/Allow 规则,百度蜘蛛抓取前会先读 robots.txt,按规则决定是否抓取。注意 robots.txt 是建议性的,恶意蜘蛛不遵守,但百度、Google 等正规引擎严格遵守。

禁止指定目录:Disallow: /目录名/ 禁止该目录下所有内容,Disallow: /目录名/*.php$ 禁止该目录下 php 文件,Disallow: /*?id= 禁止包含 id 参数的 URL。通配符 * 匹配任意字符,$ 匹配结尾。百度蜘蛛支持 * 和 $,部分老蜘蛛只支持 *。

配置参考(robots.txt 标准示例): ``` User-agent: * Disallow: /admin/ Disallow: /install/ Disallow: /temp/ Disallow: /*?* Disallow: /*?page= Allow: /

User-agent: Baiduspider Disallow: /admin/ Disallow: /*?s=

Sitemap: https://域名/sitemap.xml ```

蜘蛛抓取流量大但收录少,通常是抓取了大量低价值页面:分页参数、搜索结果页、筛选页、标签页。用 robots.txt 禁止这些 URL 模式,把抓取配额留给内容页。Disallow: /*?page=、Disallow: /*?s=、Disallow: /*?filter=,禁止后蜘蛛集中抓取正文页,收录效率提升。

robots.txt 的高级用法:Crawl-delay 参数限制抓取间隔(部分蜘蛛支持,百度不支持),Disallow 配合通配符禁止参数页,Allow 单独放开重要目录。复杂规则写完必须用百度站长平台的 robots 检测工具逐条验证,输入典型 URL 看是否被允许,避免误封整站。

西部数码虚拟主机百度蜘蛛占用流量_robots.txt 不生效解决

标签:

更新时间:2026-08-27 11:29:47

上一篇:php网站发布文章数据库死锁_并发写入与表锁处理

下一篇:虚拟主机数据库慢查询_phpMyAdmin