我的知识记录

虚拟主机robots.txt教程_禁止抓取动态参数与sitemap

robots.txt 是搜索引擎抓取的规则文件,放在网站根目录,文件名必须小写。禁止抓取动态参数时在 robots.txt 里写 User-agent 和 Disallow/Allow 规则,百度蜘蛛抓取前会先读 robots.txt,按规则决定是否抓取。注意 robots.txt 是建议性的,恶意蜘蛛不遵守,但百度、Google 等正规引擎严格遵守。

限制百度蜘蛛抓取频率不在 robots.txt 里写(robots 没有频率参数),而是在百度站长平台 → 抓取频次 → 设置抓取压力。选"平和"会降低抓取频率,适合流量紧张的虚拟主机。调整后 1 到 3 天生效,蜘蛛请求量下降 30% 到 50%。

配置参考(robots.txt 只允许百度和 Google): ``` User-agent: Baiduspider Allow: /

User-agent: Googlebot Allow: /

User-agent: * Disallow: / ```

robots.txt 写完用百度站长平台的 robots 检测工具验证,输入要检测的 URL,看是否被允许抓取。也可以用百度蜘蛛模拟抓取直接访问 http://域名/robots.txt 确认内容正确。robots.txt 文件必须放在根目录,编码 UTF-8 无 BOM,文件名全小写,否则蜘蛛不识别。

robots.txt 与 301、404 的配合:页面已删除不要只靠 robots 禁止,要让页面返回 404 再提交死链;页面移动到新地址用 301,不要 robots 禁止旧地址(禁止后蜘蛛不抓取,301 无法传递权重)。robots.txt 管抓取范围,301 和 404 管状态码,三者配合才能完整控制收录。

robots.txt 的高级用法:Crawl-delay 参数限制抓取间隔(部分蜘蛛支持,百度不支持),Disallow 配合通配符禁止参数页,Allow 单独放开重要目录。复杂规则写完必须用百度站长平台的 robots 检测工具逐条验证,输入典型 URL 看是否被允许,避免误封整站。

虚拟主机robots.txt教程_禁止抓取动态参数与sitemap

标签:

更新时间:2026-08-26 23:27:29

上一篇:WordPress插件页面404?wordpress插件页面404解决,已解决

下一篇:Linux下root用户修改只读文件的拦截与防护方案_网站安全运维实战指南