腾讯云虚拟主机百度蜘蛛占用流量_robots.txt 不生效解决
很多站长遇到 robots.txt 不生效直接在 robots.txt 写 Disallow: /,结果整站被禁止抓取,收录全部消失。robots.txt 修改前用百度站长平台的 robots 检测工具验证,确认只屏蔽了目标目录,没有误封正常内容。
robots.txt 只能禁止抓取,不能删除已收录的页面。已经被百度收录的页面,即使 robots.txt 禁止抓取,收录仍会保留(只是不再更新)。要删除收录需要页面返回 404 或 410,再在站长平台提交死链。robots.txt + 404 配合才能彻底清理。
配置参考(robots.txt 标准示例): ``` User-agent: * Disallow: /admin/ Disallow: /install/ Disallow: /temp/ Disallow: /*?* Disallow: /*?page= Allow: /
User-agent: Baiduspider Disallow: /admin/ Disallow: /*?s=
Sitemap: https://域名/sitemap.xml ```
蜘蛛抓取流量大但收录少,通常是抓取了大量低价值页面:分页参数、搜索结果页、筛选页、标签页。用 robots.txt 禁止这些 URL 模式,把抓取配额留给内容页。Disallow: /*?page=、Disallow: /*?s=、Disallow: /*?filter=,禁止后蜘蛛集中抓取正文页,收录效率提升。
robots.txt 的高级用法:Crawl-delay 参数限制抓取间隔(部分蜘蛛支持,百度不支持),Disallow 配合通配符禁止参数页,Allow 单独放开重要目录。复杂规则写完必须用百度站长平台的 robots 检测工具逐条验证,输入典型 URL 看是否被允许,避免误封整站。
百度蜘蛛流量大但收录少,通常是抓取了大量低价值页面。优化方向:robots.txt 禁止搜索结果页、筛选页、分页参数、标签云;页面加 canonical 指向主版本;sitemap 只提交高质量页面。蜘蛛抓取配额集中到正文页后,收录量和排名都会提升,流量反而下降。

更新时间:2026-08-26 22:25:27
上一篇:腾讯云虚拟主机流量持续上涨排查完整流程_日志分析与定位