robots.txt怎么写_屏蔽无用蜘蛛与站长平台配合
西部数码虚拟主机百度蜘蛛占用流量大,先看访问日志里 Baiduspider 的请求量和流量占比。正常站点蜘蛛流量占 5% 到 15%,超过 30% 就是抓取异常。用 robots.txt 限制抓取目录、调整百度站长平台的抓取频率,能把蜘蛛流量降下来。
robots.txt 只能禁止抓取,不能删除已收录的页面。已经被百度收录的页面,即使 robots.txt 禁止抓取,收录仍会保留(只是不再更新)。要删除收录需要页面返回 404 或 410,再在站长平台提交死链。robots.txt + 404 配合才能彻底清理。
配置参考(robots.txt 标准示例): ``` User-agent: * Disallow: /admin/ Disallow: /install/ Disallow: /temp/ Disallow: /*?* Disallow: /*?page= Allow: /
User-agent: Baiduspider Disallow: /admin/ Disallow: /*?s=
Sitemap: https://域名/sitemap.xml ```
robots.txt 写完用百度站长平台的 robots 检测工具验证,输入要检测的 URL,看是否被允许抓取。也可以用浏览器开发者工具 Network 直接访问 http://域名/robots.txt 确认内容正确。robots.txt 文件必须放在根目录,编码 UTF-8 无 BOM,文件名全小写,否则蜘蛛不识别。
百度蜘蛛流量大但收录少,通常是抓取了大量低价值页面。优化方向:robots.txt 禁止搜索结果页、筛选页、分页参数、标签云;页面加 canonical 指向主版本;sitemap 只提交高质量页面。蜘蛛抓取配额集中到正文页后,收录量和排名都会提升,流量反而下降。
robots.txt 与 301、404 的配合:页面已删除不要只靠 robots 禁止,要让页面返回 404 再提交死链;页面移动到新地址用 301,不要 robots 禁止旧地址(禁止后蜘蛛不抓取,301 无法传递权重)。robots.txt 管抓取范围,301 和 404 管状态码,三者配合才能完整控制收录。

更新时间:2026-08-26 21:47:16