我的知识记录

蜘蛛抓取重复页面_robots检测工具与收录恢复

时代互联虚拟主机做蜘蛛抓取重复页面,robots.txt 配合百度站长平台效果最好。站长平台可以设置抓取频率(平和/正常/加快),提交 sitemap,看抓取异常。robots.txt 管抓取范围,站长平台管抓取频率,两者配合把蜘蛛流量控制在合理范围,同时保证正常收录。

禁止指定目录:Disallow: /目录名/ 禁止该目录下所有内容,Disallow: /目录名/*.php$ 禁止该目录下 php 文件,Disallow: /*?id= 禁止包含 id 参数的 URL。通配符 * 匹配任意字符,$ 匹配结尾。百度蜘蛛支持 * 和 $,部分老蜘蛛只支持 *。

配置参考(robots.txt 标准示例): ``` User-agent: * Disallow: /admin/ Disallow: /install/ Disallow: /temp/ Disallow: /*?* Disallow: /*?page= Allow: /

User-agent: Baiduspider Disallow: /admin/ Disallow: /*?s=

Sitemap: https://域名/sitemap.xml ```

禁止了整站抓取是常见坑。Disallow: /admin 会匹配 /admin、/adminabc、/admin/xxx,要精确禁止目录用 Disallow: /admin/(带尾斜杠)。Allow 优先级在百度蜘蛛里是"最具体的规则优先",不是简单的先到先得,写复杂规则前用检测工具验证。

百度蜘蛛流量大但收录少,通常是抓取了大量低价值页面。优化方向:robots.txt 禁止搜索结果页、筛选页、分页参数、标签云;页面加 canonical 指向主版本;sitemap 只提交高质量页面。蜘蛛抓取配额集中到正文页后,收录量和排名都会提升,流量反而下降。

robots.txt 与 301、404 的配合:页面已删除不要只靠 robots 禁止,要让页面返回 404 再提交死链;页面移动到新地址用 301,不要 robots 禁止旧地址(禁止后蜘蛛不抓取,301 无法传递权重)。robots.txt 管抓取范围,301 和 404 管状态码,三者配合才能完整控制收录。

蜘蛛抓取重复页面_robots检测工具与收录恢复

标签:

更新时间:2026-09-02 13:38:59

上一篇:网站首页404错误?网站首页404 not found解决,已解决

下一篇:宝塔面板端口登录安全设置_完整操作教程_防火墙与安全组_运维笔记