robots.txt怎么写_蜘蛛抓取 404 页面与站长平台配合
蜘蛛抓取 404 页面的标准写法:User-agent: Baiduspider 针对百度蜘蛛,User-agent: * 针对所有蜘蛛。Disallow: /admin/ 禁止抓取后台目录,Disallow: /? 禁止抓取带问号的动态 URL,Allow: / 允许抓取全站。规则按顺序匹配,先匹配到的先生效。
robots.txt 完整示例:User-agent: * 下 Disallow: /admin/、Disallow: /install/、Disallow: /?、Disallow: /*?*、Disallow: /temp/、Allow: /。Sitemap: http://域名/sitemap.xml。禁止后台、安装目录、动态参数 URL、临时目录,允许其余内容,末尾提交 sitemap 地址。
配置参考(robots.txt 只允许百度和 Google): ``` User-agent: Baiduspider Allow: /
User-agent: Googlebot Allow: /
User-agent: * Disallow: / ```
Disallow 路径写法错误是常见坑。Disallow: /admin 会匹配 /admin、/adminabc、/admin/xxx,要精确禁止目录用 Disallow: /admin/(带尾斜杠)。Allow 优先级在百度蜘蛛里是"最具体的规则优先",不是简单的先到先得,写复杂规则前用检测工具验证。
robots.txt 与 301、404 的配合:页面已删除不要只靠 robots 禁止,要让页面返回 404 再提交死链;页面移动到新地址用 301,不要 robots 禁止旧地址(禁止后蜘蛛不抓取,301 无法传递权重)。robots.txt 管抓取范围,301 和 404 管状态码,三者配合才能完整控制收录。
robots.txt 与 301、404 的配合:页面已删除不要只靠 robots 禁止,要让页面返回 404 再提交死链;页面移动到新地址用 301,不要 robots 禁止旧地址(禁止后蜘蛛不抓取,301 无法传递权重)。robots.txt 管抓取范围,301 和 404 管状态码,三者配合才能完整控制收录。

更新时间:2026-08-26 23:03:05
上一篇:禁用TRACE方法后用curl命令验证配置是否生效的方法_网站安全运维实战指南