Robots.txt生成器
为搜索引擎爬虫生成robots.txt文件。
预览
1
用户代理块
推荐工具
精心挑选的实用工具
创建 robots.txt 文件以引导搜索爬虫
概述
robots.txt 文件告诉搜索引擎爬虫可以或不可以访问你网站的哪些部分。它位于域名根目录,是守规矩的机器人在抓取前首先查看的东西。此生成器根据简单选择——允许或禁止哪些路径、以及站点地图的位置——构建有效的 robots.txt,让你无需记住语法。
使用步骤
- 1
选择你的规则
选择规则适用于哪些 user-agent,以及要允许或禁止哪些路径。
- 2
添加你的站点地图
可选加入站点地图 URL,让爬虫能找到你的所有页面。
- 3
保存为 robots.txt
把生成的文本复制到名为 robots.txt 的文件并上传到域名根目录。
工作原理
你指定 user-agent(规则适用于哪些爬虫,通常用 * 表示全部),然后是针对 URL 路径的 Allow 和 Disallow 规则,并可选加入站点地图 URL。工具将这些组装成搜索引擎期望的确切文本格式。你把输出复制到名为 robots.txt 的文件并上传到网站根目录。它是一组指令,而非安全屏障——它引导合作的爬虫。
什么时候用
阻止爬虫进入后台、暂存或重复页面。向搜索引擎指出站点地图以加快发现。屏蔽某个正在猛压你服务器的机器人。允许一切的同时仍声明站点地图。防止内容单薄或私密的区块被抓取。为新站上线设置 robots 规则。
常见问题
不能。它只是请求合作的爬虫跳过某路径;页面仍可公开访问,不遵守规则的机器人可无视它。要真正限制访问,请使用身份验证或服务器端控制。
注意事项
一行写错的 Disallow 就可能把你整个网站从搜索中隐藏。请仔细核对路径,并记住 robots.txt 是公开的——任何人都能读到,所以不要列出你想隐藏的机密 URL。