Robots.txt生成器

为搜索引擎爬虫生成robots.txt文件。

预览

1

用户代理块

创建 robots.txt 文件以引导搜索爬虫

概述

robots.txt 文件告诉搜索引擎爬虫可以或不可以访问你网站的哪些部分。它位于域名根目录,是守规矩的机器人在抓取前首先查看的东西。此生成器根据简单选择——允许或禁止哪些路径、以及站点地图的位置——构建有效的 robots.txt,让你无需记住语法。

使用步骤

  1. 1

    选择你的规则

    选择规则适用于哪些 user-agent,以及要允许或禁止哪些路径。

  2. 2

    添加你的站点地图

    可选加入站点地图 URL,让爬虫能找到你的所有页面。

  3. 3

    保存为 robots.txt

    把生成的文本复制到名为 robots.txt 的文件并上传到域名根目录。

工作原理

你指定 user-agent(规则适用于哪些爬虫,通常用 * 表示全部),然后是针对 URL 路径的 Allow 和 Disallow 规则,并可选加入站点地图 URL。工具将这些组装成搜索引擎期望的确切文本格式。你把输出复制到名为 robots.txt 的文件并上传到网站根目录。它是一组指令,而非安全屏障——它引导合作的爬虫。

什么时候用

阻止爬虫进入后台、暂存或重复页面。向搜索引擎指出站点地图以加快发现。屏蔽某个正在猛压你服务器的机器人。允许一切的同时仍声明站点地图。防止内容单薄或私密的区块被抓取。为新站上线设置 robots 规则。

常见问题

不能。它只是请求合作的爬虫跳过某路径;页面仍可公开访问,不遵守规则的机器人可无视它。要真正限制访问,请使用身份验证或服务器端控制。

注意事项

一行写错的 Disallow 就可能把你整个网站从搜索中隐藏。请仔细核对路径,并记住 robots.txt 是公开的——任何人都能读到,所以不要列出你想隐藏的机密 URL。

Robots.txt生成器 | Super Easy Utils