Gerador de Robots.txt

Monte um robots.txt válido com presets, regras próprias, bloqueio de crawlers de IA e a linha do seu sitemap.

Como usar

  1. Escolha um preset — liberar tudo, bloquear tudo ou bloquear as pastas típicas de CMS — ou digite os seus próprios caminhos, um por linha.
  2. Acrescente exceções em Allow, um crawl delay se precisar, e a URL completa do seu sitemap.
  3. Marque a opção de crawlers de IA se quiser, depois baixe o robots.txt e envie para a raiz do seu domínio.

Sobre esta ferramenta

O robots.txt é um arquivo de texto puro na raiz de um domínio que informa aos rastreadores automatizados quais caminhos eles podem requisitar. Ele segue o Robots Exclusion Protocol, padronizado como RFC 9309, e a sua estrutura é simples: grupos que começam com uma ou mais linhas User-agent seguidas de regras Disallow e Allow, mais linhas Sitemap avulsas que valem para o arquivo inteiro. Caminhos casam por prefixo, * representa qualquer sequência de caracteres e $ ancora o fim de uma URL, então /*.pdf$ bloqueia todo PDF. Um "Disallow:" vazio é a forma canônica de dizer que pode rastrear tudo.

Este gerador escreve essa sintaxe para você e ajeita a entrada no caminho: todo caminho ganha uma barra inicial se você esqueceu, linhas começando com # são mantidas como comentários, uma lista de regras vazia vira o grupo canônico de liberar tudo, e o crawl delay só é escrito quando é um número positivo. A opção de crawlers de IA acrescenta um grupo separado listando GPTBot, ChatGPT-User, OAI-SearchBot, CCBot, anthropic-ai, ClaudeBot, Claude-Web, Google-Extended, PerplexityBot, Applebot-Extended, Bytespider, Amazonbot, Meta-ExternalAgent e cohere-ai sob um único Disallow: /, que é como você opta por ficar fora do treinamento de IA e do rastreamento de motores de resposta sem mexer no Googlebot. A linha Sitemap é validada como URL absoluta, porque caminhos relativos de sitemap são ignorados pelos buscadores.

Vale repetir dois limites honestos. Primeiro, o robots.txt é um pedido, não um muro: rastreadores bem-comportados o obedecem, scrapers o ignoram, e tudo o que você lista ali é publicamente legível — nunca o use para esconder caminhos sensíveis. Segundo, bloquear uma URL impede o rastreamento, não a indexação; uma página bloqueada que outros sites linkam ainda pode aparecer nos resultados sem descrição, então use uma meta tag noindex na própria página quando quiser tirá-la do índice. O arquivo é gerado inteiramente no seu navegador e baixado localmente — nada sobre o seu site é enviado aqui.

A fórmula

User-agent: / Disallow: / Allow: / Crawl-delay: — repetidos por grupo, com Sitemap: em linha própria.

Perguntas frequentes

Onde eu coloco o arquivo robots.txt?

Na raiz do domínio, acessível em https://seusite.com/robots.txt. Rastreadores só olham ali — um arquivo em subpasta é ignorado, e cada subdomínio precisa do seu próprio.

Disallow tira uma página do Google?

Não. Ele impede que a página seja rastreada, mas uma URL bloqueada ainda pode ser indexada a partir de links externos. Para manter uma página fora dos resultados, libere o rastreamento e acrescente uma meta tag noindex à página.

Os crawlers de IA realmente respeitam o robots.txt?

Alguns sim, outros não. OpenAI, Google e Anthropic documentam os seus user-agents e respeitam o arquivo; muitos scrapers o ignoram por completo. Bloquear é um sinal claro, não uma imposição.

O Google aceita Crawl-delay?

Não — o Googlebot ignora a diretiva e ajusta o próprio ritmo, embora Bing e Yandex a leiam. Use o Search Console se precisar desacelerar o Google.

Devo bloquear meu sitemap ou meus arquivos CSS e JavaScript?

Não. Bloquear arquivos CSS ou JS impede que os buscadores renderizem as suas páginas como os usuários as veem, o que pode prejudicar o ranqueamento, e o sitemap precisa continuar acessível.

Algo do que eu digito é enviado para algum servidor?

Não. O arquivo é montado por JavaScript no seu dispositivo e salvo direto na sua pasta de downloads.

Ferramentas relacionadas

Links longos? Encurte de graça

O Vai.la transforma qualquer URL em um link curto com estatísticas de cliques, QR Code e seu próprio biolink.

O Vai.la não se responsabiliza pelo uso das ferramentas nem por decisões tomadas com base nos seus resultados.