Monte um robots.txt válido com presets, regras próprias, bloqueio de crawlers de IA e a linha do seu sitemap.
O robots.txt é um arquivo de texto puro na raiz de um domínio que informa aos rastreadores automatizados quais caminhos eles podem requisitar. Ele segue o Robots Exclusion Protocol, padronizado como RFC 9309, e a sua estrutura é simples: grupos que começam com uma ou mais linhas User-agent seguidas de regras Disallow e Allow, mais linhas Sitemap avulsas que valem para o arquivo inteiro. Caminhos casam por prefixo, * representa qualquer sequência de caracteres e $ ancora o fim de uma URL, então /*.pdf$ bloqueia todo PDF. Um "Disallow:" vazio é a forma canônica de dizer que pode rastrear tudo.
Este gerador escreve essa sintaxe para você e ajeita a entrada no caminho: todo caminho ganha uma barra inicial se você esqueceu, linhas começando com # são mantidas como comentários, uma lista de regras vazia vira o grupo canônico de liberar tudo, e o crawl delay só é escrito quando é um número positivo. A opção de crawlers de IA acrescenta um grupo separado listando GPTBot, ChatGPT-User, OAI-SearchBot, CCBot, anthropic-ai, ClaudeBot, Claude-Web, Google-Extended, PerplexityBot, Applebot-Extended, Bytespider, Amazonbot, Meta-ExternalAgent e cohere-ai sob um único Disallow: /, que é como você opta por ficar fora do treinamento de IA e do rastreamento de motores de resposta sem mexer no Googlebot. A linha Sitemap é validada como URL absoluta, porque caminhos relativos de sitemap são ignorados pelos buscadores.
Vale repetir dois limites honestos. Primeiro, o robots.txt é um pedido, não um muro: rastreadores bem-comportados o obedecem, scrapers o ignoram, e tudo o que você lista ali é publicamente legível — nunca o use para esconder caminhos sensíveis. Segundo, bloquear uma URL impede o rastreamento, não a indexação; uma página bloqueada que outros sites linkam ainda pode aparecer nos resultados sem descrição, então use uma meta tag noindex na própria página quando quiser tirá-la do índice. O arquivo é gerado inteiramente no seu navegador e baixado localmente — nada sobre o seu site é enviado aqui.
User-agent:
Na raiz do domínio, acessível em https://seusite.com/robots.txt. Rastreadores só olham ali — um arquivo em subpasta é ignorado, e cada subdomínio precisa do seu próprio.
Não. Ele impede que a página seja rastreada, mas uma URL bloqueada ainda pode ser indexada a partir de links externos. Para manter uma página fora dos resultados, libere o rastreamento e acrescente uma meta tag noindex à página.
Alguns sim, outros não. OpenAI, Google e Anthropic documentam os seus user-agents e respeitam o arquivo; muitos scrapers o ignoram por completo. Bloquear é um sinal claro, não uma imposição.
Não — o Googlebot ignora a diretiva e ajusta o próprio ritmo, embora Bing e Yandex a leiam. Use o Search Console se precisar desacelerar o Google.
Não. Bloquear arquivos CSS ou JS impede que os buscadores renderizem as suas páginas como os usuários as veem, o que pode prejudicar o ranqueamento, e o sitemap precisa continuar acessível.
Não. O arquivo é montado por JavaScript no seu dispositivo e salvo direto na sua pasta de downloads.
O Vai.la transforma qualquer URL em um link curto com estatísticas de cliques, QR Code e seu próprio biolink.
O Vai.la não se responsabiliza pelo uso das ferramentas nem por decisões tomadas com base nos seus resultados.