O que é robots.txt
robots.txt é o arquivo na raiz do site que informa a cada robô quais partes ele pode acessar. Incluindo os crawlers de IA, que precisam ser liberados explicitamente para que o site possa ser citado.
robots.txt é um arquivo de texto na raiz do site que diz a cada tipo de robô o que ele pode ou não acessar.
Para um site que quer ser encontrado, a configuração correta é simples: liberar quase tudo e bloquear apenas áreas internas, como painéis administrativos.
O ponto que muda com a busca por IA são os robôs específicos desses serviços, GPTBot, ClaudeBot, PerplexityBot, CCBot e Google-Extended. Cada um pode ser liberado ou bloqueado individualmente.
Bloquear Google-Extended é o erro mais comum e mais caro dessa lista: significa optar por ficar de fora das respostas generativas do Google. Empresas fazem isso por receio de “ter o conteúdo usado para treinar IA”, sem perceber que estão abrindo mão de aparecer justamente onde uma fatia crescente dos clientes procura fornecedor.
Vale registrar que robots.txt é uma convenção, não um bloqueio técnico: robôs bem comportados respeitam, os demais não.
Veja também
- llms.txtllms.txt é um arquivo de texto na raiz do site que resume, em formato simples, o que a organização faz e quais páginas importam. Pensado para ser lido por modelos de linguagem.
- GEOGEO é a otimização para motores generativos: o conjunto de práticas que aumenta a chance de ChatGPT, Gemini, Perplexity e Claude citarem uma empresa ao responder perguntas sobre o assunto dela.
- SEOSEO é o conjunto de práticas que faz uma página ser encontrada nos buscadores por quem procura aquele assunto, combinando conteúdo útil, estrutura técnica e reputação do domínio.
Verbete escrito e revisado por Renan Ribeiro Vivas. Atualizado em 30 de agosto de 2026.
Voltar ao glossário