llms.txt vs robots.txt: para que serve cada um
Dois ficheiros na raiz do site, dois trabalhos diferentes: o robots.txt controla quem entra, o llms.txt indexa o conteúdo. Como configurá-los para os motores de IA.
O robots.txt e o llms.txt vivem os dois na raiz do site, mas fazem trabalhos opostos. O robots.txt decide quem entra: diz a cada crawler o que pode visitar. O llms.txt convida: dá aos motores de IA um índice curado do conteúdo que importa. Um regula o acesso, o outro orienta a leitura. Confundi-los custa visibilidade.
- o robots.txt decide o acesso; o llms.txt indexa o conteúdo
- o robots.txt é essencial e deve permitir os crawlers de IA relevantes
- o llms.txt é opcional, emergente e barato, com tendência a ganhar peso
- bloquear crawlers de IA remove-o das respostas sem devolver os cliques
Dois ficheiros, dois trabalhos
Ambos são ficheiros de texto simples, ambos vivem na raiz do domínio, e é aí que acabam as semelhanças. O robots.txt existe desde os anos 90 e é uma convenção de acesso: lista crawlers e diz-lhes onde podem ou não ir. O llms.txt nasceu em 2024 como proposta e é uma convenção de orientação: em vez de barrar, guia, apontando aos modelos o conteúdo principal do site num formato que eles leem com facilidade.
A confusão comum é tratá-los como alternativas. Não são. Um decide se o motor entra; o outro, uma vez lá dentro, ajuda-o a perceber o que importa. Fazem sentido juntos.
robots.txt: a porta
O robots.txt é a primeira coisa que um crawler consulta. Para visibilidade em IA, o que interessa é permitir os crawlers certos. Cada motor tem os seus, e vale a pena distinguir dois tipos: os que recolhem conteúdo para treino dos modelos e os que pesquisam a web ao vivo para responder a uma pergunta no momento.
Se quer aparecer nas respostas, a lista a permitir inclui, entre outros, o GPTBot e o OAI-SearchBot da OpenAI, o ClaudeBot e o Claude-SearchBot da Anthropic, o PerplexityBot, e o Google-Extended. Bloquear qualquer um destes remove o site das fontes que esse motor consegue ler.
O erro que mais custa é o bloqueio por omissão. Muitos sites herdam, via plugin ou template, um robots.txt que barra crawlers de IA sem decisão consciente. O resultado é ficar de fora das respostas sem sequer saber porquê. A decisão de bloquear pode ser legítima, uma editora com conteúdo pago tem razões para barrar treino, mas deve ser escolhida, não sofrida.
llms.txt: o índice
O llms.txt é um ficheiro em markdown que descreve o site de forma estruturada e legível por modelos: quem é, o que faz, e ligações para as páginas que importam. A variante llms-full.txt vai mais longe e entrega o texto principal do site numa única leitura, poupando ao crawler o trabalho de saltar entre páginas.
É honesto dizer que, sozinho, não faz milagres. É um padrão emergente e nem todos os motores o leem hoje. Mas o custo de o criar é uma tarde de trabalho, não há contraindicações, e a probabilidade de ganhar peso é alta à medida que os motores maturam. É o tipo de aposta de baixo risco que vale a pena fazer cedo.
A tabela, lado a lado
| Dimensão | robots.txt | llms.txt |
|---|---|---|
| Função | Decidir o acesso dos crawlers | Indexar o conteúdo para leitura |
| Postura | Permitir ou barrar | Convidar e orientar |
| Maturidade | Standard estabelecido | Proposta emergente (2024) |
| Obrigatório para GEO | Sim, deve permitir crawlers de IA | Não, mas recomendável |
| Formato | Regras user-agent e allow ou disallow | Markdown com ligações |
O pacote mínimo de higiene técnica
Nenhum destes ficheiros trabalha isolado. A fundação técnica que os motores esperam junta três peças: um robots.txt que permite os crawlers de IA relevantes, um llms.txt que os orienta, e dados estruturados (schema.org) nas páginas principais para que a marca seja identificada sem ambiguidade. As três são baratas e fazem-se uma vez. Para um exemplo feito, o destaque.ai/robots.txt e o destaque.ai/llms.txt são públicos.
Perguntas frequentes
Qual é a diferença entre llms.txt e robots.txt?
O robots.txt decide o acesso: diz a cada crawler o que pode ou não visitar. O llms.txt faz o oposto, é um convite: dá aos motores de IA um índice curado do conteúdo mais importante do site. Um regula a entrada, o outro orienta a leitura. Não se substituem, complementam-se.
Preciso dos dois?
O robots.txt é essencial e deve permitir os crawlers de IA relevantes se quer aparecer nas respostas. O llms.txt é opcional e emergente, barato de implementar e sem contraindicações, com tendência a ganhar peso. Para uma empresa que quer ser encontrada, o robots.txt correto é obrigatório e o llms.txt é uma boa aposta de baixo custo.
Bloquear crawlers de IA no robots.txt protege o meu conteúdo?
Bloqueia a leitura, mas ao custo de sair das respostas onde os seus clientes procuram. Para quem vive de ser encontrado, a troca raramente compensa. A escolha fina existe, decidir crawler a crawler e distinguir bots de treino de bots de pesquisa, e deve ser uma decisão consciente, não o valor por omissão de um plugin.
A ler a seguir
- O que é o llms.txt e como criar o seu, o ficheiro em detalhe.
- Seis comandos para saber se a IA consegue ler o seu site, para verificar os dois de uma vez.
- Schema.org para SaaS B2B: o mínimo viável, a terceira peça do pacote.
Publicado primeiro em destaque.ai/blog/llms-txt-vs-robots-txt