Periscopy
Artigos
Metodologia7 min de leitura

llms.txt vs robots.txt: para que serve cada um

Dois ficheiros na raiz do site, dois trabalhos diferentes: o robots.txt controla quem entra, o llms.txt indexa o conteúdo. Como configurá-los para os motores de IA.


O robots.txt e o llms.txt vivem os dois na raiz do site, mas fazem trabalhos opostos. O robots.txt decide quem entra: diz a cada crawler o que pode visitar. O llms.txt convida: dá aos motores de IA um índice curado do conteúdo que importa. Um regula o acesso, o outro orienta a leitura. Confundi-los custa visibilidade.

Key takeaways
  • o robots.txt decide o acesso; o llms.txt indexa o conteúdo
  • o robots.txt é essencial e deve permitir os crawlers de IA relevantes
  • o llms.txt é opcional, emergente e barato, com tendência a ganhar peso
  • bloquear crawlers de IA remove-o das respostas sem devolver os cliques

Dois ficheiros, dois trabalhos

Ambos são ficheiros de texto simples, ambos vivem na raiz do domínio, e é aí que acabam as semelhanças. O robots.txt existe desde os anos 90 e é uma convenção de acesso: lista crawlers e diz-lhes onde podem ou não ir. O llms.txt nasceu em 2024 como proposta e é uma convenção de orientação: em vez de barrar, guia, apontando aos modelos o conteúdo principal do site num formato que eles leem com facilidade.

A confusão comum é tratá-los como alternativas. Não são. Um decide se o motor entra; o outro, uma vez lá dentro, ajuda-o a perceber o que importa. Fazem sentido juntos.

robots.txt: a porta

O robots.txt é a primeira coisa que um crawler consulta. Para visibilidade em IA, o que interessa é permitir os crawlers certos. Cada motor tem os seus, e vale a pena distinguir dois tipos: os que recolhem conteúdo para treino dos modelos e os que pesquisam a web ao vivo para responder a uma pergunta no momento.

Se quer aparecer nas respostas, a lista a permitir inclui, entre outros, o GPTBot e o OAI-SearchBot da OpenAI, o ClaudeBot e o Claude-SearchBot da Anthropic, o PerplexityBot, e o Google-Extended. Bloquear qualquer um destes remove o site das fontes que esse motor consegue ler.

O erro que mais custa é o bloqueio por omissão. Muitos sites herdam, via plugin ou template, um robots.txt que barra crawlers de IA sem decisão consciente. O resultado é ficar de fora das respostas sem sequer saber porquê. A decisão de bloquear pode ser legítima, uma editora com conteúdo pago tem razões para barrar treino, mas deve ser escolhida, não sofrida.

llms.txt: o índice

O llms.txt é um ficheiro em markdown que descreve o site de forma estruturada e legível por modelos: quem é, o que faz, e ligações para as páginas que importam. A variante llms-full.txt vai mais longe e entrega o texto principal do site numa única leitura, poupando ao crawler o trabalho de saltar entre páginas.

É honesto dizer que, sozinho, não faz milagres. É um padrão emergente e nem todos os motores o leem hoje. Mas o custo de o criar é uma tarde de trabalho, não há contraindicações, e a probabilidade de ganhar peso é alta à medida que os motores maturam. É o tipo de aposta de baixo risco que vale a pena fazer cedo.

A tabela, lado a lado

Dimensãorobots.txtllms.txt
FunçãoDecidir o acesso dos crawlersIndexar o conteúdo para leitura
PosturaPermitir ou barrarConvidar e orientar
MaturidadeStandard estabelecidoProposta emergente (2024)
Obrigatório para GEOSim, deve permitir crawlers de IANão, mas recomendável
FormatoRegras user-agent e allow ou disallowMarkdown com ligações

O pacote mínimo de higiene técnica

Nenhum destes ficheiros trabalha isolado. A fundação técnica que os motores esperam junta três peças: um robots.txt que permite os crawlers de IA relevantes, um llms.txt que os orienta, e dados estruturados (schema.org) nas páginas principais para que a marca seja identificada sem ambiguidade. As três são baratas e fazem-se uma vez. Para um exemplo feito, o destaque.ai/robots.txt e o destaque.ai/llms.txt são públicos.

Perguntas frequentes

Qual é a diferença entre llms.txt e robots.txt?

O robots.txt decide o acesso: diz a cada crawler o que pode ou não visitar. O llms.txt faz o oposto, é um convite: dá aos motores de IA um índice curado do conteúdo mais importante do site. Um regula a entrada, o outro orienta a leitura. Não se substituem, complementam-se.

Preciso dos dois?

O robots.txt é essencial e deve permitir os crawlers de IA relevantes se quer aparecer nas respostas. O llms.txt é opcional e emergente, barato de implementar e sem contraindicações, com tendência a ganhar peso. Para uma empresa que quer ser encontrada, o robots.txt correto é obrigatório e o llms.txt é uma boa aposta de baixo custo.

Bloquear crawlers de IA no robots.txt protege o meu conteúdo?

Bloqueia a leitura, mas ao custo de sair das respostas onde os seus clientes procuram. Para quem vive de ser encontrado, a troca raramente compensa. A escolha fina existe, decidir crawler a crawler e distinguir bots de treino de bots de pesquisa, e deve ser uma decisão consciente, não o valor por omissão de um plugin.

A ler a seguir

Publicado primeiro em destaque.ai/blog/llms-txt-vs-robots-txt