Seis comandos para saber se a IA consegue ler o seu site
Antes de perguntar porque é que a IA não o cita, confirme que ela chega ao site. Seis verificações que corre no terminal em cinco minutos, com output real e o que fazer quando cada uma falha.
A pergunta que mais ouvimos é porque é que a IA não recomenda a marca. Antes de responder a isso, vale a pena responder a uma mais simples: a IA consegue sequer ler o site? Em cerca de metade dos casos que auditamos, alguma destas seis coisas está partida, e o trabalho de conteúdo que se fez por cima estava a ser feito às escuras.
Cada comando abaixo foi corrido contra o destaque.ai a 20 de Agosto de 2026, e o que está nas caixas é o resultado verdadeiro, não um exemplo desenhado para o artigo. Substitua o domínio pelo seu e leva cinco minutos.
01 · Os robôs de IA têm entrada
O comando
curl -s https://example.com/robots.txt | grep -iA1 'GPTBot\|ClaudeBot\|PerplexityBot\|Google-Extended\|OAI-SearchBot'
O que devolveu
User-Agent: GPTBot Allow: / -- User-Agent: OAI-SearchBot Allow: / -- User-Agent: ClaudeBot Allow: / -- User-Agent: Google-Extended Allow: / -- User-Agent: PerplexityBot Allow: /
Cinco agentes, cinco autorizações. Se algum aparecer com Disallow, ou não aparecer de todo enquanto existe um Disallow genérico acima, esse motor não lê o site e nada do resto interessa.
Note a diferença entre os dois tipos: GPTBot e ClaudeBot recolhem para treino, OAI-SearchBot e PerplexityBot vão buscar a página no momento em que alguém pergunta. Bloquear os primeiros é uma decisão legítima; bloquear os segundos é desaparecer das respostas com pesquisa ao vivo, que é onde se ganha no curto prazo.
02 · O llms.txt existe e diz alguma coisa
O comando
curl -s -o /dev/null -w '%{http_code} %{size_download}\n' https://example.com/llms.txtO que devolveu
200 24759
Vinte e quatro mil setecentos e cinquenta e nove bytes de mapa em texto (o 200 é o código HTTP): quem somos, o que vendemos, que estudos publicámos, com uma linha de contexto por ligação. Um 404 aqui não é fatal, mas é uma oportunidade deitada fora.
Um llms.txt de dez linhas com só os títulos das páginas não serve para nada. O que o torna útil é a frase de contexto a seguir a cada ligação, que é o que um motor cita quando não vai abrir a página toda.
03 · O texto está no HTML, não só no JavaScript
O comando
curl -s https://example.com/pagina | sed 's/<script.*<\/script>//g' | sed 's/<[^>]*>/ /g' | wc -w
O que devolveu
2082
Duas mil e oitenta e duas palavras chegam sem executar uma linha de JavaScript, numa página com um h1 e onze h2. Este é o teste que mais sites falha, e falha em silêncio: no browser a página parece cheia, e o que sai do servidor é uma casca vazia.
Se o número vier perto de zero, o conteúdo está a ser montado no browser. Alguns motores executam JavaScript, a maioria dos recolectores não. A correção é renderizar no servidor, não é acrescentar mais schema por cima do vazio.
04 · O schema declara o que a página é
O comando
curl -s https://example.com/pagina | grep -o '"@type":"[^"]*"' | sort | uniq -c | sort -rn
O que devolveu
14x ImageObject 1x Organization 1x Person 1x WebSite 1x WebPage 1x Service 1x SoftwareApplication 1x FAQPage 1x BreadcrumbList
Uma página de produto que se declara SoftwareApplication, com a organização, a pessoa que assina, as perguntas frequentes e as imagens identificadas uma a uma. Nove tipos, todos verdadeiros.
O erro comum não é ter pouco schema, é ter schema que mente: declarar Product numa página que não vende nada, ou FAQPage com perguntas que não estão visíveis na página. Isso apanha-se, e custa mais do que não ter nenhum.
05 · As versões em cada língua apontam uma para a outra
O comando
curl -s https://example.com/pagina | grep -oE '<link rel="(canonical|alternate)"[^>]*>'
O que devolveu
<link rel="canonical" href="https://www.destaque.ai/tracker"/> <link rel="alternate" hrefLang="pt-PT" href="https://www.destaque.ai/tracker"/> <link rel="alternate" hrefLang="en" href="https://www.destaque.ai/en/tracker"/> <link rel="alternate" hrefLang="x-default" href="https://www.destaque.ai/tracker"/>
A versão portuguesa declara a inglesa, e é preciso correr o mesmo comando na inglesa para confirmar que ela declara a portuguesa. Sem reciprocidade o Google descarta o par inteiro e as duas páginas competem uma com a outra.
Este foi um erro real daquele site: a homepage não declarava alternativa nenhuma, e a versão inglesa ficava sem sinal na página mais importante. Correr o comando nos dois lados é o que o apanha.
06 · A página existe no sitemap
O comando
curl -s https://example.com/sitemap.xml | grep -c '<loc>'
O que devolveu
64
Sessenta e quatro endereços, e as páginas que interessam estão lá, o que se confirma procurando cada uma no sitemap. Um sitemap que não acompanha as páginas novas é pior do que não existir: dá ao motor uma lista desatualizada e ele confia nela.
Verifique sempre as páginas criadas nas últimas semanas. São essas que ficam de fora quando o sitemap é escrito à mão em vez de gerado a partir das rotas.
O que estes seis comandos não dizem
Dizem que o site é legível. Não dizem que a marca é citada, e a diferença entre as duas coisas é o trabalho todo. Um site com os seis pontos verdes pode continuar a não aparecer em resposta nenhuma, porque ser citado depende de autoridade, de dados próprios e de responder melhor do que os outros à pergunta que o comprador faz.
A legibilidade é a condição de entrada. Sem ela, nada do resto conta; com ela, começa o trabalho.
Perguntas frequentes
Estas seis verificações garantem que a IA me vai citar?
Não, e é importante perceber a diferença. Estas verificações dizem que o site é legível: que os agentes entram, que o texto sai do servidor, que a página se declara pelo que é. Ser citado depende de outra coisa, que é ter autoridade e conteúdo que responda à pergunta melhor do que o dos outros. A legibilidade é a condição de entrada, não a vitória. Um site perfeito nestes seis pontos pode continuar a não aparecer em resposta nenhuma.
Devo bloquear o GPTBot para a IA não treinar com o meu conteúdo?
É uma decisão legítima e depende do que vende. O que não se deve fazer é bloquear sem distinguir: GPTBot e ClaudeBot recolhem conteúdo para treino, enquanto OAI-SearchBot e PerplexityBot vão buscar a página no momento em que um utilizador pergunta. Bloquear os segundos significa desaparecer das respostas com pesquisa ao vivo, que é onde a visibilidade se ganha em semanas em vez de meses.
Com que frequência se repetem estas verificações?
Uma vez por trimestre chega para um site estável, e sempre que se muda de framework, se migra de servidor ou se lança uma secção nova. As duas que mais partem sozinhas são a terceira, quando alguém converte uma página para renderização no browser, e a sexta, quando se criam páginas que o sitemap não apanha.
A ler a seguir
- llms.txt e robots.txt: qual serve para quê, se a segunda verificação lhe deu 404.
- Schema.org para SaaS B2B: o mínimo viável, se a quarta lhe deu pouca coisa.
- Como auditar a visibilidade da sua marca em IA, o passo seguinte a estes seis.
Publicado primeiro em destaque.ai/blog/verificar-se-a-ia-le-o-seu-site