CRBRASIL
GEO

SEO técnico para IA: rastreamento, robots.txt para crawlers de IA e o que fazer com o llms.txt

Por Redação CRO Brasil ·

SEO técnico para IA: rastreamento, robots.txt para crawlers de IA e o que fazer com o llms.txt

Antes de qualquer estratégia de conteúdo, uma pergunta: os robôs conseguem ler o seu site? Veja a base técnica para aparecer no Google e nas IAs, e como separar robôs de busca de robôs de treinamento.

Índice do artigo

A base: sem acesso, não há citação

Todo o caminho até uma citação começa com um robô conseguindo acessar e ler a página. Se o robots.txt, a CDN, o firewall ou o próprio código impedem isso, nenhuma estratégia de conteúdo resolve.

Em uma frase: SEO técnico é o que torna o seu conteúdo elegível; conteúdo é o que o torna escolhido.

Os requisitos do Google para os recursos de IA

Segundo o Google, para aparecer em AI Overviews e AI Mode a página precisa:

  • estar indexada e elegível a aparecer na Busca com snippet, cumprindo os requisitos técnicos da Busca;
  • estar em um site incluído nos recursos de IA generativa da Busca (há configuração relacionada no Search Console).

E as boas práticas técnicas de sempre continuam valendo:

  • permitir o rastreamento no robots.txt e na infraestrutura (CDN, hospedagem);
  • tornar o conteúdo encontrável por links internos;
  • seguir boas práticas de SEO para JavaScript;
  • oferecer boa experiência de página em todos os dispositivos;
  • reduzir conteúdo duplicado;
  • verificar o site no Search Console para diagnosticar problemas.

JavaScript, renderização e conteúdo escondido

O Google consegue processar JavaScript quando não está bloqueado, mas lembra que sites com frameworks JavaScript são mais complexos para SEO. Outros robôs podem ter capacidade de renderização mais limitada. Boas práticas:

  • conteúdo principal presente no HTML entregue pelo servidor (renderização no servidor ou geração estática) sempre que possível;
  • links internos como elementos de link reais, não só eventos de clique;
  • não esconder o conteúdo principal atrás de interações (abas que carregam só no clique, “ver mais” que busca o texto depois);
  • recursos (CSS, JS) não bloqueados no robots.txt.

Um teste simples: veja o código-fonte da página (não o inspecionar elemento). Se o texto principal não está lá, alguns robôs podem não enxergá-lo.

Robôs de IA: busca, treinamento e acesso do usuário

Os principais provedores separam os robôs por função:

  • Robôs de busca/indexação: coletam páginas para que a plataforma possa citá-las em respostas. Exemplos: OAI-SearchBot (OpenAI), Claude-SearchBot (Anthropic), PerplexityBot (Perplexity).
  • Robôs de treinamento: coletam conteúdo para treinar modelos. Exemplos: GPTBot (OpenAI), ClaudeBot (Anthropic), e o token Google-Extended, que controla o uso de conteúdo para treinar e fazer grounding dos modelos Gemini.
  • Acesso a pedido do usuário: quando alguém pede para a IA abrir uma URL específica. Exemplos: ChatGPT-User, Claude-User.

Dois pontos importantes:

  • O Google-Extended não afeta a Busca do Google, incluindo AI Overviews e AI Mode, que usam o Googlebot.
  • Bloquear robôs de treinamento não é o mesmo que bloquear robôs de busca. É possível optar por não participar do treinamento e continuar elegível para citação.

Os nomes e funções mudam com frequência. Confirme sempre na documentação oficial de cada provedor antes de publicar regras.

Como configurar o robots.txt

Defina primeiro a política da empresa (decisão de negócio e jurídica), depois traduza em regras. Um exemplo de política “citável, mas sem treino”:

# Busca do Google (inclui AI Overviews e AI Mode)

User-agent: Googlebot

Allow: /

# Robôs de busca de IA: permitir

User-agent: OAI-SearchBot

Allow: /

User-agent: Claude-SearchBot

Allow: /

User-agent: PerplexityBot

Allow: /

# Robôs de treinamento: bloquear (decisão de negócio)

User-agent: GPTBot

Disallow: /

User-agent: ClaudeBot

Disallow: /

User-agent: Google-Extended

Disallow: /

Sitemap: https://www.seusite.com.br/sitemap.xml

Cuidados:

  • Valide o arquivo antes de publicar. Um erro de sintaxe pode bloquear o Googlebot e derrubar todo o tráfego orgânico.
  • robots.txt é uma convenção: robôs legítimos respeitam, mas não é mecanismo de segurança.
  • Revise o arquivo depois de migrações e redesigns; regras antigas costumam sobreviver.

CDN e firewall: o bloqueio que ninguém vê

Muitas CDNs e serviços de segurança passaram a oferecer bloqueio de robôs de IA com um clique, às vezes ativado por padrão. O robots.txt pode dizer “permitido” enquanto a CDN responde com erro ou desafio. Verifique:

  • as configurações de gerenciamento de bots da CDN;
  • os logs do servidor, procurando os user-agents dos robôs e os códigos de resposta;
  • se regras de limite de taxa não estão bloqueando rastreamentos legítimos.

llms.txt: usar ou não?

O llms.txt é uma proposta de arquivo em Markdown com um resumo do site e links para as páginas mais importantes, pensado para modelos de linguagem.

O que se sabe hoje:

  • O Google afirma que a Busca não usa llms.txt: criar o arquivo não ajuda nem prejudica a visibilidade no Google, incluindo recursos de IA.
  • Outros serviços podem ou não usar o arquivo. Algumas documentações técnicas publicam llms.txt para facilitar o uso por assistentes de código, por exemplo.

Recomendação prática: trate o llms.txt como opcional e de baixo custo, útil principalmente para documentação técnica. Nunca como substituto de indexação, conteúdo e links internos.

Checklist técnico

  1. Páginas importantes indexadas no Search Console.
  2. robots.txt revisado, com política clara para robôs de busca e de treinamento.
  3. CDN e firewall permitindo os robôs que a política autoriza.
  4. Conteúdo principal no HTML servido, sem depender só de JavaScript no cliente.
  5. Links internos rastreáveis levando às páginas importantes.
  6. Sitemap atualizado e declarado.
  7. Canonicals corretos e conteúdo duplicado reduzido.
  8. Boa performance e experiência em mobile.
  9. Logs do servidor monitorados para acesso dos robôs.

Perguntas frequentes

Devo bloquear o GPTBot?

É uma decisão de negócio. O GPTBot é associado ao treinamento dos modelos da OpenAI; a presença na busca do ChatGPT está ligada ao OAI-SearchBot.

Bloquear o Google-Extended tira meu site do AI Overview?

Não. O Google-Extended não afeta a Busca; AI Overviews e AI Mode usam o Googlebot.

Posso permitir citação e bloquear treinamento?

Sim, permitindo os robôs de busca e bloqueando os de treinamento no robots.txt.

O llms.txt ajuda no Google?

Não. O Google afirma que a Busca ignora esse arquivo.

Por que meu site não recebe visitas de robôs de IA?

Verifique robots.txt, configurações de bots na CDN, firewall e logs do servidor.

JavaScript atrapalha a indexação por IA?

Pode atrapalhar, principalmente em robôs com renderização limitada. Entregue o conteúdo principal no HTML sempre que possível.