Ser citado por um assistente de IA é um problema de crawler antes de ser um problema de conteúdo: se o bot não consegue buscar e analisar a página, nenhuma quantidade de boa escrita aparecerá numa resposta. A boa notícia é que a camada técnica é pequena — um punhado de regras no robots.txt, opcionalmente um llms.txt, e um conjunto de sinais ao nível da página que tornam o teu conteúdo trivialmente citável. Este guia cobre exatamente isso, na ordem em que o deves fazer.
Está escrito a partir da experiência de manter estes ficheiros em produção no aat.ee, incluindo as regras para crawlers de IA e o llms.txt que servem este site.
Como um assistente de IA acaba por te citar
Há dois caminhos, e deves otimizar para ambos:
- Recuperação em tempo real. O assistente procura ou busca páginas no momento da resposta. É aqui que a rastreabilidade, a atualidade e a estrutura extraível decidem tudo. Se a tua página está bloqueada, não pode ser recuperada.
- Dados de treino. A associação "categoria → produtos líderes" foi aprendida a partir de texto com que o modelo foi treinado. Produtos mencionados com frequência, em fontes credíveis, em linguagem clara tornam-se predefinições a que o modelo recorre. Este caminho é mais lento e menos controlável, e é por isso que a consistência em toda a web importa.
A recuperação em tempo real é a que podes influenciar esta semana. Começa por aí.
Passo 1: Deixa entrar os crawlers de IA
A primeira falha é o bloqueio excessivo silencioso. Muitos sites proíbem "bots desconhecidos" ou copiam um robots.txt que bloqueia user agents de IA — e depois perguntam-se porque nunca são mencionados. Decide deliberadamente.
Sabe quem é quem
A distinção crítica: crawlers de treino e agentes de busca em tempo real são user agents separados, e bloquear um não bloqueia o outro.
| User agent | O que faz | Se o bloqueares |
|---|
GPTBot | Crawler de treino da OpenAI | Ficas excluído de futuros dados de treino |
ChatGPT-User | Busca em tempo real quando o prompt de um utilizador precisa de uma página | O ChatGPT não consegue ler a tua página em respostas que navegam |
ClaudeBot | Rastreamento da Anthropic | Cobertura reduzida de treino e recuperação |
Claude-User | Busca em tempo real desencadeada por um utilizador do Claude | O Claude não consegue ler a página a pedido |
PerplexityBot | Crawler da Perplexity | Ficas ausente das respostas com fontes da Perplexity |
Google-Extended | Controla o uso para treino do Gemini/Vertex de conteúdo rastreado pelo Google | A Pesquisa Google continua a funcionar, mas o uso para treino do Gemini fica desativado |
CCBot | Common Crawl, um corpus em que muitos modelos treinam | Excluído de um corpus aberto amplamente utilizado |
Se o teu objetivo é ser recomendado, a predefinição deve ser permitir para ambas as classes. Se tens uma razão específica para recusar o treino mas ainda assim ser citável em respostas em tempo real, bloqueia os agentes de treino (GPTBot, ClaudeBot, CCBot, Google-Extended) e permite explicitamente os agentes de busca em tempo real (ChatGPT-User, Claude-User, PerplexityBot). Essa é uma posição coerente — apenas toma-a de propósito.
Um padrão de robots.txt que funciona
Bloqueia os caminhos que tens de bloquear (superfícies privadas da aplicação, admin, ferramentas internas) e deixa tudo o resto ser rastreado. Mantém a mesma lista de caminhos privados para agentes de IA como para todos os outros, e declara o teu sitemap:
User-agent: *
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Disallow: /settings/
Sitemap: https://example.com/sitemap.xml
User-agent: GPTBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: PerplexityBot
Allow: /
Disallow: /api/
Disallow: /admin/
Crawl-delay: 10
Duas notas que poupam tempo real de depuração:
- Testa o ficheiro em tempo real, não o código-fonte. Busca
https://yoursite.com/robots.txt num navegador e confirma o resultado renderizado — a maioria dos frameworks gera-o a partir de código, e um bug nesse código é invisível até olhares.
- Um
Crawl-delay é um pedido, não uma garantia. Ainda assim vale a pena definir um valor educado: o rastreamento agressivo de um site pequeno é como acabas limitado por taxa ou bloqueado pelo teu próprio alojamento.
Uma coisa a remover
Se tens uma regra que proíbe um padrão de URL e não tens a certeza porque está lá, verifica se está a bloquear um agente de IA antes de a deixares. Regras de robots.txt herdadas são uma das causas mais comuns de "estamos indexados no Google mas nunca somos nomeados pelo ChatGPT."
Passo 2: Serve um llms.txt (se merecer o seu lugar)
llms.txt é uma convenção proposta, não um padrão: um ficheiro Markdown em /llms.txt que dá aos modelos um mapa curado do teu site — o que és, as tuas páginas mais importantes, e o que pode ser rastreado e reutilizado. Não há garantia de que qualquer assistente específico o leia, e não deves esperar que substitua páginas rastreáveis.
Ainda assim vale a pena publicá-lo, por duas razões: custa cerca de uma hora, e é o único lugar onde podes declarar, em linguagem simples, como queres que o teu conteúdo seja atribuído. Isso é útil para qualquer sistema que escolha lê-lo, e é uma declaração pública clara da tua política de rastreamento.
Um llms.txt útil tem cinco partes:
# llms.txt - AI/LLM Crawling Instructions for example.com
# About
> example.com is a [one-line description of what the site is and who it is for].
# Key pages
- [Product directory](https://example.com/categories)
- [Pricing](https://example.com/pricing)
- [Blog](https://example.com/blog)
- [Latest launches](https://example.com/trending)
# Crawling permissions
## Allowed
- Homepage, product pages, blog articles, categories, legal pages
## Restricted
- API endpoints, dashboard, settings, admin areas
# Usage policy
- AI training: with attribution
- Indexing and retrieval: allowed
- Attribution: cite "according to example.com"
# Contact
- Website: https://example.com
- Sitemap: https://example.com/sitemap.xml
Adapta-o às tuas rotas reais. O erro mais comum é publicar um modelo que descreve um site que não tens — caminhos desatualizados são piores do que nenhum ficheiro.
Não deixes que o llms.txt se torne uma desculpa
A convenção é sedutora porque parece um interruptor que podes acionar. Não é. Um modelo que recupera páginas em tempo real vai ler as tuas páginas, não o teu manifesto. Publica o llms.txt pela clareza de atribuição, e depois vai fazer o trabalho ao nível da página.
Passo 3: Torna as páginas citáveis
É aqui que as citações são realmente ganhas. Os sistemas de recuperação extraem afirmações autónomas, por isso estrutura as tuas páginas para lhas entregares.
- Resposta numa só frase no topo. O primeiro parágrafo após o título deve definir a coisa numa única frase, em linguagem declarativa simples. Essa frase é o que é extraído para uma resposta.
- Títulos em forma de pergunta. Usa a formulação que as pessoas realmente escrevem — "Quanto custa X?", "X é melhor que Y?" — para que o título e a resposta se alinhem.
- Tabelas de comparação. As tabelas mapeiam diretamente para perguntas de comparação e são citadas de forma desproporcionada. Mantém-nas estreitas (3–4 colunas) e completas.
- Uma FAQ real. Cinco a oito perguntas genuínas com respostas diretas. Não texto de marketing em forma de pergunta.
- Datas e versões. "Em julho de 2026" diz a um sistema de recuperação que a página está atual. Páginas sem data competem mal contra as que têm data.
- Factos que coincidem em todo o lado. O mesmo nome de produto, o mesmo one-liner, a mesma categoria, o mesmo URL canónico em todo o teu site, nas tuas listagens de diretórios e nos teus perfis. A inconsistência baixa a confiança de um modelo — e modelos confiantes nomeiam produtos.
Passo 4: Dá-lhe uma razão para preferir o teu domínio
A rastreabilidade faz-te ser considerado; a credibilidade faz-te ser citado. Os inputs são pouco glamorosos e acumulam-se:
- Listagens permanentes e relevantes. Páginas de diretório estruturadas são fáceis de analisar e frequentemente usadas como fontes (backlinks de diretórios dofollow).
- Menções em sites autoritativos e relevantes ao tema. Onde uma menção aparece tem mais peso do que quantas existem (domain rating e visibilidade em IA).
- Consistência entre páginas. Os mesmos factos em todo o lado, para que nada tenha de ser reconciliado.
- Atualidade. Atualiza as tuas páginas-chave num calendário real; a recuperação favorece conteúdo atual (o manual de GEO/AIEO).
Uma checklist de 90 minutos
Faz isso uma vez, e o trabalho contínuo é apenas a atualidade.
FAQ
Preciso de llms.txt para ser citado por assistentes de IA?
Não. É uma convenção opcional sem leitura garantida. Páginas rastreáveis e conteúdo extraível são o que realmente te faz ser citado; trata o llms.txt como um bónus de baixo custo para clareza de atribuição.
Devo bloquear o GPTBot ou o ClaudeBot?
Só se deliberadamente não quiseres que o teu conteúdo seja usado para treino. Bloquear crawlers de treino reduz a frequência com que os modelos aprendem a tua associação de categoria; geralmente não impede que os agentes de busca em tempo real leiam as tuas páginas numa resposta. Se o teu objetivo é ser recomendado, permitir ambos é a predefinição pragmática.
Qual é a diferença entre ClaudeBot e Claude-User?
ClaudeBot é o crawler da Anthropic, usado para construir e atualizar dados de treino. Claude-User é o agente que busca uma página porque uma pessoa perguntou ao Claude sobre ela neste momento. Bloquear o segundo remove-te das respostas em tempo real enquanto deixa o treino inalterado.
O Google-Extended afeta o meu posicionamento na pesquisa?
Não. O Google-Extended controla se o conteúdo rastreado pelo Google pode ser usado para treino do Gemini e do Vertex AI. A indexação e o posicionamento na Pesquisa Google são regidos pelas regras normais do Googlebot.
Quanto tempo até ver resultados?
A recuperação em tempo real pode refletir uma página nova, indexada e bem estruturada em poucos dias. As associações de dados de treino constroem-se ao longo de meses, à medida que menções credíveis se acumulam em toda a web. Essa assimetria é exatamente a razão pela qual fazes o trabalho técnico agora.
Torna o teu site fácil de citar: lista o teu produto no aat.ee para uma listagem dofollow permanente que crawlers e assistentes conseguem realmente ler, ou compara os níveis de diretório e GEO.