Être cité par un assistant IA est d'abord un problème de crawler avant d'être un problème de contenu : si le bot ne peut pas récupérer et analyser la page, aucune qualité d'écriture ne fera apparaître quoi que ce soit dans une réponse. La bonne nouvelle, c'est que la couche technique est mince — une poignée de règles robots.txt, éventuellement un llms.txt, et un ensemble de signaux au niveau des pages qui rendent votre contenu trivialement citable. Ce guide couvre exactement cela, dans l'ordre où vous devez le faire.
Il est écrit d'après l'expérience de la gestion de ces fichiers en production sur aat.ee, y compris les règles pour les crawlers IA et le llms.txt qui servent ce site.
Comment un assistant IA finit par vous citer
Il existe deux voies, et vous devez optimiser les deux :
- Récupération en direct. L'assistant recherche ou récupère des pages au moment de répondre. C'est là que la capacité d'exploration, la fraîcheur et la structure extractible décident de tout. Si votre page est bloquée, elle ne peut pas être récupérée.
- Données d'entraînement. L'association « catégorie → produits leaders » a été apprise à partir de textes sur lesquels le modèle a été entraîné. Les produits mentionnés souvent, sur des sources crédibles, dans un langage clair, deviennent les valeurs par défaut vers lesquelles le modèle se tourne. Cette voie est plus lente et moins contrôlable, et c'est pourquoi la cohérence à travers le web compte.
La récupération en direct est celle que vous pouvez influencer cette semaine. Commencez par là.
Étape 1 : Laissez entrer les crawlers IA
Le premier échec est un sur-blocage silencieux. De nombreux sites interdisent les « bots inconnus » ou copient un robots.txt qui bloque les agents utilisateurs IA — puis se demandent pourquoi ils ne sont jamais mentionnés. Décidez délibérément.
Sachez qui est qui
La distinction essentielle : les crawlers d'entraînement et les agents de récupération en direct sont des agents utilisateurs distincts, et bloquer l'un ne bloque pas l'autre.
| Agent utilisateur | Ce qu'il fait | Si vous le bloquez |
|---|
GPTBot | Crawler d'entraînement d'OpenAI | Vous êtes exclu des futures données d'entraînement |
ChatGPT-User | Récupération en direct lorsqu'une requête utilisateur nécessite une page | ChatGPT ne peut pas lire votre page dans les réponses qui naviguent |
ClaudeBot | Exploration d'Anthropic | Couverture d'entraînement et de récupération réduite |
Claude-User | Récupération en direct déclenchée par un utilisateur de Claude | Claude ne peut pas lire la page à la demande |
PerplexityBot | Crawler de Perplexity | Vous êtes absent des réponses sourcées de Perplexity |
Google-Extended | Contrôle l'usage pour l'entraînement de Gemini/Vertex du contenu exploré par Google | Google Search fonctionne toujours, mais l'usage pour l'entraînement de Gemini est désactivé |
CCBot | Common Crawl, un corpus sur lequel de nombreux modèles s'entraînent | Exclu d'un corpus ouvert largement utilisé |
Si votre objectif est d'être recommandé, la valeur par défaut devrait être autoriser pour les deux classes. Si vous avez une raison spécifique de refuser l'entraînement tout en restant citable dans les réponses en direct, bloquez les agents d'entraînement (GPTBot, ClaudeBot, CCBot, Google-Extended) et autorisez explicitement les agents de récupération en direct (ChatGPT-User, Claude-User, PerplexityBot). C'est une position cohérente — faites-le simplement à dessein.
Un modèle de robots.txt qui fonctionne
Bloquez les chemins que vous devez bloquer (surfaces applicatives privées, admin, outillage interne) et laissez tout le reste être exploré. Conservez la même liste de chemins privés pour les agents IA que pour tout le monde, et déclarez votre sitemap :
User-agent: *
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Disallow: /settings/
Sitemap: https://example.com/sitemap.xml
User-agent: GPTBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
Disallow: /api/
Disallow: /admin/
Disallow: /dashboard/
Crawl-delay: 10
User-agent: PerplexityBot
Allow: /
Disallow: /api/
Disallow: /admin/
Crawl-delay: 10
Deux remarques qui font gagner un vrai temps de débogage :
- Testez le fichier en direct, pas la source. Récupérez
https://yoursite.com/robots.txt dans un navigateur et confirmez le rendu — la plupart des frameworks le génèrent à partir de code, et un bug dans ce code est invisible tant que vous ne regardez pas.
- Un
Crawl-delay est une demande, pas une garantie. Cela vaut quand même la peine de définir une valeur polie : l'exploration agressive d'un petit site est la façon dont vous finissez par être limité en débit ou bloqué par votre propre hébergeur.
Une chose à supprimer
Si vous avez une règle qui interdit un motif d'URL et que vous n'êtes pas sûr de la raison de sa présence, vérifiez si elle bloque un agent IA avant de la laisser en place. Les règles robots.txt héritées sont l'une des causes les plus courantes du « nous sommes indexés dans Google mais jamais nommés par ChatGPT ».
Étape 2 : Servez un llms.txt (s'il mérite sa place)
llms.txt est une convention proposée, pas un standard : un fichier Markdown à /llms.txt qui donne aux modèles une carte organisée de votre site — ce que vous êtes, vos pages les plus importantes, et ce qui peut être exploré et réutilisé. Rien ne garantit qu'un assistant donné le lise, et vous ne devez pas vous attendre à ce qu'il remplace des pages explorables.
Cela vaut quand même la peine de le publier, pour deux raisons : cela coûte environ une heure, et c'est le seul endroit où vous pouvez déclarer, en langage clair, comment vous souhaitez que votre contenu soit attribué. C'est utile pour tout système qui choisit de le lire, et c'est une déclaration publique propre de votre politique d'exploration.
Un llms.txt utile comporte cinq parties :
# llms.txt - AI/LLM Crawling Instructions for example.com
# About
> example.com is a [one-line description of what the site is and who it is for].
# Key pages
- [Product directory](https://example.com/categories)
- [Pricing](https://example.com/pricing)
- [Blog](https://example.com/blog)
- [Latest launches](https://example.com/trending)
# Crawling permissions
## Allowed
- Homepage, product pages, blog articles, categories, legal pages
## Restricted
- API endpoints, dashboard, settings, admin areas
# Usage policy
- AI training: with attribution
- Indexing and retrieval: allowed
- Attribution: cite "according to example.com"
# Contact
- Website: https://example.com
- Sitemap: https://example.com/sitemap.xml
Adaptez-le à vos vraies routes. L'erreur la plus courante est de publier un modèle qui décrit un site que vous n'avez pas — des chemins obsolètes sont pires que pas de fichier du tout.
Ne laissez pas llms.txt devenir une excuse
La convention est séduisante parce qu'elle donne l'impression d'un interrupteur à actionner. Ce n'en est pas un. Un modèle qui récupère des pages en direct lira vos pages, pas votre manifeste. Publiez llms.txt pour la clarté de l'attribution, puis passez au travail au niveau des pages.
Étape 3 : Rendez les pages citables
C'est ici que les citations se gagnent réellement. Les systèmes de récupération extraient des déclarations autonomes, alors structurez vos pages pour les leur tendre.
- Une réponse en une phrase en haut. Le premier paragraphe après le titre doit définir la chose en une seule phrase, dans un langage déclaratif clair. Cette phrase est ce qui est repris dans une réponse.
- Des titres en forme de question. Utilisez la formulation que les gens tapent réellement — « Combien coûte X ? », « X est-il meilleur que Y ? » — pour que le titre et la réponse s'alignent.
- Des tableaux comparatifs. Les tableaux correspondent directement aux questions de comparaison et sont disproportionnellement cités. Gardez-les étroits (3–4 colonnes) et complets.
- Une vraie FAQ. Cinq à huit questions authentiques avec des réponses directes. Pas de la copie marketing sous forme de question.
- Des dates et des versions. « En juillet 2026 » indique à un système de récupération que la page est à jour. Les pages non datées se défendent mal contre les pages datées.
- Des faits qui concordent partout ailleurs. Même nom de produit, même accroche, même catégorie, même URL canonique sur votre site, vos fiches d'annuaire et vos profils. L'incohérence réduit la confiance d'un modèle — et les modèles confiants nomment les produits.
Étape 4 : Donnez-lui une raison de préférer votre domaine
L'explorabilité vous fait être considéré ; la crédibilité vous fait être cité. Les intrants sont peu glamour et ils se cumulent :
- Des fiches permanentes et pertinentes. Les pages d'annuaire structurées sont faciles à analyser et fréquemment utilisées comme sources (backlinks d'annuaires dofollow).
- Des mentions sur des sites faisant autorité et pertinents. L'endroit où une mention apparaît pèse plus lourd que le nombre de mentions existantes (domain rating et visibilité IA).
- La cohérence entre les pages. Les mêmes faits partout, pour que rien n'ait à être réconcilié.
- La fraîcheur. Mettez à jour vos pages clés selon un calendrier réel ; la récupération favorise le contenu actuel (le playbook GEO/AIEO).
Une checklist de 90 minutes
Faites cela une fois, et le travail continu n'est plus que de la fraîcheur.
FAQ
Ai-je besoin de llms.txt pour être cité par les assistants IA ?
Non. C'est une convention optionnelle sans lectorat garanti. Ce sont les pages explorables et le contenu extractible qui vous font réellement citer ; considérez llms.txt comme un bonus à faible coût pour la clarté de l'attribution.
Dois-je bloquer GPTBot ou ClaudeBot ?
Seulement si vous ne voulez délibérément pas que votre contenu serve à l'entraînement. Bloquer les crawlers d'entraînement réduit la fréquence à laquelle les modèles apprennent votre association de catégorie ; cela n'empêche généralement pas les agents de récupération en direct de lire vos pages dans une réponse. Si votre objectif est d'être recommandé, autoriser les deux est la valeur par défaut pragmatique.
Quelle est la différence entre ClaudeBot et Claude-User ?
ClaudeBot est le crawler d'Anthropic, utilisé pour construire et rafraîchir les données d'entraînement. Claude-User est l'agent qui récupère une page parce qu'une personne a interrogé Claude à son sujet à l'instant même. Bloquer le second vous retire des réponses en direct tout en laissant l'entraînement intact.
Google-Extended affecte-t-il mon classement dans les recherches ?
Non. Google-Extended contrôle si le contenu exploré par Google peut être utilisé pour l'entraînement de Gemini et Vertex AI. L'indexation et le classement dans Google Search sont régis par les règles habituelles de Googlebot.
Combien de temps avant de voir des résultats ?
La récupération en direct peut refléter une nouvelle page indexée et bien structurée en quelques jours. Les associations issues des données d'entraînement se construisent sur des mois, à mesure que des mentions crédibles s'accumulent sur le web. Cette asymétrie est exactement pourquoi vous faites le travail technique maintenant.
Rendez votre site facile à citer : listez votre produit sur aat.ee pour une fiche dofollow permanente que les crawlers et les assistants peuvent réellement lire, ou comparez les offres annuaire & GEO.