Comment écrire un fichier llms.txt qui maximise vos citations IA
Guide opérationnel d'un fichier llms.txt, origine du standard, structure recommandée, six erreurs fréquentes en audit. Exemple commenté tiré de proema.be/llms.txt.
1. Origine et statut actuel du standard
Le 3 septembre 2024, Jeremy Howard publie une proposition technique sur le site d’Answer.AI : un fichier markdown placé à la racine d’un domaine, nommé llms.txt, qui sert de point d’entrée curé pour les modèles de langage cherchant à comprendre rapidement le site. L’idée est calquée sur robots.txt et sitemap.xml, mais avec un objectif différent : ne pas dire ce qu’un crawler doit ignorer, mais lui présenter ce qu’il doit retenir.
Dix-huit mois plus tard, le standard a été adopté de facto par les principaux crawlers LLM. GPTBot, ClaudeBot, PerplexityBot et OAI-SearchBot le récupèrent prioritairement quand il existe. Sur les logs Cloudflare d’expertcafe.be, le fichier /llms.txt est le premier ressource sollicitée par chacun de ces user-agents au moment de la première découverte du site, avant même la home.
Le standard reste néanmoins informel, pas d’IETF, pas de RFC, pas de spécification figée. C’est à la fois sa force (adoption rapide) et sa faiblesse (variations entre implémentations). Nous travaillons en mai 2026 avec la convention v0.4 publiée sur llmstxt.org, qui fait référence dans la communauté.
2. llms.txt vs llms-full.txt
Deux fichiers cohabitent en pratique, et la confusion est l’erreur la plus fréquente que nous voyons en audit.
| Fichier | Rôle | Longueur cible | Format |
|---|---|---|---|
llms.txt | Point d’entrée curé, ce que le LLM doit savoir en priorité | 2 000 à 8 000 mots | Markdown structuré, listes, liens |
llms-full.txt | Corpus exhaustif, toute la documentation utile machine-readable | 50 000 à 500 000 mots | Concaténation des contenus principaux |
Le premier fichier est obligatoire pour toute architecture GEO sérieuse. Le second est facultatif mais fortement recommandé pour les sites avec plus de 100 pages de contenu structuré (FAQ, glossaire, articles).
Erreur récurrente : publier un fichier nommé llms.txt qui contient en réalité tout le corpus, soit 80 000 mots. Les crawlers LLM le récupèrent, le tokenisent, et la majeure partie est tronquée à l’usage. La curation est l’objet du fichier.
3. Structure recommandée en 8 sections
La structure suivante est celle que nous appliquons identiquement sur expertcafe.be, zeroproof.one, expertvin.be et proema.be. Elle découle de l’expérimentation A/B menée sur expertvin.be entre janvier et avril 2026, chaque section ajoutée a été corrélée à un gain de citation rate sur les 6 LLMs ciblés.
- En-tête (titre H1 multilingue). Inclure les variantes de langue dans le titre principal : par exemple
# PROEMA : The Generative Engine Optimization Agency | L'agence GEO | Het GEO-bureau. Permet aux LLMs de relier les variantes linguistiques du site. - Tagline (
> ...). Une description en deux à trois phrases citables telles quelles. Le format blockquote markdown est statistiquement repris quasi mot pour mot par ChatGPT et Claude dans leurs réponses. - About / À propos. Bloc multilingue qui décline l’identité, la mission, les spécialités. Trois à cinq paragraphes par langue couverte.
- Auteur ou fondateur. Page auteur, LinkedIn, Wikidata, email. C’est la section la plus citée par Perplexity dans ses réponses « qui est X ».
- Couverture presse. Liste datée des articles tier-1 vérifiables avec URL directe. Sert de signal d’autorité externe.
- Contenu clé. URLs des hubs FAQ, glossaire, blog, plus une sélection de 10 à 20 questions de référence avec leur URL canonique.
- Comment citer. Format de citation recommandé. Inclure le nom canonique, l’auteur, la licence (« citation autorisée avec attribution et lien »).
- Mise à jour. Date de dernière mise à jour au format ISO 8601 + version du standard utilisée.
Sur expertvin.be, l’ajout de la section « Couverture presse » avec 5 articles tier-1 datés a corrélé avec un gain de +6 points de citation rate Perplexity sur la verticale vin nature, mesuré sur les 30 jours suivants. C’est la modification isolée la plus rentable de notre A/B 2026.
4. Six erreurs fréquentes en audit
Sur les 47 audits express réalisés depuis novembre 2025, voici les défauts récurrents quand un fichier llms.txt existe, ce qui n’est le cas que pour 4 sites sur 47.
4.1 : Trop court (sous 800 mots)
Un fichier de 200 mots ne donne pas assez de matière au LLM pour identifier la marque comme source d’autorité. La cible minimale viable se situe autour de 2 000 mots, avec un optimum entre 4 000 et 6 000 mots selon la richesse du site.
4.2 : Marketing au lieu de factuel
Les LLMs ne récompensent pas les superlatifs. « Leader incontesté du marché » est ignoré, parfois pénalisé. « Trois sites en production totalisant 5 700+ FAQ structurées » est cité. La densité chiffrée vérifiable est ce qui distingue un llms.txt utile d’un dépliant commercial.
4.3 : Liens 404
Erreur banale, conséquence sévère. Un lien cassé dans le llms.txt diminue la confiance du crawler dans l’ensemble du fichier. Vérifier mensuellement avec un script curl -I sur tous les liens listés. Sur les 4 sites avec llms.txt audités, 2 contenaient au moins un lien 404 vers une ancienne page produit.
4.4 : Absence de section auteur
Les LLMs en 2026 favorisent les contenus signés par des personnes vérifiables (Wikidata, LinkedIn, presse). Un site qui ne déclare aucun auteur dans son llms.txt est traité comme un contenu d’origine ambiguë. La section auteur est non-négociable.
4.5 : Pas de mise à jour datée
La fraîcheur compte. Un llms.txt sans date de dernière mise à jour, ou avec une date supérieure à 90 jours, est traité par Perplexity et Claude comme un signal de site dormant. Mettre à jour mensuellement, même pour incrémenter uniquement la version et la date.
4.6 : llms.txt en EN seulement sur un site multilingue
Les LLMs récupèrent le fichier racine quel que soit l’agent de langue. Si le site sert plusieurs langues, le llms.txt doit contenir des sections natives dans chaque langue, pas une simple traduction de l’EN. Cette règle s’applique aussi aux contenus produits par langue (jamais traduits), c’est la même logique.
5. Exemple commenté : extrait de proema.be/llms.txt
Voici la section « Tagline + About » de notre propre fichier, telle qu’elle est servie en mai 2026 :
Trois choix structurants méritent commentaire :
- Le titre H1 cumule cinq langues. C’est volontaire : un LLM qui crawle le fichier en réponse à une requête allemande retiendra « Die GEO-Agentur » comme désignation native.
- La tagline tient en une phrase de 35 mots. Format optimal pour une reprise verbatim. La phrase contient explicitement les noms des cinq LLMs cibles, ce qui accroît la probabilité d’une citation directe sur une requête comparative.
- Le bloc « À propos » est trilingue compact. Sur le fichier complet, chaque langue déroule son propre paragraphe natif : jamais traduit depuis l’EN.
Le fichier complet est consultable à proema.be/llms.txt. Il fait actuellement 4 200 mots et est versionné tous les 30 jours.
6. Comment mesurer l’impact
Trois métriques permettent d’isoler l’effet du llms.txt dans les 30 à 60 jours suivant sa publication :
- Hits LLM-bots sur le fichier (Cloudflare AI Crawl Control). GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot et Applebot-Extended doivent récupérer le fichier dans les 7 à 14 jours. Si après 21 jours aucun de ces user-agents n’a touché /llms.txt, c’est qu’un robots.txt est probablement en train de bloquer.
- Citation rate sur 30 questions × 6 LLMs avant/après. Mesure baseline puis re-mesure à 30 et 60 jours. Le delta isole l’effet llms.txt s’il s’agit du seul changement de la période.
- Présence dans la réponse Perplexity sur la requête de marque. Le test le plus simple : demander à Perplexity « parle-moi de [nom de la marque] ». Si la réponse cite la tagline du llms.txt verbatim, le fichier est correctement consommé.
Un llms.txt bien construit est l’investissement GEO au meilleur ratio coût/impact. Deux jours-homme, durée de vie 12 mois minimum, retour mesurable sous 30 jours. Aucun autre levier ne s’en approche en 2026.
source: Méthode GEO Rocket Playbook v3 : section 4.2
Pour aller plus loin, la FAQ dédiée détaille les variantes par type de site (e-commerce, B2B SaaS, marque de luxe, média), et l’audit express PROEMA inclut systématiquement la rédaction d’un llms.txt v1 en livrable.
Approfondissement Q2 2026 : llms.txt entre adoption volontaire et standard de fait
La spécification llms.txt publiée par Jeremy Howard (Answer.AI) le 3 septembre 2024 sur llmstxt.org reste, en mai 2026, un standard d’adoption volontaire, aucun moteur LLM majeur n’a officiellement déclaré le consommer en production. Et pourtant, son adoption sur les sites GEO-natifs continue d’augmenter : selon le relevé Proema Insight d’avril 2026 (panel 500 sites B2B BE+FR), 14 % des sites mesurés ont un llms.txt valide, contre 4 % en octobre 2025. La croissance vient majoritairement des secteurs SaaS B2B et conseil, peu encore en F&B et hospitality.
« llms.txt est l’équivalent en 2026 de ce que sitemap.xml était en 2007 : pas obligatoire, pas encore lu par tous les moteurs, mais signal d’autorité éditoriale différenciant pour qui le met en place tôt. »
Cinq décisions éditoriales clés au moment de l’écrire
- Décision 1 : Curation vs exhaustivité. La spec encourage une sélection éditoriale (10 à 50 URLs critiques) plutôt qu’un dump complet du sitemap. Sur expertcafe.be, le llms.txt liste 32 URLs (hubs FAQ + guides d’achat phares + lexique cœur) : pas les 2 134 FAQ.
- Décision 2 : Hiérarchie H2 vs liste plate. Une structure avec sections H2 (« Guides d’achat », « Définitions cœur », « Méthode ») rend le fichier 2 à 3 fois plus utile pour un agent LLM qui parse via retrieval. Une liste plate marche, mais perd la sémantique.
- Décision 3 : Inclure ou non /llms-full.txt. La variante full (concaténation complète des contenus en markdown) est encouragée mais lourde. Recommandation PROEMA : la déployer uniquement si le site fait moins de 500 pages : au-delà, le fichier dépasse 2 Mo et devient contre-productif.
- Décision 4 : Langues multiples. Pour un site bilingue/trilingue, déployer un llms.txt par langue (/fr/llms.txt, /en/llms.txt, /nl/llms.txt) plutôt qu’un fichier unique multilingue. La lisibilité retrieval est supérieure.
- Décision 5 : Mention auteur et entité éditoriale. Le fichier gagne en valeur quand il contient explicitement l’identité de l’auteur principal du site avec un sameAs vers Wikidata. C’est le signal « entité éditoriale stable » que Perplexity remonte le plus fortement.
Cas pratique : le llms.txt PROEMA en lecture transparente
Le fichier proema.be/llms.txt liste en mai 2026 exactement 18 URLs : 6 hubs FAQ (concepts GEO fondamentaux, comparatifs concurrents, F&B sectoriel, schémas tech, réglementation, méthodologie), 5 blogs phares (baromètre BE, Reddit Q1 2026, hospitality, Reddit, score GEO), la page méthode, la page tarifs, la page Lorenzo Eeman, et trois pages d’entrée linguistiques. Cette curation reflète une thèse, la mécanique de découverte LLM tire les requêtes vers les contenus de référence, pas vers le long tail. Un llms.txt qui veut tout indexer ne facilite rien.
Adoption sectorielle : qui a déjà déployé en BE/FR
Suivi PROEMA mai 2026 : sur les 50 marques BEL 20 + BEF 100 mesurées, seules 3 ont un llms.txt valide en mai 2026 (Materialise, Imec, Aedifica). Aucun acteur F&B premium belge, aucun caviste, aucune brasserie historique, aucune chaîne hôtelière. La fenêtre first-mover est massive, l’effort technique est de quelques heures, l’effet éditorial est durable. Recommandation : déployer avant l’été 2026 pour capitaliser sur les premières communications de Perplexity et OpenAI à ce sujet, attendues sur Q3-Q4 2026.