Comment écrire un llms.txt efficace ?

Réponse rapide

Un llms.txt efficace tient en trois principes : court, hiérarchisé, factuel. 8 000 tokens maximum, structuré en sections "Docs" / "Optional", chaque entrée = un lien Markdown + une phrase descriptive précise.

Comment écrire un llms.txt efficace, dans le détail ?

Le fichier /llms.txt a une structure strictement définie par la spec Jeremy Howard (Answer.AI, 3 septembre 2024) hébergée sur llmstxt.org : un seul H1 (le nom du projet ou du site), un blockquote pour le résumé court, puis zéro ou plusieurs sections markdown au format H2 ou H3, sans autres titres. Toute la complexité éditoriale tient ensuite dans cinq décisions concrètes.

Décision 1, Que pointer ? La règle d'or : pointer uniquement les pages que vous voulez vraiment voir citées. Pas le pied de page, pas les CGU, pas la confidentialité. Sur le portefeuille GEO Rocket, le ratio cible est environ 50 à 200 URLs prioritaires par site, pas 5 000. La sélection est éditoriale, pas exhaustive.

Décision 2, Quelle granularité de section ? Découpez par silo thématique cohérent. Pour expertcafe.be : « Spécialités », « Origines », « Méthodes d'extraction », « Glossaire », « FAQ ». Chaque section commence par un H2, contient une ligne d'introduction d'une phrase, puis une liste markdown de liens avec titre + description courte (10-15 mots). Le LLM doit pouvoir comprendre la valeur d'un lien sans cliquer.

Décision 3, Faut-il un fichier llms-full.txt ? Oui, dès que la documentation utile dépasse 30 pages. Le second fichier contient l'intégralité de votre contenu en markdown plat, dans l'ordre logique, pour ingestion directe par un LLM. Il sert quand le moteur prend le chemin lent (contexte long).

Décision 4, Versionner et déployer en CI. Le fichier doit être généré automatiquement à chaque build du site, à partir de la même source de vérité que les pages. Sinon, dérive garantie en 3 mois. Sur le portefeuille GEO Rocket, llms.txt est généré par un script Python qui scanne la sitemap, applique des règles d'inclusion et écrit en markdown.

Décision 5, Ne pas en faire un livrable unique. Aucun moteur de réponse (OpenAI, Anthropic, Google, Perplexity) n'a publiquement confirmé en 2026 utiliser llms.txt dans son crawl ou son retrieval. La valeur est indirecte : signal de discipline, structure éditoriale, audit facilité. Couplez toujours le déploiement de llms.txt à la mise en place d'un robots.txt propre (qui sépare GPTBot, OAI-SearchBot, Claude-SearchBot, PerplexityBot, Google-Extended) et d'un Schema.org dense. Sans cette base, llms.txt n'achète rien.

Donnée contre-intuitive. Sur un échantillon de 500 llms.txt scrapés par PROEMA en avril 2026, 63 % dépassaient 8 000 tokens et incluaient des sections "marketing" sans valeur informationnelle. Les LLMs (selon la documentation publique d'Anthropic et OpenAI sur les context windows efficaces) compressent ces fichiers en signaux faibles. « Un llms.txt de moins de 2 000 tokens, structuré en entrées Markdown, produit un meilleur rappel qu'un fichier volumineux et bavard », observe Lorenzo Eeman, fondateur de PROEMA.

Repères en bref
  • Copier le sitemap (trop large)
  • Mettre des URL avec paramètres
  • Description vague type "découvrez notre univers"
  • Oublier de versionner
  • Plus de 30 entrées en section Docs
  • Mélange de langues