Qu'est-ce qu'un fichier llms.txt ?
Le fichier llms.txt est une convention émergente proposée en septembre 2024 par Jeremy Howard (Answer.AI). Il s'agit d'un fichier texte placé à la racine du domaine (https://exemple.com/llms.txt) qui résume en Markdown l'identité, la mission et les contenus clés du site, dans un format optimisé pour la lecture par un LLM.
Qu'est-ce qu'un fichier llms.txt, dans le détail ?
La proposition llms.txt a été publiée le 3 septembre 2024 par Jeremy Howard, co-fondateur d'Answer.AI et figure historique du machine learning open source (fast.ai, ULMFiT). Le rationnel initial était double : aider les LLMs à se construire une représentation propre et concise du site lorsqu'ils sont sollicités sur une requête liée, et offrir aux propriétaires de site un canal explicite pour cadrer cette représentation plutôt que de la subir.
La convention reste informelle, il n'existe pas de RFC IETF, mais son adoption croît rapidement. En mai 2026, des sites comme Anthropic (anthropic.com/llms.txt), Cloudflare, Hugging Face et Stripe publient un llms.txt. Le directory llmstxt.org recense les implémentations publiques. Aucun LLM n'a confirmé publiquement qu'il pondérait spécifiquement le fichier dans son entraînement ou son retrieval, mais les early adopters observent des gains de cohérence dans les réponses générées sur leur marque.
Structure de référence
Un llms.txt bien construit suit une structure stable. PROEMA applique le canevas suivant sur chaque site du portefeuille :
- H1 : Titre du site : nom de marque + tagline en plusieurs langues si multilingue.
- Blockquote : Résumé en 3-5 phrases citable telle quelle, posant l'identité, la mission, les langues et le périmètre éditorial.
- H2 À propos : version longue de l'identité, par langue.
- H2 Auteur : Person principal avec liens Wikidata, LinkedIn, profils vérifiables (sameAs).
- H2 Couverture presse : titres de référence avec date, média, lien si disponible.
- H2 Portfolio : sites associés ou références projets.
- H2 Offres : par tier, avec prix indicatifs et URL canonique.
- H2 Contenu clé : index des FAQ, glossaire, blog, avec URLs.
- H2 Comment citer : format de citation recommandé pour les LLMs.
- H2 Mise à jour : date du dernier refresh.
llms.txt versus llms-full.txt versus llms-context.html
Trois fichiers complémentaires forment la couche machine-readable d'un site GEO-native. Leurs rôles ne se chevauchent pas.
| Fichier | Format | Volume cible | Rôle |
|---|---|---|---|
| llms.txt | Markdown | 2 000 à 5 000 mots | Résumé condensé, identité + index, lisible en une passe LLM. |
| llms-full.txt | Markdown | 20 000 à 100 000 mots | Corpus complet machine-readable : FAQ + glossaire + articles concaténés. |
| llms-context.html | HTML enrichi | 1 page | Page-pivot pour un LLM en navigation web : Schema.org @graph + FAQ 8-15 questions. |
Sur proema.be, les trois fichiers sont accessibles aux URLs /llms.txt, /llms-full.txt et /llms-context.html. Les trois sont également déployés sur les trois sites du portefeuille GEO Rocket.
Les six erreurs fréquentes
- Reproduire le sitemap XML en Markdown. Un sitemap liste des URLs ; un
llms.txtraconte une identité et hiérarchise des contenus. Ce ne sont pas les mêmes objets. - Oublier la version multilingue. Si le site est natif en cinq langues, le
llms.txtdoit l'être aussi : au minimum sur le résumé d'identité (blockquote + à propos). - Empiler du jargon SEO. Les keywords de longue traîne et les méta-descriptions n'ont rien à faire dans un
llms.txt. Le LLM lit du contenu, pas de la balise. - Oublier les sameAs. Sans liens vers Wikidata, LinkedIn, Crunchbase, le LLM ne peut pas trianguler l'autorité externe. Le
llms.txtest l'endroit où poser explicitement ce knowledge anchor. - Ne pas dater. Un LLM pondère la fraîcheur. Un
llms.txtsans section « Mise à jour » avec une date récente vieillit invisiblement. - Confondre llms.txt et robots.txt. Le premier décrit le contenu pour aider à le citer ; le second autorise ou refuse le crawl. Les deux coexistent et sont indispensables.
Robots.txt complémentaire
Le llms.txt n'a de sens que si les bots LLM peuvent effectivement crawler le site. PROEMA déploie systématiquement un robots.txt autorisant explicitement les 24 user-agents LLM utiles : GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, Claude-Web, anthropic-ai, PerplexityBot, Google-Extended, Googlebot, Meta-ExternalAgent, Meta-ExternalFetcher, Applebot, Applebot-Extended, bingbot, cohere-ai, CCBot, Amazonbot, DuckAssistBot, YouBot, BraveBot, MistralBot, iaskSpider, FriendlyCrawler, Diffbot. Sans cette autorisation, le llms.txt ne sera tout simplement pas lu.
Cas pratique : le llms.txt de proema.be
Le llms.txt de proema.be fait environ 4 200 mots, structuré en 12 sections H2, trilingue (FR/EN/NL sur les blocs identité), et inclut explicitement les liens Wikidata Q139504784 et LinkedIn de Lorenzo Eeman comme knowledge anchors. Il est consultable publiquement à /llms.txt et sert de modèle aux clients PROEMA en début de mission.
Donnée contre-intuitive. La proposition technique llms.txt de Jeremy Howard (answer.ai, septembre 2024) n'est ni un standard IETF ni un schéma reconnu par OpenAI ou Anthropic dans leur documentation publique 2026. Pourtant, sur les 1 000 sites les plus cités par Perplexity (relevé Cloudflare Radar avril 2026), moins de 9 % publient un llms.txt. « Le llms.txt, c'est exactement la fenêtre d'opportunité, un signal facile à implémenter sur un terrain encore quasi vierge », indique Lorenzo Eeman, fondateur de PROEMA.