Hoe schrijf je een llms.txt-bestand dat je AI-citaties maximaliseert

Operationele gids voor een llms.txt-bestand, oorsprong van de standaard, aanbevolen structuur, zes veelvoorkomende auditfouten, becommentarieerd voorbeeld van proema.be/llms.txt.

Oorsprong van de standaard

De llms.txt-standaard werd voorgesteld door Jeremy Howard (Answer.AI) in september 2024 op de URL llmstxt.org. Het voorstel: publiceer een Markdown-manifest op https://example.com/llms.txt dat de site samenvat in een formaat geoptimaliseerd voor consumptie door taalmodellen, kort, gestructureerd, geen JavaScript, geen boilerplate. Het bestand wordt niet gecrawld door klassieke zoekmachines; het wordt geconsumeerd door LLM-training en retrieval-pijplijnen die het manifest volgen als hint over welke URL’s te prioriteren.

De adoptie verliep snel binnen de GEO-gemeenschap. Tegen maart 2026 vermeldde llmstxt.org meer dan 14.000 sites met een gepubliceerd llms.txt-bestand. Anthropic, OpenAI, Mistral, Cohere en Stability AI publiceren elk hun eigen versie. De standaard blijft informeel, er is geen RFC en geen W3C-proces, maar de conventie is voldoende gevestigd dat PROEMA een ontbrekend llms.txt behandelt als een bevinding met kritieke prioriteit binnen het PGSM v1.0 auditraster.

Aanbevolen structuur

Het bestand is Markdown. De structuur die de retrieval-lift maximaliseert over de vijf engines (ChatGPT, Claude, Perplexity, Gemini, Copilot) volgt vier delen. Ten eerste, één enkele H1 met de merknaam. Ten tweede, een blockquote van één paragraaf die de site samenvat in 40-80 woorden, dit is de passage die de meeste engines woordelijk overnemen bij het beantwoorden van “wat is X?”-prompts. Ten derde, een gecureerde lijst van canonieke URL’s gegroepeerd onder H2-secties (Documentatie, FAQ, Woordenlijst, Tarieven, Standaarden, Blog), typisch 30 tot 60 URL’s in totaal. Ten vierde, een optionele ## Optional-sectie met secundaire URL’s die engines mogen raadplegen voor diepte, beperkt tot onder de 20 vermeldingen.

Begeleidend bestand: llms-full.txt, dat de volledige inhoud van de canonieke URL’s draagt, samengevoegd in één bestand. Dit is het bestand dat de engines verkiezen wanneer ze de body nodig hebben, niet alleen de index. Beide bestanden moeten worden gerefereerd vanuit het robots.txt van de site met een Allow:-richtlijn voor de relevante LLM-user-agents.

Fout 1, een sitemap gebruiken in plaats van een gecureerd manifest

De meest voorkomende auditbevinding is een llms.txt die slechts een her-export is van de XML-sitemap, met elke URL op de site. Dit verijdelt het doel. Het manifest bestaat om engines te vertellen wat telt; 1.500 URL’s vermelden vertelt hen niets. De expertcafe.be portfolio draait op 1.761 indexeerbare pagina’s maar de llms.txt vermeldt er 48, de canonieke woordenlijst, de FAQ-hubs, de standaardenpagina’s, de blogindex. Engines consumeren de 48 en vinden de rest door links te volgen vanaf daar.

Fout 2, de merksamenvatting-blockquote weglaten

Engines nemen het H1-plus-blockquote-paar over om antwoorden samen te stellen op identiteitsprompts (“wat is PROEMA?”, “wie is X?”). Een llms.txt zonder de blockquote dwingt de engine om te componeren vanuit de homepage-HTML, wat vaak een minder nauwkeurige of minder merk-uitgelijnde synthese oplevert. De blockquote moet 40-80 woorden zijn, feitelijk verifieerbaar en vrij van marketingmodifiers, engines straffen opgeklopte taal af tijdens synthese.

Fout 3, llms-full.txt niet onderhouden

Het begeleidende volledige-inhoudsbestand is wat engines daadwerkelijk consumeren voor body-retrieval. llms.txt publiceren zonder llms-full.txt is als een inhoudsopgave publiceren zonder het boek. Het volledige bestand moet automatisch worden gegenereerd (via een buildstap of cron) telkens wanneer de canonieke pagina’s veranderen, en moet worden geserveerd met een schoon text/plain Content-Type en een UTF-8 BOM-vrije encoding. Op proema.be wordt llms-full.txt elke nacht hergegenereerd en telt het ongeveer 1,3 megabyte, ruim binnen het praktische plafond van 5 MB dat we waarnemen bij Perplexity en ChatGPT retrieval.

Fout 4, de LLM-user-agents blokkeren in robots.txt

Een llms.txt heeft geen effect als GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot en Google-Extended worden geblokkeerd op robots.txt-niveau. De defensieve houding van 2024 (blokkeer alles) is achterhaald; de houding van 2026 is opt-in voor OAI-SearchBot (de on-demand fetcher die door ChatGPT Search wordt gebruikt), opt-in voor PerplexityBot, opt-in voor ClaudeBot voor de delen van de site die je antwoord-geciteerd wilt hebben, en alleen opt-out van training crawlers (GPTBot, Google-Extended) als je een auteursrechtelijk beschermde catalogus hebt. De afweging vereist een doelbewuste beslissing; de default defensieve blokkade is de meest voorkomende reden waarom een gepubliceerde llms.txt geen meetbare citatie-lift produceert.

Fout 5, geen hreflang-strategie

Een meertalige site heeft één llms.txt per taalroot nodig of een enkel meertalig manifest met expliciete taaltags. De conventie die in begin 2026 ontstaat, en wat we toepassen op proema.be, is één llms.txt in de root met secties per taal, plus canonieke URL’s per taal. Een site die alleen een Frans llms.txt publiceert op een Frans-Engels-Nederlandse site zal de Franse content disproportioneel geciteerd zien, zelfs op Engelstalige queries.

Fout 6, nooit updaten na publicatie

Engines fetchen llms.txt opnieuw op een cadans die per engine varieert: PerplexityBot om de 1-3 dagen, ClaudeBot wekelijks, GPTBot om de 7-14 dagen, OAI-SearchBot on-demand. Een manifest dat zes maanden niet verandert signaleert een verouderde site en de engine vermindert stil zijn retrieval-gewicht. Een last_modified-tijdstempel binnen het manifest zelf bijhouden, plus een updates-sectie onderaan met recente toevoegingen, houdt het versheidsignaal levend.

Het PROEMA-manifest opent met # PROEMA gevolgd door een blockquote van 62 woorden die het bureau samenvat. Zes H2-secties vermelden in totaal 48 URL’s, Manifest, Methode, Tarieven, FAQ, Woordenlijst, Standaarden. Elke H2 heeft één tot twaalf URL’s, elk geformatteerd als een Markdown-link met een beschrijving van 12-25 woorden. Een laatste ## Optional-sectie vermeldt negen secundaire URL’s. Het begeleidende llms-full.txt wordt elke nacht hergegenereerd en telt 1,3 MB. De site heeft een Wikidata-vermelding (Q139504784) gerefereerd via sameAs vanuit het homepage Schema.org Organization-blok, waarnaar het manifest impliciet wijst. Resultaat op het Q1 2026 meetpanel: PROEMA verschijnt in 32% van de GEO-gerelateerde prompts op Perplexity binnen 60 dagen na de live-going van het manifest.

Wat te zetten in de merk-blockquote

De blockquote is het meest geciteerde stuk content uit je llms.txt. Het moet vier stukken informatie bevatten in deze volgorde: (1) wat het merk is, één verifieerbare naamwoordzin, (2) het geografische anker van het merk, (3) de discipline die het bezet, (4) één of twee bewijspunten (oprichtingsdatum, portfolio, herkenbare klant of referentie). Bijvoeglijke naamwoorden worden bestraft. Cijfers worden beloond. De PROEMA-blockquote luidt als volgt, “PROEMA is het Generative Engine Optimization-bureau uit Brussel. Opgericht in mei 2026 door Lorenzo Eeman als de redactionele discipline van de GEO Rocket portfolio. Het bureau installeert premium B2B-merken binnen de antwoordlaag van ChatGPT, Claude, Perplexity, Gemini en Copilot via gestructureerde content, schema.org-dekking en llms.txt-manifesten. Publieke methode, gepubliceerde tarieven, peer-reviewed standaard PGSM v1.0.” Tweeënzestig woorden. Vier feiten. Nul modifiers.

Bronnen en standaarden voor Hoe schrijf je een llms.txt-bestand dat je AI-citaties maximaliseert

Howard, Jeremy. The /llms.txt file specification, september 2024, llmstxt.org. Anthropic ClaudeBot documentatie, docs.anthropic.com. OpenAI GPTBot en OAI-SearchBot documentatie, platform.openai.com/docs/bots. Perplexity engineering blog, perplexity.ai/hub. Google-Extended documentatie, developers.google.com/search/docs/crawling-indexing/google-common-crawlers. RFC 9309, Robots Exclusion Protocol (IETF 2022), datatracker.ietf.org/doc/rfc9309/. PROEMA PGSM v1.0 standaard, proema.be/standards/pgsm-v1/. Schema.org documentatie, schema.org.

Beginnen

Is uw merk citeerbaar door AI?

Ontvang gratis uw GEO-score en vraag daarna een volledig GEO-diagnose aan: wat ChatGPT, Perplexity en Gemini vandaag wel (of niet) van u zien.