Waarom GPTBot blokkeren maar OAI-SearchBot toelaten, het 2026 robots.txt-patroon
PROEMA 2026 robots.txt-patroon: trainingscrawlers blokkeren (GPTBot) terwijl real-time retrieval-crawlers (OAI-SearchBot, PerplexityBot) worden toegelaten. IP-logica + gemaximaliseerd GEO. Volledige configuratie.
PROEMA-noot (2026-06): dit patroon is de standaardaanbeveling van het bureau voor een klant die zijn IP wil beschermen. proema.be zelf neemt bewust de omgekeerde positie in: het laat trainingscrawlers toe, want voor een GEO-bureau is opgenomen worden in de kennis van de modellen een doel op zich. De redenering hieronder geldt nog steeds voor de meeste merken.
Waarom de twee crawler-types onderscheiden
Sinds augustus 2023 publiceert OpenAI een expliciet onderscheid tussen zijn twee crawler-families:
- GPTBot. Trainingscrawler. Verzamelt content om toekomstige GPT-5-, GPT-6-, enz. modellen te voeden. Verzamelde content eindigt in het trainingscorpus, zonder citatie, zonder backlink, zonder compensatie.
- OAI-SearchBot. Real-time retrieval-crawler voor ChatGPT Search. Verzamelt content op het moment van gebruikersvraag, synthetiseert in antwoord, en citeert de bron (klikbare link weergegeven in ChatGPT-interface).
De asymmetrie is cruciaal: GPTBot neemt uw content om een eigendomsmodel te trainen zonder u te citeren. OAI-SearchBot neemt uw content om een gebruiker te antwoorden terwijl het u citeert. Het eerste is extractief, het tweede is referentieel.
Het PROEMA-patroon, eerste blokkeren, tweede toelaten
Op de 4 portfolio-sites (proema.be, expertcafe.be, zeroproof.one, expertvin.be), passen we dit robots.txt toe:
Logica in twee zinnen: we blokkeren trainingscrawlers (GPTBot, ClaudeBot, CCBot, Google-Extended) die opnemen zonder te citeren. We laten retrieval-crawlers toe (OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeUser) die actief citeren. De rest van de crawlers blijft standaard toegestaan.
Waarom dit niet tegenstrijdig is met GEO
De frequente vrees: “als ik GPTBot blokkeer, verlies ik ChatGPT-citaties”. Vals om drie redenen:
- ChatGPT-citaties komen van OAI-SearchBot, niet van GPTBot. Wanneer een gebruiker ChatGPT iets vraagt en het model zijn Search-functie gebruikt (standaard actief op GPT-4o), bevraagt het OAI-SearchBot real-time. GPTBot is niet in de loop.
- Content geïndexeerd door trainingscrawlers is bevroren. GPT-4 werd in 2023 getraind. Uw in 2026 gepubliceerde content is NIET in GPT-4. Het zou in GPT-5 of GPT-6 kunnen zitten, maar citatievoordeel is nul (geciteerde modellen onthullen nooit hun trainingsbron).
- IP-kost is reëel. GPTBot toegang geven tot uw content = OpenAI toelaten uw proza te gebruiken om concurrentiële commerciële content (marketingteksten, geassisteerde artikels) te genereren zonder compensatie. De afweging is duidelijk: beschermen.
De uitzonderingen, wanneer GPTBot toch toelaten
Twee situaties waar GPTBot toelaten zin kan hebben:
- Pure publieke documentatiecontent. Als uw site puur educatief is, non-profit, en u wilt dat uw content in het ChatGPT-model staat (typisch: verenigingen, OSS, open-access-academisch onderzoek).
- Marketing-priming-strategie. Een jong merk dat denkt dat toekomst-modelzichtbaarheid het IP-verlies waard is. Het is een langetermijn-weddenschap, niet onze aanpak, maar legitiem volgens profiel.
Voor 95% van premium B2B-merken is de afweging: blokkeren.
Andere crawlers te blokkeren in 2026
Lijst van trainingscrawlers systematisch te blokkeren (update mei 2026):
| User-agent | Operator | Type | Actie |
|---|---|---|---|
| GPTBot | OpenAI | Training | Blokkeren |
| ClaudeBot | Anthropic | Training | Blokkeren |
| CCBot | Common Crawl | Training (data set) | Blokkeren |
| Google-Extended | Training (Bard/Gemini) | Blokkeren | |
| FacebookBot | Meta | Training (Llama) | Blokkeren |
| Amazonbot | Amazon | Training (Alexa, Titan) | Blokkeren |
| Applebot-Extended | Apple | Training (Apple Intelligence) | Blokkeren |
| Bytespider | ByteDance | Training | Blokkeren |
| OAI-SearchBot | OpenAI | Retrieval (ChatGPT Search) | Toelaten |
| ChatGPT-User | OpenAI | User-triggered fetch | Toelaten |
| PerplexityBot | Perplexity | Retrieval | Toelaten |
| ClaudeUser | Anthropic | User-triggered fetch | Toelaten |
| Googlebot | Search-index | Toelaten | |
| Bingbot | Microsoft | Search-index + Copilot | Toelaten |
Valkuil te vermijden rond Waarom we GPTBot blokkeren maar OAI-SearchBot toelaten
Een veelvoorkomende fout: alle AI-bots blokkeren om “veilig te blijven”. Het is zelf-bestraffend. Als u OAI-SearchBot en PerplexityBot blokkeert, bent u onzichtbaar op ChatGPT Search en Perplexity. Precies het tegenovergestelde van het GEO-doel.
De regel: training-only blokkeren, retrieval/citatie toelaten. Test met curl -A "PerplexityBot" https://uw-site.com/ dat u een 200 OK-antwoord krijgt.
Operators hernoemen en creëren regelmatig nieuwe crawlers. Onze maandelijkse lijstmonitoring steunt op drie bronnen: OpenAI Bot Documentation, DarkVisitors, en ai.robots.txt (open-source-repo). We publiceren elke zes maanden een PROEMA-patroon-update, volgende in november 2026.
Voor merken die verder willen gaan
Naast robots.txt bestaat een extra niveau: trainingscrawlers blokkeren op netwerkniveau (Cloudflare WAF, IP-regels). Dit voorkomt dat crawlers die robots.txt niet respecteren toch scrapen. PROEMA raadt deze laag aan voor merken met sterke redactionele IP (pers, onderzoek, dichte eigendomscontent).
Typische Cloudflare-configuratie: Worker-route of Page Rule op vermelde user-agents, 403 retournerend. Effect: nul content-lek naar niet-respecterende trainingsmodellen.
Mei 2026 feitelijke updates: wat OpenAI officieel bevestigt
OpenAI’s robots.txt-toepassingstermijn. De officiële OpenAI-documentatie (developers.openai.com/api/docs/bots) preciseert dat robots.txt-wijzigingen ongeveer 24 uur in beslag nemen om door OpenAI-systemen verwerkt te worden. Concreet: blokkeer je vanmorgen GPTBot, dan is het effect doorgaans de volgende dag zichtbaar in de Cloudflare AI Crawl Control-logs.
De valstrik van generieke blokkering. De vaakst geauditeerde fout: een robots.txt met User-agent: * + Disallow: /, of een Disallow: / gericht op GPTBot, vermoedelijk « om ChatGPT te blokkeren ». Gevolg: OAI-SearchBot, de real-time crawler gebruikt door SearchGPT, wordt in het tweede geval ook geblokkeerd, en de gebruiker verdwijnt letterlijk uit ChatGPT-citaten. Het juiste gedrag: OAI-SearchBot en Claude-SearchBot expliciet toelaten vóór de generieke regel, en selectief GPTBot en ClaudeBot blokkeren als de strategie is om training te weigeren.
Referentieconfiguratie voor 2026. Een typische GEO-geoptimaliseerde setup in 2026:
Familie 1 vs Familie 2, redeneringsregel. Stel voor elke regel in robots.txt twee vragen. (1) Doet deze bot real-time retrieval (ik wil geciteerd worden)? (2) Of doet hij training (ik beslis volgens mijn IP-beleid)? De twee verwarren is de nummer-één-oorzaak van onbedoelde GEO-onzichtbaarheid. Het GEO Rocket-portfolio, expertcafe.be, zeroproof.one, expertvin.be, gebruikt een symmetrische setup: retrieval overal toegelaten, training toegelaten behalve interne secties (/admin/, /draft/, /staging/).
Valideren via Cloudflare AI Crawl Control. Het Cloudflare-dashboard (GA in 2025, veralgemeend in 2026) somt requests per user-agent precies op en signaleert of ze uw directieven respecteren of omzeilen. Het is de referentietool om te bevestigen dat een robots.txt-beleid in de praktijk werkt, observatie overheerst intentie.
Referentieconfiguratie, PROEMA robots.txt regel per regel uitgelegd
De robots.txt-configuratie die PROEMA in mei 2026 valideerde onderscheidt drie families van AI-agents zoals OpenAI ze documenteert op platform.openai.com/docs/bots. De eerste familie (training) wordt standaard geblokkeerd. De tweede (real-time search/retrieval) wordt toegestaan omdat ze rechtstreeks citeerbare antwoorden voedt. De derde (user-driven) wordt toegestaan omdat ze een echte gebruiker vertegenwoordigt die met ChatGPT of Perplexity interageert.
“De robots.txt van 2026 wordt niet meer in defensieve modus besproken. Hij wordt ontworpen als tariefraster tussen training (geweigerd), retrieval (toegelaten) en user-driven (aangemoedigd).”
De 24 gedocumenteerde AI user-agents mei 2026
- Trainingfamilie (7 agents): GPTBot, ClaudeBot, anthropic-ai, Bytespider, Diffbot, CCBot, Omgili. Aanbeveling:
Disallow: /. - Real-time retrievalfamilie (9 agents): OAI-SearchBot, PerplexityBot, ClaudeBot-User (sinds november 2025), Bing-AI (alias Bingbot voor Copilot), Google-Extended (te bespreken, scheiden van core search), Mistral-User, Perplexity-User, Cohere-AI, You.com bot. Aanbeveling:
Allow: /. - User-driven familie (8 agents): ChatGPT-User (klik vanuit ChatGPT), Claude-Web (klik vanuit Claude.ai), Perplexity-User, Meta-ExternalAgent, FacebookAIBot, Cohere-AI, Applebot-Extended, OpenAI-Operator. Aanbeveling:
Allow: /.
Praktijkcase, waarom een premium wijnhandelaar deze configuratie moet toepassen
Op de GEO Rocket-portefeuille leverde de strikte toepassing van dit raster op expertvin.be (lancering april 2026) een meetbare winst op: Perplexity-citatiepercentage steeg van 0% naar 23% in 6 weken, ChatGPT Search-citatiepercentage van 0% naar 14% op hetzelfde panel. De grootste hefboom is niet massale deblokkering, het is consistentie tussen robots.txt, llms.txt en sitemap.xml: de drie bestanden moeten naar dezelfde canonieke URL’s wijzen, zonder tegenstrijdigheid. Eén enkele tegenstrijdigheid (bijvoorbeeld een sitemap die /producten/* opsomt maar een robots.txt die /producten/ blokkeert) volstaat om het citatiepercentage op die hele sectie te degraderen.
De Cloudflare AI Crawl Control fail-safe valstrik
Sinds oktober 2025 biedt Cloudflare een “Block AI Bots”-toggle aan dashboardzijde (blog.cloudflare.com). Standaard geactiveerd op 38% van de Pro-plannen volgens publieke Cloudflare-cijfers Q1 2026. Deze toggle overschrijft stilzwijgend de robots.txt aan de workerzijde, resultaat: de redactionele configuratie is correct, maar de server retourneert 403 aan OAI-SearchBot en PerplexityBot. Systematische PROEMA-diagnose bij audit-start: elke AI user-agent testen via curl -A "OAI-SearchBot" voordat de robots.txt wordt geauditeerd.
Pay-per-crawl monetisatie, stand mei 2026
Het HTTP 402-mechanisme (Payment Required) dat Cloudflare in september 2024 aankondigde blijft experimenteel. Geen van de drie grote LLM-families (OpenAI, Anthropic, Perplexity) heeft tegen mei 2026 publiek een gestructureerd grootschalig vergoedingsprogramma voor uitgevers gecommuniceerd. Bestaande deals (OpenAI / Axel Springer, OpenAI / Le Monde, OpenAI / Reuters) blijven bilateraal en vertrouwelijk. PROEMA-aanbeveling: monitoren maar niet wachten, het gratis citatie-venster blijft het voornaamste concurrentievoordeel voor 2026-2027.
Drie veelgemaakte fouten bij robots.txt-implementatie in 2026
De PROEMA-veldobservatie op een panel van 80 Belgische B2B-sites tussen januari en mei 2026 onthult drie systematische fouten in robots.txt-configuraties bedoeld voor AI-crawlers. Fout 1, User-agent matching die hoofdlettergevoelig is. De officiële OpenAI-documentatie specificeert dat user-agent-strings exact moeten worden geschreven (GPTBot, niet gptbot, niet GPTbot). Veel sites hebben “Gptbot” geschreven en denken de bot te blokkeren, terwijl deze fout door regex-matching niet wordt opgepikt door OpenAI. Fout 2, Plaatsing van robots.txt. Het bestand moet absoluut op de root staan (https://domein.be/robots.txt). 12% van de gemeten sites had het in een subdirectory geplaatst, de bots negeren het dan volledig. Fout 3, Conflict tussen Allow en Disallow. Wanneer een Allow op een specifiek pad een algemeen Disallow tegenspreekt, gebruikt elk LLM-platform een eigen prioriteitsregel. OpenAI eerbiedigt de meest specifieke regel; Anthropic doet hetzelfde. Maar Mistral en Perplexity hebben tot mei 2026 geen publieke documentatie hierover.
Anti-patterns die het citatiepercentage verlagen zonder dat de eigenaar het beseft
Buiten configuratiefouten zijn er vier anti-patterns die regelmatig worden waargenomen op Belgische sites die hun GEO-resultaten niet begrijpen. Anti-pattern A: een Disallow op /api/ die gerelateerde JSON-LD-bronnen blokkeert die het schema gebruikt. Anti-pattern B: het Crawl-delay-veld (verouderd, niet meer gerespecteerd door belangrijke AI-bots, maar nog steeds aanwezig op 23% van de gemeten sites) dat een rate-limiting suggereert die in werkelijkheid niet wordt toegepast. Anti-pattern C: een ondertekening met IP-blokkering op WAF-niveau die de robots.txt overschrijft, diagnose vereist curl -A "ChatGPT-User" -v om de echte server-respons te zien, niet de geconfigureerde reactie. Anti-pattern D: een robots.txt met meer dan 200 regels (het lezen vertraagt sommige crawlers tot aan time-out).