Wat is een AI-crawler en waarom moet u er om geven?

Snel antwoord

Een AI-crawler is een geautomatiseerd programma dat het web afgaat om LLM's te voeden. GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, GoogleBot Gemini zijn de belangrijkste. Blokkeer je ze in robots.txt, dan word je onzichtbaar voor AI's. Laat je ze door, dan voedt jouw content de modellen.

Wat is een AI-crawler en waarom moet u er om geven, volgens PROEMA?

Een AI-crawler is een softwarerobot die het web doorzoekt namens een AI-leverancier. Tegen 2026 zijn er minstens 24 identificeerbare user-agents, verdeeld over drie functionele families, en die verdeling bepaalt je toelatingsstrategie.

Familie 1, Trainingscrawlers. Ze verzamelen content om toekomstige modellen te trainen. Voornaamste namen: GPTBot (OpenAI, officiële documentatie sinds augustus 2023), ClaudeBot (Anthropic), Google-Extended (Google Gemini), CCBot (Common Crawl, dat veel open-source trainingsdatasets voedt), Bytespider (TikTok/ByteDance). Deze familie blokkeren haalt je niet uit de gegenereerde antwoorden, het belet enkel dat je content in het volgende trainingscorpus terechtkomt. Veel nieuwsuitgevers (NYT, Reuters, AFP) kozen voor opt-out na de zaak NYT v. OpenAI.

Familie 2, Real-time retrieval crawlers. Ze halen content op aanvraag op wanneer een gebruiker een vraag stelt in ChatGPT, Perplexity of Claude. Voornaamste namen: OAI-SearchBot (OpenAI, browsing-modus en SearchGPT), Claude-SearchBot (Anthropic), PerplexityBot (Perplexity). Blokkeer je deze familie, dan verdwijn je letterlijk uit de LLM-citaten. GPTBot blokkeren blokkeert OAI-SearchBot niet, die vereisen aparte directieven in robots.txt, en het is de vaakst gemaakte fout in onze audits.

Familie 3, User-fetch crawlers. Ze halen een URL op uitdrukkelijk verzoek van een gebruiker (iemand plakt een link in de chat). Voornaamste naam: Claude-User. Crawlen nooit in bulk.

Waarom je dit aanbelangt? Volgens telemetrie van Cloudflare AI Crawl Control kan het AI-crawlerverkeer 5 tot 15 procent bedragen van het totale verkeer op een premium redactionele site in 2026. Drie concrete inzetten voor een beslisser. "Wie zichtbaar wil zijn, moet de real-time retrieval crawlers toelaten, dat is een niet-onderhandelbare voorwaarde om in de antwoorden te verschijnen", benadrukt Lorenzo Eeman, oprichter van PROEMA. Monetisatie: Cloudflare lanceerde pay-per-crawl in 2025, je oorsprong stuurt HTTP 402 terug naar AI-crawlers en Cloudflare factureert namens jou aan de botoperator. Merkbeheer: jij kiest welk stuk content in welke trainingscorpora belandt. De minimumdiagnose: audit je robots.txt en activeer het Cloudflare AI Crawl Control-dashboard om te zien wie je vandaag al crawlt zonder dat je het weet.

In het kort
CrawlerUitgeverLanceringToelaten?
GPTBotOpenAIaug 2023Ja (ChatGPT zichtbaarheid)
ClaudeBotAnthropic2023Ja (Claude)
PerplexityBotPerplexity2024Ja (Perplexity)
Applebot-ExtendedApple2024Ja voor EU
GoogleBot (Gemini)Google2024Ja (AI Overviews)