robots.txt configureren voor AI-crawlers
Een praktische doorloop van GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended en de rest: wat elke bot doet, en een robots.txt die je daadwerkelijk kunt gebruiken.
De meeste sites blokkeren AI-crawlers per ongeluk — via een geërfde WAF-regel of een gekopieerd robots.txt-sjabloon — of staan alles toe zonder na te denken over wat elke bot eigenlijk doet. Deze gids lost beide op.
Check mijn crawler-toegangTwee soorten AI-crawlers, niet één
AI-bedrijven draaien minstens twee verschillende soorten crawlers, en ze als één ding behandelen is de meest gemaakte robots.txt-fout. Trainingscrawlers zoals GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) en CCBot (Common Crawl, indirect gebruikt door veel modellen) bezoeken je site op hun eigen schema om data te verzamelen voor een toekomstige modelversie. Eén ervan blokkeren verwijdert niets dat al geleerd is van een eerdere crawl; het opt je alleen uit voor de volgende.
Realtime fetch-crawlers werken anders: OAI-SearchBot en ChatGPT-User (OpenAI), PerplexityBot (Perplexity), en de zoekverbonden fetches die Claude en Gemini doen, draaien allemaal op het moment dat een gebruiker een vraag stelt die jouw pagina nu nodig heeft. Deze blokkeren heeft direct effect: de engine kan je pagina niet lezen voor dat antwoord, punt uit, zelfs als jouw content precies was wat het nodig had.
Daarom is een blanco 'blokkeer alle bots'-regel meestal een fout, en een blanco 'sta alles toe'-regel zonder nadenken ook. Een goede robots.txt behandelt elke crawler op basis van wat hij doet: sta de bots toe die citaties en realtime antwoorden aandrijven, en maak een bewuste, geïnformeerde keuze — geen standaardinstelling — over de trainingsbots.
Wat je moet beslissen voordat je robots.txt bewerkt
Weet welk type je blokkeert
Controleer voordat je iets verbiedt of het een trainingscrawler is, die alleen toekomstige modelversies beïnvloedt, of een realtime fetcher, die beïnvloedt of je nu geciteerd wordt in een antwoord. De twee hebben compleet verschillende gevolgen.
Verifieer dat de bot echt is
Een user-agent string is gewoon tekst — iedereen kan 'GPTBot' in een request-header sturen. Verifieer voor alles wat verder gaat dan een basale robots.txt-regel, zoals een WAF-blokkade, aan de hand van gepubliceerde IP-ranges of een geverifieerde-bot-lijst van een CDN, niet aan de hand van de string alleen.
Check je serverlogs, niet alleen robots.txt
robots.txt is een verzoek, geen slot — brave bots respecteren het, maar de enige manier om te weten of je regels echt werken is je serverlogs periodiek checken op 200-responses (niet stille drops of WAF-uitdagingen) van de bots die je wilde toestaan.
Waarom dit de moeite waard is om goed te doen
Per ongeluk blokkeren is de norm, niet de uitzondering
Onafhankelijk onderzoek van Originality.ai vond dat GPTBot geblokkeerd wordt door meer dan een derde van de top 1.000 websites — en interviews met site-eigenaren toonden dat veel van die blokkades geërfd waren van standaard WAF-regels of gekopieerde sjablonen, niet van een bewuste beslissing.
Meestal een vijf-minuten-fix
Zodra je weet welke bots je wilt toestaan, is de daadwerkelijke robots.txt-wijziging een handvol regels. Het lastige deel is weten wat je moet schrijven, niet het schrijven zelf.
Blokkeren heeft een meetbare prijs
Case studies geanalyseerd door Hack/Hackers vonden dat sites die AI-crawlers blokkeerden vervolgens een merkbare daling zagen in verwijzingsverkeer vanuit AI-antwoordmachines. De crawler die je vandaag blokkeert, is de citatie die je morgen mist.
AI crawler-toegang instellen in 3 stappen
Beslis per bot, niet alles-of-niets
Lijst welke crawlers je wilt toestaan. De meeste sites zouden de realtime fetchers — OAI-SearchBot, ChatGPT-User en PerplexityBot — standaard moeten toestaan, want ze blokkeren sluit je direct uit van live antwoorden.
Schrijf expliciete Allow-regels
Voeg per bot een User-agent-blok toe in plaats van te vertrouwen op een generieke wildcard-regel uit een sjabloon. Expliciete regels overschrijven standaardinstellingen en maken je intentie later controleerbaar.
Bevestig met serverlogs
Check na het deployen je logs op de bots die je toestond. Zoek naar 200-responses, niet 403's of WAF-uitdagingen. Een bot die robots.txt respecteert maar toch geblokkeerd wordt elders in je stack heeft een aparte fix nodig.
AI Crawler Access — veelgestelde vragen
Wat is het verschil tussen een trainingscrawler en een realtime fetch-crawler?
Een trainingscrawler zoals GPTBot, ClaudeBot of Google-Extended verzamelt data op zijn eigen schema om een toekomstige modelversie te verbeteren — blokkeren heeft geen effect op citaties die vandaag plaatsvinden. Een realtime fetch-crawler zoals OAI-SearchBot, ChatGPT-User of PerplexityBot draait op het moment dat de vraag van een gebruiker jouw pagina nodig heeft — blokkeren betekent dat dat specifieke antwoord jouw content helemaal niet kan gebruiken.
Hoe ziet een werkende robots.txt voor AI-crawlers eruit?
Een minimaal voorbeeld dat de belangrijkste citatie-relevante bots toestaat: User-agent: GPTBot, Allow: /; User-agent: OAI-SearchBot, Allow: /; User-agent: ChatGPT-User, Allow: /; User-agent: ClaudeBot, Allow: /; User-agent: PerplexityBot, Allow: /; User-agent: Google-Extended, Allow: /; gevolgd door een Sitemap-regel die naar je sitemap.xml wijst. Pas aan welke bots Allow versus Disallow krijgen op basis van je eigen keuze rond trainingsdata.
Moet ik GPTBot blokkeren om AI weg te houden van mijn content?
Voor de meeste sites: nee. GPTBot is OpenAI's trainingscrawler — blokkeren voorkomt dat toekomstige modellen trainen op nieuwe content, maar verwijdert niets dat al geleerd is, en beïnvloedt niet ChatGPT's realtime citaties, die komen namelijk van OAI-SearchBot en ChatGPT-User. Blokkeren is een bewuste opt-out-beslissing, geen beveiligingsmaatregel, en case-study-data suggereert dat het echt verwijzingsverkeer kan kosten zonder duidelijk voordeel voor de meeste uitgevers.
Heeft het blokkeren van AI-crawlers invloed op mijn Google-ranking?
Het blokkeren van GPTBot, ClaudeBot of PerplexityBot heeft geen direct effect op je Google-zoekranking — Googlebot is een volledig aparte crawler. Google-Extended specifiek blokkeren is anders: dat stopt je content van gebruik in Google's eigen AI-functies zoals AI Overviews en Gemini, zonder je gewone zoekranking te raken, want die wordt bepaald door Googlebot.
Hoe weet ik of een verzoek dat zegt GPTBot te zijn, ook echt GPTBot is?
Vertrouw nooit alleen op de user-agent string — die is triviaal te vervalsen. Verifieer voor alles wat verder gaat dan een basale robots.txt-regel aan de hand van de gepubliceerde IP-ranges van de crawler (OpenAI, Anthropic en anderen publiceren deze) of gebruik een geverifieerde-bot-lijst van een CDN, zoals Cloudflare's AI Crawl Control, die meer checkt dan alleen de header.
Heb ik ook een llms.txt-bestand nodig?
llms.txt is een opkomende, onofficiële conventie die sommige sites gebruiken om AI-crawlers naar een samengestelde samenvatting van hun content te wijzen. Het is geen standaard waarvan een groot AI-bedrijf heeft bevestigd dat het die leest, en het vervangt robots.txt niet — dat is het daadwerkelijke toegangscontrolemechanisme dat crawlers respecteren. Het is de moeite waard om in de gaten te houden, maar nog niet de moeite waard om voorrang te geven boven een correcte robots.txt.
Check of AI-crawlers je site daadwerkelijk kunnen lezen
GEO-Score inspecteert je robots.txt, serverresponses en JavaScript-gerenderde content om precies te laten zien welke AI-bots toegang hebben. Vijf paginachecks per domein zijn elke 30 dagen gratis.
Check mijn crawler-toegang