Konfigurera robots.txt för AI-crawlrar
En praktisk genomgång av GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended och resten: vad var och en gör, och en robots.txt du faktiskt kan använda.
De flesta webbplatser blockerar AI-crawlrar antingen av misstag — via en ärvd WAF-regel eller en kopierad robots.txt-mall — eller tillåter allt utan att tänka på vad varje bot faktiskt är till för. Den här guiden löser båda delarna.
Kontrollera Min CrawleråtkomstTvå Sorters AI-crawlrar, Inte En
AI-företag kör minst två olika typer av crawlrar, och att behandla dem som en enda sak är det vanligaste robots.txt-misstaget. Träningscrawlrar som GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) och CCBot (Common Crawl, används indirekt av många modeller) besöker din webbplats enligt sitt eget schema för att samla in data till en framtida modellversion. Att blockera en av dem tar inte bort något som redan lärts från en tidigare genomsökning — det tackar bara nej till nästa.
Realtidshämtare fungerar annorlunda: OAI-SearchBot och ChatGPT-User (OpenAI), PerplexityBot (Perplexity), och de sökanslutna hämtningarna Claude och Gemini gör, körs alla i det ögonblick en användare ställer en fråga som behöver din sida just nu. Att blockera dessa har omedelbar effekt: motorn kan inte läsa din sida för det svaret, punkt, även om ditt innehåll var precis vad den behövde.
Det är därför en generell regel om att 'blockera alla bottar' oftast är ett misstag, och det är en generell regel om att 'tillåta allt' utan eftertanke också. En bra robots.txt behandlar varje crawlrar efter vad den gör: tillåt de som driver citeringar och realtidssvar, och gör ett medvetet, informerat val — inte ett standardval — kring de rena träningsbottarna.
Vad Du Bör Bestämma Innan Du Ändrar robots.txt
Vet Vilken Typ Du Blockerar
Innan du förbjuder något, kontrollera om det är en träningscrawlrar, som bara påverkar framtida modellversioner, eller en realtidshämtare, som påverkar om du citeras i ett svar just nu. De två har helt olika konsekvenser.
Verifiera Att Boten Är Äkta
En user-agent-sträng är bara text — vem som helst kan skicka 'GPTBot' i en förfråganshuvud. Verifiera allt bortom en grundläggande robots.txt-regel, som en WAF-blockering, mot publicerade IP-intervall eller en verifierad bot-lista från ett CDN, inte bara strängen.
Kontrollera Dina Serverloggar, Inte Bara robots.txt
robots.txt är en begäran, inte ett lås — väluppfostrade bottar respekterar den, men det enda sättet att veta om dina regler faktiskt fungerar är att regelbundet kontrollera serverloggarna efter 200-svar (inte tysta avslag eller WAF-utmaningar) från de bottar du ville tillåta.
Varför Det Är Värt Att Göra Rätt
Oavsiktlig Blockering Är Normen, Inte Undantaget
Oberoende forskning från Originality.ai fann att GPTBot blockeras av över en tredjedel av de 1 000 mest besökta webbplatserna — och intervjuer med webbplatsägare visade att många av dessa blockeringar ärvts från standard-WAF-regler eller kopierade mallar, inte ett medvetet beslut.
Vanligtvis En Femminutersfix
När du väl vet vilka bottar du vill tillåta är själva robots.txt-ändringen en handfull rader. Den svåra delen är att veta vad man ska skriva, inte att skriva det.
Blockering Har Ett Mätbart Pris
Fallstudier analyserade av Hack/Hackers fann att webbplatser som blockerade AI-crawlrar därefter fick en märkbar nedgång i hänvisningstrafik från AI-svarsmotorer. Crawlern du blockerar idag är citeringen du inte får imorgon.
Ställ In AI-crawleråtkomst i 3 Steg
Bestäm Per Bot, Inte Allt-eller-inget
Lista vilka crawlrar du vill tillåta. De flesta webbplatser bör som standard tillåta realtidshämtarna — OAI-SearchBot, ChatGPT-User och PerplexityBot — eftersom att blockera dem omedelbart utesluter dig från direktsvar.
Skriv Explicita Allow-regler
Lägg till ett User-agent-block per bot i stället för att förlita dig på en generisk jokerteckenregel ärvd från en mall. Explicita regler åsidosätter standardinställningar och gör din avsikt granskningsbar senare.
Bekräfta Med Serverloggar
Efter driftsättning, kontrollera dina loggar för de bottar du tillät. Leta efter 200-svar, inte 403:or eller WAF-utmaningar. En bot som respekterar robots.txt men ändå blockeras någon annanstans i din stack behöver en separat fix.
AI Crawler Access — Vanliga Frågor
Vad är skillnaden mellan en träningscrawlrar och en realtidshämtar-crawlrar?
En träningscrawlrar som GPTBot, ClaudeBot eller Google-Extended samlar in data enligt sitt eget schema för att förbättra en framtida modellversion — att blockera den påverkar inte citeringar som sker idag. En realtidshämtar-crawlrar som OAI-SearchBot, ChatGPT-User eller PerplexityBot körs i det ögonblick en användares fråga behöver din sida — att blockera den betyder att just det svaret inte alls kan använda ditt innehåll.
Hur ser en fungerande robots.txt för AI-crawlrar ut?
Ett minimalt exempel som tillåter de viktigaste citeringsrelevanta bottarna: User-agent: GPTBot, Allow: /; User-agent: OAI-SearchBot, Allow: /; User-agent: ChatGPT-User, Allow: /; User-agent: ClaudeBot, Allow: /; User-agent: PerplexityBot, Allow: /; User-agent: Google-Extended, Allow: /; följt av en Sitemap-rad som pekar på din sitemap.xml. Justera vilka bottar som får Allow respektive Disallow utifrån ditt eget beslut om träningsdata.
Bör jag blockera GPTBot för att hålla AI borta från mitt innehåll?
För de flesta webbplatser: nej. GPTBot är OpenAIs träningscrawlrar — att blockera den stoppar framtida modeller från att träna på nytt innehåll, men tar inte bort något redan inlärt, och påverkar inte ChatGPTs realtidsciteringar, som i stället kommer från OAI-SearchBot och ChatGPT-User. Att blockera den är ett medvetet avanmälningsbeslut, inte en säkerhetsåtgärd, och fallstudiedata tyder på att det kan kosta verklig hänvisningstrafik utan en tydlig fördel för de flesta utgivare.
Påverkar blockering av AI-crawlrar min Google-ranking?
Att blockera GPTBot, ClaudeBot eller PerplexityBot har ingen direkt effekt på din Google-sökranking — Googlebot är en helt separat crawlrar. Att specifikt blockera Google-Extended är annorlunda: det förhindrar att ditt innehåll används i Googles egna AI-funktioner, som AI Overviews och Gemini, utan att röra din vanliga sökranking, som styrs av Googlebot.
Hur vet jag om en begäran som påstår sig vara GPTBot verkligen är GPTBot?
Lita aldrig bara på user-agent-strängen — den är trivial att förfalska. Verifiera allt bortom en grundläggande robots.txt-regel mot crawlerns publicerade IP-intervall (OpenAI, Anthropic och andra publicerar dessa) eller använd en verifierad bot-lista från ett CDN, som Cloudflares AI Crawl Control, som kontrollerar mer än bara headern.
Behöver jag också en llms.txt-fil?
llms.txt är en framväxande, inofficiell konvention som vissa webbplatser använder för att peka AI-crawlrar mot en kurerad sammanfattning av sitt innehåll. Det är ingen standard som något stort AI-företag har bekräftat att det läser, och det ersätter inte robots.txt, som är den faktiska åtkomstkontrollmekanism crawlrar respekterar. Värt att hålla koll på, men ännu inte värt att prioritera framför att få robots.txt rätt.
Kontrollera Om AI-crawlrar Faktiskt Kan Läsa Din Webbplats
GEO-Score granskar din robots.txt, serversvar och JavaScript-renderat innehåll för att visa exakt vilka AI-bottar som släpps in. Fem sidkontroller per domän är gratis var 30:e dag.
Kontrollera Min Crawleråtkomst