AI-crawlerspådinwebbplats:vilkadubörsläppain,vilkadukanblockeraochvarfördetspelarroll
Kolla serverloggarna på en vanlig företagssajt en vanlig vecka och en stor del av trafiken är inte människor. Googlebot och Bingbot har alltid varit där. Sedan 2023 har de fått sällskap av en växande grupp AI-relaterade robotar: GPTBot, ClaudeBot, PerplexityBot, CCBot, Bytespider, Google-Extended, Applebot-Extended och fler därtill.
Vanliga reaktioner är att antingen blockera allt som låter som AI eller att inte göra någonting alls. Båda är dåliga val, eftersom robotarna gör olika saker och konsekvenserna av att stänga ute dem skiljer sig rejält.
Tre sorters robotar, tre olika syften
"AI-crawler" är ett paraplybegrepp för minst tre olika beteenden.
Träningsrobotar. De samlar in text för att träna framtida modeller. Här hittar du GPTBot från OpenAI, ClaudeBot från Anthropic, CCBot från Common Crawl och Bytespider från ByteDance. Blockerar du dem påverkas inte er synlighet i något söksvar idag. Det ni väljer bort är att bidra till nästa generations modeller.
Sökrobotar. De indexerar webben för att kunna citera och länka i AI-genererade svar. OpenAI kör OAI-SearchBot för ChatGPT Search, Anthropic har Claude-SearchBot och Perplexity har PerplexityBot. Blockerar du dem försvinner ni ur just de svaren. Det är alltså den här gruppen som avgör om ni syns när någon frågar ChatGPT eller Perplexity om ert område.
Användarstyrda agenter. De hämtar en sida på begäran av en specifik användare, till exempel när någon klistrar in en länk i ChatGPT och ber om en sammanfattning. OpenAI kallar sin ChatGPT-User, Anthropic Claude-User. Det här är närmare en människa med en webbläsare än en crawler, och robots.txt respekteras inte alltid på samma sätt.
Google är ett specialfall. Googlebot indexerar för sök, inklusive AI Overviews och AI Mode. Google-Extended är en separat token som styr om innehållet får användas för Gemini-träning och grounding, men den påverkar inte hur ni syns i sökresultaten. Blockerar ni Googlebot försvinner ni ur allt. Blockerar ni Google-Extended förlorar ni ingenting i Search.
Vad robots.txt gör
robots.txt är en överenskommelse, inte en brandvägg. Seriösa aktörer publicerar sina user agents och lovar att respektera filen. OpenAI, Anthropic och Google har alla dokumentation om exakt vilka strängar de använder och vilka IP-intervall trafiken kommer från.
Mindre seriösa aktörer struntar i filen. Därför är robots.txt rätt verktyg för att styra de robotar som lyssnar, och fel verktyg för att stoppa de som inte gör det.
En robots.txt som skiljer på syftena kan se ut så här:
# Träning: nej tack
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# Sök och citering: välkomna
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: *
Allow: /
Sitemap: https://www.example.se/sitemap.xml
Vill ni istället bidra till träning finns det inget som hindrar det. Beslutet bör bara tas medvetet och per robot, inte som en reflex.
Ett vanligt misstag
Ett vanligt scenario är att en sajt har fått en bred blockering av allt med "GPT" eller "AI" i namnet, ofta via en säkerhetsplugin eller ett CDN-preset, och sedan aldrig dyker upp i ChatGPT Search.
Orsaken är att sökroboten blockerades i samma svep som träningsroboten. Sajten kan ha tjänstesidor, FAQ och strukturerad data i god ordning och ändå ha låst dörren för den enda robot som skulle kunna citera den.
Kontrollera därför robots.txt innan ni lägger tid på GEO-arbete. Det tar två minuter.
När blockering är rätt
Det finns goda skäl att säga nej till vissa robotar.
- Ni publicerar innehåll som är er affärsidé, som betalda guider, kursmaterial eller databaser, och vill inte att det tränas in i modeller gratis.
- En robot drar orimligt mycket trafik. Bytespider och några mindre kända crawlers har fått kritik för hög belastning, och för en liten sajt på delat webbhotell kan det märkas.
- Ni har juridiska skäl, till exempel licensavtal med tredje part som begränsar vidare användning.
I de fallen är robots.txt första steget. För robotar som inte lyssnar behöver ni något på nätverksnivå.
Cloudflare och tanken på att ta betalt
Sommaren 2025 ändrade Cloudflare standardinställningen så att nya kunder blockerar AI-crawlers om de inte aktivt väljer att släppa in dem. Samtidigt introducerades Pay Per Crawl, där sajtägare kan sätta ett pris per hämtning och robotar som vill in får betala via HTTP-statuskod 402. Det började som en begränsad beta och det återstår att se hur mycket volym som går den vägen.
Viktigare på sikt är att infrastrukturen för att identifiera robotar blir bättre. Cloudflare driver tillsammans med bland andra OpenAI ett förslag kallat Web Bot Auth, där robotar signerar sina förfrågningar kryptografiskt istället för att bara påstå ett user agent-namn. Om det får spridning går det att släppa in en verifierad sökrobot och stänga ute allt som låtsas vara den.
För en vanlig företagssajt räcker det ofta att veta att den här inställningen finns i CDN:et och att den kan vara påslagen utan att någon bett om det.
En rimlig arbetsgång
- Läs er robots.txt och lista varje user agent som nämns. Om ni inte vet vad en rad gör, ta reda på det.
- Bestäm hållning till träning separat från hållning till sök. De flesta företag tjänar på att vara sökbara och förlorar inget på att neka träning.
- Kontrollera CDN och säkerhetsplugins. Ett preset kan blockera mer än ni tror.
- Titta i loggarna en gång per kvartal. Nya robotar dyker upp och gamla byter namn.
- Testa. Fråga ChatGPT och Perplexity om ert företag och se om era sidor citeras. Om inte, kontrollera först att sökrobotarna kommer in.
Sökrobotarna ger synlighet, träningsrobotarna ger i dagsläget ingenting tillbaka, och användaragenterna är i praktiken besökare. Skriv ner hur ni vill behandla var och en i robots.txt och kontrollera att ingen mellanhand fattat ett annat beslut åt er.