To bots, samme selskap, to helt forskjellige jobber
GPTBot og OAI-SearchBot kommer begge fra OpenAI, og navnene ligner nok til at de ofte behandles som ett og samme problem i en robots.txt-fil. Det er de ikke. GPTBot henter innhold for å bygge fremtidige modeller – en bakgrunnsjobb som ikke har noen enkelt bruker som venter på resultatet der og da. OAI-SearchBot henter innhold fordi det trengs i et svar som skal leveres nå, på samme måte som en søkemotor henter en side for å avgjøre om den er relevant for et treff.
Skriver du en regel som «blokker alt som inneholder GPT» fordi du ikke vil bidra gratis til trening av en fremtidig modell, treffer regelen som regel begge – ikke fordi du bestemte deg for det, men fordi navnelikheten gjorde det til samme linje i konfigurasjonen.
Den tredje kategorien: brukerinitiert henting
ChatGPT-User er verken en trenings- eller en bakgrunns-retrieval-bot. Den brukes når en faktisk bruker, midt i en samtale, ber ChatGPT hente eller lese noe direkte fra en spesifikk side. Dette er den mest direkte formen for AI-trafikk som finnes – et menneske venter bokstavelig talt på nettopp denne siden akkurat nå. Blokkerer du den sammen med de to andre, stopper du ikke bare en bakgrunnsjobb; du stopper en interessent midt i handlingen.
Samme mønster hos Anthropic, litt enklere hos Google
Anthropic følger nøyaktig samme tredeling som OpenAI: ClaudeBot til trening, Claude-SearchBot til retrieval, Claude-User til brukerinitiert henting. Google har valgt en enklere modell med to bots i stedet for tre: Googlebot dekker både klassisk indeksering og retrieval-type henting, mens Google-Extended er utelukkende samtykke-bryteren for trening av Googles generative modeller.
| Leverandør | Trening (bygger fremtidige modeller) | Retrieval (henter til et svar nå) | Brukerinitiert henting |
|---|---|---|---|
| OpenAI | GPTBot | OAI-SearchBot | ChatGPT-User |
| Anthropic | ClaudeBot | Claude-SearchBot | Claude-User |
| Google-Extended | Googlebot | — |
Misforståelsen de fleste går i: Google-Extended og AI Overviews
Fordi Google-Extended har «AI» i navnet i praksis (den styrer bruk til generative AI-produkter), antar mange at det er bryteren som avgjør om siden deres kan dukke opp i AI Overviews. Det stemmer ikke. Google har vært tydelig på at AI Overviews bygger på det samme underliggende søkeindeksen som vanlig Google-søk, drevet av Googlebot – ikke av samtykket i Google-Extended. Blokkerer du kun Google-Extended, endrer du ikke din tilstedeværelse i AI Overviews. Skal du bort derfra, må du i stedet styre den vanlige indekseringen via Googlebot, med de konsekvensene det har for hele det klassiske søket ditt også.
Beslutningsmatrise: hva vil du oppnå, og hva blokkerer det faktisk
Det finnes ikke ett riktig svar for alle nettsteder. Det som finnes, er fire ulike mål, og fire ulike sett med bots å blokkere for hvert av dem:
| Hva du vil oppnå | Blokker | Slipp gjennom |
|---|---|---|
| Innholdet mitt skal ikke brukes til å trene fremtidige modeller, men jeg vil gjerne bli sitert nå | GPTBot, ClaudeBot, Google-Extended | OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, Googlebot |
| Jeg vil ikke figurere i AI-svar i det hele tatt – et bevisst valg | Alle AI-bottene over, inkludert retrieval- og brukerinitierte varianter | Ingen – dette er en fullstendig opt-out, ikke en delvis en |
| Jeg vil ha begge deler: siteres nå og trolig også formet av senere trening | Ingen navngitte, verifiserte AI-bots | Alle AI-bottene over |
| Jeg har begrenset serverkapasitet og vil bare stoppe useriøs/uverifisert bot-trafikk | Alt som ikke består reverse-DNS- eller IP-verifisering, uansett navn i user-agent-strengen | Alle offisielt verifiserte AI-bots, uavhengig av hvilken av de tre rollene de har |
Hvorfor navnet i user-agent-strengen ikke er nok
En HTTP-forespørsel sender med seg en user-agent-streng som klienten selv velger fritt – ingenting hindrer et vilkårlig skript i å presentere seg som «GPTBot» uten å være det. For rene disallow-regler i robots.txt spiller ikke dette så stor rolle, siden useriøse aktører uansett ikke bryr seg om robots.txt. Men i det øyeblikket du bygger noe som gir kjente AI-crawlere en fordel – en romsligere rate-limit, et unntak i en geo-regel, tilgang gjennom en ellers streng WAF – må identiteten bekreftes med reverse DNS-oppslag mot forespørselens IP-adresse, eller mot leverandørens offisielt publiserte IP-lister. Uten det unntaket er «gi AI-crawlere fordeler» nøyaktig den samme åpningen som «gi alle som skriver riktig navn i en tekstfelt fordeler».
Selvsjekk: les robots.txt-en din høyt
Selvsjekk. Åpne robots.txt-filen din og les hver linje høyt, én om gangen. For hver linje: vet du hvorfor den står der, og husker noen i organisasjonen hvem som satte den og hva de prøvde å oppnå? En regel ingen kan forklare formålet med, er ikke en bevisst beskyttelse – den er en tilfeldighet som en dag ble stående, og som nå kanskje koster deg synlighet i nøyaktig de AI-svarene der kjøperne dine leter etter deg.
Ofte stilte spørsmål
Hvis jeg blokkerer GPTBot, forsvinner jeg da fra ChatGPT?
Er det galt å blokkere alle AI-bots med én regel for å slippe å tenke på dette?
Betyr det at Googlebot ikke kan brukes til trening?
Hvordan vet jeg at en forespørsel som utgir seg for å være GPTBot faktisk er det?
Var dette nyttig?
