Wat zijn AI-crawlers en welke moet ik toelaten?

AI-crawlers zijn bots die je website lezen voor AI-systemen. Er zijn drie soorten: trainings-crawlers, zoek-crawlers en user-crawlers. Om zichtbaar te zijn in AI-antwoorden moet je de zoek-crawlers toelaten, zoals OAI-SearchBot, PerplexityBot en Claude-SearchBot. Die blokkeren maakt je onzichtbaar. Trainings-crawlers blokkeren is een keuze die je zichtbaarheid niet raakt.

Laat mij je robots.txt controleren Gratis kennismaking, ik doe vooraf een snelle scan.

Kort samengevat

  • Een AI-crawler is een bot die je site leest voor een AI-systeem.
  • Drie soorten: trainings-crawlers, zoek-crawlers en user-crawlers.
  • Laat de zoek-crawlers altijd toe, dat is je citatie-pijplijn.
  • Blokkeer je OAI-SearchBot, dan verschijn je niet in ChatGPT.
  • De meesten maken zich druk om de verkeerde crawler.

Wat is een AI-crawler?

Een AI-crawler is een bot van een AI-bedrijf die je website bezoekt en de inhoud leest. Net zoals Googlebot je site leest voor de Google-zoekresultaten, lezen deze bots je site voor AI-systemen zoals ChatGPT, Perplexity en Claude. Ze staan in je logbestanden onder een eigen naam, de user-agent.

Je bepaalt zelf welke je binnenlaat, via een bestand op je site dat robots.txt heet. En daar gaat het vaak mis, want veel bedrijven blokkeren zonder het te weten de verkeerde bots, of laten juist de belangrijke buiten.

De drie soorten AI-crawlers

Voordat je iets toelaat of blokkeert, moet je het verschil kennen. Er zijn drie families, elk met een andere taak.

1. Trainings-crawlers

Deze verzamelen tekst om AI-modellen mee te trainen. Wat ze meenemen, wordt onderdeel van de basiskennis van het model. Ze bepalen niet of je vandaag geciteerd wordt, maar helpen het model op termijn je bedrijf te leren kennen.

Voorbeelden: GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

2. Zoek-crawlers

Deze bouwen de index waaruit een AI-zoekmachine zijn antwoord haalt. Dit is je citatie-pijplijn. Blokkeer je deze, dan zit je niet in de vijver waaruit gekozen wordt, en verschijn je dus niet in AI-antwoorden.

Voorbeelden: OAI-SearchBot, PerplexityBot, Claude-SearchBot, Bingbot.

3. User-crawlers

Deze halen een specifieke pagina live op, op het moment dat een gebruiker de AI vraagt een link te openen. Blokkeer je deze, dan kan de AI je pagina niet tonen, ook al is die geïndexeerd.

Voorbeelden: ChatGPT-User, Claude-User, Perplexity-User.

Welke moet je toelaten?

De zoek-crawlers en de user-crawlers laat je altijd toe. Dat is niet onderhandelbaar, want zonder die twee besta je niet in AI-antwoorden. Ze sturen bezoekers en leveren citaties op.

De trainings-crawlers zijn een keuze. Blokkeer je ze, dan gebruik je een recht dat je hebt: je content niet laten meetrainen. Dat kost je geen zichtbaarheid vandaag. Maar mijn advies voor wie gevonden wil worden, is ze juist toe te laten. Hoe vaker en consistenter een model je tegenkomt, hoe beter het je als bedrijf leert kennen. Dat helpt je entiteit.

De enige die ik zou tegenhouden, zijn de slecht gedragende scrapers die robots.txt negeren en alleen serverlast opleveren, zoals Bytespider. Die hou je niet met robots.txt tegen, daarvoor heb je een serverregel nodig.

De fout die de meesten maken

Bijna iedereen die zich hierin verdiept, kijkt naar GPTBot. Logisch, want dat is de bekendste naam van OpenAI. Maar GPTBot is de trainings-crawler. Die bepaalt niet of ChatGPT je noemt.

De crawler die telt voor gevonden worden in ChatGPT is OAI-SearchBot, niet GPTBot. Blokkeer je die per ongeluk, dan besta je niet in ChatGPT, hoe goed je content ook is.

Ik zie het geregeld: een site die GPTBot netjes blokkeert uit voorzichtigheid, en tegelijk per ongeluk OAI-SearchBot buitensluit. Het gevolg is precies verkeerd om. Je content wordt niet meegetraind, maar je bent ook onzichtbaar in de zoekantwoorden waar je klant kijkt. Ken het verschil, en je maakt die fout niet.

Je robots.txt instellen

Controleer eerst je huidige robots.txt op jouwdomein.nl/robots.txt. Zoek naar de namen hierboven met een regel Disallow: / eronder. Staat die er, dan blokkeer je die crawler nu. Zo laat je de belangrijkste juist expliciet toe:

# AI zoek- en user-crawlers toelaten (nodig voor zichtbaarheid)
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Claude-SearchBot
User-agent: Claude-User
Allow: /

# AI trainings-crawlers (toelaten helpt het leren van je entiteit)
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Allow: /

De volledige uitleg, met het verschil tussen toelaten en blokkeren en de valkuilen, staat op robots.txt instellen voor AI-zoekmachines en Google. En waarom OAI-SearchBot samenhangt met Bing, lees je op ChatGPT en de Bing-index.

Wat dit voor jou betekent

Doe vandaag één ding: open je robots.txt en kijk of er een van de zoek-crawlers geblokkeerd staat. Is dat zo, dan is dat waarschijnlijk je snelste winst, want dan word je nu simpelweg niet gelezen. Twijfel je over de trainings-crawlers, laat ze dan staan als je gevonden wilt worden. Terug naar het overzicht van AI-zoekmachines.

Veelgestelde vragen

Moet ik GPTBot blokkeren of toelaten?

Dat is een keuze, geen must. GPTBot is de trainings-crawler van OpenAI. Blokkeren voorkomt dat je content meetraint, maar raakt je zichtbaarheid in ChatGPT niet. Voor ChatGPT-zichtbaarheid telt OAI-SearchBot. Wil je gevonden worden, dan is GPTBot toelaten meestal het beste, want het helpt het model je te leren kennen.

Wat gebeurt er als ik OAI-SearchBot blokkeer?

Dan verschijn je niet in de zoekantwoorden van ChatGPT. OAI-SearchBot bouwt de index waaruit ChatGPT zijn bronnen haalt. Blokkeer je die, dan zit je niet in de vijver waaruit gekozen wordt, ongeacht hoe goed je content is. Dit is de crawler die je zeker moet toelaten.

Kan ik alle AI-crawlers met robots.txt tegenhouden?

De meeste respecteren robots.txt, zoals GPTBot, ClaudeBot en PerplexityBot. Maar sommige scrapers negeren het bestand, zoals Bytespider. Wil je die echt tegenhouden, dan heb je een serverregel of firewall nodig, want een regel in robots.txt alleen is voor hen niet genoeg.

Is Google-Extended een crawler?

Niet echt. Google-Extended is een instelling in robots.txt, geen bot die je site bezoekt. Het bepaalt of Google jouw content mag gebruiken voor het trainen van Gemini. Je gewone Googlebot en je Google-zichtbaarheid blijven er ongemoeid door.

Wat andere ondernemers zeggen

AI-vindbaarheidsspecialist Jesper Daan Ploegsma controleert welke AI-crawlers een website mag toelaten

Laat jij per ongeluk de verkeerde crawler buiten?

Laten we gewoon even bellen met een kop koffie erbij. Ik controleer vooraf je robots.txt en kijk of de zoek-crawlers wel binnenkomen, zodat AI je überhaupt kan lezen.

Geen verkooppraatje. Wel eerlijk advies.

Plan een kennismakingsgesprek

Liever eerst appen of mailen? Bel of app 06 57003549, of mail jesper@aikracht.nl