Hoe stel ik robots.txt in voor AI-zoekmachines en Google?
Robots.txt is een bestand op je site dat crawlers vertelt wat ze mogen lezen. Voor AI-zoekmachines en Google laat je de zoek-crawlers toe, zoals OAI-SearchBot, PerplexityBot, Bingbot en Googlebot, en zorg je dat geen enkele regel ze per ongeluk blokkeert. Het bestand staat in de hoofdmap van je site en is het eerste wat een crawler leest.
Kort samengevat
- Robots.txt staat in de hoofdmap en stuurt wat crawlers mogen lezen.
- Laat de zoek-crawlers en Googlebot altijd toe, anders ben je onzichtbaar.
- Eén regel
Disallow: /blokkeert je hele site. - Hieronder staat een kant-en-klare config om te kopiëren.
- Test na elke wijziging of de belangrijke crawlers nog binnenkomen.
Wat is robots.txt?
Robots.txt is een simpel tekstbestand dat in de hoofdmap van je site staat, op jouwdomein.nl/robots.txt. Het is het eerste wat een crawler leest voordat hij je pagina's bezoekt. In dat bestand vertel je per crawler of hij binnen mag of niet.
Het is dus een poortwachter. Staat de poort open voor de juiste bots, dan word je gelezen. Staat er per ongeluk een slot op, dan blijf je buiten beeld, hoe goed je site verder ook is.
De basis: hoe een regel werkt
Een robots.txt-regel bestaat uit twee delen. User-agent zegt voor welke crawler de regel geldt, en Disallow of Allow zegt wat die crawler wel of niet mag.
User-agent: *geldt voor alle crawlers.Allow: /geeft toegang tot je hele site.Disallow: /sluit je hele site af. Dit is de gevaarlijke regel.Disallow: /wp-admin/sluit alleen dat mapje af, wat prima is.
Welke crawlers er precies zijn en welke je wilt toelaten, staat op wat zijn AI-crawlers en welke moet ik toelaten. Op deze pagina zet ik ze in een werkende config.
De kant-en-klare config
Dit is een robots.txt die de belangrijke AI-crawlers en Google toelaat, en alleen je beheermap afschermt. Vervang de sitemap-regel door jouw eigen sitemap-adres.
# Standaard: alles toegankelijk, alleen beheer afgeschermd User-agent: * Allow: / Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php # AI zoek- en user-crawlers (nodig voor zichtbaarheid) User-agent: OAI-SearchBot User-agent: ChatGPT-User User-agent: PerplexityBot User-agent: Perplexity-User User-agent: Claude-SearchBot User-agent: Claude-User User-agent: Bingbot Allow: / # AI trainings-crawlers (toelaten helpt je entiteit) User-agent: GPTBot User-agent: ClaudeBot User-agent: Google-Extended Allow: / # Sitemap Sitemap: https://jouwdomein.nl/sitemap_index.xml
Googlebot staat hier bewust niet apart genoemd, want die valt onder User-agent: * en heeft volledige toegang. Je hoeft Googlebot nooit expliciet toe te laten, alleen nooit te blokkeren.
De drie fouten die je moet vermijden
1. Een Disallow: / voor iedereen
Deze ene regel sluit je hele site af voor alle crawlers. Het gebeurt vaker dan je denkt, meestal per ongeluk. Controleer dat deze regel nergens onder User-agent: * staat.
2. Per ongeluk OAI-SearchBot blokkeren
Wie GPTBot blokkeert uit voorzichtigheid, sluit soms per ongeluk ook OAI-SearchBot buiten. Dan ben je onzichtbaar in ChatGPT, terwijl dat niet de bedoeling was. Ken het verschil tussen die twee.
3. Vertrouwen op robots.txt tegen scrapers
Sommige bots negeren robots.txt, zoals Bytespider. Wil je die echt weren, dan heb je een serverregel of firewall nodig. Een regel in robots.txt houdt ze niet tegen.
Waar zet je robots.txt in WordPress?
WordPress maakt zelf een onzichtbare robots.txt aan. Om die te overschrijven met de config hierboven, gebruik je meestal je SEO-plugin. In RankMath ga je naar Algemene instellingen en dan Robots.txt bewerken, en plak je de config daar. Sla op en klaar.
Let op één instelling die veel schade doet. In WordPress onder Lezen staat een vinkje om zoekmachines te ontmoedigen. Staat dat aan, dan zet WordPress je hele site op slot, ongeacht je robots.txt. Zet dat vinkje uit voordat je verder kijkt.
Wat ik in de praktijk tegenkom
De meest zure fout die ik zie: een site die live ging met de robots.txt van de testomgeving er nog in, met een Disallow voor de hele site. Maandenlang onzichtbaar in Google en de AI-zoekmachines, zonder dat iemand het doorhad. Al het werk aan de content deed er niet toe, want de poort stond op slot. Eén regel checken had dat voorkomen.
Testen of het werkt
Na het opslaan controleer je twee dingen. Open jouwdomein.nl/robots.txt in je browser en kijk of de config er echt staat. En gebruik de robots.txt-controle in Google Search Console om te zien of Googlebot je belangrijke pagina's mag lezen. Zie je daar een blokkade, dan pak je die eerst aan.
Wil je zeker weten of AI je nu leest, dan controleer je je serverlogs op de crawler-namen, of je meet of je genoemd wordt. Hoe je dat doet, staat op controleren of ChatGPT je noemt.
Wat dit voor jou betekent
Doe vandaag de check: open je robots.txt en zoek naar Disallow: /. Staat die er verkeerd, dan is dat waarschijnlijk je snelste winst van allemaal. Daarna plak je de config hierboven en test je het. Terug naar het overzicht van AI-zoekmachines.
Veelgestelde vragen
Waar vind ik mijn robots.txt?
Op jouwdomein.nl/robots.txt. Typ dat in je browser en je ziet het bestand. Is er nog geen, dan maakt WordPress een onzichtbare standaardversie aan die je met je SEO-plugin kunt overschrijven.
Blokkeer ik met robots.txt ook mijn Google-vindbaarheid?
Alleen als je Googlebot blokkeert, en dat wil je nooit. In de config hierboven valt Googlebot onder de algemene toegang en blijft je Google-vindbaarheid volledig intact. Je regelt met dit bestand alleen wie er wel en niet in mag.
Moet ik een aparte regel voor Googlebot toevoegen?
Nee. Googlebot heeft via User-agent: * al volledige toegang. Je hoeft Googlebot nooit expliciet toe te laten, je moet hem alleen nooit blokkeren. Hetzelfde geldt voor Bingbot, al noem ik die er voor de zekerheid apart bij.
Hoe snel werkt een wijziging in robots.txt?
Crawlers lezen robots.txt bij een volgend bezoek, meestal binnen een paar dagen. Wil je het versnellen, dan kun je in Google Search Console een herindexatie aanvragen. Voor de AI-zoekmachines heb je geen knop, daar wacht je op hun volgende bezoek.
Wat andere ondernemers zeggen
Twijfel je of je robots.txt klopt?
Laten we gewoon even bellen met een kop koffie erbij. Ik kijk vooraf of je robots.txt de zoek-crawlers en Google binnenlaat, en of er geen blokkade in staat die je onzichtbaar maakt.
Geen verkooppraatje. Wel eerlijk advies.
Plan een kennismakingsgesprek→
Liever eerst appen of mailen? Bel of app 06 57003549, of mail jesper@aikracht.nl