Robots.txt: bepaal zelf welke AI-bots jouw site mogen lezen
Stel in robots.txt zelf in of GPTBot, ClaudeBot, PerplexityBot en Google-Extended je site mogen crawlen, en test het gratis met Search Console.
⚡ Key Takeaways voor KMO-Bestuurders
- ✓Van Zoekwoorden naar Vector Embeddings: ChatGPT & Perplexity zoeken niet naar geïsoleerde trefwoorden, maar ontleden bedrijfsentiteiten.
- ✓Citaat-Autoriteit: AI-engines adviseren bedrijven die gestructureerde JSON-LD kennisgrafieken en heldere antwoordblokken hanteren.
- ✓Direct Resultaat: Belgische KMO's die GEO toepassen behalen tot 3.4x meer offertes via AI Search assistants.

Elke grote AI-chatbot stuurt een eigen crawler langs je website: GPTBot van OpenAI, ClaudeBot van Anthropic, PerplexityBot van Perplexity en Google-Extended van Google. Die bots lezen je pagina's om modellen te trainen of om antwoorden op te bouwen, vaak zonder dat je het merkt. Met een paar regels in je robots.txt-bestand bepaal je zelf wie binnenkomt en wie niet.
Key takeaways
- GPTBot, ClaudeBot, PerplexityBot en Google-Extended zijn vier aparte user-agents die je los van elkaar mag toelaten of blokkeren.
- Toegang geven kan je zichtbaarheid in AI-antwoorden vergroten, blokkeren beschermt je content tegen ongevraagd hergebruik.
- Je robots.txt-bestand staat altijd op hetzelfde adres, namelijk jouwsite.nl/robots.txt, en een tikfout in een user-agent-naam maakt die hele regel onzichtbaar.
- Het robots.txt-rapport in Google Search Console laat gratis zien of je bestand foutloos leesbaar is, ook voor de Google-Extended-regel.
- Een blokkade in robots.txt is een verzoek, geen slot: serieuze aanbieders houden zich eraan, maar een garantie is het niet.
Stap 1: Zoek je huidige robots.txt-bestand op
Typ jouwsite.nl/robots.txt in je browser, met je eigen domeinnaam in plaats van jouwsite.nl. Bestaat het bestand al, dan zie je een lijst met User-agent- en Disallow-regels, vaak aangevuld met een verwijzing naar je sitemap. Bestaat het nog niet, dan krijg je een foutmelding en begin je met een leeg bestand.
Gebruik je WordPress, dan regelt een SEO-plugin zoals Yoast of Rank Math meestal de inhoud en vind je een editor in het instellingenmenu van die plugin. Gebruik je Shopify, Wix of een andere platformoplossing, dan ligt de bewerkingsmogelijkheid vaak beperkter en moet je in de instellingen van het platform zelf zoeken. Heb je een eigen server, dan bewerk je het bestand rechtstreeks via FTP of de bestandsbeheerder van je hosting. Dit is gelukt zodra je de huidige inhoud van het bestand kunt lezen en weet waar je hem kunt aanpassen.
Stap 2: Bepaal per AI-bot of je hem toelaat of blokkeert
GPTBot is de crawler van OpenAI die pagina's verzamelt om ChatGPT te trainen. ClaudeBot doet hetzelfde voor Anthropic en Claude. PerplexityBot haalt content op voor de antwoorden van Perplexity, vaak actueler dan een trainingsdataset omdat dit dichter bij live opzoeken zit. Google-Extended is geen aparte crawler maar een instelling die bepaalt of Google jouw content mag gebruiken voor Gemini en AI-functies in de zoekresultaten, los van de gewone Googlebot die je site indexeert voor het klassieke zoekresultaat.
Wil je dat klanten je bedrijf tegenkomen in een antwoord van ChatGPT, Claude of Perplexity, dan laat je die bots toe. Heb je content die je niet ongevraagd herverwerkt wilt zien, zoals een betaalde gids of exclusief onderzoek, dan blokkeer je de bots voor die specifieke pagina's of voor de hele site. Er is geen kant-en-klare juiste keuze: dit is een strategische afweging tussen zichtbaarheid en controle, en je mag per bot een andere keuze maken.
Stap 3: Schrijf de regels en zet ze in robots.txt
Elke regel begint met de naam van de bot, gevolgd door wat je toestaat of weigert. Wil je GPTBot volledig weren, dan schrijf je dit:
User-agent: GPTBotDisallow: /
Wil je ClaudeBot juist overal toelaten, dan schrijf je dit:
User-agent: ClaudeBotAllow: /
Wil je PerplexityBot alleen weren uit een specifieke map, bijvoorbeeld je ledenomgeving, dan schrijf je dit:
User-agent: PerplexityBotDisallow: /leden/
En voor Google-Extended werkt hetzelfde principe:
User-agent: Google-ExtendedDisallow: /
Zet elke regel als apart blok onder elkaar in je robots.txt-bestand en laat je bestaande regels, zoals die voor Googlebot of je sitemap, gewoon staan. Sla het bestand op als platte tekst met de naam robots.txt, precies zo geschreven, in de hoofdmap van je website.
Stap 4: Test je bestand en controleer of het live staat
Open Google Search Console voor je domein en ga naar het robots.txt-rapport onder Instellingen. Daar zie je of Google je bestand kan ophalen, of er syntaxfouten in staan en wanneer Google het voor het laatst heeft ingelezen. Staat er een foutmelding bij een van je regels, herstel die dan en vraag daarna een nieuwe controle aan.
Wil je vooraf al testen of een specifieke regel doet wat je bedoelt, gebruik dan een externe robots.txt-tester zoals die van technicalseo.com. Daar voer je een URL van je site in samen met de naam van een bot, bijvoorbeeld GPTBot, en zie je meteen of die URL wordt toegelaten of geblokkeerd volgens je huidige bestand. Dit is gelukt zodra je zowel in Search Console als in de externe tester geen foutmeldingen meer ziet en de uitkomst overeenkomt met wat je wilde instellen.
Aanbevolen platforms en tools
| Tool | Wat het doet | Kosten |
|---|---|---|
| Google Search Console | Toont het robots.txt-rapport van je eigen site: leest Google het bestand correct, en staan er syntaxfouten in. | Gratis |
| Dark Visitors | Houdt een actuele lijst bij van bekende AI-crawlers en helpt je kant-en-klare robots.txt-regels samen te stellen om ze toe te laten of te weren. | Gratis |
| technicalseo.com Robots.txt Tester | Simuleert of een specifieke user-agent, waaronder AI-bots, een bepaalde URL van je site mag bezoeken volgens je huidige regels. | Gratis |
| Screaming Frog SEO Spider | Doorzoekt je site zoals een crawler en toont per pagina of robots.txt die blokkeert of toelaat. | Gratis instapniveau voor een beperkt aantal URL's, betaald jaarabonnement voor onbeperkt gebruik |
| Cloudflare | Beheert en blokkeert AI-crawlers al op netwerkniveau, nog voordat ze je robots.txt bereiken. | Gratis basisplan, betaalplannen vanaf een klein bedrag per maand voor uitgebreidere botcontrole |
Tips en tricks
- Google-Extended blokkeren stopt niet dat Googlebot je site indexeert voor de gewone zoekresultaten. Dat zijn twee losse regels met een andere user-agent.
- Niet elke AI-bot houdt zich aan robots.txt. Controleer in je serverlogs af en toe of een bot zich effectief aan je regels houdt, vooral bij content die je echt wilt afschermen.
- Een lege Disallow-regel, dus
Disallow:zonder waarde erachter, betekent dat alles is toegestaan. AlleenDisallow: /blokkeert de hele site voor die bot. - Wildcardtekens zoals * en $ werken in robots.txt, maar niet elke bot ondersteunt ze op dezelfde manier. Test een regel met een wildcard dus altijd apart na.
- Een wijziging in robots.txt wordt niet direct overal opgepikt. Bots lezen het bestand periodiek opnieuw in, dus reken niet op een blokkade binnen enkele minuten.
Doe de zelfscan
Weet je welke AI-bots je site nu al bezoeken?
Kijk in je serverlogs of in de crawlstatistieken van Google Search Console naar user-agents zoals GPTBot, ClaudeBot en PerplexityBot. Zie je daar niets van terug, dan heb je waarschijnlijk nog geen robots.txt-regels voor AI-bots staan en begin je vanaf nul.
Heb je een reden om AI-bots juist toe te laten?
Wil je dat klanten je bedrijf tegenkomen in antwoorden van ChatGPT, Claude of Perplexity, dan helpt toegang geven daarbij. Weet je het nog niet zeker, kies dan voorlopig bewust een richting en leg die keuze na een paar maanden opnieuw naast je statistieken.
Bevat je site content die je niet ongevraagd herverwerkt wilt zien?
Denk aan een betaalde cursus, exclusief onderzoek of een prijslijst voor klanten. Staat die achter een gewone pagina zonder login, dan is een Disallow-regel voor de betrokken AI-bots het enige dat je zelf kunt regelen. Overweeg voor echt gevoelige content ook een login of een paywall.
Heb je je robots.txt ooit getest na de laatste wijziging?
Een tikfout in een user-agent-naam maakt de hele regel onzichtbaar voor die bot. Is dat nog niet gebeurd, open dan nu het robots.txt-rapport in Search Console of de tester van technicalseo.com en controleer elke regel opnieuw.
Robots.txt aanpassen kost je een kwartier zodra je weet welke bots je wilt toelaten en welke niet. Twijfel je over de juiste keuze voor jouw site, of wil je dat iemand de regels voor je nakijkt voordat je ze live zet, dan denkt HisarWeb daar graag in mee.
Gerelateerde Artikelen
Klaar om te starten?


