AI-crawlers toestaan of blokkeren? De afweging
De beslissing wordt meestal als principekwestie gevoerd en is een bedrijfskwestie: wie met content geld verdient, verliest door toestaan. Wie via content opdrachten wint, verliest door blokkeren – en wel meer.
Het belangrijkste kort
- Er zijn twee soorten toegang: vooruitkijkende verzamelaars en ophaalacties tijdens het beantwoorden. Ze laten zich apart sturen – en juist daarin ligt de bruikbaarste oplossing.
- Wie opdrachten verkoopt, zou het ophalen tijdens het beantwoorden in elk geval moeten toestaan: het levert vermeldingen op bij mensen die middenin hun zoektocht naar een oplossing zitten.
- Wie content verkoopt of aan advertenties verdient, heeft goede redenen om de verzamelaars te blokkeren.
- robots.txt is een verzoek, geen slot. Wie het technisch wil afdwingen, heeft een blokkade op serverniveau nodig.
De twee soorten toegang
Vooruitkijkende verzamelaars
Halen content op los van een concrete vraag – voor training of voor een eigen zoekindex. Voorbeelden: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
Nut voor jullie: indirect – de content staat in een index ter beschikking. Kosten: de content wordt gebruikt zonder dat iemand jullie pagina bezoekt.
Ophalen tijdens het beantwoorden
Haalt een pagina op op het moment dat iemand een passende vraag heeft gesteld. Voorbeelden: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.
Nut voor jullie: direct – daaruit ontstaan vermeldingen en verwijzingen in concrete antwoorden. Kosten: praktisch geen.
Wist je dat?
Wie zonder onderscheid „alle AI-bots“ blokkeert, blokkeert beide soorten – en verliest daarmee precies het deel dat hem van nut is. De vermelding als bron in een antwoord veronderstelt dat de pagina tijdens het beantwoorden opgehaald mag worden.
Voor een bedrijf dat opdrachten verkoopt, is dat de slechtst denkbare ruil: je verhindert een aanbeveling aan iemand die middenin zijn zoektocht naar een oplossing zit, om te verhinderen dat een model leert uit een openbaar toegankelijke vakbijdrage.
Drie strategieën
| Strategie | Verzamelaars | Ophalen bij beantwoorden | Past bij |
|---|---|---|---|
| Open | toestaan | toestaan | dienstverleners, B2B, advies |
| Gemengd | blokkeren | toestaan | uitgevers, cursusaanbieders, vakmedia |
| Gesloten | blokkeren | blokkeren | betaalde content, afgeschermde delen |
Voor de meeste kleine en middelgrote bedrijven is „open“ de juiste keuze. De gemengde strategie is de zinvolle tussenweg voor iedereen bij wie de content zelf het product is.
De robots.txt
Voor de open strategie met uitdrukkelijke vermelding – dat is niet strikt noodzakelijk, maar maakt de beslissing zichtbaar en legt haar vast:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Voor de gemengde strategie worden de verzamelaars geblokkeerd en de ophaalacties tijdens het beantwoorden toegestaan:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-User Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Google-Extended stuurt alleen het gebruik voor Googles AI-producten – niet de gewone zoekindexering. Wie per ongeluk Googlebot blokkeert, verdwijnt uit de zoekmachine. Die twee namen zijn verschillende dingen en worden geregeld verwisseld.
Wat robots.txt niet doet
Drie beperkingen die je zou moeten kennen voordat je op het bestand vertrouwt:
- Het is een verzoek. Serieuze aanbieders houden zich eraan, andere niet. Wie het technisch wil afdwingen, heeft een regel op server- of firewallniveau op basis van de kenmerknaam nodig.
- Het werkt niet met terugwerkende kracht. Wat al verzameld is, verdwijnt er niet door.
- Het beschermt niet tegen weergave uit andere bronnen. Als jullie content elders wordt geciteerd, helpt jullie eigen bestand niet.
Voordat je de beslissing neemt, loont een blik in het serverlogboek: welke van deze kenmerknamen komen überhaupt voor, hoe vaak, en welke pagina's halen ze op?
Bij kleine websites is de uitkomst vaak ontnuchterend – weinig bezoeken, weinig pagina's. Dan is de vraag praktisch bijzaak, en de eigenlijke opgave is een andere: überhaupt gevonden worden. Een blokkade voor crawlers die helemaal niet komen, lost geen probleem op en voorkomt alleen dat het later anders wordt.
Het juridische kader
In de EU bestaat een voorbehoud voor tekst- en datamining: rechthebbenden kunnen het gebruik van hun content voor geautomatiseerde verwerking uitdrukkelijk verbieden, en dat voorbehoud moet machineleesbaar worden verklaard. De robots.txt is daarvoor de gebruikelijke vorm, soms aangevuld met een bepaling in de gebruiksvoorwaarden.
Voor Zwitserland geldt dat niet rechtstreeks; wie zijn content ook op EU-gebruikers richt, zou het voorbehoud toch moeten verklaren als hij het wenst. Dat is een punt dat een vakkundige zou moeten beoordelen – deze bijdrage vervangt geen juridisch advies.
Conclusie
De vraag is geen principiële, maar hangt aan het bedrijfsmodel. Wie content verkoopt, blokkeert de verzamelaars. Wie opdrachten verkoopt, laat beide toe – en wint daarmee vermeldingen bij mensen die net naar een oplossing zoeken.
In elk geval geldt: bekijk het ophalen tijdens het beantwoorden apart. Dat zonder onderscheid meeblokkeren is de vaakst gemaakte en duurste fout in deze beslissing.
Veelgestelde vragen
Zou je AI-crawlers moeten blokkeren?
Dat hangt van het bedrijfsmodel af. Wie met content zelf geld verdient – uitgevers, cursusaanbieders, vakmedia – heeft goede redenen om de vooruitkijkende verzamelaars te blokkeren. Wie opdrachten of diensten verkoopt, verliest door blokkeren meer dan hij wint.
Wat is het verschil tussen verzamelaars en ophalen tijdens het beantwoorden?
Verzamelaars als GPTBot, ClaudeBot of PerplexityBot halen content op los van een concrete vraag, voor training of een eigen index. Ophaalacties als ChatGPT-User, Perplexity-User of OAI-SearchBot halen een pagina precies dan op wanneer iemand een passende vraag heeft gesteld – daaruit ontstaan vermeldingen en verwijzingen.
Wat is Google-Extended?
Een kenmerknaam waarmee het gebruik van content voor Googles AI-producten te sturen is – niet de gewone zoekindexering. Het is iets anders dan Googlebot; wie die per ongeluk blokkeert, verdwijnt uit de zoekmachine.
Houdt elke crawler zich aan de robots.txt?
Nee. Het is een verzoek, geen technische blokkade. Serieuze aanbieders houden zich eraan, andere niet. Wie een blokkade wil afdwingen, heeft een regel op server- of firewallniveau op basis van de kenmerknaam nodig – en zelfs dan werkt die niet met terugwerkende kracht op al verzamelde content.
Hoe toets je welke crawlers er überhaupt komen?
Via het serverlogboek, gefilterd op de bekende kenmerknamen. Dat laat zien welke crawlers hoe vaak welke pagina's ophalen. Bij kleine websites is de uitkomst vaak overzichtelijk – dan is de blokkeervraag bijzaak vergeleken met de opgave om überhaupt gevonden te worden.
Marketing die zichzelf opzet
De bèta van de Studio Engine is open. Reserveer je plek en denk vanaf het begin mee.
Deelnemen aan de bèta →