Waarom een AI sommige pagina's citeert en andere negeert
Tussen twee pagina's met dezelfde kennis beslist niet de kwaliteit welke wordt geciteerd. Beslissend is of zich uit een ervan een zin laat losmaken die op zichzelf staat en te toetsen is.
Het belangrijkste kort
- Geciteerd worden passages, geen pagina's – daarom beslist de ordening meer dan de algehele kwaliteit.
- Zes eigenschappen hebben geciteerde bronnen gemeen: een losmaakbaar antwoord, een toetsbaar gegeven, herkenbare verantwoordelijkheid, actualiteit, technische leesbaarheid en thematische nabijheid.
- Drie redenen sluiten sterke pagina's uit: de inhoud ontstaat pas door JavaScript, de pagina is geblokkeerd, of de uitspraken staan alleen verspreid in de lopende tekst.
- Het toetsbare eigen gegeven is de sterkste afzonderlijke factor – het is de reden waarom een model jullie noemt in plaats van een algemene bron.
Wanneer een systeem een antwoord bouwt, kiest het bronnen niet op sympathie of gezag, maar op bruikbaarheid. De vraag is altijd dezelfde: levert deze pagina een tekstfragment dat de gestelde vraag beantwoordt, op zichzelf begrijpelijk is en zich laat onderbouwen?
De zes eigenschappen
1. Losmaakbaar antwoord
Een passage die de vraag in twee tot vier zinnen volledig beantwoordt, zonder naar de omringende tekst te verwijzen. Veruit de belangrijkste eigenschap – en de enige die je volledig zelf in de hand hebt.
2. Toetsbaar eigen gegeven
Een cijfer, een werkwijze, een tijdsbestek, een ervaring met een reikwijdte. Dat is de reden waarom een model jullie noemt in plaats van een algemene bron: jullie zeggen iets wat elders niet staat.
3. Herkenbare verantwoordelijkheid
Auteur met rol, bedrijf met adres, datum van de laatste controle – zichtbaar op de pagina en in de gestructureerde data, met dezelfde waarde. Vooral belangrijk bij onderwerpen die geld, gezondheid of recht raken.
4. Navolgbare actualiteit
Een datum dat klopt, en inhoud die bij dat datum past. Een wijzigingsdatum van gisteren bij een tekst die een allang achterhaalde stand beschrijft, is slechter dan helemaal geen datum.
5. Technische leesbaarheid
De inhoud staat in de uitgeleverde HTML, niet pas na uitvoering van JavaScript. Een nette koppenhiërarchie, geen blokkade in de robots.txt voor het ophalen tijdens het beantwoorden.
6. Thematische nabijheid van de omgeving
Een pagina in een veld dat de website herkenbaar bezet, wordt eerder als vakbron gewaardeerd dan een losse bijdrage tussen twintig onsamenhangende onderwerpen. Dat is de reden waarom themaclusters werken.
Wist je dat?
Eigenschap twee is de eigenlijke hefboom voor kleine bedrijven. Bij algemene kennis concurreren jullie met grote portalen en verliezen jullie – daar is geen reden om uitgerekend jullie te noemen.
Bij een toetsbaar eigen gegeven zijn jullie de bron. „In de praktijk duurt het opschonen van een gegroeide contactenlijst één tot drie dagen“ is geen algemeen bekende uitspraak – ze komt van iemand die het heeft gedaan, en juist daarom is ze citeerbaar. Eén zin met eigen ervaring weegt zwaarder dan drie alinea's samenvatting.
Drie redenen waarom sterke pagina's afvallen
| Reden | Waaraan je het herkent | Moeite om het te verhelpen |
|---|---|---|
| Inhoud ontstaat pas in de browser | de paginabron bevat de tekst niet | hoog – architectuurvraag |
| Ophalen tijdens beantwoorden geblokkeerd | robots.txt blokkeert ChatGPT-User & co. | minuten |
| Uitspraken alleen verspreid in de lopende tekst | geen alinea beantwoordt op zichzelf een vraag | gemiddeld – alinea's verbouwen |
De tweede reden is de ergerlijkste, omdat hij in minuten is verholpen en toch vaak voorkomt – meestal als bijwerking van een ongenuanceerde blokkade van „alle AI-bots“.
Een patroon dat opvalt bij het analyseren van geciteerde bronnen: het zijn zelden de omvangrijke overzichtsbijdragen. Het zijn korte pagina's die precies één vraag volledig beantwoorden – vaak pagina's die intern als bijproduct gelden.
Een bijdrage van 900 woorden met één helder cijfer en een benoemde reikwijdte wordt vaker geciteerd dan een gids van 2.500 woorden over hetzelfde onderwerp waarin datzelfde cijfer in alinea elf staat. Voor de contentplanning betekent dat: meer scherp afgebakende losse vragen, minder allesomvattende gidsen.
Wat je concreet kunt doen
- De losmaaktoets doen. Kopieer een willekeurige alinea naar een leeg document: beantwoordt hij op zichzelf een herkenbare vraag? Bij de meeste bijdragen slagen twee van de tien alinea's.
- Eigen gegevens toevoegen. Per bijdrage minstens één cijfer, één werkwijze of één ervaring met een reikwijdte – uit het eigen bedrijf, niet uit een bron.
- Korte samenvatting naar boven. Vier volledige uitspraken. Vijftien minuten per bijdrage, zonder wijziging aan de inhoud.
- Ophalen tijdens beantwoorden toetsen. Kijk in de robots.txt of ChatGPT-User, Perplexity-User en Claude-User zijn toegestaan.
- Serverlogboek analyseren. Worden jullie pagina's überhaupt opgehaald? Zonder toegang geen citaat – en dat is een ander werkterrein dan de citeerbaarheid.
Beoordeel waarom deze pagina door antwoordmachines wel of niet zou worden geciteerd. Wees streng; prijs niets; herschrijf de tekst niet. Paginatekst: [tekst invoegen] Aanvullende gegevens: - Staat de inhoud in de uitgeleverde HTML? [ja / nee / onbekend] - Zijn auteur, rol en controledatum zichtbaar? [ja / nee] - Welk veld bezet onze website verder? [onderwerpen] Opdrachten: 1. Toets de zes eigenschappen afzonderlijk – losmaakbaar antwoord, toetsbaar eigen gegeven, herkenbare verantwoordelijkheid, actualiteit, technische leesbaarheid, thematische nabijheid van de omgeving. Geef per eigenschap voldaan/deels/niet voldaan met onderbouwing aan een voorbeeld uit de tekst. 2. Noem de drie alinea's die het eerst zouden worden geciteerd, en zeg bij elk welke vraag hij beantwoordt. 3. Noem elke uitspraak in de tekst die ook op elke andere pagina zou kunnen staan – die dus niets eigens bevat. 4. Formuleer drie vragen aan mij waarvan de antwoorden toetsbare eigen gegevens zouden opleveren die de tekst vandaag mist. Verzin geen cijfers en geen bronnen.
Conclusie
Geciteerd wordt wat zich laat losmaken en iets zegt dat elders niet staat. Beide zijn een kwestie van ordening en substantie, niet van de algehele kwaliteit van een bijdrage.
Voor kleine bedrijven ligt de hefboom duidelijk bij eigenschap twee: bij algemene kennis is er geen reden om jullie te noemen. Bij een eigen cijfer met een benoemde reikwijdte zijn jullie de bron.
Veelgestelde vragen
Waarom citeert een AI sommige pagina's en andere niet?
Omdat hij passages kiest, geen pagina's. Geciteerd wordt wat zich laat losmaken en op zichzelf begrijpelijk blijft, wat een toetsbaar gegeven bevat, waar herkenbaar is wie erachter staat, wat actueel en technisch leesbaar is – en wat staat in een veld dat de website herkenbaar bezet.
Wat is de sterkste afzonderlijke factor?
Een toetsbaar eigen gegeven: een cijfer, een werkwijze, een ervaring met een benoemde reikwijdte. Bij algemene kennis is er geen reden om uitgerekend een klein bedrijf te noemen – bij een eigen gegeven is het de bron.
Waarom wordt een inhoudelijk sterke pagina soms nooit geciteerd?
Om drie redenen: de inhoud ontstaat pas door JavaScript en staat niet in de uitgeleverde HTML; het ophalen tijdens het beantwoorden is in de robots.txt geblokkeerd, vaak als bijwerking van een ongenuanceerde blokkade van alle AI-bots; of de uitspraken zijn over de lopende tekst verspreid, zodat geen alinea op zichzelf een vraag beantwoordt.
Worden lange of korte bijdragen vaker geciteerd?
In de praktijk eerder korte, scherp afgebakende. Een bijdrage van rond de 900 woorden met één helder cijfer en een benoemde reikwijdte wordt vaker geciteerd dan een omvangrijke gids waarin datzelfde cijfer in alinea elf staat – omdat de korte bijdrage zich makkelijker laat losmaken.
Hoe toets je de eigen citeerbaarheid?
Met de losmaaktoets: kopieer een willekeurige alinea naar een leeg document en lees hem. Beantwoordt hij op zichzelf een herkenbare vraag volledig? Bij de meeste bijdragen slagen ongeveer twee van de tien alinea's – dat aandeel is het meest zeggende kengetal voor citeerbaarheid.
Marketing die zichzelf opzet
De bèta van de Studio Engine is open. Reserveer je plek en denk vanaf het begin mee.
Deelnemen aan de bèta →