Hvorfor en KI siterer noen sider og ignorerer andre

Mellom to sider med samme kunnskap er det ikke kvaliteten som avgjør hvilken som blir sitert. Det avgjørende er om det lar seg løsrive en setning fra en av dem som står på egne ben og er etterprøvbar.

Ut av et felt med like svake former blir nøyaktig én truffet av lys og trer fram

Det viktigste kort

  • Det er avsnitt som siteres, ikke sider – derfor avgjør oppstillingen mer enn den samlede kvaliteten.
  • Seks egenskaper har siterte kilder til felles: løsrivbart svar, etterprøvbar opplysning, synlig ansvar, aktualitet, teknisk lesbarhet og tematisk nærhet.
  • Tre grunner utelukker sterke sider: innholdet oppstår først gjennom JavaScript, siden er sperret, eller utsagnene står bare fordelt i den løpende teksten.
  • Den etterprøvbare egne opplysningen er den sterkeste enkeltfaktoren – den er grunnen til at en modell nevner dere i stedet for en allmenn kilde.

Når et system bygger et svar, velger det ikke kilder etter sympati eller autoritet, men etter anvendelighet. Spørsmålet er alltid det samme: leverer denne siden et tekstutdrag som besvarer spørsmålet som ble stilt, er forståelig i seg selv og lar seg belegge?

De seks egenskapene

1. Løsrivbart svar

Et avsnitt som besvarer spørsmålet fullstendig i to til fire setninger, uten å vise til den omkringliggende teksten. Den klart viktigste egenskapen – og den eneste man har fullstendig i egen hånd.

2. Etterprøvbar egen opplysning

Et tall, en framgangsmåte, et tidsrom, en erfaring med angitt gyldighetsområde. Det er grunnen til at en modell nevner dere i stedet for en allmenn kilde: dere sier noe som ikke står andre steder.

3. Synlig ansvar

Forfatter med rolle, bedrift med adresse, dato for siste kontroll – synlig på siden og i de strukturerte dataene, med samme verdi. Særlig viktig ved temaer som berører penger, helse eller jus.

4. Etterprøvbar aktualitet

En dato som stemmer, og innhold som passer til denne datoen. En endringsdato fra i går på en tekst som beskriver en for lengst utdatert tilstand, er verre enn ingen dato i det hele tatt.

5. Teknisk lesbarhet

Innholdet står i den utleverte HTML-en, ikke først etter at JavaScript er kjørt. Ryddig overskriftshierarki, ingen sperre i robots.txt for oppslag i sanntid.

6. Tematisk nærhet i omgivelsene

En side i et felt nettstedet tydelig besetter, blir heller regnet som fagkilde enn et enkeltinnlegg mellom tjue usammenhengende temaer. Det er grunnen til at temaklynger virker.

Visste du at …?

Egenskap to er den egentlige spaken for små bedrifter. Ved allmenn kunnskap konkurrerer dere med store portaler og taper – der finnes ingen grunn til å nevne nettopp dere.

Ved en etterprøvbar egen opplysning er dere kilden. «I praksis tar oppryddingen i en kontaktliste som har vokst fram over tid, én til tre dager» er ikke et allment kjent utsagn – det stammer fra noen som har gjort det, og nettopp derfor er det siterbart. Én setning med egen erfaring veier mer enn tre avsnitt sammendrag.

Tre grunner til at sterke sider faller ut

GrunnHvordan man kjenner det igjenInnsats for å rette
Innholdet oppstår først i nettleserensidens kildekode inneholder ikke tekstenhøy – et arkitekturspørsmål
Oppslag i sanntid sperretrobots.txt sperrer ChatGPT-User & co.minutter
Utsagn bare fordelt i den løpende tekstenikke noe avsnitt besvarer et spørsmål alenemiddels – ombygging av avsnittene

Den andre grunnen er den mest ergerlige, fordi den er rettet på minutter og likevel forekommer ofte – som regel som bivirkning av en sperre av «alle KI-boter» over én kam.

Fra praksis

Et mønster som viser seg når man gjennomgår siterte kilder: det er sjelden de omfangsrike oversiktsinnleggene. Det er korte sider som besvarer nøyaktig ett spørsmål fullstendig – ofte slike som internt regnes som biprodukter.

Et innlegg på 900 ord med ett tydelig tall og et navngitt gyldighetsområde blir oftere sitert enn en guide på 2 500 ord om samme tema, der det samme tallet står i avsnitt elleve. For innholdsplanleggingen betyr det: flere skarpt avgrensede enkeltspørsmål, færre altomfattende guider.

Hva man konkret kan gjøre

  1. Ta løsrivningstesten. Kopier et vilkårlig avsnitt inn i et tomt dokument: besvarer det alene et gjenkjennelig spørsmål? Ved de fleste innlegg består to av ti avsnitt.
  2. Legg til egne opplysninger. For hvert innlegg minst ett tall, én framgangsmåte eller én erfaring med gyldighetsområde – fra egen virksomhet, ikke fra en kilde.
  3. Kort sammendrag øverst. Fire fullstendige utsagn. Femten minutter per innlegg, uten endring i innholdet.
  4. Kontroller oppslagene i sanntid. Se etter i robots.txt om ChatGPT-User, Perplexity-User og Claude-User er tillatt.
  5. Gjennomgå serverloggen. Blir sidene deres i det hele tatt hentet? Uten tilgang ingen sitering – og det er en annen byggeplass enn siterbarheten.
Prompt
Vurder hvorfor denne siden ville blitt sitert av svarmaskiner
eller ikke. Vær streng; ikke ros noe; ikke skriv om teksten.

Sidetekst:
[sett inn tekst]

Tilleggsopplysninger:
- Står innholdet i den utleverte HTML-en? [ja / nei / ukjent]
- Er forfatter, rolle og kontrolldato synlige? [ja / nei]
- Hvilket felt besetter nettstedet vårt ellers? [temaer]

Oppgaver:
1. Kontroller de seks egenskapene enkeltvis – løsrivbart svar,
   etterprøvbar egen opplysning, synlig ansvar,
   aktualitet, teknisk lesbarhet, tematisk nærhet i
   omgivelsene. Angi per egenskap oppfylt/delvis/ikke oppfylt
   med begrunnelse i et eksempel fra teksten.
2. Nevn de tre avsnittene som lettest ville blitt sitert, og
   si for hvert av dem hvilket spørsmål det besvarer.
3. Nevn hvert utsagn i teksten som også kunne stått på enhver
   annen side – altså ikke inneholder noe eget.
4. Formuler tre spørsmål til meg der svarene ville gitt etterprøvbare
   egne opplysninger som teksten mangler i dag.

Ikke finn på tall eller kilder.

Konklusjon

Det som siteres, er det som lar seg løsrive og sier noe som ikke står andre steder. Begge deler er et spørsmål om oppstilling og substans, ikke om den samlede kvaliteten i et innlegg.

For små bedrifter ligger spaken tydelig ved egenskap to: ved allmenn kunnskap finnes ingen grunn til å nevne dere. Ved et eget tall med navngitt gyldighetsområde er dere kilden.

Vanlige spørsmål

Hvorfor siterer en KI noen sider og andre ikke?

Fordi den velger avsnitt, ikke sider. Det som siteres, er det som lar seg løsrive og forblir forståelig i seg selv, som inneholder en etterprøvbar opplysning, der det er synlig hvem som står bak, som er aktuelt og teknisk lesbart – og som står i et felt nettstedet tydelig besetter.

Hva er den sterkeste enkeltfaktoren?

En etterprøvbar egen opplysning: et tall, en framgangsmåte, en erfaring med navngitt gyldighetsområde. Ved allmenn kunnskap finnes ingen grunn til å nevne nettopp en liten bedrift – ved en egen opplysning er den kilden.

Hvorfor blir en innholdssterk side av og til aldri sitert?

Av tre grunner: innholdet oppstår først gjennom JavaScript og står ikke i den utleverte HTML-en; oppslagene i sanntid er sperret i robots.txt, ofte som bivirkning av en sperre av alle KI-boter over én kam; eller utsagnene er fordelt utover den løpende teksten, slik at ikke noe avsnitt besvarer et spørsmål alene.

Blir lange eller korte innlegg oftest sitert?

I praksis heller korte og skarpt avgrensede. Et innlegg på rundt 900 ord med ett tydelig tall og navngitt gyldighetsområde blir oftere sitert enn en omfangsrik guide der det samme tallet står i avsnitt elleve – fordi det korte innlegget lettere lar seg løsrive.

Hvordan kontrollerer man sin egen siterbarhet?

Med løsrivningstesten: kopier et vilkårlig avsnitt inn i et tomt dokument og les. Besvarer det alene et gjenkjennelig spørsmål fullstendig? Ved de fleste innlegg består omtrent to av ti avsnitt – denne andelen er det mest talende nøkkeltallet for siterbarhet.

Markedsføring som setter seg opp selv

Betaen for Studio Engine er åpen. Sikre deg en plass og bidra fra starten.

Bli med i betaen →
← Tilbake til oversikten