Dlaczego AI cytuje jedne strony, a inne ignoruje

Między dwiema stronami o tej samej wiedzy o tym, która zostanie zacytowana, nie decyduje jakość. Decyduje to, czy z jednej z nich da się wyodrębnić zdanie, które stoi samo i jest sprawdzalne.

Z pola jednakowych słabych form dokładnie jedna zostaje ujęta światłem i wysuwa się do przodu

Najważniejsze w skrócie

  • Cytowane są fragmenty, nie strony – dlatego ułożenie decyduje bardziej niż jakość całości.
  • Cytowane źródła mają wspólnych sześć cech: dająca się wyodrębnić odpowiedź, sprawdzalna informacja, rozpoznawalna odpowiedzialność, aktualność, czytelność techniczna i bliskość tematyczna otoczenia.
  • Trzy powody wykluczają mocne strony: treść powstaje dopiero przez JavaScript, strona jest zablokowana albo stwierdzenia są rozproszone tylko w tekście ciągłym.
  • Sprawdzalna własna informacja jest najmocniejszym pojedynczym czynnikiem – to powód, dla którego model wymieni was zamiast ogólnego źródła.

Gdy system buduje odpowiedź, wybiera źródła nie według sympatii czy autorytetu, lecz według przydatności. Pytanie brzmi zawsze tak samo: czy ta strona dostarcza wycinka tekstu, który odpowiada na zadane pytanie, jest sam w sobie zrozumiały i daje się poprzeć?

Sześć cech

1. Dająca się wyodrębnić odpowiedź

Fragment odpowiadający na pytanie w dwóch do czterech zdań w całości, bez odsyłania do otaczającego tekstu. Zdecydowanie najważniejsza cecha – i jedyna, którą ma się w pełni w swoim ręku.

2. Sprawdzalna własna informacja

Liczba, procedura, okres, doświadczenie z zakresem obowiązywania. To powód, dla którego model wymieni was zamiast ogólnego źródła: mówicie coś, czego gdzie indziej nie ma.

3. Rozpoznawalna odpowiedzialność

Autor z rolą, firma z adresem, data ostatniego sprawdzenia – widoczne na stronie i w danych strukturalnych, z tą samą wartością. Szczególnie ważne przy tematach dotykających pieniędzy, zdrowia albo prawa.

4. Zrozumiała aktualność

Data, która się zgadza, i treści pasujące do tej daty. Data aktualizacji z wczoraj przy tekście opisującym dawno nieaktualny stan jest gorsza niż żadna.

5. Czytelność techniczna

Treść stoi w dostarczonym HTML, a nie dopiero po wykonaniu JavaScriptu. Czysta hierarchia nagłówków, brak blokady w robots.txt dla pobrań w czasie działania.

6. Bliskość tematyczna otoczenia

Strona w polu, które serwis rozpoznawalnie zajmuje, jest oceniana jako źródło fachowe prędzej niż pojedynczy artykuł między dwudziestoma niepowiązanymi tematami. To powód, dla którego klastry tematyczne działają.

Czy wiesz, że…?

Cecha druga jest właściwą dźwignią dla małych firm. Przy wiedzy ogólnej konkurujecie z dużymi portalami i przegrywacie – tam nie ma powodu, by wymieniać akurat was.

Przy sprawdzalnej własnej informacji to wy jesteście źródłem. „W praktyce oczyszczenie rozrośniętej listy kontaktów trwa jeden do trzech dni” nie jest stwierdzeniem powszechnie znanym – pochodzi od kogoś, kto to robił, i właśnie dlatego nadaje się do cytowania. Jedno zdanie z własnym doświadczeniem waży więcej niż trzy akapity streszczenia.

Trzy powody, dla których mocne strony odpadają

PowódPo czym poznaćNakład na usunięcie
Treść powstaje dopiero w przeglądarcekod źródłowy strony nie zawiera tekstuduży – kwestia architektury
Zablokowane pobrania w czasie działaniarobots.txt blokuje ChatGPT-User i spółkęminuty
Stwierdzenia rozproszone tylko w tekście ciągłymżaden akapit sam nie odpowiada na pytanieśredni – przebudowa akapitów

Drugi powód jest najbardziej irytujący, bo usuwa się go w minuty, a mimo to występuje często – zwykle jako skutek uboczny ryczałtowej blokady „wszystkich botów AI”.

Z praktyki

Wzorzec pokazujący się przy analizie cytowanych źródeł: rzadko są to obszerne artykuły przeglądowe. Są to krótkie strony odpowiadające w całości dokładnie na jedno pytanie – często takie, które we własnej firmie uchodzą za produkt uboczny.

Artykuł o 900 słowach z wyraźną liczbą i nazwanym zakresem obowiązywania bywa cytowany częściej niż przewodnik o 2500 słowach na ten sam temat, w którym ta sama liczba stoi w jedenastym akapicie. Dla planowania treści znaczy to: więcej ostro odgraniczonych pojedynczych pytań, mniej wszechobejmujących przewodników.

Co konkretnie można zrobić

  1. Zrobić test wyodrębnienia. Skopiować dowolny akapit do pustego dokumentu: czy sam odpowiada na rozpoznawalne pytanie? W większości artykułów przechodzą to dwa akapity na dziesięć.
  2. Dopisać własne dane. Do każdego artykułu co najmniej jedna liczba, procedura albo doświadczenie z zakresem obowiązywania – z własnej firmy, nie ze źródła.
  3. Krótkie streszczenie na górę. Cztery pełne stwierdzenia. Piętnaście minut na artykuł, bez zmiany treści.
  4. Sprawdzić pobrania w czasie działania. Zajrzeć do robots.txt, czy ChatGPT-User, Perplexity-User i Claude-User są dopuszczeni.
  5. Przeanalizować dziennik serwera. Czy wasze strony są w ogóle pobierane? Bez dostępu nie ma cytowania – a to inny plac budowy niż cytowalność.
Prompt
Oceń, dlaczego ta strona zostałaby zacytowana przez silniki
odpowiedzi albo nie. Bądź surowy; niczego nie chwal; nie
przepisuj tekstu.

Tekst strony:
[wklej tekst]

Dane dodatkowe:
- Czy treść stoi w dostarczonym HTML? [tak / nie / nieznane]
- Czy autor, rola i data sprawdzenia są widoczne? [tak / nie]
- Jakie pole nasza strona poza tym zajmuje? [tematy]

Zadania:
1. Sprawdź sześć cech osobno – dająca się wyodrębnić odpowiedź,
   sprawdzalna własna informacja, rozpoznawalna
   odpowiedzialność, aktualność, czytelność techniczna,
   bliskość tematyczna otoczenia. Podaj przy każdej cesze
   spełniona/częściowo/niespełniona z uzasadnieniem na
   przykładzie z tekstu.
2. Wskaż trzy akapity, które najprędzej zostałyby zacytowane, i
   powiedz przy każdym, na jakie pytanie odpowiada.
3. Wskaż każde stwierdzenie w tekście, które mogłoby stać także
   na każdej innej stronie – czyli nie zawiera nic własnego.
4. Sformułuj trzy pytania do mnie, których odpowiedzi dałyby
   sprawdzalne własne informacje, brakujące dziś w tekście.

Nie wymyślaj liczb ani źródeł.

Podsumowanie

Cytowane jest to, co da się wyodrębnić i co mówi coś, czego gdzie indziej nie ma. Jedno i drugie jest kwestią ułożenia i substancji, nie jakości całości artykułu.

Dla małych firm dźwignia leży jednoznacznie przy cesze drugiej: przy wiedzy ogólnej nie ma powodu, by was wymieniać. Przy własnej liczbie z nazwanym zakresem obowiązywania to wy jesteście źródłem.

Częste pytania

Dlaczego AI cytuje jedne strony, a innych nie?

Bo wybiera fragmenty, nie strony. Cytowane jest to, co da się wyodrębnić i pozostaje zrozumiałe samo, co zawiera sprawdzalną informację, gdzie widać, kto za tym stoi, co jest aktualne i czytelne technicznie – i co stoi w polu, które serwis rozpoznawalnie zajmuje.

Jaki jest najmocniejszy pojedynczy czynnik?

Sprawdzalna własna informacja: liczba, procedura, doświadczenie z nazwanym zakresem obowiązywania. Przy wiedzy ogólnej nie ma powodu, by wymieniać akurat małą firmę – przy własnej informacji to ona jest źródłem.

Dlaczego treściowo mocna strona bywa nigdy niecytowana?

Z trzech powodów: treść powstaje dopiero przez JavaScript i nie stoi w dostarczonym HTML; pobrania w czasie działania są zablokowane w robots.txt, często jako skutek uboczny ryczałtowej blokady wszystkich botów AI; albo stwierdzenia są rozproszone po tekście ciągłym tak, że żaden akapit sam nie odpowiada na pytanie.

Czy częściej cytowane są długie czy krótkie artykuły?

W praktyce raczej krótkie, ostro odgraniczone. Artykuł o około 900 słowach z wyraźną liczbą i nazwanym zakresem obowiązywania bywa cytowany częściej niż obszerny przewodnik, w którym ta sama liczba stoi w jedenastym akapicie – bo krótki artykuł łatwiej wyodrębnić.

Jak sprawdzić własną cytowalność?

Testem wyodrębnienia: skopiować dowolny akapit do pustego dokumentu i przeczytać. Czy sam odpowiada w całości na rozpoznawalne pytanie? W większości artykułów przechodzą to około dwa akapity na dziesięć – ten odsetek jest najbardziej wymownym wskaźnikiem cytowalności.

Marketing, który konfiguruje się sam

Beta Studio Engine jest otwarta. Zarezerwuj miejsce i współtwórz od początku.

Dołącz do bety →
← Powrót do listy