Dlaczego AI cytuje jedne strony, a inne ignoruje
Między dwiema stronami o tej samej wiedzy o tym, która zostanie zacytowana, nie decyduje jakość. Decyduje to, czy z jednej z nich da się wyodrębnić zdanie, które stoi samo i jest sprawdzalne.
Najważniejsze w skrócie
- Cytowane są fragmenty, nie strony – dlatego ułożenie decyduje bardziej niż jakość całości.
- Cytowane źródła mają wspólnych sześć cech: dająca się wyodrębnić odpowiedź, sprawdzalna informacja, rozpoznawalna odpowiedzialność, aktualność, czytelność techniczna i bliskość tematyczna otoczenia.
- Trzy powody wykluczają mocne strony: treść powstaje dopiero przez JavaScript, strona jest zablokowana albo stwierdzenia są rozproszone tylko w tekście ciągłym.
- Sprawdzalna własna informacja jest najmocniejszym pojedynczym czynnikiem – to powód, dla którego model wymieni was zamiast ogólnego źródła.
Gdy system buduje odpowiedź, wybiera źródła nie według sympatii czy autorytetu, lecz według przydatności. Pytanie brzmi zawsze tak samo: czy ta strona dostarcza wycinka tekstu, który odpowiada na zadane pytanie, jest sam w sobie zrozumiały i daje się poprzeć?
Sześć cech
1. Dająca się wyodrębnić odpowiedź
Fragment odpowiadający na pytanie w dwóch do czterech zdań w całości, bez odsyłania do otaczającego tekstu. Zdecydowanie najważniejsza cecha – i jedyna, którą ma się w pełni w swoim ręku.
2. Sprawdzalna własna informacja
Liczba, procedura, okres, doświadczenie z zakresem obowiązywania. To powód, dla którego model wymieni was zamiast ogólnego źródła: mówicie coś, czego gdzie indziej nie ma.
3. Rozpoznawalna odpowiedzialność
Autor z rolą, firma z adresem, data ostatniego sprawdzenia – widoczne na stronie i w danych strukturalnych, z tą samą wartością. Szczególnie ważne przy tematach dotykających pieniędzy, zdrowia albo prawa.
4. Zrozumiała aktualność
Data, która się zgadza, i treści pasujące do tej daty. Data aktualizacji z wczoraj przy tekście opisującym dawno nieaktualny stan jest gorsza niż żadna.
5. Czytelność techniczna
Treść stoi w dostarczonym HTML, a nie dopiero po wykonaniu JavaScriptu. Czysta hierarchia nagłówków, brak blokady w robots.txt dla pobrań w czasie działania.
6. Bliskość tematyczna otoczenia
Strona w polu, które serwis rozpoznawalnie zajmuje, jest oceniana jako źródło fachowe prędzej niż pojedynczy artykuł między dwudziestoma niepowiązanymi tematami. To powód, dla którego klastry tematyczne działają.
Czy wiesz, że…?
Cecha druga jest właściwą dźwignią dla małych firm. Przy wiedzy ogólnej konkurujecie z dużymi portalami i przegrywacie – tam nie ma powodu, by wymieniać akurat was.
Przy sprawdzalnej własnej informacji to wy jesteście źródłem. „W praktyce oczyszczenie rozrośniętej listy kontaktów trwa jeden do trzech dni” nie jest stwierdzeniem powszechnie znanym – pochodzi od kogoś, kto to robił, i właśnie dlatego nadaje się do cytowania. Jedno zdanie z własnym doświadczeniem waży więcej niż trzy akapity streszczenia.
Trzy powody, dla których mocne strony odpadają
| Powód | Po czym poznać | Nakład na usunięcie |
|---|---|---|
| Treść powstaje dopiero w przeglądarce | kod źródłowy strony nie zawiera tekstu | duży – kwestia architektury |
| Zablokowane pobrania w czasie działania | robots.txt blokuje ChatGPT-User i spółkę | minuty |
| Stwierdzenia rozproszone tylko w tekście ciągłym | żaden akapit sam nie odpowiada na pytanie | średni – przebudowa akapitów |
Drugi powód jest najbardziej irytujący, bo usuwa się go w minuty, a mimo to występuje często – zwykle jako skutek uboczny ryczałtowej blokady „wszystkich botów AI”.
Wzorzec pokazujący się przy analizie cytowanych źródeł: rzadko są to obszerne artykuły przeglądowe. Są to krótkie strony odpowiadające w całości dokładnie na jedno pytanie – często takie, które we własnej firmie uchodzą za produkt uboczny.
Artykuł o 900 słowach z wyraźną liczbą i nazwanym zakresem obowiązywania bywa cytowany częściej niż przewodnik o 2500 słowach na ten sam temat, w którym ta sama liczba stoi w jedenastym akapicie. Dla planowania treści znaczy to: więcej ostro odgraniczonych pojedynczych pytań, mniej wszechobejmujących przewodników.
Co konkretnie można zrobić
- Zrobić test wyodrębnienia. Skopiować dowolny akapit do pustego dokumentu: czy sam odpowiada na rozpoznawalne pytanie? W większości artykułów przechodzą to dwa akapity na dziesięć.
- Dopisać własne dane. Do każdego artykułu co najmniej jedna liczba, procedura albo doświadczenie z zakresem obowiązywania – z własnej firmy, nie ze źródła.
- Krótkie streszczenie na górę. Cztery pełne stwierdzenia. Piętnaście minut na artykuł, bez zmiany treści.
- Sprawdzić pobrania w czasie działania. Zajrzeć do robots.txt, czy ChatGPT-User, Perplexity-User i Claude-User są dopuszczeni.
- Przeanalizować dziennik serwera. Czy wasze strony są w ogóle pobierane? Bez dostępu nie ma cytowania – a to inny plac budowy niż cytowalność.
Oceń, dlaczego ta strona zostałaby zacytowana przez silniki odpowiedzi albo nie. Bądź surowy; niczego nie chwal; nie przepisuj tekstu. Tekst strony: [wklej tekst] Dane dodatkowe: - Czy treść stoi w dostarczonym HTML? [tak / nie / nieznane] - Czy autor, rola i data sprawdzenia są widoczne? [tak / nie] - Jakie pole nasza strona poza tym zajmuje? [tematy] Zadania: 1. Sprawdź sześć cech osobno – dająca się wyodrębnić odpowiedź, sprawdzalna własna informacja, rozpoznawalna odpowiedzialność, aktualność, czytelność techniczna, bliskość tematyczna otoczenia. Podaj przy każdej cesze spełniona/częściowo/niespełniona z uzasadnieniem na przykładzie z tekstu. 2. Wskaż trzy akapity, które najprędzej zostałyby zacytowane, i powiedz przy każdym, na jakie pytanie odpowiada. 3. Wskaż każde stwierdzenie w tekście, które mogłoby stać także na każdej innej stronie – czyli nie zawiera nic własnego. 4. Sformułuj trzy pytania do mnie, których odpowiedzi dałyby sprawdzalne własne informacje, brakujące dziś w tekście. Nie wymyślaj liczb ani źródeł.
Podsumowanie
Cytowane jest to, co da się wyodrębnić i co mówi coś, czego gdzie indziej nie ma. Jedno i drugie jest kwestią ułożenia i substancji, nie jakości całości artykułu.
Dla małych firm dźwignia leży jednoznacznie przy cesze drugiej: przy wiedzy ogólnej nie ma powodu, by was wymieniać. Przy własnej liczbie z nazwanym zakresem obowiązywania to wy jesteście źródłem.
Częste pytania
Dlaczego AI cytuje jedne strony, a innych nie?
Bo wybiera fragmenty, nie strony. Cytowane jest to, co da się wyodrębnić i pozostaje zrozumiałe samo, co zawiera sprawdzalną informację, gdzie widać, kto za tym stoi, co jest aktualne i czytelne technicznie – i co stoi w polu, które serwis rozpoznawalnie zajmuje.
Jaki jest najmocniejszy pojedynczy czynnik?
Sprawdzalna własna informacja: liczba, procedura, doświadczenie z nazwanym zakresem obowiązywania. Przy wiedzy ogólnej nie ma powodu, by wymieniać akurat małą firmę – przy własnej informacji to ona jest źródłem.
Dlaczego treściowo mocna strona bywa nigdy niecytowana?
Z trzech powodów: treść powstaje dopiero przez JavaScript i nie stoi w dostarczonym HTML; pobrania w czasie działania są zablokowane w robots.txt, często jako skutek uboczny ryczałtowej blokady wszystkich botów AI; albo stwierdzenia są rozproszone po tekście ciągłym tak, że żaden akapit sam nie odpowiada na pytanie.
Czy częściej cytowane są długie czy krótkie artykuły?
W praktyce raczej krótkie, ostro odgraniczone. Artykuł o około 900 słowach z wyraźną liczbą i nazwanym zakresem obowiązywania bywa cytowany częściej niż obszerny przewodnik, w którym ta sama liczba stoi w jedenastym akapicie – bo krótki artykuł łatwiej wyodrębnić.
Jak sprawdzić własną cytowalność?
Testem wyodrębnienia: skopiować dowolny akapit do pustego dokumentu i przeczytać. Czy sam odpowiada w całości na rozpoznawalne pytanie? W większości artykułów przechodzą to około dwa akapity na dziesięć – ten odsetek jest najbardziej wymownym wskaźnikiem cytowalności.
Marketing, który konfiguruje się sam
Beta Studio Engine jest otwarta. Zarezerwuj miejsce i współtwórz od początku.
Dołącz do bety →