Proč AI některé stránky cituje a jiné ignoruje
Mezi dvěma stránkami s týmiž znalostmi nerozhoduje o citaci kvalita. Rozhoduje, jestli se z jedné z nich dá vyjmout věta, která stojí sama o sobě a je ověřitelná.
To nejdůležitější
- Citují se odstavce, ne stránky – proto rozhoduje uspořádání víc než celková kvalita.
- Citované zdroje mají společných šest vlastností: vyjmutelnou odpověď, ověřitelný údaj, rozpoznatelnou odpovědnost, aktuálnost, technickou čitelnost a tematickou blízkost okolí.
- Silné stránky vylučují tři důvody: obsah vzniká až díky JavaScriptu, stránka je zablokovaná, nebo jsou tvrzení rozeseta jen v souvislém textu.
- Ověřitelný vlastní údaj je nejsilnější jednotlivý činitel – je to důvod, proč model uvede vás místo obecného zdroje.
Když systém staví odpověď, nevybírá zdroje podle sympatií ani autority, ale podle použitelnosti. Otázka je vždycky stejná: dodá tato stránka výsek textu, který zodpoví položenou otázku, je sám o sobě srozumitelný a dá se doložit?
Šest vlastností
1. Vyjmutelná odpověď
Odstavec, který otázku úplně zodpoví ve dvou až čtyřech větách, aniž by odkazoval na okolní text. Zdaleka nejdůležitější vlastnost – a jediná, kterou máte plně ve vlastních rukou.
2. Ověřitelný vlastní údaj
Číslo, postup, časové rozpětí, zkušenost s vymezenou platností. To je důvod, proč model uvede vás místo obecného zdroje: říkáte něco, co jinde nestojí.
3. Rozpoznatelná odpovědnost
Autor s rolí, firma s adresou, datum poslední kontroly – viditelně na stránce i ve strukturovaných datech, se stejnou hodnotou. Zvlášť důležité u témat, která se dotýkají peněz, zdraví nebo práva.
4. Pochopitelná aktuálnost
Datum, které sedí, a obsah, který k tomu datu pasuje. Včerejší datum změny u textu, který popisuje dávno překonaný stav, je horší než žádné.
5. Technická čitelnost
Obsah stojí v doručeném HTML, ne až po spuštění JavaScriptu. Čistá hierarchie nadpisů, žádné blokování dotazů za běhu v souboru robots.txt.
6. Tematická blízkost okolí
Stránka v poli, které web rozpoznatelně obsazuje, se hodnotí spíš jako odborný zdroj než jednotlivý příspěvek mezi dvaceti nesouvisejícími tématy. To je důvod, proč tematické clustery fungují.
Věděli jste, že…?
Vlastnost dvě je skutečná páka pro malé firmy. U obecných znalostí soupeříte s velkými portály a prohrajete – tam není důvod uvádět zrovna vás.
U ověřitelného vlastního údaje jste zdrojem vy. „V praxi trvá pročištění rozrostlého kontaktního seznamu jeden až tři dny“ není obecně známé tvrzení – pochází od někoho, kdo to dělal, a právě proto se dá citovat. Jedna věta s vlastní zkušeností váží víc než tři odstavce shrnutí.
Tři důvody, proč silné stránky vypadnou
| Důvod | Podle čeho se pozná | Náročnost nápravy |
|---|---|---|
| Obsah vzniká až v prohlížeči | zdrojový kód stránky text neobsahuje | vysoká – otázka architektury |
| Dotazy za běhu zablokované | robots.txt blokuje ChatGPT-User & spol. | minuty |
| Tvrzení rozeseta jen v souvislém textu | žádný odstavec sám nezodpoví otázku | střední – přestavba odstavců |
Druhý důvod je nejmrzutější, protože se odstraní za pár minut a přesto se vyskytuje často – většinou jako vedlejší účinek paušálního zablokování „všech botů AI“.
Vzorec, který se ukazuje při vyhodnocování citovaných zdrojů: jen zřídka jde o rozsáhlé přehledové příspěvky. Jsou to krátké stránky, které úplně zodpoví právě jednu otázku – často takové, které se doma považují za vedlejší produkt.
Příspěvek o 900 slovech s jasným číslem a pojmenovanou platností se cituje častěji než průvodce o 2 500 slovech k témuž tématu, v němž totéž číslo stojí v jedenáctém odstavci. Pro plánování obsahu to znamená: víc ostře vymezených jednotlivých otázek, méně vše zahrnujících průvodců.
Co se dá konkrétně udělat
- Udělat zkoušku vyjmutím. Zkopírovat libovolný odstavec do prázdného dokumentu: zodpoví sám o sobě rozpoznatelnou otázku? U většiny příspěvků obstojí dva odstavce z deseti.
- Doplnit vlastní údaje. Ke každému příspěvku aspoň jedno číslo, postup nebo zkušenost s vymezenou platností – z vlastního provozu, ne z cizího zdroje.
- Krátké shrnutí nahoru. Čtyři úplná tvrzení. Patnáct minut na příspěvek, bez změny obsahu.
- Prověřit dotazy za běhu. Podívat se do robots.txt, jestli jsou povoleny ChatGPT-User, Perplexity-User a Claude-User.
- Vyhodnotit serverový protokol. Stahují se vaše stránky vůbec? Bez přístupu žádná citace – a to je jiná práce než citovatelnost.
Posuď, proč by tuhle stránku odpovědní stroje citovaly, nebo ne. Buď přísný; nic nechval; text nepřepisuj. Text stránky: [vložit text] Doplňující údaje: - Stojí obsah v doručeném HTML? [ano / ne / neznámé] - Jsou vidět autor, role a datum kontroly? [ano / ne] - Jaké pole náš web jinak obsazuje? [témata] Úkoly: 1. Prověř šest vlastností jednotlivě – vyjmutelná odpověď, ověřitelný vlastní údaj, rozpoznatelná odpovědnost, aktuálnost, technická čitelnost, tematická blízkost okolí. U každé uveď splněno/zčásti/nesplněno se zdůvodněním na příkladu z textu. 2. Uveď tři odstavce, které by se citovaly nejspíš, a u každého řekni, jakou otázku zodpoví. 3. Uveď každé tvrzení v textu, které by mohlo stát i na jakékoli jiné stránce – tedy neobsahuje nic vlastního. 4. Zformuluj mi tři otázky, jejichž odpovědi by daly ověřitelné vlastní údaje, které dnes textu chybí. Nevymýšlej si čísla ani zdroje.
Závěr
Cituje se to, co se dá vyjmout a co říká něco, co jinde nestojí. Obojí je otázka uspořádání a podstaty, ne celkové kvality příspěvku.
Pro malé firmy leží páka jednoznačně u vlastnosti dvě: u obecných znalostí není důvod uvádět vás. U vlastního čísla s pojmenovanou platností jste zdrojem vy.
Časté otázky
Proč AI některé stránky cituje a jiné ne?
Protože vybírá odstavce, ne stránky. Cituje se to, co se dá vyjmout a zůstane samo o sobě srozumitelné, co obsahuje ověřitelný údaj, kde je poznat, kdo za tím stojí, co je aktuální a technicky čitelné – a co stojí v poli, které web rozpoznatelně obsazuje.
Co je nejsilnější jednotlivý činitel?
Ověřitelný vlastní údaj: číslo, postup, zkušenost s pojmenovanou platností. U obecných znalostí není důvod uvádět zrovna malou firmu – u vlastního údaje je zdrojem ona.
Proč se obsahově silná stránka někdy nikdy necituje?
Ze tří důvodů: obsah vzniká až díky JavaScriptu a nestojí v doručeném HTML; dotazy za běhu jsou zablokované v robots.txt, často jako vedlejší účinek paušálního zablokování všech botů AI; nebo jsou tvrzení rozeseta po souvislém textu, takže žádný odstavec sám nezodpoví otázku.
Citují se častěji dlouhé, nebo krátké příspěvky?
V praxi spíš krátké, ostře vymezené. Příspěvek o zhruba 900 slovech s jasným číslem a pojmenovanou platností se cituje častěji než rozsáhlý průvodce, v němž totéž číslo stojí v jedenáctém odstavci – protože krátký příspěvek se snáz vyjme.
Jak se ověří vlastní citovatelnost?
Zkouškou vyjmutím: zkopírovat libovolný odstavec do prázdného dokumentu a přečíst. Zodpoví sám o sobě úplně rozpoznatelnou otázku? U většiny příspěvků obstojí zhruba dva odstavce z deseti – tento podíl je nejvýmluvnější metrika citovatelnosti.
Marketing, který se nastaví sám
Beta verze Studio Engine je otevřená. Zarezervujte si místo a podílejte se od začátku.
Zapojit se do bety →