Crawlery AI povolit, nebo blokovat? Zvážení
Rozhodnutí se většinou vede jako otázka principu a je to otázka obchodní: kdo vydělává obsahem, povolením ztrácí. Kdo obsahem získává zakázky, ztrácí blokováním – a to víc.
To nejdůležitější
- Existují dva druhy přístupů: předzásobující sběrači a dotazy za běhu. Dají se řídit odděleně – a právě v tom leží nejpoužitelnější řešení.
- Kdo prodává zakázky, měl by dotazy za běhu v každém případě povolit: vytvářejí zmínky u lidí uprostřed hledání řešení.
- Kdo prodává obsah nebo vydělává zobrazováním reklamy, má dobré důvody sběrače zablokovat.
- robots.txt je prosba, ne zámek. Kdo chce prosadit technicky, potřebuje blokování na úrovni serveru.
Dva druhy přístupů
Předzásobující sběrači
Stahují obsah nezávisle na konkrétní otázce – pro trénink nebo pro vlastní vyhledávací index. Příklady: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
Užitek pro vás: zprostředkovaný – obsah je k dispozici v indexu. Náklad: obsah se používá, aniž by někdo navštívil vaši stránku.
Dotazy za běhu
Stáhnou stránku ve chvíli, kdy někdo položil odpovídající otázku. Příklady: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.
Užitek pro vás: bezprostřední – vznikají z toho zmínky a odkazy v konkrétních odpovědích. Náklad: prakticky žádný.
Věděli jste, že…?
Kdo paušálně zablokuje „všechny boty AI“, zablokuje oba druhy – a ztratí tím právě tu část, která mu prospívá. Zmínka jako zdroj v odpovědi předpokládá, že se stránka smí stáhnout za běhu.
Pro firmu, která prodává zakázky, je to nejhorší myslitelná výměna: člověk zabrání doporučení někomu uprostřed hledání řešení, aby zabránil tomu, že se model naučí z veřejně přístupného odborného příspěvku.
Tři strategie
| Strategie | Sběrači | Dotazy za běhu | Hodí se pro |
|---|---|---|---|
| Otevřená | povolit | povolit | poskytovatele služeb, B2B, poradenství |
| Smíšená | blokovat | povolit | vydavatelství, poskytovatele kurzů, odborná média |
| Uzavřená | blokovat | blokovat | placený obsah, chráněné oblasti |
Pro většinu malých a středních firem je správnou volbou „otevřená“. Smíšená strategie je rozumná střední cesta pro všechny, jejichž obsah je sám o sobě produktem.
Soubor robots.txt
Pro otevřenou strategii s výslovným uvedením – to není nezbytně nutné, ale zviditelňuje rozhodnutí a dokumentuje ho:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
U smíšené strategie se sběrači zablokují a dotazy za běhu se povolí:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-User Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Google-Extended řídí jen využití pro produkty AI od Googlu – ne běžnou indexaci ve vyhledávání. Kdo omylem zablokuje Googlebot, zmizí z vyhledávání. Tato dvě jména jsou různé věci a pravidelně se pletou.
Co robots.txt nezvládne
Tři omezení, která je dobré znát, než se na soubor spolehnete:
- Je to prosba. Seriózní poskytovatelé se jí drží, ostatní ne. Kdo chce prosadit technicky, potřebuje blokování na úrovni serveru nebo firewallu podle identifikace.
- Nepůsobí zpětně. Co už bylo sesbíráno, tím nezmizí.
- Nechrání před převzetím z jiných zdrojů. Když je váš obsah citován jinde, vlastní soubor nepomůže.
Než rozhodnutí padne, vyplatí se pohled do serverového protokolu: které z těchto identifikací se vůbec objevují, jak často a které stránky stahují.
U malých webů bývá výsledek střízlivý – málo přístupů, málo stránek. Pak je otázka prakticky druhořadá a skutečný úkol je jiný: být vůbec nalezen. Blokování crawlerů, kteří vůbec nechodí, neřeší žádný problém a jen brání tomu, aby se to později změnilo.
Právní rámec
V EU existuje výhrada k dolování textů a dat: držitelé práv mohou využití svého obsahu pro automatizované vyhodnocení výslovně zakázat a tato výhrada musí být vyjádřena strojově čitelně. Soubor robots.txt je pro to obvyklou formou, zčásti doplněnou upozorněním v podmínkách užívání.
Pro Švýcarsko to neplatí bezprostředně; kdo obsah cílí i na uživatele v EU, měl by výhradu přesto vyjádřit, pokud si ji přeje. To je bod, který by měl posoudit odborník – tento příspěvek nenahrazuje právní poradenství.
Závěr
Otázka není principiální, ale závisí na obchodním modelu. Kdo prodává obsah, blokuje sběrače. Kdo prodává zakázky, povolí obojí – a získá tím zmínky u lidí, kteří právě hledají řešení.
V každém případě platí: dotazy za běhu posuzovat zvlášť. Zablokovat je paušálně spolu s ostatními je nejčastější a nejdražší chyba v tomto rozhodnutí.
Časté otázky
Mají se crawlery AI blokovat?
Záleží na obchodním modelu. Kdo vydělává samotným obsahem – vydavatelství, poskytovatelé kurzů, odborná média – má dobré důvody předzásobující sběrače zablokovat. Kdo prodává zakázky nebo služby, blokováním ztratí víc, než získá.
Jaký je rozdíl mezi sběrači a dotazy za běhu?
Sběrači jako GPTBot, ClaudeBot nebo PerplexityBot stahují obsah nezávisle na konkrétní otázce, pro trénink nebo vlastní index. Dotazy za běhu jako ChatGPT-User, Perplexity-User nebo OAI-SearchBot stáhnou stránku právě tehdy, když někdo položil odpovídající otázku – vznikají z toho zmínky a odkazy.
Co je Google-Extended?
Identifikace, kterou se dá řídit využití obsahu pro produkty AI od Googlu – ne běžná indexace ve vyhledávání. Je to něco jiného než Googlebot; kdo toho omylem zablokuje, zmizí z vyhledávání.
Drží se každý crawler souboru robots.txt?
Ne. Je to prosba, ne technický zámek. Seriózní poskytovatelé se jí drží, ostatní ne. Kdo chce blokování prosadit, potřebuje pravidlo na úrovni serveru nebo firewallu podle identifikace – a ani pak nepůsobí zpětně na už sesbíraný obsah.
Jak se ověří, které crawlery vůbec chodí?
Přes serverový protokol, filtrovaný podle známých identifikací. Ukáže, které crawlery jak často a které stránky stahují. U malých webů bývá výsledek přehledný – pak je otázka blokování druhořadá vůči úkolu být vůbec nalezen.
Marketing, který se nastaví sám
Beta verze Studio Engine je otevřená. Zarezervujte si místo a podílejte se od začátku.
Zapojit se do bety →