Crawlery AI povolit, nebo blokovat? Zvážení

Rozhodnutí se většinou vede jako otázka principu a je to otázka obchodní: kdo vydělává obsahem, povolením ztrácí. Kdo obsahem získává zakázky, ztrácí blokováním – a to víc.

Řada úzkých otvorů, třemi z nich proudí světlo do prostoru za nimi, ostatní zůstávají tmavé

To nejdůležitější

  • Existují dva druhy přístupů: předzásobující sběrači a dotazy za běhu. Dají se řídit odděleně – a právě v tom leží nejpoužitelnější řešení.
  • Kdo prodává zakázky, měl by dotazy za běhu v každém případě povolit: vytvářejí zmínky u lidí uprostřed hledání řešení.
  • Kdo prodává obsah nebo vydělává zobrazováním reklamy, má dobré důvody sběrače zablokovat.
  • robots.txt je prosba, ne zámek. Kdo chce prosadit technicky, potřebuje blokování na úrovni serveru.

Dva druhy přístupů

Předzásobující sběrači

Stahují obsah nezávisle na konkrétní otázce – pro trénink nebo pro vlastní vyhledávací index. Příklady: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

Užitek pro vás: zprostředkovaný – obsah je k dispozici v indexu. Náklad: obsah se používá, aniž by někdo navštívil vaši stránku.

Dotazy za běhu

Stáhnou stránku ve chvíli, kdy někdo položil odpovídající otázku. Příklady: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.

Užitek pro vás: bezprostřední – vznikají z toho zmínky a odkazy v konkrétních odpovědích. Náklad: prakticky žádný.

Věděli jste, že…?

Kdo paušálně zablokuje „všechny boty AI“, zablokuje oba druhy – a ztratí tím právě tu část, která mu prospívá. Zmínka jako zdroj v odpovědi předpokládá, že se stránka smí stáhnout za běhu.

Pro firmu, která prodává zakázky, je to nejhorší myslitelná výměna: člověk zabrání doporučení někomu uprostřed hledání řešení, aby zabránil tomu, že se model naučí z veřejně přístupného odborného příspěvku.

Tři strategie

StrategieSběračiDotazy za běhuHodí se pro
Otevřenápovolitpovolitposkytovatele služeb, B2B, poradenství
Smíšenáblokovatpovolitvydavatelství, poskytovatele kurzů, odborná média
Uzavřenáblokovatblokovatplacený obsah, chráněné oblasti

Pro většinu malých a středních firem je správnou volbou „otevřená“. Smíšená strategie je rozumná střední cesta pro všechny, jejichž obsah je sám o sobě produktem.

Soubor robots.txt

Pro otevřenou strategii s výslovným uvedením – to není nezbytně nutné, ale zviditelňuje rozhodnutí a dokumentuje ho:

robots.txt – otevřená
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

U smíšené strategie se sběrači zablokují a dotazy za běhu se povolí:

robots.txt – smíšená
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml
Pozor Google-Extended řídí jen využití pro produkty AI od Googlu – ne běžnou indexaci ve vyhledávání. Kdo omylem zablokuje Googlebot, zmizí z vyhledávání. Tato dvě jména jsou různé věci a pravidelně se pletou.

Co robots.txt nezvládne

Tři omezení, která je dobré znát, než se na soubor spolehnete:

  • Je to prosba. Seriózní poskytovatelé se jí drží, ostatní ne. Kdo chce prosadit technicky, potřebuje blokování na úrovni serveru nebo firewallu podle identifikace.
  • Nepůsobí zpětně. Co už bylo sesbíráno, tím nezmizí.
  • Nechrání před převzetím z jiných zdrojů. Když je váš obsah citován jinde, vlastní soubor nepomůže.
Z praxe

Než rozhodnutí padne, vyplatí se pohled do serverového protokolu: které z těchto identifikací se vůbec objevují, jak často a které stránky stahují.

U malých webů bývá výsledek střízlivý – málo přístupů, málo stránek. Pak je otázka prakticky druhořadá a skutečný úkol je jiný: být vůbec nalezen. Blokování crawlerů, kteří vůbec nechodí, neřeší žádný problém a jen brání tomu, aby se to později změnilo.

Právní rámec

V EU existuje výhrada k dolování textů a dat: držitelé práv mohou využití svého obsahu pro automatizované vyhodnocení výslovně zakázat a tato výhrada musí být vyjádřena strojově čitelně. Soubor robots.txt je pro to obvyklou formou, zčásti doplněnou upozorněním v podmínkách užívání.

Pro Švýcarsko to neplatí bezprostředně; kdo obsah cílí i na uživatele v EU, měl by výhradu přesto vyjádřit, pokud si ji přeje. To je bod, který by měl posoudit odborník – tento příspěvek nenahrazuje právní poradenství.

Závěr

Otázka není principiální, ale závisí na obchodním modelu. Kdo prodává obsah, blokuje sběrače. Kdo prodává zakázky, povolí obojí – a získá tím zmínky u lidí, kteří právě hledají řešení.

V každém případě platí: dotazy za běhu posuzovat zvlášť. Zablokovat je paušálně spolu s ostatními je nejčastější a nejdražší chyba v tomto rozhodnutí.

Časté otázky

Mají se crawlery AI blokovat?

Záleží na obchodním modelu. Kdo vydělává samotným obsahem – vydavatelství, poskytovatelé kurzů, odborná média – má dobré důvody předzásobující sběrače zablokovat. Kdo prodává zakázky nebo služby, blokováním ztratí víc, než získá.

Jaký je rozdíl mezi sběrači a dotazy za běhu?

Sběrači jako GPTBot, ClaudeBot nebo PerplexityBot stahují obsah nezávisle na konkrétní otázce, pro trénink nebo vlastní index. Dotazy za běhu jako ChatGPT-User, Perplexity-User nebo OAI-SearchBot stáhnou stránku právě tehdy, když někdo položil odpovídající otázku – vznikají z toho zmínky a odkazy.

Co je Google-Extended?

Identifikace, kterou se dá řídit využití obsahu pro produkty AI od Googlu – ne běžná indexace ve vyhledávání. Je to něco jiného než Googlebot; kdo toho omylem zablokuje, zmizí z vyhledávání.

Drží se každý crawler souboru robots.txt?

Ne. Je to prosba, ne technický zámek. Seriózní poskytovatelé se jí drží, ostatní ne. Kdo chce blokování prosadit, potřebuje pravidlo na úrovni serveru nebo firewallu podle identifikace – a ani pak nepůsobí zpětně na už sesbíraný obsah.

Jak se ověří, které crawlery vůbec chodí?

Přes serverový protokol, filtrovaný podle známých identifikací. Ukáže, které crawlery jak často a které stránky stahují. U malých webů bývá výsledek přehledný – pak je otázka blokování druhořadá vůči úkolu být vůbec nalezen.

Marketing, který se nastaví sám

Beta verze Studio Engine je otevřená. Zarezervujte si místo a podílejte se od začátku.

Zapojit se do bety →
← Zpět na přehled