AI alate za indeksiranje dopustiti ili blokirati? Odvagivanje

Odluka se najčešće vodi kao načelno pitanje, a zapravo je poslovno pitanje: tko sadržajem zarađuje, gubi dopuštanjem. Tko sadržajem stječe naloge, gubi blokiranjem – i to više.

Niz uskih otvora, kroz tri od njih svjetlo struji u prostor iza, ostali ostaju tamni

Najvažnije ukratko

  • Postoje dvije vrste pristupa: sakupljači koji rade unaprijed i dohvati u trenutku upita. Njima se može upravljati odvojeno – i upravo u tome leži najupotrebljivije rješenje.
  • Tko prodaje naloge, trebao bi dohvate u trenutku upita u svakom slučaju dopustiti: oni stvaraju spominjanja kod ljudi usred traženja rješenja.
  • Tko prodaje sadržaj ili zarađuje na oglasnim prikazima, ima dobre razloge zapriječiti sakupljače.
  • robots.txt je molba, a ne zapreka. Tko želi tehnički provesti zabranu, treba zapreku na razini poslužitelja.

Dvije vrste pristupa

Sakupljači koji rade unaprijed

Dohvaćaju sadržaj neovisno o konkretnom pitanju – za učenje ili za vlastito kazalo pretrage. Primjeri: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

Korist za vas: posredna – sadržaj stoji na raspolaganju u nekom kazalu. Trošak: sadržaj se koristi, a da nitko ne posjeti vašu stranicu.

Dohvati u trenutku upita

Dohvaćaju stranicu u trenutku u kojem je netko postavio odgovarajuće pitanje. Primjeri: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.

Korist za vas: neposredna – iz toga nastaju spominjanja i poveznice u konkretnim odgovorima. Trošak: praktički nikakav.

Jeste li znali?

Tko paušalno zapriječi «sve AI botove», priječi obje vrste – i time gubi upravo onaj dio koji mu koristi. Spominjanje kao izvor u odgovoru pretpostavlja da se stranica smije dohvatiti u trenutku upita.

Za tvrtku koja prodaje naloge to je najgora zamisliva razmjena: sprječava se preporuka nekome usred traženja rješenja, kako bi se spriječilo da model uči iz javno dostupnog stručnog članka.

Tri strategije

StrategijaSakupljačiDohvati u trenutku upitaOdgovara
Otvorenadopustitidopustitipružateljima usluga, B2B-u, savjetovanju
Miješanazapriječitidopustitinakladnicima, ponuđačima tečajeva, stručnim medijima
Zatvorenazapriječitizapriječitinaplatnom sadržaju, zaštićenim područjima

Za većinu malih i srednjih poduzeća «otvorena» je pravi izbor. Miješana je strategija smislen srednji put za sve one kojima je sam sadržaj proizvod.

Datoteka robots.txt

Za otvorenu strategiju s izričitim navođenjem – to nije nužno potrebno, ali odluku čini vidljivom i dokumentira je:

robots.txt – otvoreno
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Za miješanu se strategiju sakupljači priječe, a dohvati u trenutku upita dopuštaju:

robots.txt – miješano
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml
Pozor Google-Extended upravlja samo uporabom za Googleove AI proizvode – ne i uobičajenim uvrštavanjem u kazalo pretrage. Tko nehotice zapriječi Googlebot, nestaje iz pretrage. Ta su dva naziva različite stvari i redovito se brkaju.

Što robots.txt ne postiže

Tri ograničenja koja treba poznavati prije nego što se čovjek osloni na tu datoteku:

  • To je molba. Ozbiljni je pružatelji poštuju, drugi ne. Tko želi tehnički provesti zabranu, treba pravilo na razini poslužitelja ili vatrozida prema oznaci.
  • Ne djeluje unatrag. Ono što je već sakupljeno time ne nestaje.
  • Ne štiti od prenošenja iz drugih izvora. Ako se vaš sadržaj navodi drugdje, vlastita datoteka ne pomaže.
Iz prakse

Prije donošenja odluke isplati se pogledati zapisnik poslužitelja: koje se od tih oznaka uopće pojavljuju, koliko često i koje stranice dohvaćaju.

Kod malih je web stranica rezultat često otrežnjujući – malo pristupa, malo stranica. Tada je pitanje praktički sporedno, a stvarna je zadaća druga: uopće biti pronađen. Zapreka za alate za indeksiranje koji uopće ne dolaze ne rješava nikakav problem i samo sprječava da poslije bude drukčije.

Pravni okvir

U EU postoji pridržaj za rudarenje teksta i podataka: nositelji prava mogu izričito zabraniti uporabu svojeg sadržaja za automatiziranu obradu, a taj se pridržaj mora izjaviti strojno čitljivo. robots.txt je za to uvriježen oblik, dijelom dopunjen napomenom u uvjetima korištenja.

Za Švicarsku to ne vrijedi neposredno; tko sadržaj upućuje i korisnicima u EU, pridržaj bi ipak trebao izjaviti ako ga želi. To je točka koju bi trebala prosuditi stručna osoba – ovaj članak ne zamjenjuje pravno savjetovanje.

Zaključak

Pitanje nije načelno, nego ovisi o poslovnom modelu. Tko prodaje sadržaj, priječi sakupljače. Tko prodaje naloge, dopušta oboje – i time dobiva spominjanja kod ljudi koji upravo traže rješenje.

U svakom slučaju vrijedi: dohvate u trenutku upita promatrati odvojeno. Paušalno ih zapriječiti zajedno s ostalima najčešća je i najskuplja pogreška u toj odluci.

Česta pitanja

Treba li blokirati AI alate za indeksiranje?

To ovisi o poslovnom modelu. Tko samim sadržajem zarađuje – nakladnici, ponuđači tečajeva, stručni mediji – ima dobre razloge zapriječiti sakupljače koji rade unaprijed. Tko prodaje naloge ili usluge, blokiranjem gubi više nego što dobiva.

Koja je razlika između sakupljača i dohvata u trenutku upita?

Sakupljači poput GPTBota, ClaudeBota ili PerplexityBota dohvaćaju sadržaj neovisno o konkretnom pitanju, za učenje ili vlastito kazalo. Dohvati u trenutku upita poput ChatGPT-Usera, Perplexity-Usera ili OAI-SearchBota dohvaćaju stranicu upravo onda kad je netko postavio odgovarajuće pitanje – iz toga nastaju spominjanja i poveznice.

Što je Google-Extended?

Oznaka kojom se može upravljati uporabom sadržaja za Googleove AI proizvode – ne i uobičajenim uvrštavanjem u kazalo pretrage. To je nešto drugo od Googlebota; tko njega nehotice zapriječi, nestaje iz pretrage.

Poštuje li svaki alat za indeksiranje robots.txt?

Ne. To je molba, a ne tehnička zapreka. Ozbiljni je pružatelji poštuju, drugi ne. Tko zabranu želi provesti, treba pravilo na razini poslužitelja ili vatrozida prema oznaci – a ni tada ne djeluje unatrag na već sakupljeni sadržaj.

Kako se provjerava koji alati za indeksiranje uopće dolaze?

Preko zapisnika poslužitelja, filtriranog po poznatim oznakama. To pokazuje koji alati koliko često dohvaćaju koje stranice. Kod malih je web stranica rezultat često pregledan – tada je pitanje zapreke sporedno u odnosu na zadaću da se uopće bude pronađen.

Marketing koji se sam postavlja

Beta verzija Studio Enginea je otvorena. Osigurajte mjesto i sudjelujte od početka.

Pridruži se beti →
← Natrag na pregled