Engedélyezzük vagy blokkoljuk az MI-crawlereket? A mérlegelés

A döntést rendszerint elvi kérdésként vezetik le, pedig üzleti kérdés: aki tartalommal keres pénzt, az engedélyezéssel veszít. Aki tartalmakon keresztül szerez megbízásokat, az a blokkolással veszít – mégpedig többet.

Keskeny nyílások sora, hármon fény árad be a mögöttes térbe, a többi sötét marad

A lényeg röviden

  • Kétféle hozzáférés van: előretekintő gyűjtők és futásidejű lekérések. Külön szabályozhatók – és épp ebben rejlik a leginkább használható megoldás.
  • Aki megbízásokat ad el, mindenképpen engedélyezze a futásidejű lekéréseket: ezek említéseket hoznak olyan embereknél, akik épp megoldást keresnek.
  • Akinek a tartalom maga a bevétele, vagy hirdetésmegjelenítésből él, annak jó okai vannak a gyűjtők tiltására.
  • A robots.txt kérés, nem zár. Aki technikailag akarja érvényesíteni, annak kiszolgálószintű zárolás kell.

A hozzáférések két fajtája

Előretekintő gyűjtők

Konkrét kérdéstől függetlenül hoznak be tartalmakat – tanításhoz vagy saját keresőindexhez. Példák: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

Haszon nektek: közvetett – a tartalmak rendelkezésre állnak egy indexben. Költség: a tartalmakat felhasználják anélkül, hogy bárki meglátogatná az oldalatokat.

Futásidejű lekérések

Abban a pillanatban hoznak be egy oldalt, amikor valaki megfelelő kérdést tett fel. Példák: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.

Haszon nektek: közvetlen – ebből konkrét válaszokban szereplő említések és hivatkozások keletkeznek. Költség: gyakorlatilag semmi.

Tudtad?

Aki átalányban tiltja „az összes MI-botot”, mindkét fajtát tiltja – és ezzel épp azt a részt veszíti el, amelyik használ neki. A válaszban forrásként való említéshez az szükséges, hogy az oldalt futásidőben be lehessen hozni.

Egy megbízásokat értékesítő cégnek ez az elképzelhető legrosszabb csere: megakadályozunk egy ajánlást olyan valakinél, aki épp megoldást keres, azért, hogy megakadályozzuk, hogy egy modell tanuljon egy nyilvánosan hozzáférhető szakcikkből.

Három stratégia

StratégiaGyűjtőkFutásidejű lekérésekMihez illik
Nyitottengedélyezniengedélyezniszolgáltatóknak, B2B-nek, tanácsadásnak
Vegyestiltaniengedélyeznikiadóknak, tanfolyam-szolgáltatóknak, szakmédiumoknak
Zárttiltanitiltanifizetős tartalmakhoz, védett területekhez

A legtöbb kis- és középvállalkozásnak a „nyitott” a helyes választás. A vegyes stratégia az ésszerű középút mindazoknak, akiknél maga a tartalom a termék.

A robots.txt

A nyitott stratégiához, kifejezett megnevezéssel – ez nem feltétlenül szükséges, de láthatóvá teszi és dokumentálja a döntést:

robots.txt – nyitott
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

A vegyes stratégiánál a gyűjtőket tiltjuk, a futásidejű lekéréseket pedig engedélyezzük:

robots.txt – vegyes
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml
Figyelem A Google-Extended csak a Google MI-termékeihez való felhasználást szabályozza – nem a szokásos keresőindexelést. Aki véletlenül a Googlebot ügynököt tiltja le, eltűnik a keresőből. Ez a két név különböző dolog, és rendszeresen összekeverik őket.

Amit a robots.txt nem tud

Három korlát, amelyet érdemes ismerni, mielőtt az ember a fájlra hagyatkozik:

  • Ez kérés. A komoly szolgáltatók tartják magukat hozzá, mások nem. Aki technikailag akarja érvényesíteni, annak kiszolgáló- vagy tűzfalszintű zárolás kell az azonosító alapján.
  • Nem hat visszamenőleg. Ami már összegyűlt, attól nem tűnik el.
  • Nem véd a más forrásokból való átvétel ellen. Ha a tartalmaitokat máshol idézik, a saját fájlotok nem segít.
A gyakorlatból

Mielőtt az ember meghozza a döntést, megéri belenézni a kiszolgálónaplóba: melyik ezek közül az azonosítók közül bukkan fel egyáltalán, milyen gyakran, és mely oldalakat hozza be?

Kis weboldalaknál az eredmény gyakran kijózanító – kevés hozzáférés, kevés oldal. Ilyenkor a kérdés gyakorlatilag másodlagos, és a tényleges feladat más: hogy egyáltalán megtaláljanak titeket. Az olyan crawlerek tiltása, amelyek nem is jönnek, semmilyen problémát nem old meg, csak azt akadályozza meg, hogy ez később másképp legyen.

A jogi keret

Az EU-ban létezik szöveg- és adatbányászati fenntartás: a jogosultak kifejezetten megtilthatják a tartalmaik automatizált kiértékelésre való felhasználását, és ezt a fenntartást gépi úton olvashatóan kell kinyilvánítani. A robots.txt ennek a bevett formája, részben a felhasználási feltételekben szereplő utalással kiegészítve.

Svájcra ez nem közvetlenül vonatkozik; aki azonban EU-s felhasználóknak is szán tartalmakat, mégis nyilvánítsa ki a fenntartást, ha akarja. Ez olyan pont, amelyet szakembernek kell megítélnie – ez a cikk nem helyettesíti a jogi tanácsadást.

Összegzés

A kérdés nem elvi, hanem az üzleti modellen múlik. Aki tartalmat értékesít, tiltja a gyűjtőket. Aki megbízásokat értékesít, mindkettőt engedélyezi – és ezzel említéseket nyer olyan embereknél, akik épp megoldást keresnek.

Minden esetben érvényes: a futásidejű lekéréseket külön kell nézni. Az átalányban való tiltásuk a leggyakoribb és a legdrágább hiba ebben a döntésben.

Gyakori kérdések

Blokkolni kell az MI-crawlereket?

Ez az üzleti modelltől függ. Aki magával a tartalommal keres pénzt – kiadók, tanfolyam-szolgáltatók, szakmédiumok –, annak jó okai vannak az előretekintő gyűjtők tiltására. Aki megbízásokat vagy szolgáltatásokat értékesít, a blokkolással többet veszít, mint amennyit nyer.

Mi a különbség a gyűjtők és a futásidejű lekérések között?

Az olyan gyűjtők, mint a GPTBot, a ClaudeBot vagy a PerplexityBot, konkrét kérdéstől függetlenül hoznak be tartalmakat, tanításhoz vagy saját indexhez. Az olyan futásidejű lekérések, mint a ChatGPT-User, a Perplexity-User vagy az OAI-SearchBot, pontosan akkor hoznak be egy oldalt, amikor valaki megfelelő kérdést tett fel – ebből említések és hivatkozások keletkeznek.

Mi az a Google-Extended?

Olyan azonosító, amellyel a tartalmak Google MI-termékeihez való felhasználása szabályozható – nem a szokásos keresőindexelés. Ez más, mint a Googlebot; aki ez utóbbit véletlenül letiltja, eltűnik a keresőből.

Minden crawler tartja magát a robots.txt fájlhoz?

Nem. Ez kérés, nem technikai zár. A komoly szolgáltatók tartják magukat hozzá, mások nem. Aki érvényesíteni akar egy tiltást, annak kiszolgáló- vagy tűzfalszintű szabály kell az azonosító alapján – és még akkor sem hat visszamenőleg a már összegyűjtött tartalmakra.

Hogyan ellenőrizhető, mely crawlerek jönnek egyáltalán?

A kiszolgálónaplón keresztül, az ismert azonosítókra szűrve. Ez megmutatja, melyik crawler milyen gyakran mely oldalakat hozza be. Kis weboldalaknál az eredmény gyakran áttekinthető – ilyenkor a tiltás kérdése másodlagos ahhoz a feladathoz képest, hogy egyáltalán megtaláljanak titeket.

Marketing, amely magát állítja be

A Studio Engine bétája nyitva áll. Foglalj helyet, és alakítsd az elejétől fogva.

Csatlakozom a bétához →
← Vissza az áttekintéshez