Engedélyezzük vagy blokkoljuk az MI-crawlereket? A mérlegelés
A döntést rendszerint elvi kérdésként vezetik le, pedig üzleti kérdés: aki tartalommal keres pénzt, az engedélyezéssel veszít. Aki tartalmakon keresztül szerez megbízásokat, az a blokkolással veszít – mégpedig többet.
A lényeg röviden
- Kétféle hozzáférés van: előretekintő gyűjtők és futásidejű lekérések. Külön szabályozhatók – és épp ebben rejlik a leginkább használható megoldás.
- Aki megbízásokat ad el, mindenképpen engedélyezze a futásidejű lekéréseket: ezek említéseket hoznak olyan embereknél, akik épp megoldást keresnek.
- Akinek a tartalom maga a bevétele, vagy hirdetésmegjelenítésből él, annak jó okai vannak a gyűjtők tiltására.
- A robots.txt kérés, nem zár. Aki technikailag akarja érvényesíteni, annak kiszolgálószintű zárolás kell.
A hozzáférések két fajtája
Előretekintő gyűjtők
Konkrét kérdéstől függetlenül hoznak be tartalmakat – tanításhoz vagy saját keresőindexhez. Példák: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
Haszon nektek: közvetett – a tartalmak rendelkezésre állnak egy indexben. Költség: a tartalmakat felhasználják anélkül, hogy bárki meglátogatná az oldalatokat.
Futásidejű lekérések
Abban a pillanatban hoznak be egy oldalt, amikor valaki megfelelő kérdést tett fel. Példák: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.
Haszon nektek: közvetlen – ebből konkrét válaszokban szereplő említések és hivatkozások keletkeznek. Költség: gyakorlatilag semmi.
Tudtad?
Aki átalányban tiltja „az összes MI-botot”, mindkét fajtát tiltja – és ezzel épp azt a részt veszíti el, amelyik használ neki. A válaszban forrásként való említéshez az szükséges, hogy az oldalt futásidőben be lehessen hozni.
Egy megbízásokat értékesítő cégnek ez az elképzelhető legrosszabb csere: megakadályozunk egy ajánlást olyan valakinél, aki épp megoldást keres, azért, hogy megakadályozzuk, hogy egy modell tanuljon egy nyilvánosan hozzáférhető szakcikkből.
Három stratégia
| Stratégia | Gyűjtők | Futásidejű lekérések | Mihez illik |
|---|---|---|---|
| Nyitott | engedélyezni | engedélyezni | szolgáltatóknak, B2B-nek, tanácsadásnak |
| Vegyes | tiltani | engedélyezni | kiadóknak, tanfolyam-szolgáltatóknak, szakmédiumoknak |
| Zárt | tiltani | tiltani | fizetős tartalmakhoz, védett területekhez |
A legtöbb kis- és középvállalkozásnak a „nyitott” a helyes választás. A vegyes stratégia az ésszerű középút mindazoknak, akiknél maga a tartalom a termék.
A robots.txt
A nyitott stratégiához, kifejezett megnevezéssel – ez nem feltétlenül szükséges, de láthatóvá teszi és dokumentálja a döntést:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
A vegyes stratégiánál a gyűjtőket tiltjuk, a futásidejű lekéréseket pedig engedélyezzük:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-User Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Google-Extended csak a Google MI-termékeihez való felhasználást szabályozza – nem a szokásos keresőindexelést. Aki véletlenül a Googlebot ügynököt tiltja le, eltűnik a keresőből. Ez a két név különböző dolog, és rendszeresen összekeverik őket.
Amit a robots.txt nem tud
Három korlát, amelyet érdemes ismerni, mielőtt az ember a fájlra hagyatkozik:
- Ez kérés. A komoly szolgáltatók tartják magukat hozzá, mások nem. Aki technikailag akarja érvényesíteni, annak kiszolgáló- vagy tűzfalszintű zárolás kell az azonosító alapján.
- Nem hat visszamenőleg. Ami már összegyűlt, attól nem tűnik el.
- Nem véd a más forrásokból való átvétel ellen. Ha a tartalmaitokat máshol idézik, a saját fájlotok nem segít.
Mielőtt az ember meghozza a döntést, megéri belenézni a kiszolgálónaplóba: melyik ezek közül az azonosítók közül bukkan fel egyáltalán, milyen gyakran, és mely oldalakat hozza be?
Kis weboldalaknál az eredmény gyakran kijózanító – kevés hozzáférés, kevés oldal. Ilyenkor a kérdés gyakorlatilag másodlagos, és a tényleges feladat más: hogy egyáltalán megtaláljanak titeket. Az olyan crawlerek tiltása, amelyek nem is jönnek, semmilyen problémát nem old meg, csak azt akadályozza meg, hogy ez később másképp legyen.
A jogi keret
Az EU-ban létezik szöveg- és adatbányászati fenntartás: a jogosultak kifejezetten megtilthatják a tartalmaik automatizált kiértékelésre való felhasználását, és ezt a fenntartást gépi úton olvashatóan kell kinyilvánítani. A robots.txt ennek a bevett formája, részben a felhasználási feltételekben szereplő utalással kiegészítve.
Svájcra ez nem közvetlenül vonatkozik; aki azonban EU-s felhasználóknak is szán tartalmakat, mégis nyilvánítsa ki a fenntartást, ha akarja. Ez olyan pont, amelyet szakembernek kell megítélnie – ez a cikk nem helyettesíti a jogi tanácsadást.
Összegzés
A kérdés nem elvi, hanem az üzleti modellen múlik. Aki tartalmat értékesít, tiltja a gyűjtőket. Aki megbízásokat értékesít, mindkettőt engedélyezi – és ezzel említéseket nyer olyan embereknél, akik épp megoldást keresnek.
Minden esetben érvényes: a futásidejű lekéréseket külön kell nézni. Az átalányban való tiltásuk a leggyakoribb és a legdrágább hiba ebben a döntésben.
Gyakori kérdések
Blokkolni kell az MI-crawlereket?
Ez az üzleti modelltől függ. Aki magával a tartalommal keres pénzt – kiadók, tanfolyam-szolgáltatók, szakmédiumok –, annak jó okai vannak az előretekintő gyűjtők tiltására. Aki megbízásokat vagy szolgáltatásokat értékesít, a blokkolással többet veszít, mint amennyit nyer.
Mi a különbség a gyűjtők és a futásidejű lekérések között?
Az olyan gyűjtők, mint a GPTBot, a ClaudeBot vagy a PerplexityBot, konkrét kérdéstől függetlenül hoznak be tartalmakat, tanításhoz vagy saját indexhez. Az olyan futásidejű lekérések, mint a ChatGPT-User, a Perplexity-User vagy az OAI-SearchBot, pontosan akkor hoznak be egy oldalt, amikor valaki megfelelő kérdést tett fel – ebből említések és hivatkozások keletkeznek.
Mi az a Google-Extended?
Olyan azonosító, amellyel a tartalmak Google MI-termékeihez való felhasználása szabályozható – nem a szokásos keresőindexelés. Ez más, mint a Googlebot; aki ez utóbbit véletlenül letiltja, eltűnik a keresőből.
Minden crawler tartja magát a robots.txt fájlhoz?
Nem. Ez kérés, nem technikai zár. A komoly szolgáltatók tartják magukat hozzá, mások nem. Aki érvényesíteni akar egy tiltást, annak kiszolgáló- vagy tűzfalszintű szabály kell az azonosító alapján – és még akkor sem hat visszamenőleg a már összegyűjtött tartalmakra.
Hogyan ellenőrizhető, mely crawlerek jönnek egyáltalán?
A kiszolgálónaplón keresztül, az ismert azonosítókra szűrve. Ez megmutatja, melyik crawler milyen gyakran mely oldalakat hozza be. Kis weboldalaknál az eredmény gyakran áttekinthető – ilyenkor a tiltás kérdése másodlagos ahhoz a feladathoz képest, hogy egyáltalán megtaláljanak titeket.
Marketing, amely magát állítja be
A Studio Engine bétája nyitva áll. Foglalj helyet, és alakítsd az elejétől fogva.
Csatlakozom a bétához →