Dopuścić czy blokować roboty AI? Rozważenie
Decyzję prowadzi się zwykle jako kwestię zasadniczą, a jest ona kwestią biznesową: kto zarabia na treściach, traci przez dopuszczenie. Kto przez treści zdobywa zlecenia, traci przez blokadę – i to więcej.
Najważniejsze w skrócie
- Są dwa rodzaje dostępów: zbierające z wyprzedzeniem i pobierające w czasie działania. Da się nimi sterować osobno – i właśnie w tym leży najbardziej użyteczne rozwiązanie.
- Kto sprzedaje zlecenia, powinien w każdym razie dopuścić pobrania w czasie działania: tworzą wymienienia u ludzi w środku poszukiwania rozwiązania.
- Kto sprzedaje treści albo zarabia na wyświetleniach reklam, ma dobre powody, by zablokować zbierające.
- robots.txt jest prośbą, nie blokadą. Kto chce wymusić technicznie, potrzebuje blokady na poziomie serwera.
Dwa rodzaje dostępów
Zbierające z wyprzedzeniem
Pobierają treści niezależnie od konkretnego pytania – do treningu albo do własnego indeksu wyszukiwania. Przykłady: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
Pożytek dla was: pośredni – treści są dostępne w indeksie. Koszt: treści są wykorzystywane bez tego, by ktoś odwiedził waszą stronę.
Pobrania w czasie działania
Pobierają stronę w momencie, w którym ktoś zadał pasujące pytanie. Przykłady: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.
Pożytek dla was: bezpośredni – powstają z tego wymienienia i odnośniki w konkretnych odpowiedziach. Koszt: praktycznie żaden.
Czy wiesz, że…?
Kto ryczałtem zablokuje „wszystkie boty AI”, blokuje oba rodzaje – i traci przez to dokładnie tę część, która mu służy. Wymienienie jako źródło w odpowiedzi zakłada, że stronę wolno pobrać w czasie działania.
Dla firmy sprzedającej zlecenia to najgorsza możliwa wymiana: zapobiega się rekomendacji dla kogoś w środku poszukiwania rozwiązania po to, by zapobiec temu, że model nauczy się z publicznie dostępnego tekstu fachowego.
Trzy strategie
| Strategia | Zbierające | Pobrania w czasie działania | Pasuje do |
|---|---|---|---|
| Otwarta | dopuścić | dopuścić | usługodawców, B2B, doradztwa |
| Mieszana | zablokować | dopuścić | wydawnictw, dostawców kursów, mediów branżowych |
| Zamknięta | zablokować | zablokować | treści płatnych, obszarów chronionych |
Dla większości małych i średnich firm właściwym wyborem jest „otwarta”. Strategia mieszana jest sensowną drogą pośrednią dla wszystkich, u których sama treść jest produktem.
Plik robots.txt
Dla strategii otwartej z wyraźnym wymienieniem – nie jest to bezwzględnie konieczne, ale czyni decyzję widoczną i ją dokumentuje:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Przy strategii mieszanej zbierające zostają zablokowane, a pobrania w czasie działania dopuszczone:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-User Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Google-Extended steruje tylko wykorzystaniem do produktów AI Google – a nie zwykłym indeksowaniem w wyszukiwarce. Kto przez pomyłkę zablokuje Googlebot, zniknie z wyszukiwania. Te dwie nazwy to różne rzeczy i bywają regularnie mylone.
Czego robots.txt nie zapewnia
Trzy ograniczenia, które warto znać, zanim się na tym pliku oprze:
- To prośba. Poważni dostawcy się do niej stosują, inni nie. Kto chce wymusić technicznie, potrzebuje blokady na poziomie serwera albo zapory, po identyfikatorze.
- Nie działa wstecz. To, co już zostało zebrane, przez to nie zniknie.
- Nie chroni przed odtwarzaniem z innych źródeł. Jeśli wasze treści są cytowane gdzie indziej, własny plik nie pomoże.
Zanim podejmie się decyzję, opłaca się spojrzeć w dziennik serwera: które z tych identyfikatorów w ogóle występują, jak często i jakie strony pobierają?
Przy małych stronach wynik bywa otrzeźwiający – niewiele wejść, niewiele podstron. Wtedy pytanie jest praktycznie drugorzędne, a właściwe zadanie brzmi inaczej: w ogóle zostać znalezionym. Blokada dla robotów, które i tak nie przychodzą, nie rozwiązuje żadnego problemu, a jedynie zapobiega temu, by później było inaczej.
Ramy prawne
W UE istnieje zastrzeżenie dotyczące eksploracji tekstów i danych: uprawnieni mogą wyraźnie zabronić wykorzystania swoich treści do automatycznej analizy, a zastrzeżenie to musi zostać wyrażone w sposób odczytywalny maszynowo. robots.txt jest do tego formą powszechną, częściowo uzupełnianą wzmianką w warunkach korzystania.
Dla Szwajcarii nie obowiązuje to bezpośrednio; kto kieruje treści także do użytkowników z UE, powinien mimo to wyrazić zastrzeżenie, jeśli go sobie życzy. To punkt, który powinna ocenić osoba fachowa – ten artykuł nie zastępuje porady prawnej.
Podsumowanie
Pytanie nie jest zasadnicze, lecz zależy od modelu biznesowego. Kto sprzedaje treści, blokuje zbierające. Kto sprzedaje zlecenia, dopuszcza jedno i drugie – i zyskuje przez to wymienienia u ludzi, którzy właśnie szukają rozwiązania.
W każdym przypadku obowiązuje: pobrania w czasie działania rozpatrywać osobno. Zablokowanie ich ryczałtem przy okazji to najczęstszy i najdroższy błąd w tej decyzji.
Częste pytania
Czy blokować roboty AI?
Zależy to od modelu biznesowego. Kto zarabia na samych treściach – wydawnictwa, dostawcy kursów, media branżowe – ma dobre powody, by zablokować zbierające z wyprzedzeniem. Kto sprzedaje zlecenia albo usługi, traci przez blokadę więcej, niż zyskuje.
Jaka jest różnica między zbierającymi a pobraniami w czasie działania?
Zbierające, jak GPTBot, ClaudeBot czy PerplexityBot, pobierają treści niezależnie od konkretnego pytania, do treningu albo własnego indeksu. Pobrania w czasie działania, jak ChatGPT-User, Perplexity-User czy OAI-SearchBot, pobierają stronę dokładnie wtedy, gdy ktoś zadał pasujące pytanie – powstają z tego wymienienia i odnośniki.
Czym jest Google-Extended?
Identyfikatorem, którym da się sterować wykorzystaniem treści do produktów AI Google – a nie zwykłym indeksowaniem w wyszukiwarce. To coś innego niż Googlebot; kto tego drugiego przez pomyłkę zablokuje, zniknie z wyszukiwania.
Czy każdy robot stosuje się do robots.txt?
Nie. To prośba, nie blokada techniczna. Poważni dostawcy się do niej stosują, inni nie. Kto chce blokadę wymusić, potrzebuje reguły na poziomie serwera albo zapory, po identyfikatorze – a i wtedy nie działa ona wstecz na treści już zebrane.
Jak sprawdzić, które roboty w ogóle przychodzą?
Przez dziennik serwera, filtrowany po znanych identyfikatorach. Pokazuje to, które roboty jak często jakie strony pobierają. Przy małych stronach wynik bywa niewielki – wtedy kwestia blokady jest drugorzędna wobec zadania, by w ogóle zostać znalezionym.
Marketing, który konfiguruje się sam
Beta Studio Engine jest otwarta. Zarezerwuj miejsce i współtwórz od początku.
Dołącz do bety →