Разрешать или блокировать ИИ-краулеров? Взвешенное решение

Это решение чаще всего ведут как принципиальный вопрос, а оно вопрос бизнеса: кто зарабатывает на контенте, теряет от разрешения. Кто через контент получает заказы, теряет от блокировки — и притом больше.

Ряд узких проёмов, через три из них свет струится в пространство позади, остальные остаются тёмными

Самое важное вкратце

  • Есть два вида обращений: предвосхищающие сборщики и обращения во время выполнения. Ими можно управлять раздельно — и именно в этом самое пригодное решение.
  • Кто продаёт заказы, должен в любом случае разрешить обращения во время выполнения: они порождают упоминания у людей в разгар поиска решения.
  • У того, кто продаёт контент или зарабатывает на показе рекламы, есть веские причины закрыть сборщиков.
  • robots.txt — это просьба, а не запрет. Кто хочет добиться этого технически, нуждается в блокировке на уровне сервера.

Два вида обращений

Предвосхищающие сборщики

Забирают контент независимо от конкретного вопроса — для обучения или для собственного поискового индекса. Примеры: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

Польза для вас: опосредованная — контент доступен в индексе. Затраты: контент используется без того, чтобы кто-то посетил вашу страницу.

Обращения во время выполнения

Забирают страницу в тот момент, когда кто-то задал подходящий вопрос. Примеры: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.

Польза для вас: непосредственная — из этого возникают упоминания и ссылки в конкретных ответах. Затраты: практически никаких.

А ты знал?

Кто огульно блокирует «всех ИИ-ботов», блокирует оба вида — и теряет тем самым именно ту часть, что ему полезна. Упоминание в качестве источника в ответе предполагает, что страницу разрешено забирать во время выполнения.

Для компании, которая продаёт заказы, это худший мыслимый обмен: она мешает рекомендации кому-то в разгар поиска решения — ради того, чтобы не дать модели научиться на общедоступном профессиональном материале.

Три стратегии

СтратегияСборщикиОбращения во время выполненияПодходит
Открытаяразрешитьразрешитьпоставщикам услуг, B2B, консалтингу
Смешаннаязакрытьразрешитьиздательствам, поставщикам курсов, отраслевым СМИ
Закрытаязакрытьзакрытьплатному контенту, защищённым разделам

Для большинства малых и средних предприятий «открытая» — правильный выбор. Смешанная стратегия — разумный средний путь для всех, чей контент сам по себе и есть продукт.

Файл robots.txt

Для открытой стратегии с явным перечислением — это не обязательно, но делает решение видимым и документирует его:

robots.txt — открытая
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Для смешанной стратегии сборщики закрываются, а обращения во время выполнения разрешаются:

robots.txt — смешанная
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml
Внимание Google-Extended управляет лишь использованием для ИИ-продуктов Google — не обычной поисковой индексацией. Кто по ошибке закроет Googlebot, исчезнет из поиска. Эти два имени — разные вещи, и их регулярно путают.

Чего robots.txt не делает

Три ограничения, которые стоит знать, прежде чем полагаться на файл:

  • Это просьба. Серьёзные поставщики её соблюдают, другие нет. Кто хочет добиться этого технически, нуждается в блокировке на уровне сервера или брандмауэра по идентификатору.
  • Она не действует задним числом. То, что уже собрано, от этого не исчезает.
  • Она не защищает от воспроизведения из других источников. Если ваш контент цитируют где-то ещё, ваш собственный файл не поможет.
Из практики

Прежде чем принимать решение, стóит заглянуть в журнал сервера: какие из этих идентификаторов вообще появляются, как часто и какие страницы они забирают?

У небольших сайтов результат часто отрезвляющий — мало обращений, мало страниц. Тогда вопрос практически второстепенен, а настоящая задача другая: вообще быть найденным. Блокировка для краулеров, которые вовсе не приходят, не решает никакой проблемы и лишь мешает тому, чтобы позже стало иначе.

Правовые рамки

В ЕС существует оговорка о text and data mining: правообладатели могут явно запретить использование своего контента для автоматизированного анализа, и эта оговорка должна быть заявлена машиночитаемо. robots.txt — общепринятая для этого форма, отчасти дополненная указанием в условиях использования.

Для Швейцарии это напрямую не действует; кто направляет контент и на пользователей ЕС, тому всё же стоит заявить оговорку, если он её желает. Это пункт, который должен оценить специалист, — данный материал не заменяет юридической консультации.

Итог

Вопрос не принципиальный, а зависит от бизнес-модели. Кто продаёт контент, закрывает сборщиков. Кто продаёт заказы, разрешает оба вида — и выигрывает тем самым упоминания у людей, которые как раз ищут решение.

В любом случае: рассматривать обращения во время выполнения отдельно. Огульно закрыть их заодно — самая частая и самая дорогая ошибка в этом решении.

Частые вопросы

Стоит ли блокировать ИИ-краулеров?

Это зависит от бизнес-модели. У того, кто зарабатывает на самом контенте — издательства, поставщики курсов, отраслевые СМИ, — есть веские причины закрыть предвосхищающих сборщиков. Кто продаёт заказы или услуги, теряет от блокировки больше, чем выигрывает.

В чём разница между сборщиками и обращениями во время выполнения?

Сборщики вроде GPTBot, ClaudeBot или PerplexityBot забирают контент независимо от конкретного вопроса, для обучения или собственного индекса. Обращения во время выполнения вроде ChatGPT-User, Perplexity-User или OAI-SearchBot забирают страницу именно тогда, когда кто-то задал подходящий вопрос, — из этого возникают упоминания и ссылки.

Что такое Google-Extended?

Идентификатор, которым можно управлять использованием контента для ИИ-продуктов Google — не обычной поисковой индексацией. Это нечто иное, чем Googlebot; кто по ошибке закроет последний, исчезнет из поиска.

Соблюдает ли robots.txt каждый краулер?

Нет. Это просьба, а не техническая блокировка. Серьёзные поставщики её соблюдают, другие нет. Кто хочет добиться блокировки, нуждается в правиле на уровне сервера или брандмауэра по идентификатору — и даже тогда оно не действует задним числом на уже собранный контент.

Как проверить, какие краулеры вообще приходят?

Через журнал сервера, отфильтрованный по известным идентификаторам. Это показывает, какие краулеры как часто какие страницы забирают. У небольших сайтов результат часто обозрим — тогда вопрос блокировки второстепенен по сравнению с задачей вообще быть найденным.

Маркетинг, который настраивается сам

Бета Studio Engine уже открыта. Забронируй место и участвуй в развитии с самого начала.

Присоединиться к бете →
← Назад к обзору