¿Permitir o bloquear los rastreadores de IA? La ponderación
La decisión se plantea casi siempre como una cuestión de principios y es una cuestión de negocio: quien gana dinero con contenidos pierde permitiendo. Quien gana encargos con contenidos pierde bloqueando, y pierde más.
Lo esencial
- Hay dos tipos de accesos: los recolectores anticipados y las recuperaciones en tiempo de ejecución. Se controlan por separado, y justo ahí está la solución más aprovechable.
- Quien vende encargos debería permitir en cualquier caso las recuperaciones en tiempo de ejecución: producen menciones ante personas en plena búsqueda de solución.
- Quien vende contenidos o gana con publicidad tiene buenos motivos para bloquear los recolectores.
- El robots.txt es una petición, no un bloqueo. Quien quiera imponerlo técnicamente necesita un bloqueo a nivel de servidor.
Los dos tipos de accesos
Recolectores anticipados
Recogen contenidos con independencia de una pregunta concreta, para entrenamiento o para un índice de búsqueda propio. Ejemplos: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
Utilidad para vosotros: indirecta; los contenidos quedan disponibles en un índice. Coste: los contenidos se usan sin que nadie visite vuestra página.
Recuperaciones en tiempo de ejecución
Recogen una página en el momento en que alguien ha planteado una pregunta que encaja. Ejemplos: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.
Utilidad para vosotros: directa; de ahí salen menciones y enlaces en respuestas concretas. Coste: prácticamente ninguno.
¿Sabías que…?
Quien bloquea de forma general «todos los bots de IA» bloquea ambos tipos, y pierde con ello justo la parte que le beneficia. La mención como fuente en una respuesta presupone que la página se pueda recoger en tiempo de ejecución.
Para una empresa que vende encargos ese es el peor intercambio imaginable: se impide una recomendación a alguien en plena búsqueda de solución para evitar que un modelo aprenda de un artículo especializado de acceso público.
Tres estrategias
| Estrategia | Recolectores | Recuperaciones en ejecución | Encaja con |
|---|---|---|---|
| Abierta | permitir | permitir | prestadores de servicios, B2B, consultoría |
| Mixta | bloquear | permitir | editoriales, formación, medios especializados |
| Cerrada | bloquear | bloquear | contenidos de pago, zonas protegidas |
Para la mayoría de las pymes, «abierta» es la elección correcta. La estrategia mixta es la vía intermedia sensata para todos aquellos cuyo contenido es el propio producto.
El robots.txt
Para la estrategia abierta con mención expresa; no es obligatorio, pero hace visible la decisión y la documenta:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Para la estrategia mixta se bloquean los recolectores y se permiten las recuperaciones en tiempo de ejecución:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-User Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Google-Extended controla solo el uso para los productos de IA de Google, no la indexación normal de la búsqueda. Quien bloquee por error Googlebot desaparece de la búsqueda. Esos dos nombres son cosas distintas y se confunden con regularidad.
Lo que el robots.txt no consigue
Tres limitaciones que conviene conocer antes de confiar en el archivo:
- Es una petición. Los proveedores serios la respetan, otros no. Quien quiera imponerlo técnicamente necesita un bloqueo a nivel de servidor o cortafuegos según la identificación.
- No actúa con efecto retroactivo. Lo que ya se ha recogido no desaparece por ello.
- No protege frente a la reproducción desde otras fuentes. Si vuestros contenidos se citan en otro sitio, vuestro propio archivo no ayuda.
Antes de tomar la decisión compensa mirar el registro del servidor: ¿cuáles de esas identificaciones aparecen siquiera, con qué frecuencia y qué páginas recogen?
En webs pequeñas el resultado suele ser desalentador: pocos accesos, pocas páginas. Entonces la pregunta es prácticamente secundaria y la tarea real es otra: ser encontrado siquiera. Un bloqueo para rastreadores que no vienen no resuelve ningún problema y solo impide que eso cambie más adelante.
El marco jurídico
En la UE existe una reserva de derechos para la minería de textos y datos: los titulares pueden prohibir expresamente el uso de sus contenidos para el análisis automatizado, y esa reserva debe declararse de forma legible por máquina. El robots.txt es la forma habitual para ello, a veces complementada con una indicación en las condiciones de uso.
Para Suiza eso no rige de forma directa; quien dirija contenidos también a usuarios de la UE debería declarar la reserva si la desea. Es un punto que debería valorar una persona especializada: este artículo no sustituye al asesoramiento jurídico.
Conclusión
La pregunta no es de principios sino que depende del modelo de negocio. Quien vende contenidos bloquea los recolectores. Quien vende encargos permite ambos, y gana con ello menciones ante personas que están buscando una solución.
En cualquier caso vale: considerar las recuperaciones en tiempo de ejecución por separado. Bloquearlas de paso es el error más frecuente y más caro de esta decisión.
Preguntas frecuentes
¿Conviene bloquear los rastreadores de IA?
Depende del modelo de negocio. Quien gana dinero con los propios contenidos —editoriales, formación, medios especializados— tiene buenos motivos para bloquear los recolectores anticipados. Quien vende encargos o servicios pierde más bloqueando de lo que gana.
¿Qué diferencia hay entre recolectores y recuperaciones en tiempo de ejecución?
Los recolectores como GPTBot, ClaudeBot o PerplexityBot recogen contenidos con independencia de una pregunta concreta, para entrenamiento o para un índice propio. Las recuperaciones en tiempo de ejecución como ChatGPT-User, Perplexity-User u OAI-SearchBot recogen una página justo cuando alguien ha planteado una pregunta que encaja, y de ahí salen menciones y enlaces.
¿Qué es Google-Extended?
Una identificación con la que se controla el uso de los contenidos para los productos de IA de Google, no la indexación normal de la búsqueda. Es algo distinto de Googlebot; quien bloquee este último por error desaparece de la búsqueda.
¿Respetan todos los rastreadores el robots.txt?
No. Es una petición, no un bloqueo técnico. Los proveedores serios la respetan, otros no. Quien quiera imponer un bloqueo necesita una regla a nivel de servidor o cortafuegos según la identificación, y ni siquiera entonces actúa con efecto retroactivo sobre lo ya recogido.
¿Cómo se comprueba qué rastreadores vienen siquiera?
Con el registro del servidor, filtrado por las identificaciones conocidas. Eso muestra qué rastreadores recogen qué páginas y con qué frecuencia. En webs pequeñas el resultado suele ser abarcable, y entonces la pregunta del bloqueo es secundaria frente a la tarea de ser encontrado siquiera.
Marketing que se configura solo
La beta del Studio Engine está abierta. Reserva tu plaza y participa desde el principio.
Unirse a la beta →