Permettere o bloccare i crawler IA? La valutazione

La decisione viene condotta di solito come questione di principio ed è una questione di business: chi guadagna con i contenuti perde permettendo. Chi ottiene commesse grazie ai contenuti perde bloccando, e perde di più.

Una fila di fessure strette, attraverso tre di esse la luce entra nello spazio dietro, le altre restano scure

In breve

  • Esistono due tipi di accesso: raccoglitori anticipati e recuperi in tempo reale. Si governano separatamente, ed è proprio lì che sta la soluzione più utile.
  • Chi vende commesse dovrebbe in ogni caso permettere i recuperi in tempo reale: producono menzioni presso persone nel mezzo della ricerca di una soluzione.
  • Chi vende contenuti o guadagna con la pubblicità ha buoni motivi per bloccare i raccoglitori.
  • Il robots.txt è una richiesta, non un blocco. Chi vuole imporlo tecnicamente ha bisogno di un blocco a livello di server.

I due tipi di accesso

Raccoglitori anticipati

Prendono i contenuti a prescindere da una domanda concreta, per l'addestramento o per un indice di ricerca proprio. Esempi: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

Utilità per voi: indiretta, i contenuti restano disponibili in un indice. Costo: i contenuti vengono usati senza che nessuno visiti la vostra pagina.

Recuperi in tempo reale

Prendono una pagina nel momento in cui qualcuno ha posto una domanda pertinente. Esempi: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.

Utilità per voi: diretta, ne nascono menzioni e collegamenti in risposte concrete. Costo: praticamente nessuno.

Lo sapevi?

Chi blocca in blocco «tutti i bot IA» blocca entrambi i tipi, e perde così proprio la parte che gli è utile. Essere nominati come fonte in una risposta presuppone che la pagina possa essere presa in tempo reale.

Per un'azienda che vende commesse è lo scambio peggiore immaginabile: si impedisce una raccomandazione a qualcuno nel mezzo della ricerca di una soluzione, per impedire che un modello impari da un articolo tecnico pubblicamente accessibile.

Tre strategie

StrategiaRaccoglitoriRecuperi in tempo realeAdatta a
Apertapermessipermessiprestatori di servizi, B2B, consulenza
Mistabloccatipermessieditori, offerte formative, media di settore
Chiusabloccatibloccaticontenuti a pagamento, aree riservate

Per la maggior parte delle piccole e medie imprese la scelta giusta è «aperta». La strategia mista è la via di mezzo sensata per tutti quelli il cui contenuto è esso stesso il prodotto.

Il robots.txt

Per la strategia aperta con menzione esplicita: non è strettamente necessaria, ma rende visibile la decisione e la documenta.

robots.txt – aperto
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Per la strategia mista si bloccano i raccoglitori e si permettono i recuperi in tempo reale:

robots.txt – misto
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml
Attenzione Google-Extended governa solo l'uso per i prodotti IA di Google, non la normale indicizzazione di ricerca. Chi blocca per errore Googlebot sparisce dalla ricerca. Questi due nomi sono cose diverse e vengono confusi con regolarità.

Che cosa il robots.txt non fa

Tre limiti da conoscere prima di affidarsi al file:

  • È una richiesta. I fornitori seri la rispettano, altri no. Chi vuole imporla tecnicamente ha bisogno di un blocco a livello di server o firewall basato sull'identificativo.
  • Non agisce retroattivamente. Ciò che è già stato raccolto non sparisce.
  • Non protegge dalla riproduzione tramite altre fonti. Se i vostri contenuti vengono citati altrove, il vostro file non aiuta.
Dalla pratica

Prima di decidere conviene guardare il registro del server: quali di questi identificativi compaiono davvero, con che frequenza, e quali pagine prendono?

Nei siti piccoli il risultato è spesso deludente: pochi accessi, poche pagine. Allora la questione è praticamente secondaria, e il compito vero è un altro: farsi trovare. Un blocco per crawler che non arrivano nemmeno non risolve alcun problema e impedisce soltanto che in futuro le cose vadano diversamente.

Il quadro giuridico

Nell'UE esiste una riserva sul text and data mining: i titolari dei diritti possono vietare espressamente l'uso dei propri contenuti per l'analisi automatizzata, e quella riserva deve essere dichiarata in forma leggibile dalle macchine. Il robots.txt è la forma abituale, a volte integrata da un'indicazione nelle condizioni d'uso.

Per la Svizzera non si applica direttamente; chi rivolge i contenuti anche a utenti dell'UE dovrebbe comunque dichiarare la riserva, se la desidera. È un punto che dovrebbe valutare un professionista: questo articolo non sostituisce una consulenza legale.

Conclusione

La domanda non è di principio, dipende dal modello di business. Chi vende contenuti blocca i raccoglitori. Chi vende commesse permette entrambi, e guadagna così menzioni presso persone che stanno proprio cercando una soluzione.

In ogni caso vale: considerare i recuperi in tempo reale separatamente. Bloccarli in blocco insieme agli altri è l'errore più frequente e più costoso di questa decisione.

Domande frequenti

Conviene bloccare i crawler IA?

Dipende dal modello di business. Chi guadagna con i contenuti stessi — editori, offerte formative, media di settore — ha buoni motivi per bloccare i raccoglitori anticipati. Chi vende commesse o servizi perde più di quanto guadagni bloccando.

Qual è la differenza tra raccoglitori e recuperi in tempo reale?

I raccoglitori come GPTBot, ClaudeBot o PerplexityBot prendono i contenuti a prescindere da una domanda concreta, per l'addestramento o per un indice proprio. I recuperi in tempo reale come ChatGPT-User, Perplexity-User o OAI-SearchBot prendono una pagina esattamente quando qualcuno ha posto una domanda pertinente, e da lì nascono menzioni e collegamenti.

Che cos'è Google-Extended?

Un identificativo con cui si governa l'uso dei contenuti per i prodotti IA di Google, non la normale indicizzazione di ricerca. È una cosa diversa da Googlebot: chi blocca quest'ultimo per errore sparisce dalla ricerca.

Tutti i crawler rispettano il robots.txt?

No. È una richiesta, non un blocco tecnico. I fornitori seri la rispettano, altri no. Chi vuole imporre un blocco ha bisogno di una regola a livello di server o firewall basata sull'identificativo, e anche allora non agisce retroattivamente sui contenuti già raccolti.

Come si verifica quali crawler arrivino davvero?

Attraverso il registro del server, filtrato sugli identificativi noti. Mostra quali crawler prendono quali pagine e con che frequenza. Nei siti piccoli il risultato è spesso contenuto, e allora la questione del blocco è secondaria rispetto al compito di farsi trovare.

Un marketing che si configura da solo

La beta di Studio Engine è aperta. Prenota il tuo posto e contribuisci fin dall’inizio.

Partecipa alla beta →
← Torna all'elenco