Tekoälyrobotit sallia vai estää? Punninta

Päätöstä käsitellään useimmiten periaatekysymyksenä, ja se on liiketoimintakysymys: se, joka ansaitsee sisällöillä, menettää salliessaan. Se, joka saa sisällöillä toimeksiantoja, menettää estäessään – ja enemmän.

Rivi kapeita aukkoja, kolmesta niistä virtaa valoa takana olevaan tilaan, loput pysyvät pimeinä

Tärkeimmät kohdat

  • Käyntejä on kahta lajia: ennakoivat kerääjät ja ajonaikaiset haut. Niitä voi ohjata erikseen – ja juuri siinä on käyttökelpoisin ratkaisu.
  • Se, joka myy toimeksiantoja, sallikoon ajonaikaiset haut joka tapauksessa: ne tuottavat mainintoja ihmisille, jotka ovat keskellä ratkaisun etsintää.
  • Sillä, joka myy sisältöä tai ansaitsee mainosnäytöillä, on hyvät syyt estää kerääjät.
  • robots.txt on pyyntö, ei este. Se, joka haluaa toteuttaa eston teknisesti, tarvitsee eston palvelintasolla.

Kaksi käyntien lajia

Ennakoivat kerääjät

Hakevat sisältöä riippumatta konkreettisesta kysymyksestä – koulutusta tai omaa hakuindeksiä varten. Esimerkkejä: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.

Hyöty teille: välillinen – sisällöt ovat käytettävissä indeksissä. Kustannus: sisältöjä käytetään ilman että kukaan käy sivustollanne.

Ajonaikaiset haut

Hakevat sivun sillä hetkellä, kun joku on esittänyt sopivan kysymyksen. Esimerkkejä: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.

Hyöty teille: välitön – niistä syntyy mainintoja ja linkityksiä konkreettisiin vastauksiin. Kustannus: käytännössä ei mitään.

Tiesitkö?

Se, joka estää yleispätevästi «kaikki tekoälybotit», estää molemmat lajit – ja menettää siten juuri sen osan, josta on hänelle hyötyä. Maininta lähteenä vastauksessa edellyttää, että sivu saadaan hakea ajon aikana.

Yritykselle, joka myy toimeksiantoja, se on huonoin kuviteltavissa oleva vaihtokauppa: estetään suositus keskellä ratkaisun etsintää olevalle ihmiselle, jotta estettäisiin mallia oppimasta julkisesti saatavilla olevasta asiantuntija-artikkelista.

Kolme strategiaa

StrategiaKerääjätAjonaikaiset hautSopii
Avoinsallitaansallitaanpalveluntarjoajille, B2B:lle, konsultoinnille
Sekamuotoestetäänsallitaankustantajille, kurssitarjoajille, ammattimedioille
Suljettuestetäänestetäänmaksulliselle sisällölle, suojatuille alueille

Useimmille pienille ja keskisuurille yrityksille «avoin» on oikea valinta. Sekamuoto on järkevä välitie kaikille niille, joiden sisältö itsessään on tuote.

robots.txt

Avoimeen strategiaan nimenomaisin maininnoin – se ei ole välttämätöntä, mutta tekee päätöksen näkyväksi ja dokumentoi sen:

robots.txt – avoin
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Sekamuodossa kerääjät estetään ja ajonaikaiset haut sallitaan:

robots.txt – sekamuoto
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml
Huomio Google-Extended ohjaa vain käyttöä Googlen tekoälytuotteissa – ei tavallista hakuindeksointia. Se, joka estää vahingossa Googlebot-robotin, katoaa hausta. Nämä kaksi nimeä ovat eri asioita ja menevät säännöllisesti sekaisin.

Mihin robots.txt ei pysty

Kolme rajoitusta, jotka on syytä tuntea ennen kuin tiedostoon luottaa:

  • Se on pyyntö. Vakavasti otettavat toimijat noudattavat sitä, muut eivät. Se, joka haluaa toteuttaa eston teknisesti, tarvitsee säännön palvelin- tai palomuuritasolla tunnisteen perusteella.
  • Se ei vaikuta taannehtivasti. Se, mikä on jo kerätty, ei katoa sen myötä.
  • Se ei suojaa toistolta muista lähteistä. Jos sisältöjänne lainataan muualla, oma tiedostonne ei auta.
Käytännöstä

Ennen päätöksen tekemistä kannattaa vilkaista palvelinlokia: mitkä näistä tunnisteista ylipäätään esiintyvät, kuinka usein, ja mitä sivuja ne hakevat?

Pienillä verkkosivustoilla tulos on usein karu – vähän käyntejä, vähän sivuja. Silloin kysymys on käytännössä toissijainen, ja varsinainen tehtävä on toinen: tulla ylipäätään löydetyksi. Esto roboteille, jotka eivät edes tule, ei ratkaise mitään ongelmaa ja estää vain sen, että tilanne myöhemmin muuttuisi.

Oikeudellinen kehys

EU:ssa on voimassa teksti- ja tiedonlouhintaa koskeva varauma: oikeudenhaltijat voivat nimenomaisesti kieltää sisältöjensä käytön automaattiseen analyysiin, ja tämä varauma on esitettävä koneluettavassa muodossa. robots.txt on siihen vakiintunut muoto, osin täydennettynä maininnalla käyttöehdoissa.

Sveitsissä tämä ei päde suoraan; se, joka suuntaa sisältöjä myös EU-käyttäjille, esittäköön varauman kuitenkin, jos hän sitä haluaa. Tämä on kohta, jonka asiantuntijan on syytä arvioida – tämä artikkeli ei korvaa oikeudellista neuvontaa.

Johtopäätös

Kysymys ei ole periaatteellinen vaan riippuu liiketoimintamallista. Se, joka myy sisältöä, estää kerääjät. Se, joka myy toimeksiantoja, sallii molemmat – ja saa siten mainintoja ihmisille, jotka juuri etsivät ratkaisua.

Joka tapauksessa pätee: käsitelkää ajonaikaiset haut erikseen. Niiden estäminen samalla kertaa on tämän päätöksen yleisin ja kallein virhe.

Usein kysytyt kysymykset

Pitäisikö tekoälyrobotit estää?

Se riippuu liiketoimintamallista. Sillä, joka ansaitsee sisällöillä itsellään – kustantajat, kurssitarjoajat, ammattimediat – on hyvät syyt estää ennakoivat kerääjät. Se, joka myy toimeksiantoja tai palveluja, menettää estämällä enemmän kuin voittaa.

Mikä on kerääjien ja ajonaikaisten hakujen ero?

Kerääjät kuten GPTBot, ClaudeBot tai PerplexityBot hakevat sisältöä riippumatta konkreettisesta kysymyksestä, koulutusta tai omaa indeksiä varten. Ajonaikaiset haut kuten ChatGPT-User, Perplexity-User tai OAI-SearchBot hakevat sivun juuri silloin, kun joku on esittänyt sopivan kysymyksen – niistä syntyy mainintoja ja linkityksiä.

Mikä on Google-Extended?

Tunniste, jolla voi ohjata sisältöjen käyttöä Googlen tekoälytuotteissa – ei tavallista hakuindeksointia. Se on eri asia kuin Googlebot; se, joka estää tämän vahingossa, katoaa hausta.

Noudattaako jokainen robotti robots.txt-tiedostoa?

Ei. Se on pyyntö, ei tekninen este. Vakavasti otettavat toimijat noudattavat sitä, muut eivät. Se, joka haluaa toteuttaa eston, tarvitsee säännön palvelin- tai palomuuritasolla tunnisteen perusteella – eikä sekään vaikuta taannehtivasti jo kerättyyn sisältöön.

Miten tarkistetaan, mitkä robotit ylipäätään tulevat?

Palvelinlokista, suodatettuna tunnettujen tunnisteiden mukaan. Se näyttää, mitkä robotit hakevat kuinka usein mitäkin sivuja. Pienillä verkkosivustoilla tulos on usein vähäinen – silloin estokysymys on toissijainen suhteessa tehtävään tulla ylipäätään löydetyksi.

Markkinointi, joka pystyttää itsensä

Studio Enginen beta on auki. Varaa paikkasi ja ole mukana alusta asti.

Osallistu betaan →
← Takaisin listaukseen