Tekoälyrobotit sallia vai estää? Punninta
Päätöstä käsitellään useimmiten periaatekysymyksenä, ja se on liiketoimintakysymys: se, joka ansaitsee sisällöillä, menettää salliessaan. Se, joka saa sisällöillä toimeksiantoja, menettää estäessään – ja enemmän.
Tärkeimmät kohdat
- Käyntejä on kahta lajia: ennakoivat kerääjät ja ajonaikaiset haut. Niitä voi ohjata erikseen – ja juuri siinä on käyttökelpoisin ratkaisu.
- Se, joka myy toimeksiantoja, sallikoon ajonaikaiset haut joka tapauksessa: ne tuottavat mainintoja ihmisille, jotka ovat keskellä ratkaisun etsintää.
- Sillä, joka myy sisältöä tai ansaitsee mainosnäytöillä, on hyvät syyt estää kerääjät.
- robots.txt on pyyntö, ei este. Se, joka haluaa toteuttaa eston teknisesti, tarvitsee eston palvelintasolla.
Kaksi käyntien lajia
Ennakoivat kerääjät
Hakevat sisältöä riippumatta konkreettisesta kysymyksestä – koulutusta tai omaa hakuindeksiä varten. Esimerkkejä: GPTBot, PerplexityBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
Hyöty teille: välillinen – sisällöt ovat käytettävissä indeksissä. Kustannus: sisältöjä käytetään ilman että kukaan käy sivustollanne.
Ajonaikaiset haut
Hakevat sivun sillä hetkellä, kun joku on esittänyt sopivan kysymyksen. Esimerkkejä: OAI-SearchBot, ChatGPT-User, Perplexity-User, Claude-User.
Hyöty teille: välitön – niistä syntyy mainintoja ja linkityksiä konkreettisiin vastauksiin. Kustannus: käytännössä ei mitään.
Tiesitkö?
Se, joka estää yleispätevästi «kaikki tekoälybotit», estää molemmat lajit – ja menettää siten juuri sen osan, josta on hänelle hyötyä. Maininta lähteenä vastauksessa edellyttää, että sivu saadaan hakea ajon aikana.
Yritykselle, joka myy toimeksiantoja, se on huonoin kuviteltavissa oleva vaihtokauppa: estetään suositus keskellä ratkaisun etsintää olevalle ihmiselle, jotta estettäisiin mallia oppimasta julkisesti saatavilla olevasta asiantuntija-artikkelista.
Kolme strategiaa
| Strategia | Kerääjät | Ajonaikaiset haut | Sopii |
|---|---|---|---|
| Avoin | sallitaan | sallitaan | palveluntarjoajille, B2B:lle, konsultoinnille |
| Sekamuoto | estetään | sallitaan | kustantajille, kurssitarjoajille, ammattimedioille |
| Suljettu | estetään | estetään | maksulliselle sisällölle, suojatuille alueille |
Useimmille pienille ja keskisuurille yrityksille «avoin» on oikea valinta. Sekamuoto on järkevä välitie kaikille niille, joiden sisältö itsessään on tuote.
robots.txt
Avoimeen strategiaan nimenomaisin maininnoin – se ei ole välttämätöntä, mutta tekee päätöksen näkyväksi ja dokumentoi sen:
User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: Applebot-Extended Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Sekamuodossa kerääjät estetään ja ajonaikaiset haut sallitaan:
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: PerplexityBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-User Allow: / User-agent: * Allow: / Sitemap: https://example.com/sitemap.xml
Google-Extended ohjaa vain käyttöä Googlen tekoälytuotteissa – ei tavallista hakuindeksointia. Se, joka estää vahingossa Googlebot-robotin, katoaa hausta. Nämä kaksi nimeä ovat eri asioita ja menevät säännöllisesti sekaisin.
Mihin robots.txt ei pysty
Kolme rajoitusta, jotka on syytä tuntea ennen kuin tiedostoon luottaa:
- Se on pyyntö. Vakavasti otettavat toimijat noudattavat sitä, muut eivät. Se, joka haluaa toteuttaa eston teknisesti, tarvitsee säännön palvelin- tai palomuuritasolla tunnisteen perusteella.
- Se ei vaikuta taannehtivasti. Se, mikä on jo kerätty, ei katoa sen myötä.
- Se ei suojaa toistolta muista lähteistä. Jos sisältöjänne lainataan muualla, oma tiedostonne ei auta.
Ennen päätöksen tekemistä kannattaa vilkaista palvelinlokia: mitkä näistä tunnisteista ylipäätään esiintyvät, kuinka usein, ja mitä sivuja ne hakevat?
Pienillä verkkosivustoilla tulos on usein karu – vähän käyntejä, vähän sivuja. Silloin kysymys on käytännössä toissijainen, ja varsinainen tehtävä on toinen: tulla ylipäätään löydetyksi. Esto roboteille, jotka eivät edes tule, ei ratkaise mitään ongelmaa ja estää vain sen, että tilanne myöhemmin muuttuisi.
Oikeudellinen kehys
EU:ssa on voimassa teksti- ja tiedonlouhintaa koskeva varauma: oikeudenhaltijat voivat nimenomaisesti kieltää sisältöjensä käytön automaattiseen analyysiin, ja tämä varauma on esitettävä koneluettavassa muodossa. robots.txt on siihen vakiintunut muoto, osin täydennettynä maininnalla käyttöehdoissa.
Sveitsissä tämä ei päde suoraan; se, joka suuntaa sisältöjä myös EU-käyttäjille, esittäköön varauman kuitenkin, jos hän sitä haluaa. Tämä on kohta, jonka asiantuntijan on syytä arvioida – tämä artikkeli ei korvaa oikeudellista neuvontaa.
Johtopäätös
Kysymys ei ole periaatteellinen vaan riippuu liiketoimintamallista. Se, joka myy sisältöä, estää kerääjät. Se, joka myy toimeksiantoja, sallii molemmat – ja saa siten mainintoja ihmisille, jotka juuri etsivät ratkaisua.
Joka tapauksessa pätee: käsitelkää ajonaikaiset haut erikseen. Niiden estäminen samalla kertaa on tämän päätöksen yleisin ja kallein virhe.
Usein kysytyt kysymykset
Pitäisikö tekoälyrobotit estää?
Se riippuu liiketoimintamallista. Sillä, joka ansaitsee sisällöillä itsellään – kustantajat, kurssitarjoajat, ammattimediat – on hyvät syyt estää ennakoivat kerääjät. Se, joka myy toimeksiantoja tai palveluja, menettää estämällä enemmän kuin voittaa.
Mikä on kerääjien ja ajonaikaisten hakujen ero?
Kerääjät kuten GPTBot, ClaudeBot tai PerplexityBot hakevat sisältöä riippumatta konkreettisesta kysymyksestä, koulutusta tai omaa indeksiä varten. Ajonaikaiset haut kuten ChatGPT-User, Perplexity-User tai OAI-SearchBot hakevat sivun juuri silloin, kun joku on esittänyt sopivan kysymyksen – niistä syntyy mainintoja ja linkityksiä.
Mikä on Google-Extended?
Tunniste, jolla voi ohjata sisältöjen käyttöä Googlen tekoälytuotteissa – ei tavallista hakuindeksointia. Se on eri asia kuin Googlebot; se, joka estää tämän vahingossa, katoaa hausta.
Noudattaako jokainen robotti robots.txt-tiedostoa?
Ei. Se on pyyntö, ei tekninen este. Vakavasti otettavat toimijat noudattavat sitä, muut eivät. Se, joka haluaa toteuttaa eston, tarvitsee säännön palvelin- tai palomuuritasolla tunnisteen perusteella – eikä sekään vaikuta taannehtivasti jo kerättyyn sisältöön.
Miten tarkistetaan, mitkä robotit ylipäätään tulevat?
Palvelinlokista, suodatettuna tunnettujen tunnisteiden mukaan. Se näyttää, mitkä robotit hakevat kuinka usein mitäkin sivuja. Pienillä verkkosivustoilla tulos on usein vähäinen – silloin estokysymys on toissijainen suhteessa tehtävään tulla ylipäätään löydetyksi.
Markkinointi, joka pystyttää itsensä
Studio Enginen beta on auki. Varaa paikkasi ja ole mukana alusta asti.
Osallistu betaan →