Miksi tekoäly lainaa joitakin sivuja ja sivuuttaa toiset

Kahden saman tiedon sisältävän sivun välillä ei laatu ratkaise sitä, kumpaa lainataan. Ratkaisevaa on, saako toisesta niistä irrotettua virkkeen, joka seisoo omillaan ja on tarkistettavissa.

Samanlaisten heikkojen muotojen kentästä valo tavoittaa täsmälleen yhden, joka astuu esiin

Tärkeimmät kohdat

  • Lainataan jaksoja, ei sivuja – siksi järjestys ratkaisee enemmän kuin kokonaislaatu.
  • Kuusi ominaisuutta on lainatuilla lähteillä yhteistä: irrotettava vastaus, tarkistettavissa oleva tieto, tunnistettava vastuu, ajantasaisuus, tekninen luettavuus ja aiheellinen läheisyys.
  • Kolme syytä sulkee vahvat sivut ulos: sisältö syntyy vasta JavaScriptillä, sivu on estetty, tai väitteet ovat hajallaan pelkässä leipätekstissä.
  • Tarkistettavissa oleva oma tieto on vahvin yksittäinen tekijä – se on syy siihen, että malli nimeää teidät eikä yleistä lähdettä.

Kun järjestelmä rakentaa vastausta, se ei valitse lähteitä myötätunnon tai arvovallan vaan käyttökelpoisuuden mukaan. Kysymys on aina sama: tuottaako tämä sivu tekstinpätkän, joka vastaa esitettyyn kysymykseen, on itsessään ymmärrettävä ja on todistettavissa?

Kuusi ominaisuutta

1. Irrotettava vastaus

Jakso, joka vastaa kysymykseen kahdesta neljään virkkeessä kokonaan viittaamatta ympäröivään tekstiin. Ylivoimaisesti tärkein ominaisuus – ja ainoa, joka on täysin omissa käsissä.

2. Tarkistettavissa oleva oma tieto

Luku, menettely, ajanjakso, kokemus pätevyysalueineen. Se on syy siihen, että malli nimeää teidät eikä yleistä lähdettä: te sanotte jotain, mitä ei lue muualla.

3. Tunnistettava vastuu

Kirjoittaja roolineen, yritys osoitteineen, viimeisen tarkistuksen päivä – näkyvissä sivulla ja strukturoidussa datassa, samalla arvolla. Erityisen tärkeää aiheissa, jotka koskettavat rahaa, terveyttä tai oikeutta.

4. Uskottava ajantasaisuus

Päivämäärä, joka pitää paikkansa, ja sisältö, joka sopii tähän päivämäärään. Eilinen muutospäivä tekstissä, joka kuvaa aikaa sitten vanhentunutta tilaa, on huonompi kuin ei päivämäärää lainkaan.

5. Tekninen luettavuus

Sisältö on toimitetussa HTML:ssä, ei vasta JavaScriptin suorittamisen jälkeen. Siisti otsikkohierarkia, ei estoa robots.txt-tiedostossa ajonaikaisille hauille.

6. Ympäristön aiheellinen läheisyys

Sivu kentässä, jonka verkkosivusto tunnistettavasti valtaa, arvotetaan todennäköisemmin asiantuntijalähteeksi kuin yksittäinen artikkeli kahdenkymmenen toisiinsa liittymättömän aiheen joukossa. Se on syy siihen, että aihekokonaisuudet vaikuttavat.

Tiesitkö?

Ominaisuus kaksi on varsinainen vipu pienille yrityksille. Yleisessä tiedossa kilpailette suurten portaalien kanssa ja häviätte – siinä ei ole mitään syytä nimetä juuri teitä.

Tarkistettavissa olevan oman tiedon kohdalla te olette lähde. «Käytännössä kasvaneen kontaktilistan siivoaminen kestää yhdestä kolmeen päivää» ei ole yleisesti tunnettu väite – se on peräisin joltakulta, joka on tehnyt sen, ja juuri siksi se on lainauskelpoinen. Yksi virke omaa kokemusta painaa enemmän kuin kolme kappaletta tiivistelmää.

Kolme syytä, joiden vuoksi vahvat sivut putoavat pois

SyyMistä sen tunnistaaKorjaamisen vaiva
Sisältö syntyy vasta selaimessaSivun lähdekoodi ei sisällä tekstiäsuuri – arkkitehtuurikysymys
Ajonaikaiset haut estettyrobots.txt estää ChatGPT-Userin & kumppanitminuutteja
Väitteet hajallaan pelkässä leipätekstissäyksikään kappale ei vastaa yksin kysymykseenkeskisuuri – kappaleiden uudelleenrakennus

Toinen syy on ärsyttävin, koska se on korjattu minuuteissa ja esiintyy silti usein – useimmiten sivuvaikutuksena yleispätevästä «kaikkien tekoälybottien» estosta.

Käytännöstä

Kuvio, joka näkyy lainattuja lähteitä analysoitaessa: ne ovat harvoin laajoja yleiskatsausartikkeleita. Ne ovat lyhyitä sivuja, jotka vastaavat täsmälleen yhteen kysymykseen kokonaan – usein sellaisia, joita omassa talossa pidetään sivutuotteina.

900 sanan artikkelia, jossa on selkeä luku ja nimetty pätevyysalue, lainataan useammin kuin 2 500 sanan opasta samasta aiheesta, jossa sama luku on kappaleessa yksitoista. Sisältösuunnittelun kannalta se tarkoittaa: enemmän terävästi rajattuja yksittäiskysymyksiä, vähemmän kaikenkattavia oppaita.

Mitä konkreettisesti voi tehdä

  1. Tee irrotustesti. Kopioi mikä tahansa kappale tyhjään dokumenttiin: vastaako se yksin tunnistettavaan kysymykseen? Useimmissa artikkeleissa kaksi kymmenestä kappaleesta läpäisee.
  2. Täydennä omia tietoja. Jokaiseen artikkeliin vähintään yksi luku, menettely tai kokemus pätevyysalueineen – omasta toiminnasta, ei lähteestä.
  3. Tiivistelmä ylös. Neljä täydellistä väitettä. Viisitoista minuuttia artikkelia kohti ilman muutosta sisältöön.
  4. Tarkista ajonaikaiset haut. Katso robots.txt-tiedostosta, ovatko ChatGPT-User, Perplexity-User ja Claude-User sallittuja.
  5. Analysoi palvelinloki. Haetaanko sivujanne ylipäätään? Ilman käyntiä ei lainausta – ja se on eri työmaa kuin lainauskelpoisuus.
Prompt
Arvioi, miksi vastauskoneet lainaisivat tätä sivua
tai eivät. Ole tiukka; älä kehu mitään; älä kirjoita tekstiä uusiksi.

Sivun teksti:
[Liitä teksti]

Lisätiedot:
- Onko sisältö toimitetussa HTML:ssä? [kyllä / ei / tuntematon]
- Ovatko kirjoittaja, rooli ja tarkistuspäivä näkyvissä? [kyllä / ei]
- Minkä kentän verkkosivustomme muuten valtaa? [Aiheet]

Tehtävät:
1. Tarkista kuusi ominaisuutta erikseen – irrotettava vastaus,
   tarkistettavissa oleva oma tieto, tunnistettava vastuu,
   ajantasaisuus, tekninen luettavuus, ympäristön aiheellinen
   läheisyys. Anna jokaisesta ominaisuudesta täyttyy/osittain/ei täyty
   perusteluineen tekstiesimerkin avulla.
2. Nimeä ne kolme kappaletta, joita lainattaisiin todennäköisimmin, ja
   kerro jokaisesta, mihin kysymykseen se vastaa.
3. Nimeä jokainen tekstin väite, joka voisi seistä millä tahansa
   muullakin sivulla – eli ei sisällä mitään omaa.
4. Muotoile minulle kolme kysymystä, joiden vastaukset tuottaisivat tarkistettavissa
   olevia omia tietoja, joita tekstistä tänään puuttuu.

Älä keksi lukuja äläkä lähteitä.

Johtopäätös

Lainataan sitä, mikä on irrotettavissa ja sanoo jotain, mitä ei lue muualla. Molemmat ovat järjestyksen ja aineiston kysymyksiä, eivät artikkelin kokonaislaadun.

Pienille yrityksille vipu on yksiselitteisesti ominaisuudessa kaksi: yleisessä tiedossa ei ole mitään syytä nimetä teitä. Oman luvun ja nimetyn pätevyysalueen kohdalla te olette lähde.

Usein kysytyt kysymykset

Miksi tekoäly lainaa joitakin sivuja ja toisia ei?

Koska se valitsee jaksoja, ei sivuja. Lainataan sitä, mikä on irrotettavissa ja pysyy itsessään ymmärrettävänä, mikä sisältää tarkistettavissa olevan tiedon, mistä on tunnistettavissa kuka on takana, mikä on ajantasaista ja teknisesti luettavaa – ja mikä sijaitsee kentässä, jonka verkkosivusto tunnistettavasti valtaa.

Mikä on vahvin yksittäinen tekijä?

Tarkistettavissa oleva oma tieto: luku, menettely, kokemus nimettyine pätevyysalueineen. Yleisessä tiedossa ei ole mitään syytä nimetä juuri pientä yritystä – oman tiedon kohdalla se on lähde.

Miksi sisällöllisesti vahvaa sivua ei joskus koskaan lainata?

Kolmesta syystä: sisältö syntyy vasta JavaScriptillä eikä ole toimitetussa HTML:ssä; ajonaikaiset haut on estetty robots.txt-tiedostossa, usein sivuvaikutuksena kaikkien tekoälybottien yleispätevästä estosta; tai väitteet ovat hajallaan leipätekstissä niin, ettei yksikään kappale vastaa yksin kysymykseen.

Lainataanko pitkiä vai lyhyitä artikkeleita useammin?

Käytännössä pikemminkin lyhyitä, terävästi rajattuja. Noin 900 sanan artikkelia, jossa on selkeä luku ja nimetty pätevyysalue, lainataan useammin kuin laajaa opasta, jossa sama luku on kappaleessa yksitoista – koska lyhyt artikkeli on helpompi irrottaa.

Miten omaa lainauskelpoisuutta tarkistetaan?

Irrotustestillä: kopioi mikä tahansa kappale tyhjään dokumenttiin ja lue se. Vastaako se yksin tunnistettavaan kysymykseen kokonaan? Useimmissa artikkeleissa noin kaksi kymmenestä kappaleesta läpäisee – tämä osuus on puhuvin mittari lainauskelpoisuudelle.

Markkinointi, joka pystyttää itsensä

Studio Enginen beta on auki. Varaa paikkasi ja ole mukana alusta asti.

Osallistu betaan →
← Takaisin listaukseen