A/B-tester med lite trafikk: Hva som likevel går

En A/B-test trenger nok tilfeller til å skille tilfeldighet fra virkning. Med 300 besøkende i måneden er den grensen ikke nåbar – hvert resultat er da en mynt. Fem andre framgangsmåter gir likevel brukbare holdepunkter.

Bare fire lysende punkter i et vidt tomt felt, og likevel er det trukket en klar kurve gjennom dem

Det viktigste kort

  • Under omtrent 1000 målhandlinger per variant lar A/B-resultater seg ikke skille fra tilfeldighet – på små nettsteder altså praktisk talt aldri.
  • Fem framgangsmåter fungerer likevel: brukerobservasjon, firesekunderstesten, før-og-etter over kvartaler, frafallspunkter og spørsmålet i førstesamtalen.
  • Ved lite trafikk lønner store endringer seg framfor små – en ny oppbygging, ikke en annen knappefarge.
  • Den som likevel vil A/B-teste, tester på e-postlister i stedet for på nettstedet: der er tallene ofte tilstrekkelige.

Hvorfor det ikke går regnemessig

En test skal vise om en endring virker, eller om forskjellen er tilfeldig. Hvor mange tilfeller som trengs til det, avhenger av to ting: utgangsraten og størrelsen på den forventede forskjellen.

Et eksempel gjør størrelsesordenen tydelig: med en utgangsrate på 3 prosent og en håpet økning til 3,6 prosent – altså 20 prosent relativ forbedring – trengs det flere tusen besøkende per variant for å skille forskjellen pålitelig fra tilfeldighet. Med 300 besøkende i måneden ville testen først vært talende etter flere år, og innen da har tilbudet endret seg.

Merk En test som avsluttes for tidlig fordi en variant «ligger foran», er ingen test, men en bekreftelse av det man antok uansett. Ved små tall skifter ledelsen jevnlig – den som avbryter ved det ønskede resultatet, finner alltid ett.

De fem framgangsmåtene som fungerer

1. Se fem mennesker over skulderen

Fra målgruppen, med en oppgave, uten forklaring. Der de nøler, ligger feilen. Fem personer avdekker mesteparten av de grove problemene.

Innsats: 2 timer · Utsagnskraft: høy for brukervennlighet

2. Firesekunderstesten

Vis siden, lukk etter fire sekunder, spør: Hva handlet det om, hvem er det for, hva burde man gjøre? Den som ikke kan svare på det, har ikke forstått toppområdet.

Innsats: 30 minutter · Utsagnskraft: høy for inngangen

3. Før og etter over kvartaler

Én stor endring, så måling i tre måneder og sammenligning med de tre månedene før. Unøyaktig, fordi andre påvirkninger spiller inn – men brukbart ved store endringer.

Innsats: lav · Utsagnskraft: middels

4. Mål frafallspunktene

Hvor slutter rullingen, hvor avbrytes skjemaet? Viser ikke hva som ville vært bedre – men svært nøyaktig hvor problemet sitter.

Innsats: oppsett én gang · Utsagnskraft: høy for stedfesting

5. Spørsmålet i førstesamtalen

«Hva fikk dere til å skrive til oss – og hva var nær ved å hindre dere i det?» Den andre delen er den verdifulle.

Innsats: ingen · Utsagnskraft: høy når det spørres jevnlig

Visste du at …?

Ved lite trafikk lønner store endringer seg framfor små – og det av regnemessige grunner: jo større den faktiske forskjellen er, desto færre tilfeller trengs for å oppdage den.

En annen knappefarge endrer raten med noen få prosent og lar seg prinsipielt ikke påvise ved små tall. En helt annen sideoppbygging kan doble raten – og det ser man også ved 300 besøkende. Den som har lite trafikk, bør endre modigere, ikke forsiktigere.

Hvor A/B-tester går også i små bedrifter

StedGjennomførbart?Merknad
Emnefelt i e-postutsendingjagrovt brukbart allerede fra noen hundre mottakere
Annonseteksterjamange visninger, rask tilbakemelding
Startsidesjeldenfor få målhandlinger
Kontaktskjemaneifor få innsendinger
Prissideneifor få tilfeller, for stor spredning
Fra praksis

Den ærligste omgangen med små tall er å ikke framstille beslutningen som et testresultat. Virker en endring fornuftig av gode grunner – kortere skjema, tydeligere toppområde, en pris i stedet for ingen – så gjennomfør den og skriv ned hva dere bygger forventningen på.

Etter tre måneder ser dere om tilstrømningstallet har rørt på seg, og vet: det er et holdepunkt, ikke et bevis. Den ærligheten er mer verdt enn en test hvis resultat er en mynt – fordi den hindrer at et tilfeldig tall blir grunnlaget for neste beslutning.

Prompt
Hjelp meg å avgjøre hvordan jeg kan vurdere en endring på
nettstedet vårt.

Tallene våre:
- Besøkende per måned på den aktuelle siden: [antall]
- Målhandlinger per måned på denne siden: [antall]
- Hva jeg vil endre: [beskrivelse]
- Hvor stor virkning jeg venter meg: [anslag]

Oppgaver:
1. Si meg om en A/B-test ville vært talende med tallene våre.
   Regn med en tommelfingerstørrelse og vis resonnementet.
   Hvis nei, si det tydelig.
2. Anbefal to av de fem alternativene – brukerobservasjon,
   firesekunderstesten, før og etter over kvartaler,
   frafallspunkter, spørsmålet i førstesamtalen – som passer
   til endringen min. Begrunn.
3. Vurder om den planlagte endringen min er stor nok til i det
   hele tatt å bli synlig med tallene våre. Hvis ikke, foreslå
   en modigere utgave.
4. Formuler de tre spørsmålene jeg bør stille til
   firesekunderstesten.
5. Formuler en setning til rapporten vår som ærlig sier hva
   resultatet vil vise og hva det ikke vil vise.

Ikke finn på sammenligningstall fra bransjen.

Konklusjon

Ved små tall er den klassiske A/B-testen ikke et verktøy, men en tilfeldighetsmaskin med vitenskapelig ferniss. Den som likevel bruker den, tar beslutninger på grunnlag av støy.

Det som fungerer: se fem mennesker over skulderen, firesekunderstesten, frafallspunkter, spørsmålet i førstesamtalen – og modige framfor forsiktige endringer, fordi store forskjeller blir synlige også ved få tilfeller.

Vanlige spørsmål

Fra når er A/B-tester talende?

Som størrelsesorden trengs det flere tusen besøkende per variant når en typisk utgangsrate på noen få prosent skal forbedres med omtrent en femtedel. Med 300 besøkende i måneden ville en slik test først vært talende etter flere år – og innen da har tilbudet endret seg.

Hva gjør man i stedet?

Fem framgangsmåter: se fem mennesker fra målgruppen over skulderen mens de bruker siden, firesekunderstesten for toppområdet, en før-og-etter-måling over kvartaler ved store endringer, måling av frafallspunkter, og spørsmålet i førstesamtalen om hva som var nær ved å hindre dem.

Hvorfor bør man endre modigere ved lite trafikk?

Fordi større faktiske forskjeller trenger færre tilfeller for å bli oppdaget. En annen knappefarge lar seg prinsipielt ikke påvise ved små tall; en helt annen sideoppbygging kan doble raten – og det ser man også ved noen få hundre besøkende.

Hvor fungerer A/B-tester også i små bedrifter?

Ved emnefelt i e-postutsending, der allerede noen hundre mottakere gir grove holdepunkter, og ved annonsetekster med mange visninger. På nettstedet – startside, kontaktskjema, prisside – strekker målhandlingene som regel ikke til.

Får man avbryte en test når en variant leder?

Nei. Ved små tall skifter ledelsen jevnlig; den som avbryter ved det ønskede resultatet, finner alltid ett. Da er det ingen test, men en bekreftelse av egen antakelse – og det tilfeldige tallet blir grunnlaget for neste beslutning.

Markedsføring som setter seg opp selv

Betaen for Studio Engine er åpen. Sikre deg en plass og bidra fra starten.

Bli med i betaen →
← Tilbake til oversikten