Testy A/B przy małym ruchu: co mimo to da się zrobić

Test A/B potrzebuje dość przypadków, by oddzielić przypadek od efektu. Przy 300 odwiedzających miesięcznie ta granica jest nieosiągalna – każdy wynik jest wtedy rzutem monetą. Pięć innych procedur mimo to daje użyteczne wskazówki.

Zaledwie cztery świecące punkty w szerokim pustym polu, przez które mimo to przeprowadzono wyraźną krzywą

Najważniejsze w skrócie

  • Poniżej mniej więcej 1000 czynności docelowych na wariant wyników A/B nie da się oddzielić od przypadku – przy małych stronach więc praktycznie nigdy.
  • Pięć procedur mimo to działa: obserwacja użytkowników, test czterech sekund, porównanie przed–po w skali kwartałów, punkty odskoku i pytanie w pierwszej rozmowie.
  • Przy małym ruchu opłacają się duże zmiany zamiast drobnych – nowa budowa, a nie inny kolor przycisku.
  • Kto mimo to chce testować A/B, testuje na listach mailowych zamiast na stronie: tam liczby często wystarczają.

Dlaczego rachunkowo się nie da

Test ma pokazać, czy zmiana działa, czy różnica jest przypadkiem. Ile przypadków do tego trzeba, zależy od dwóch rzeczy: wskaźnika wyjściowego i wielkości oczekiwanej różnicy.

Przykład czyni rząd wielkości jasnym: przy wskaźniku wyjściowym 3 procent i oczekiwanym wzroście do 3,6 procent – czyli 20 procent poprawy względnej – potrzeba na wariant kilku tysięcy odwiedzających, by wiarygodnie oddzielić różnicę od przypadku. Przy 300 odwiedzających miesięcznie test byłby wymowny po latach, a do tego czasu oferta się zmieni.

Uwaga Test przerwany za wcześnie, bo jeden wariant „prowadzi”, nie jest testem, lecz potwierdzeniem tego, co i tak się zakładało. Przy małych liczbach prowadzenie regularnie się zmienia – kto przerwie przy pożądanym wyniku, zawsze go znajdzie.

Pięć procedur, które działają

1. Popatrzeć pięciu osobom

Z grupy docelowej, z jednym zadaniem, bez wyjaśnień. Tam, gdzie się wahają, jest błąd. Pięć osób odsłania większość grubych problemów.

Nakład: 2 godziny · Wymowność: duża dla obsługiwalności

2. Test czterech sekund

Pokazać stronę, po czterech sekundach zamknąć, zapytać: o co chodziło, dla kogo to jest, co należałoby zrobić? Kto nie umie odpowiedzieć, nie zrozumiał nagłówka.

Nakład: 30 minut · Wymowność: duża dla wejścia

3. Przed–po w skali kwartałów

Jedna duża zmiana, potem trzy miesiące pomiaru i porównanie z trzema wcześniejszymi. Nieprecyzyjne, bo działają inne wpływy – ale przy dużych zmianach użyteczne.

Nakład: mały · Wymowność: średnia

4. Mierzenie punktów odskoku

Gdzie kończy się przewijanie, gdzie porzucany jest formularz? Nie pokazuje, co byłoby lepsze – ale bardzo dokładnie, gdzie siedzi problem.

Nakład: konfiguracja jednorazowa · Wymowność: duża dla umiejscowienia

5. Pytanie w pierwszej rozmowie

„Co skłoniło Państwa, żeby do nas napisać – i co niemal by Państwa od tego powstrzymało?” Druga część jest tą cenną.

Nakład: żaden · Wymowność: duża przy regularnym pytaniu

Czy wiesz, że…?

Przy małym ruchu opłacają się duże zmiany zamiast drobnych – i to z powodów rachunkowych: im większa faktyczna różnica, tym mniej przypadków trzeba, by ją rozpoznać.

Inny kolor przycisku zmienia wskaźnik o kilka procent i przy małych liczbach jest zasadniczo niewykazywalny. Zupełnie inna budowa strony może wskaźnik podwoić – a to widać także przy 300 odwiedzających. Kto ma mało ruchu, powinien zmieniać odważniej, a nie ostrożniej.

Gdzie testy A/B działają też w małych firmach

MiejsceWykonalne?Uwaga
Tematy wiadomości w wysyłce e-mailtakjuż od kilkuset odbiorców zgrubnie użyteczne
Teksty reklamtakwiele wyświetleń, szybka informacja zwrotna
Strona głównarzadkoza mało czynności docelowych
Formularz kontaktowynieza mało wysyłek
Strona z cenaminieza mało przypadków, za duży rozrzut
Z praktyki

Najuczciwszym obchodzeniem się z małymi liczbami jest niepodawanie decyzji jako wyniku testu. Jeśli zmiana z dobrych powodów wydaje się sensowna – krótszy formularz, jaśniejszy nagłówek, cena zamiast jej braku – wdróżcie ją i dopiszcie, na czym opieracie oczekiwanie.

Po trzech miesiącach patrzycie, czy liczba dopływowa się ruszyła, i wiecie: to wskazówka, nie dowód. Ta uczciwość jest warta więcej niż test, którego wynik jest rzutem monetą – bo zapobiega temu, by przypadkowa liczba stała się podstawą następnej decyzji.

Prompt
Pomóż mi zdecydować, jak mogę ocenić zmianę na naszej stronie.

Nasze liczby:
- Odwiedzający miesięcznie na tej podstronie: [liczba]
- Czynności docelowe miesięcznie na tej podstronie: [liczba]
- Co chcę zmienić: [opis]
- Jak dużego efektu oczekuję: [szacunek]

Zadania:
1. Powiedz mi, czy przy naszych liczbach test A/B byłby
   wymowny. Policz z regułą kciuka i pokaż rozumowanie. Jeśli
   nie, powiedz to wyraźnie.
2. Zaleć z pięciu alternatyw – obserwacja użytkowników, test
   czterech sekund, przed–po w skali kwartałów, punkty odskoku,
   pytanie w pierwszej rozmowie – te dwie, które pasują do mojej
   zmiany. Uzasadnij.
3. Oceń, czy moja planowana zmiana jest dość duża, by przy
   naszych liczbach w ogóle stać się widoczną. Jeśli nie,
   zaproponuj odważniejszą wersję.
4. Sformułuj do testu czterech sekund trzy pytania, które
   powinnam zadać.
5. Sformułuj zdanie do naszego raportu, które uczciwie mówi, co
   wynik pokaże, a czego nie.

Nie wymyślaj wartości porównawczych z branży.

Podsumowanie

Przy małych liczbach klasyczny test A/B nie jest narzędziem, lecz maszyną losową w naukowym przebraniu. Kto mimo to go używa, podejmuje decyzje na podstawie szumu.

Co działa: popatrzeć pięciu osobom, test czterech sekund, punkty odskoku, pytanie w pierwszej rozmowie – i zmiany odważne zamiast ostrożnych, bo duże różnice stają się widoczne także przy niewielu przypadkach.

Częste pytania

Od kiedy testy A/B są wymowne?

Jako rząd wielkości potrzeba na wariant kilku tysięcy odwiedzających, gdy typowy wskaźnik wyjściowy wynoszący kilka procent ma poprawić się o mniej więcej jedną piątą. Przy 300 odwiedzających miesięcznie taki test byłby wymowny dopiero po latach – a do tego czasu oferta się zmieni.

Co robić zamiast tego?

Pięć procedur: popatrzeć pięciu osobom z grupy docelowej przy korzystaniu, test czterech sekund dla nagłówka, porównanie przed–po w skali kwartałów przy dużych zmianach, pomiar punktów odskoku i pytanie w pierwszej rozmowie, co niemal by od tego powstrzymało.

Dlaczego przy małym ruchu zmieniać odważniej?

Bo większe faktyczne różnice wymagają mniej przypadków, by zostać rozpoznane. Inny kolor przycisku przy małych liczbach jest zasadniczo niewykazywalny; zupełnie inna budowa strony może wskaźnik podwoić – a to widać także przy kilkuset odwiedzających.

Gdzie testy A/B działają też w małych firmach?

Przy tematach wiadomości w wysyłce e-mail, gdzie już kilkuset odbiorców daje zgrubne wskazówki, i przy tekstach reklam o wielu wyświetleniach. Na stronie – strona główna, formularz kontaktowy, strona z cenami – czynności docelowych z reguły nie wystarcza.

Czy wolno przerwać test, gdy jeden wariant prowadzi?

Nie. Przy małych liczbach prowadzenie regularnie się zmienia; kto przerwie przy pożądanym wyniku, zawsze go znajdzie. To wtedy nie test, lecz potwierdzenie własnego założenia – a przypadkowa liczba staje się podstawą następnej decyzji.

Marketing, który konfiguruje się sam

Beta Studio Engine jest otwarta. Zarezerwuj miejsce i współtwórz od początku.

Dołącz do bety →
← Powrót do listy