Blogi

5 kõige levinumat A/B testimise viga ja kuidas neid parandada

Vältige raisatud pingutusi ja eksitavaid tulemusi, vältides neid viite A/B testimise viga, mis kimbutavad isegi kogenud turundajaid.

Kokkuvõte

A/B testimine on võimas meetod konversioonide optimeerimiseks, kuid paljud meeskonnad rikuvad oma katseid tavaliste vigadega. See artikkel tutvustab viit kriitilist viga: testide liiga varajane lõpetamine, mitme muudatuse korraga testimine, statistilise olulisuse ignoreerimine, tulemuste segmenteerimata jätmine ja testide läbiviimine vähese liiklusega lehtedel. Iga viga on selgitatud reaalsete näidete ja praktiliste sammudega selle vältimiseks. Õpid, kuidas arvutada vajalikku valimi suurust, eraldada muutujaid, õigesti tõlgendada p-väärtusi, tuvastada Simpsoni paradoksi ja hinnata, kas lehel on piisavalt liiklust tähendusliku testi jaoks. Lõpuks saad kontrollnimekirja, et tagada oma järgmise A/B testi usaldusväärsed ja rakendatavad tulemused.

Sissejuhatus

Olete käivitanud A/B testi, oodanud mõned päevad ja näinud paljutõotavat tõusu. Soovides sellest kasu saada, kuulutate variandi võitjaks ja avaldage selle. Nädal hiljem konversioonid langevad. Mis juhtus? Langesite klassikalisse A/B testimise lõksu.

A/B testimine on konversioonimäära optimeerimise nurgakivi, kuid seda on üllatavalt lihtne valesti teha. Selles artiklis analüüsime viit kõige levinumat viga, mis põhjustavad eksitavaid tulemusi ja raiskavad ressursse. Igaühega kaasneb konkreetne lahendus, mida saate juba täna rakendada.


Viga 1: testi liiga varajane lõpetamine

Probleem: On ahvatlev piiluda tulemusi ja kuulutada võitja kohe, kui statistiline olulisus ilmneb. Kuid varajane piilumine suurendab valepositiivsete määra. Kui kontrollite testi iga päev ja peatute hetkel, kui p < 0,05, võib teie tegelik olulisuse tase olla lähemal 0,20-le või kõrgemale.

Näide: Oletame, et testite kahte nupu värvi. Pärast 200 külastajat näitab roheline nupp 15% tõusu p=0,04 juures. Peatate ja rakendate rohelise. Kui oleksite lasknud testil joosta 1000 külastajani, oleks tõus võinud kaduda või pöörduda.

Lahendus: Määrake enne alustamist vajalik valimi suurus. Kasutage veebipõhist valimi suuruse kalkulaatorit – sisestage oma algtaseme konversioonimäär, minimaalne tuvastatav efekt ja soovitud olulisus (tavaliselt 0,05) ja võimsus (0,80). Ärge piiluge tulemusi enne, kui see valimi suurus on saavutatud. Kui peate jälgima, kasutage järjestikust testimismeetodit või Bonferroni korrektsiooni.

Hoiatus: Isegi eelnevalt määratud valimi suuruse korral võivad välised tegurid (pühad, turunduskampaaniad) tulemusi moonutada. Käivitage testid vähemalt ühe täieliku äritsükli jooksul (nt üks nädal), et arvestada nädalapäevade mõju.


Viga 2: liiga paljude muudatuste korraga testimine

Probleem: Testi käivitamine uue pealkirja, pildi, CTA ja paigutusega korraga tähendab, et te ei saa aru, milline muutus tulemust põhjustas. Seda nimetatakse liittestiks.

Näide: Kujundate ümber maandumislehe uue kangelaspildi, lühema teksti ja rohelise nupuga. Konversioonid suurenevad 20%. Kas see oli pilt? Tekst? Nupp? Teil pole aimugi – ja te ei saa edasi optimeerida ilma rohkemate testideta.

Lahendus: Testige korraga ühte elementi. Kui soovite testida mitut muudatust, käivitage järjestikused või mitme muutujaga testid, kuid enamiku meeskondade jaoks on praktilisem testida ühte muutujat eksperimendi kohta. Eelistage esmalt kõige suurema potentsiaalse mõjuga muudatusi. Raamistiku jaoks, kuidas valida, mida testida, vaadake seda juhendit testide prioriseerimiseks.

Hoiatus: Mõned muudatused mõjutavad üksteist (nt pealkiri ja pilt). Kaaluge faktoriaalset kavandit, kui teil on piisavalt liiklust, kuid hoidke see usaldusväärsete tulemuste jaoks lihtne.


Viga 3: statistilise olulisuse ignoreerimine

Probleem: Paljud turundajad kuulutavad võitja toorete konversioonimäärade põhjal, kontrollimata, kas erinevus on statistiliselt oluline. Väikeste valimite korral võivad juhuslikud kõikumised paista suurte erinevustena.

Näide: Variant A saab 5 konversiooni 100-st (5%), variant B saab 8 100-st (8%). 3% erinevus tundub märkimisväärne, kuid hii-ruut test näitab p-väärtust 0,27 – mitte oluline.

Lahendus: Arvutage enne järelduste tegemist alati p-väärtus või usaldusvahemik. Kasutage sellist tööriista nagu Optimizely või Google Optimize või tehke kiire arvutus statistilise olulisuse kalkulaatori abil. Tavaline lävi on p < 0,05 (95% usaldus). Kaaluge ka usaldusvahemikke – need näitavad mõistliku tõusu vahemikku.

Hoiatus: Statistiline olulisus ei taga praktilist olulisust. 0,5% tõus võib olla statistiliselt oluline, kuid mitte rakendamist väärt, kui muudatus on kulukas. Keskenduge efekti suurusele ja ärilisele mõjule.


Viga 4: tulemuste mitte segmenteerimine

Probleem: Üldised tulemused võivad varjata, mis toimub erinevates segmentides. Kuulus Simpsoni paradoks võib näidata võitvat varianti, mis tegelikult kaotab igas segmendis.

Näide: Testite uut ostuteed. Üldiselt on variandil B kõrgem konversioonimäär. Kuid kui jagate mobiili ja lauaarvuti lõikes, võidab variant A mõlemas. Paradoks tekib seetõttu, et liikluse koostis erineb variantide vahel (nt rohkem mobiilikäutajaid B-s, kes konverteerivad üldiselt kõrgema määraga).

Lahendus: Segmenteerige oma tulemused võtmemõõtmete järgi: seadme tüüp, liikluse allikas, kasutaja geograafia, uued vs. korduvad külastajad. Kasutage tööriista, mis jaotab tulemused automaatselt, või viige läbi eraldi analüüsid. Kui segmendil on väike valim, pange tähele selle piiratud statistilist võimsust.

Hoiatus: Olge ettevaatlik ülemäärase segmenteerimisega – paljud segmendid suurendavad valepositiivsete võimalust. Määrake eelnevalt segmendid, mida analüüsite, ja vajadusel rakendage mitmekordse testimise korrektsioone.


Viga 5: testimine vähese liiklusega lehtedel

Probleem: A/B testi käivitamine lehel, millel on 100 igapäevast külastajat, võtab olulisuse saavutamiseks kuid, eriti väikeste efektisuuruste korral. Paljud testid jäetakse pooleli või annavad valenegatiivseid tulemusi.

Näide: Teie privaatsuspoliitika leht saab 50 külastajat päevas. Testite kahte CTA asukohta, kuid nelja nädala pärast on ainult 1400 külastajat – ja olulist erinevust pole. Test oli algusest peale hukule määratud, sest vajalik valimi suurus oli 10 000.

Lahendus: Enne testimist hinnake minimaalset tuvastatavat efekti, mis teile oluline on. Kasutage võimsusanaliüsi, et näha, kas teie leht suudab selle valimi suuruse mõistliku aja jooksul (nt 2 nädalat) tagada. Kui mitte, kaaluge alternatiivseid lähenemisviise: viige test läbi suurema liiklusega lehel, kasutage bandiidi algoritme või jätke A/B testimine sellel lehel vahele ja tuginege kvalitatiivsele kasutajauuringule.

Hoiatus: Isegi suure liiklusega lehed võivad olla hooajaliselt mõjutatud. Vältige testimist ebatavalistel perioodidel (must reede, saidi ümberkujundus), välja arvatud juhul, kui see on teie hüpoteesi osa.


Kokkuvõte

A/B testimine ei seisne katsete käivitamises ja võitja lootmises. See on distsiplineeritud protsess, mis nõuab planeerimist, kannatlikkust ja hoolikat analüüsi. Neid viit viga vältides saate usaldusväärseid tulemusi, mis tõeliselt parandavad konversioone.

Teie tegevuste kontrollnimekiri:

  • Arvutage valimi suurus enne alustamist.
  • Testige korraga ühte muutujat.
  • Kontrollige statistilist olulisust sobivate tööriistadega.
  • Segmenteerige tulemusi, et paljastada varjatud mustrid.
  • Tagage testi jaoks piisav liiklus.

Rakendage neid tavasid ja teie A/B testid lõpetavad olemise oletamise ja muutuvad usaldusväärseks kasvu mootoriks.

Sources (5)