Tinklaraštis
Kaip teisingai interpretuoti A/B testų rezultatus nepasikliovus triukšmu
Išmokite žingsnis po žingsnio metodą, kaip nustatyti, kada jūsų A/B testų rezultatai yra tikrai reikšmingi, išvengti dažniausių klaidų ir priimti duomenimis pagrįstus sprendimus užtikrintai.
Santrauka
A/B testai gali žymiai padidinti konversijas, tačiau tik teisingai interpretuojant rezultatus. Daugelis rinkodaros specialistų patenka į spąstus per anksti paskelbdami nugalėtoją, o tai lemia sprendimus, pagrįstus statistiniu triukšmu. Šiame straipsnyje pateikiamas žingsnis po žingsnio metodas, kaip nustatyti, kada jūsų A/B testų rezultatai yra tikrai reikšmingi. Sužinosite, kaip apskaičiuoti reikiamą imties dydį, suprasti p-reikšmes ir pasikliautinuosius intervalus bei išvengti dažniausių klaidų, tokių kaip žvilgčiojimas ir daugybiniai palyginimai. Laikydamiesi šių gairių, galėsite priimti duomenimis pagrįstus sprendimus užtikrintai. Nesvarbu, ar esate pradedantysis, ar patyręs, šis praktinis vadovas padės atlikti patikimesnius testus.
Jūs atliekate A/B testą, po 100 lankytojų matote 15% padidėjimą ir paskelbiate pergalę. Po savaitės padidėjimas išnyksta. Skamba pažįstamai? Tai klasikinis atvejis, kai statistinis triukšmas klaidingai interpretuojamas kaip tikras rezultatas. Be tinkamo statistinio griežtumo A/B testai gali suklaidinti, kainuojant laiką ir pinigus. Šiame vadove sužinosite, kaip teisingai interpretuoti A/B testų rezultatus, kad galėtumėte užtikrintai nustatyti laimėjusias variacijas.
Kodėl statistinis reikšmingumas svarbus
Statistinis reikšmingumas parodo, ar skirtumas tarp jūsų variantų tikėtinai atsirado dėl jūsų padaryto pakeitimo, o ne dėl atsitiktinumo. Be jo rizikuojate veikti remdamiesi klaidingais teigiamais rezultatais – paskelbti nugalėtoją, kai skirtumas yra tik triukšmas. Auksinis reikšmingumo standartas yra p-reikšmė, mažesnė nei 0,05, o tai reiškia, kad tikimybė, jog pastebėtas skirtumas atsirado atsitiktinai, yra mažesnė nei 5%. Tačiau tai pasiekti reikia daugiau nei tik laukti mažos p-reikšmės; testą turite tinkamai suplanuoti nuo pat pradžių.
1 žingsnis: Nustatykite imties dydį prieš pradėdami
Viena didžiausių klaidų yra pradėti testą nežinant, kiek lankytojų jums reikia. Imties dydis priklauso nuo jūsų pradinės konversijos, mažiausio efekto, kurį norite aptikti, ir norimo statistinio reikšmingumo bei galios (paprastai 80%). Naudokite internetinį skaičiuotuvą: įveskite pradinę konversiją, pvz., 5%, ir mažiausią aptinkamą efektą 20% (taigi nuo 5% iki 6%). Esant 95% reikšmingumo ir 80% galios, jums reikės maždaug 42 000 lankytojų vienam variantui. Šis skaičius gali nustebinti, tačiau testas su tik 1 000 lankytojų yra beveik nenaudingas. Apskaičiuokite tai iš anksto ir įsipareigokite pasiekti tą skaičių prieš žvilgčiodami.
2 žingsnis: Atlikite testą pakankamai ilgai
Net ir pasiekus reikiamą imties dydį, testą reikia atlikti per visą verslo ciklą (paprastai vieną ar dvi savaites), kad būtų atsižvelgta į savaitės dienų efektus. Venkite pagundos kasdien tikrinti rezultatus; toks "žvilgčiojimas" padidina klaidingų teigiamų rezultatų dažnį. Vietoj to, nusistatykite kalendoriaus priminimą analizuoti tik po numatytos pabaigos datos.
3 žingsnis: Analizuokite p-reikšmes ir pasikliautinuosius intervalus
Pasibaigus testui, pažiūrėkite į p-reikšmę. Jei ji mažesnė nei 0,05, rezultatas yra statistiškai reikšmingas. Tačiau nesustokite ties tuo – išnagrinėkite pasikliautinuosius intervalus. Pavyzdžiui, A variantas konvertuoja 8% (PI: 6%–10%), B variantas 10% (PI: 8%–12%). Intervalai persidengia, vadinasi, skirtumas nėra reikšmingas, net jei p-reikšmė yra ribinė. Tik kai intervalai nesikerta, galite būti tikri, kad vienas variantas lenkia kitą.
4 žingsnis: Stebėkite dažniausias klaidas
Net ir naudojant teisingus metodus, klaidų gausu. Žvilgčiojimas yra dažniausias; tai išspręskite naudodami įrankį, kuris slepia tarpinius rezultatus, arba įsipareigodami fiksuotai trukmei. Daugybiniai palyginimai – vienu metu testuojant daug variantų – padidina klaidingo teigiamo rezultato tikimybę. Taikykite Bonferroni korekciją: padalinkite reikšmingumo slenkstį iš palyginimų skaičiaus. Kita klaida – sustoti anksti, nes rezultatai atrodo perspektyvūs. Norėdami giliau panagrinėti šias klaidas, peržiūrėkite mūsų straipsnį apie dažniausias A/B testų klaidas ir kaip jas ištaisyti.
Pavyzdys: Realus scenarijus
Tarkime, atliekate nukreipimo puslapio antraštės testą. Pradinė konversija yra 4%, norite aptikti 25% padidėjimą (iki 5%), todėl jums reikia 26 000 lankytojų vienam variantui. Po dviejų savaičių turite 30 000 lankytojų vienam variantui; nauja antraštė konvertuoja 5,2%, p-reikšmė 0,03, pasikliautinieji intervalai [4,8%, 5,6%] prieš kontrolinį [3,8%, 4,2%]. Intervalai nesikerta – turite nugalėtoją. Tačiau visada patikrinkite praktinį reikšmingumą: ar 1,2 procentinio punkto padidėjimas vertas pastangų? Jei taip, įgyvendinkite pakeitimą.
Įspėjimai: Už statistinio reikšmingumo ribų
Statistinis reikšmingumas nėra tas pats, kas praktinė svarba. Mažas padidėjimas, kuris yra statistiškai reikšmingas, gali nepateisinti kūrimo išlaidų. Taip pat apsvarstykite Bajeso metodus, kurie suteikia tikimybę, kad vienas variantas yra geresnis. Jie gali būti intuityvesni, tačiau reikalauja panašios disciplinos. Galiausiai atminkite, kad išoriniai veiksniai, pvz., sezoniškumas ar rinkodaros kampanijos, gali iškreipti rezultatus; jei įmanoma, visada naudokite kontrolinę grupę.
Išvada
Teisingai interpretuoti A/B testų rezultatus yra įgūdis, kuris skiria spėliojimą nuo duomenimis pagrįsto augimo. Iš anksto apskaičiavę imties dydį, atlikę testus iki galo ir suprasdami p-reikšmes bei pasikliautinuosius intervalus, galite išvengti triukšmo, kuris klaidina daugelį. Pradėkite nuo vieno gerai suplanuoto testo, iš jo mokykitės ir plėskite savo eksperimentų programą. Norėdami gauti pagalbą sprendžiant, kokius testus atlikti, peržiūrėkite mūsų vadovą kaip nustoti gaišti laiką nereikšmingiems A/B testams. Nuoseklūs, griežti testai laikui bėgant sukels reikšmingus patobulinimus.


