Tinklaraštis

Kaip atlikti A/B testus, kuriuos iš tiesų palaikys netechninė vadovybė

Praktinis vadovas įmonių rinkodaros specialistams: kaip struktūrizuoti, vykdyti ir apginti konversijų rodiklio optimizavimo eksperimentus prieš netechninius suinteresuotuosius asmenis.

Santrauka

Rinkodaros komandoms dažnai sunku pagrįsti A/B testavimo terminus ir neapibrėžtus rezultatus netechniniams vadovams, kurie eksperimentus laiko tiesiog vėlavimu paleisti kampanijas. Kai vadovybė tikisi momentinio dviženklio augimo po kiekvieno antraštės pakeitimo, atliekant griežtus padalinto srauto testus (angl. split tests) reikalinga ne tik patikima metodika, bet ir aiški komunikacijos sistema. Šiame vadove aptariamas perėjimas nuo atsitiktinių puslapio korekcijų prie įrodymais grįsto optimizavimo proceso, kuris apsaugo jūsų komandos patikimumą. Sužinosite, kaip išskirti didžiausią trintį keliančius elementus, išlaikyti statistinį patikimumą neatstumiant vadovybės ir įvertinti šiuolaikinių, DI palaikomų eksperimentų privalumus bei trūkumus. Pagrindę savo testavimo programą rizikos mažinimu ir aiškiais vartotojų elgsenos rodikliais, vadovybės skepticizmą galite paversti nuolatiniu palaikymu.

Kaip paaiškinti vadovų komandai, kodėl tris savaites vykdytas nukreipimo puslapio (angl. landing page) testas vis dar neturi aiškaus laimėtojo?

Įmonės rinkodaros specialistui nedaug susitikimų būna tokie nepatogūs, kaip kasmėnesinė augimo apžvalga, kurioje vadovybė klausia, kodėl srautas buvo padalintas tarp dviejų svarbaus puslapio versijų, užuot tiesiog paleidus visiems patikusį dizaino maketą. Netechniniam vadovui ar įkūrėjui A/B testavimas gali atrodyti kaip nereikalingas delsimas – lėtas, akademinis procesas, eikvojantis laiką, kol konkurentai juda į priekį. Kai eksperimentas baigiasi neutraliu rezultatu ar nežymiu pagerėjimu, vadovybė dažnai suabejoja, ar konversijų rodiklio optimizavimas (CRO) apskritai vertas pastangų.

Ši trintis retai kyla dėl blogų ketinimų. Taip nutinka todėl, kad techninės eksperimentavimo sąvokos – imties dydžio reikalavimai, dispersija, statistinis reikšmingumas ir padalinto testavimo mechanika – dažniausiai pateikiamos kaip statistinės kliūtys, o ne tai, kas vadovybei iš tiesų rūpi: komercinės rizikos valdymas. Kai į A/B testavimą pradedate žiūrėti kaip į draudimo polisą nuo bazinių konversijos rodiklių smukimo, visas pokalbis su vadovybe pasikeičia iš esmės.

Vadovybės lygio nesusikalbėjimo anatomija eksperimentuojant

Įsivaizduokite situaciją, kuri kas ketvirtį pasikartoja rinkodaros skyriuose. Jūsų komanda sukuria naują nukreipimo puslapį pagrindinei mokamos reklamos kampanijai. Atnaujintame puslapyje yra aiškesnė antraštė, trumpesnė kontaktų forma, atnaujinti klientų atsiliepimai ir pakeista raginimo veikti (CTA) mygtuko spalva. Norėdami įrodyti CRO vertę, paleidžiate A/B testą, nukreipdami pusę gaunamo mokamo srauto į pradinę kontrolinę versiją, o kitą pusę – į naująjį variantą.

Po penkių dienų variantas rodo nedidelį formos užpildymų šuolį. Vadovas pastebi šią tendenciją per trumpą aptarimą ir paklausia, kodėl komanda iškart neperjungė 100 % srauto į naująjį puslapį. Jūs paaiškinate, kad imties dydis vis dar per mažas ir rezultatas dar nepasiekė statistinio patikimumo. Po dviejų savaičių, išsilyginus darbo dienų ir savaitgalių srauto dėsningumams, prieaugis visiškai išnyksta. Naujojo varianto rezultatai tampa identiški kontrolinei versijai.

Vadovo požiūriu, rinkodaros komanda tris savaites vilkino naujo dizaino diegimą tik tam, kad sužinotų, jog niekas nepasikeitė. Jūsų požiūriu – jūs užkirtote kelią brangiai kainuojančiai klaidai, kai ankstyvas statistinis triukšmas buvo palaikytas tikruoju vartotojų pasirinkimu. Tačiau kadangi testas buvo pristatytas kaip momentinio šuolio siekis, o ne priežasčių, kodėl vartotojai konvertuojasi, aiškinimasis, organizacijoje šis eksperimentas užfiksuojamas kaip veltui sugaištas laikas.

Norint išvengti šio nesusikalbėjimo, kiekvienas jūsų optimizavimo eigos etapas – nuo elementų parinkimo iki galutinių ataskaitų – turi būti suformuluotas taip, kad atsakytų į komercinius klausimus pateikiant empirinius elgsenos įrodymus.

+-----------------------------------------------------------------------------+
|                     EKSPERIMENTAVIMO NESUSIKALBĖJIMAS                       |
+-----------------------------------------------------------------------------+
|  KĄ MATO VADOVYBĖ:               |  KĄ IŠ TIKRŲJŲ DARO TIKSLUS TESTAVIMAS: |
|  - Delsimą paleisti kūrybinius   |  - Neleidžia diegti nepatvirtintų,      |
|    sprendimus                    |    nuostolingų sprendimų                |
|  - Apsėdimą nereikšminga         |  - Išskiria tikrąją pirkėjų motyvaciją  |
|    statistika                    |  - Apsaugo pajamų bazes nuo             |
|  - Dideles pastangas be rezultatų|    statistinio triukšmo                 |
+-----------------------------------------------------------------------------+

Didelį poveikį turinčių kintamųjų nustatymas: kaip išvengti smulkių korekcijų spąstų

Rinkodaros specialistas dvi savaites testuoja, ar pagrindinio CTA mygtuko spalvos pakeitimas iš ryškiai mėlynos į tamsiai žalią pagerina atsiskaitymo proceso pradžią, tačiau fiksuoja nulinį skirtumą. Vadovas pažiūri į ataskaitą ir pagrįstai klausia, kodėl komandos laikas buvo skirtas mygtukų atspalviams, kai per ketvirtį sumažėjo potencialių klientų skaičius.

Šis rezultatas iliustruoja mažo poveikio testavimo pavojų. Padalinto testavimo metu eksperimento potencialų poveikį riboja keičiamo elemento elgseninė reikšmė. Smulkios vizualinės korekcijos, pavyzdžiui, mygtukų spalvos ar dekoratyviniai paveikslėliai, retai padeda įveikti giliai slypintį lankytojų dvejojimą. Kai resursai riboti, orientavimasis į mikroelementus degina pasitikėjimo kreditą vadovybės akyse, nes esminiai verslo rodikliai nejuda iš vietos.

Didelį poveikį turintis konversijų rodiklio optimizavimas koncentruojasi į keturis struktūrinius svertus, kurie tiesiogiai keičia lankytojų sprendimų priėmimą:

  1. Vertės pasiūlymo aiškumas: pagrindinės ir antrinės antraštės perrašymas taip, kad jos atlieptų pagrindinę lankytojo problemą, užuot vardinus vidinius funkcijų pavadinimus.
  2. Trintis pildant formas: privalomų laukų skaičiaus mažinimas, duomenų tikrinimo pranešimų tobulinimas arba kelių etapų užklausų skaidymas į lengvai įveikiamus žingsnius.
  3. Pasitikėjimo signalai ir socialinis įrodymas: klientų atsiliepimų, saugumo ženklelių ir patikrinamų rezultatų pateikimas šalia konversijos taško, o ne puslapio apačioje (angl. footer).
  4. Raginimo veikti mechanika: CTA teksto suderinimas su tiesioginiais lankytojo lūkesčiais (pvz., „Gauti nemokamą šabloną“, o ne bendrinis „Pateikti“).

Pristatant testų planus vadovybei, užduočių sąrašo skirstymas pagal trinties mažinimą, o ne kosmetinius pakeitimus, parodo, kad jūsų eksperimentai nukreipti į realias pirkėjo kelio kliūtis. Žinoti, kaip suderinti šias iniciatyvas, yra labai svarbu norint prioritizuoti testus, kurie iš tiesų didina konversijas, nealinant komandos nereikšmingomis dizaino diskusijomis.

Vieno kintamojo taisyklė prieš radikalų pertvarkymą

Komanda paleidžia varianto testą, kuriame visiškai pertvarkomas puslapio išdėstymas, produktų nuotraukos pakeičiamos vaizdo įrašu, perrašomi visi tekstai ir pašalinama kainų lentelė. Naujasis puslapis konvertuoja pastebimai prasčiau nei kontrolinis. Vadovybei paklausus, kas lėmė nuosmukį, komanda negali nurodyti konkretaus elemento – ar tai buvo kainų nebuvimas, automatiškai paleidžiamas vaizdo įrašas, ar nauja antraštės struktūra?

Šis scenarijus pabrėžia klasikinę dilemą tarp vieno kintamojo padalinto testavimo ir klasterinio testavimo (radikalių pertvarkymų). Formalioje optimizavimo metodikoje vieno kintamojo testavimas vienu metu užtikrina, kad bet koks išmatuotas konversijos rodiklio pokytis matematiškai priskiriamas būtent tam konkrečiam pakeitimui. Jei pakeičiate tik antraštę, tiksliai žinote, kad rezultatą lėmė antraštė.

MetodasKaip veikiaKada geriausia naudotiStrateginis kompromisasRizika vadovybės akyse
Vieno kintamojo testavimasPakeičia lygiai vieną atskirą elementą (pvz., formos ilgį arba pagrindinį CTA tekstą), lyginant su originalu.Optimizuojant nusistovėjusius, didelio srauto puslapius su žinomais baziniais rodikliais.Lėtesnis vieno testo ciklo tempas; duoda laipsniškus, o ne revoliucinius pokyčius.Suinteresuotiesiems asmenims pavieniai pokyčiai gali atrodyti per smulkūs, kad būtų verta gaišti laiką testavimui.
Radikalus pertvarkymas (klasterinis)Vienu metu testuoja visiškai naują išdėstymą, pranešimų hierarchiją ir vartotojo kelią.Paleidžiant naujus pasiūlymus, keičiant vertės pasiūlymus arba iš esmės atnaujinant senus, prastai konvertuojančius puslapius.Neįmanoma nustatyti, kuris konkretus komponentas padėjo ar pakenkė konversijų rodikliui.Didelė rizika, kad nenumatyta neigiama trintis užgoš kitais atžvilgiais puikią idėją.

Praktikoje nedidelės komandos turi pragmatiškai įvertinti šiuos kompromisus. Jei puslapis turi iš esmės blogą išdėstymą arba pasenusią komunikaciją, vieno kintamojo testai su mygtukų tekstais yra neefektyvus srauto eikvojimas. Tokiu atveju komerciškai prasminga testuoti drąsų teminį pertvarkymą lyginant su senuoju pagrindu.

Tačiau kai naujasis pagrindas įrodo savo gyvybingumą, grįžimas prie vieno kintamojo eksperimentų apsaugo nuo regresijos. Pranešdami apie tai savo vadovui, aiškiai įvardykite: „Vykdome teminį pertvarkymą, kad rastume stipresnį atspirties tašką, o vėliau naudosime izoliuotus padalintus testus atskiriems mechanizmams optimizuoti.“

Imčių dydžių ir terminų gynimas nuo „penktadienio patikrinimų“

Penktadienio popietę vadovas užsuka prie jūsų stalo, pažvelgia į analitiką, rodančią, kad B variantas po 48 valandų pirmauja penkiomis konversijomis, ir sako: „Akivaizdu, kad tai veikia. Išjunkime A versiją, kad savaitgalį neeikvotume reklamos biudžeto.“

Nusileidimas tokiam prašymui yra vienas dažniausių būdų, kaip rinkodaros komandos į savo duomenis įsileidžia klaidingai teigiamus rezultatus (angl. false positives). Ankstyvieji testavimo duomenys yra labai nepastovūs. Vartotojų elgsena smarkiai svyruoja darbo valandomis, vėlyvais vakarais ir savaitgaliais. Trumpas mobiliojo srauto šuolis šeštadienio rytą gali iškraipyti konversijų rodiklius, jei eksperimentas įvertinamas per anksti.

+-----------------------------------------------------------------------------+
|                   KODĖL ANKSTYVIEJI DUOMENYS YRA APGAULINGI                 |
+-----------------------------------------------------------------------------+
|  1–3 DIENA: Didelis kintamumas, imties triukšmas, laikini anomalumai        |
|  4–7 DIENA: Pirmasis pilnas ciklas fiksuoja darbo dienų ir savaitgalių kitą|
|  8–14 DIENA: Dispersija stabilizuojasi link tikrojo konversijų pagrindo     |
+-----------------------------------------------------------------------------+

Kad testavimas netechniniam suinteresuotam asmeniui skambėtų patikimai, o ne pedantiškai, savo testavimo trukmės taisykles susiekite su pilnais savaitiniais verslo ciklais, o ne su abstrakčia statistine terminologija. Paaiškinkite, kad vartotojų ketinimai kinta priklausomai nuo savaitės dienų, o per ankstyvas eksperimento nutraukimas reiškia optimizavimą pagal vieną konkretų laiko tarpsnį, o ne pagal bendrą pirkėjų elgseną.

Remiantis tokių tyrimų įmonių kaip „Optimizely“ ir VWO publikuotomis eksperimentavimo gairėmis, prieš skelbiant statistinį patikimumą būtina užtikrinti pakankamą imties dydį ir testo trukmę. Testų vykdymas mažiausiai dvi pilnas savaites užtikrina, kad įprasti savaitės dienų svyravimai neiškraipytų rezultatų. Suprasti, kaip valdyti šias statistines realijas, yra labai svarbu mokantis, kaip interpretuoti A/B testų rezultatus nepasiduodant duomenų triukšmui vadovybės ataskaitų metu.

Prieštaringa tiesa: kodėl neapibrėžti testai nėra nesėkmė

Paplitęs mitas korporatyvinėje rinkodaroje – kad kiekvienas A/B testas turi atskleisti aiškų laimėtoją su įspūdingu konversijų augimu. Kai eksperimentas baigiasi be statistiškai pastebimo skirtumo tarp A ir B versijų, jaunesnieji specialistai dažnai jaučiasi privalantys atsiprašyti, o vadovybė suabejoja eksperimento nauda.

Iš tikrųjų neutralūs arba neapibrėžti rezultatai yra vieni iš komerciškai vertingiausių atradimų, kuriuos gali pateikti įmonės komanda.

Įvertinkite, ką iš tiesų įrodo neapibrėžtas testas: jūsų komanda išbandė alternatyvią koncepciją – galbūt supaprastintą dizainą, taupantį programavimo resursus, pakeistą žinutę ar modernesnį vizualinį stilių – ir empirinė lankytojų elgsena parodė, kad ji veikė lygiai taip pat gerai, kaip ir seniai įsitvirtinusi kontrolinė versija.

Dar svarbiau tai, kad neutralus testas apsaugo įmonę nuo didelių investicijų į plataus masto dizaino atnaujinimus, kurie nebūtų padidinę pajamų. Jei vadovybė buvo įsitikinusi, kad norint padidinti pardavimus būtinas kapitalinis struktūrinis pertvarkymas, atliktas padalintas testas, pasibaigęs be aiškaus pokyčio, sutaupo organizacijai mėnesius inžinerinių ir dizaino resursų, kurie nebūtų atnešę jokios grąžos.

Pristatydami neutralius rezultatus vadovybei, išvadą pateikite per išsaugotus bazinius rodiklius ir rizikos sumažinimą:

„Per du pilnus srauto ciklus išbandėme siūlomą kelių žingsnių registracijos procesą lyginant su dabartine vieno puslapio forma. Duomenys neparodė jokio išmatuojamo skirtumo pildant konversijas. Šis padalintas testas leido mums įsitikinti, kad naujasis procesas nekenkia potencialių klientų pritraukimui, ir apsaugojo inžinierių komandą nuo nepatvirtinto sprendimo diegimo kitose mūsų produktų linijose.“

Neutralių rezultatų pateikimas kaip draudimas nuo klaidų parodo rinkodaros komandą kaip disciplinuotą įmonės išteklių valdytoją ir sustiprina supratimą, kada sustabdyti A/B testą, užuot leidus prastai veikiantiems variantams veikti neribotą laiką.

Šiuolaikinis eksperimentavimas: DI ir dinaminio srauto paskirstymo integravimas

Tradicinis padalintas testavimas nukreipia gaunamą srautą po lygiai visiems variantams (50/50), kol pasiekiamas iš anksto nustatytas imties dydis. Nors šis metodas išlieka auksiniu statistinio grynumo standartu, šiuolaikinės optimizavimo platformos vis dažniau naudoja mašininį mokymąsi dinaminiam srauto paskirstymui.

TRADICINIS STATINIS PADALINTAS TESTAVIMAS:
Srautas (100 %) ---> [50 % A variantui (kontrolinis)] ---> Fiksuota trukmė
                    ---> [50 % B variantui (naujas)]     ---> Fiksuota trukmė

DI VALDOMAS DINAMINIS PASKIRSTYMAS:
Srautas (100 %) ---> [Algoritmas vertina rezultatus realiuoju laiku]
                    ---> Nukreipia didesnę srauto dalį į pirmaujantį variantą
                    ---> Sumažina prastai veikiančių variantų rodymą

Dinaminio srauto paskirstymo algoritmai analizuoja vartotojų sąveiką realiuoju laiku ir automatiškai nukreipia didesnę srauto dalį į geriau veikiantį variantą, kol testas vis dar aktyvus. Šis metodas sumažina alternatyviąsias sąnaudas, atsirandančias rodant lankytojams prasčiau veikiantį puslapį ilgų testavimo ciklų metu.

Be to, DI įrankiai keičia idėjų generavimo etapą konversijų optimizavime. Užuot spėliojusios, kaip perrašyti vertės pasiūlymus, komandos gali naudoti automatizuotą natūralios kalbos apdorojimą antraščių iteracijoms generuoti, vartotojų sesijų įrašams apibendrinti ir formų laukams su didžiausiu lankytojų nubyrėjimu nustatyti. Strateginis klasikinio padalinto testavimo ir DI valdomų eksperimentų balanso išnaudojimas leidžia mažoms komandoms padidinti eksperimentavimo greitį be atskirų duomenų mokslo specialistų.

Tačiau dinaminis paskirstymas turi specifinį niuansą, kurį privalote paaiškinti vadovybei: daugiarankių banditų (angl. multi-armed bandit) ir dinaminiai algoritmai optimizuoja momentines konversijas testo metu, tačiau apsunkina švaraus, akademinio statistinio reikšmingumo apskaičiavimą. Kai priimami didelės svarbos sprendimai reikalauja neginčijamų empirinių įrodymų – pavyzdžiui, iš esmės keičiant visą įmonės kainodarą – klasikinis fiksuoto laiko padalintas testavimas išlieka geresniu pasirinkimu.

Praktiška 5 žingsnių ataskaitų struktūra netechniniams vadovams

Norėdami išlaikyti nuolatinį vadovybės palaikymą konversijų optimizavimo programai, atsisakykite žargono testų ataskaitose. Tokius terminus kaip p reikšmės, nulinės hipotezės ir dvipusiai Stjudento t testai pakeiskite paprasta verslo kalba.

Kiekvienai testo santraukai naudokite šią standartinę penkių punktų struktūrą:

  1. Verslo problema: Kokia konkreti vartotojo kelio trintis ar lankytojų nubyrėjimo vieta paskatino šį eksperimentą?
  2. Elgsenos hipotezė: Ką pakeitėme ir kokios konkrečios lankytojų reakcijos tikėjomės?
  3. Testo parametrai: Kokie puslapiai buvo testuojami, kokia srauto dalis buvo įtraukta ir kiek laiko testas vyko per pilnus kalendorinius ciklus?
  4. Empirinės išvados: Ką vartotojų elgsenos duomenys parodė apie pagrindinius konversijos veiksmus?
  5. Kitas komercinis žingsnis: Remiantis šia išvada, ką pritaikome praktikoje, ko atsisakome ir ką testuosime toliau?

Pagrindinių optimizavimo principų santrauka

Sėkmingas vidinis eksperimentavimo procesas reikalauja metodologinio tikslumo ir komercinio skaidrumo pusiausvyros. Bendraudami su suinteresuotaisiais asmenimis:

  • Siekite testavimu mažinti riziką: pristatykite eksperimentus kaip įrankius, padedančius apsaugoti pajamas nuo nepatvirtintų pakeitimų.
  • Sutelkite dėmesį į didelę trintį keliančius taškus: teikite pirmenybę formos ilgiui, vertės pasiūlymo aiškumui ir pasitikėjimo signalams, o ne kosmetiniams mikroelementams.
  • Gerbkite verslo ciklą: vykdykite testus pilnais savaitės ciklais, kad išvengtumėte strateginių sprendimų, grįstų ankstyvuoju statistiniu triukšmu.
  • Neutralius rezultatus vertinkite kaip laimėjimus: naudokite lygius rezultatus, kad parodytumėte sutaupytas inžinierių darbo valandas ir išsaugotą stabilumą.
  • Bendraukite verslo terminais: paverskite sudėtingą konversijų analitiką aiškiomis santraukomis, kurios parodo vadovybei, kaip eksperimentai apsaugo ir didina įmonės pelną.
Sources (5)