A/B testovanie: ako spustiť test, ktorému sa dá veriť

A/B testovanie: ako spustiť test, ktorému sa dá veriť

A/B testovanie je najpriamočiarejší spôsob, ako zistiť, či zmena na vašom webe naozaj zarába, a nie či sa len niekomu na porade zdala pekná. Problém je v tom, že väčšina firemných A/B testov nedá použiteľnú odpoveď. Nie preto, že by bol nástroj zlý, ale preto, že test bežal tri dni na 400 návštevníkoch, zastavil sa v momente, keď varianta B „vyhrávala“, a výsledok sa vyhlásil za 18 % nárast konverzií.

Tento článok je návod, ako to urobiť inak. Prejdeme si, čím sa A/B test líši od multivariantného a split URL testu, ako si spočítať veľkosť vzorky ešte pred spustením, prečo sa test nesmie zastaviť pri prvom dosiahnutí „významnosti“, čo konkrétne testovať na e-shope, B2B webe a PPC landing page, aké nástroje dnes reálne existujú a čo robiť s výsledkom, vrátane najčastejšieho prípadu, keď test nevyjde nijako.

Text je napísaný tak, aby ste podľa neho dokázali test naozaj spustiť. Všetky čísla a definície sú overené v primárnych zdrojoch uvedených na konci; nenájdete tu ani jedno vymyslené „zvýšili sme konverzie o 34 %“.

Čo je A/B testovanie

A/B testovanie je kontrolovaný experiment, v ktorom návštevníkov webu rozdelíte náhodne na dve (alebo viac) skupín. Jedna skupina vidí pôvodnú verziu (kontrolu, variantu A), druhá vidí upravenú verziu (variantu B). Obe skupiny sa pohybujú na webe v rovnakom čase, za rovnakých podmienok, s rovnakými zdrojmi návštevnosti. Potom porovnáte, ktorá skupina dosiahla lepší výsledok v metrike, ktorú ste si určili vopred.

Google vo svojej dokumentácii pre vyhľadávanie definuje A/B testovanie ako situáciu, keď testujete dve alebo viac variantov jednej zmeny, napríklad rôzne fonty na tlačidle, aby ste zistili, či sa zvýši počet klikov.

Podstatné slovo je náhodne. Práve náhodné rozdelenie je to, čo z merania robí experiment. Ak porovnávate marec s aprílom, nemáte A/B test. Porovnávate dva rôzne mesiace, v ktorých sa zmenilo počasie, výplatné termíny, konkurenčné akcie aj vaše vlastné kampane. Ak porovnávate mobilných používateľov s desktopovými, tiež nemáte A/B test. A/B test je jediný spôsob, ako o zmene vyhlásiť, že ju spôsobila, nie že s ňou len časovo koreluje.

Čo A/B test skutočne meria

A/B test nemeria „ktorá varianta je lepšia“. Meria rozdiel v konverznom pomere medzi dvoma náhodne vytvorenými skupinami a dáva vám k tomu informáciu o tom, nakoľko je tento rozdiel vysvetliteľný čistou náhodou.

To je dôležité rozlíšenie. Konverzný pomer, ktorý vám nástroj zobrazí, nie je fakt, je to odhad z vzorky. Keby ste ten istý test spustili zajtra znova s inými ľuďmi, dostali by ste iné číslo. Celá štatistika A/B testovania slúži práve na to, aby ste vedeli, nakoľko je ten odhad presný a či rozdiel, ktorý vidíte, nie je len šum.

A/B test vs. multivariantný test vs. split URL test

Tieto tri pojmy sa v slovenských textoch často miešajú. Rozdiel je praktický a má priamy dopad na to, koľko návštevnosti budete potrebovať.

A/B test Multivariantný test (MVT) Split URL test
Čo porovnávate Dve alebo viac celých variantov jednej zmeny Kombinácie viacerých zmien naraz na jednej stránke Dve alebo viac verzií hostovaných na rôznych URL
Čo sa dozviete Ktorá varianta vyhrala Ktorá kombinácia prvkov funguje najlepšie a či medzi prvkami existujú interakcie Ktorá verzia stránky vyhrala
Nárok na návštevnosť Najnižší Najvyšší; počet variantov je súčin všetkých kombinácií Rovnaký ako A/B test
Kedy to použiť Štandardná voľba. Menšie a stredné zmeny Keď chcete vedieť, ktorá kombinácia nadpisu, obrázka a CTA funguje spolu najlepšie, a máte dosť návštevnosti Kompletný redizajn stránky, nová šablóna, úplne iná štruktúra: čokoľvek, čo sa nedá spraviť prepísaním DOM-u
Technicky Varianta sa vykreslí na tej istej URL (JavaScript alebo server-side) To isté, len s viacerými zmenenými blokmi Presmerovanie na inú URL

Google v tej istej dokumentácii definuje multivariantné testovanie ako testovanie viac než jedného typu zmeny naraz, pričom sledujete dopad každej zmeny aj možné synergie medzi nimi.

Wingify (platforma, ktorá vznikla spojením VWO a AB Tasty) vo svojej dokumentácii opisuje multivariantný test ako „niekoľko A/B testov vykonaných na jednej stránke v rovnakom čase“ a hlavný rozdiel split URL testu formuluje tak, že varianty sú hostované na odlišných URL. Split URL test odporúča práve pre prípady, keď varianty existujú na rôznych URL alebo obsahujú výrazné zmeny voči originálu.

Praktický dôsledok: multivariantný test znie atraktívne („otestujeme všetko naraz“), ale pri štyroch prvkoch s dvoma verziami každý už testujete 16 kombinácií. To znamená 16 skupín, ktoré všetky potrebujú dostatočnú veľkosť. Pre väčšinu slovenských e-shopov a B2B webov je multivariantný test mimo dosah, nie preto, že by bol zložitý, ale preto, že na ňom nikdy nenazbierate dáta. Ak nemáte desaťtisíce konverzií mesačne, robte sériu A/B testov.

Kedy A/B test nemá zmysel

Buďme konkrétni, pretože toto je najčastejšia príčina zmarenej práce:

  • Málo konverzií. Ak máte 20 objednávok za mesiac, A/B test vám nepovie nič. Žiadnym nástrojom, žiadnou štatistikou. Potrebujete iný typ dôkazu: používateľské testovanie, analýzu nahrávok, heuristický audit.
  • Zmena, ktorá sa musí spraviť bez ohľadu na výsledok. Oprava chyby v pokladni, GDPR požiadavka, migrácia na nový platobný modul. Netestujte to, nasaďte to.
  • Zmena, ktorá sa nedá vrátiť. Prebrandovanie, zmena cenníka na celý katalóg, výmena doménového mena.
  • Veľmi dlhý nákupný cyklus bez priebežných signálov. Ak od prvej návštevy k podpisu zmluvy prejde šesť mesiacov, A/B test na finálnu konverziu nedoklepnete. Testujte mikrokonverziu (odoslanie formulára, stiahnutie podkladu) a sledujte, či za ňou kvalita leadu nekolabuje.
  • Keď viete, že varianta je horšia. Nepotrebujete test na potvrdenie, že rozbitý formulár konvertuje menej.

Štatistika A/B testu zrozumiteľne a správne

Toto je časť, ktorú väčšina návodov preskočí alebo zvládne nesprávne. Pritom práve tu sa rozhoduje, či bude váš test niečo znamenať.

Štatistická významnosť a p-hodnota — čo naozaj znamenajú

Keď nástroj ukáže „štatistická významnosť 95 %“, väčšina ľudí si to preloží ako „na 95 % je varianta B lepšia“. Toto preloženie je nesprávne.

Štandardný frekventistický test pracuje s nulovou hypotézou: predpokladom, že medzi variantami nie je žiadny rozdiel. P-hodnota potom odpovedá na otázku: keby medzi variantami naozaj nebol žiadny rozdiel, aká je pravdepodobnosť, že by som nameral rozdiel aspoň taký veľký, aký som nameral? Ak je p-hodnota 0,03, znamená to, že takýto alebo väčší rozdiel by sa pri neexistujúcom efekte vyskytol v 3 % prípadov.

American Statistical Association vydala v marci 2016 stanovisko k používaniu p-hodnôt, ktoré formuluje šesť princípov. Pre praktika z marketingu sú podstatné tri:

  1. P-hodnoty môžu indikovať, nakoľko sú dáta nekompatibilné s konkrétnym štatistickým modelom.
  2. P-hodnoty nemerajú pravdepodobnosť, že skúmaná hypotéza je pravdivá, ani pravdepodobnosť, že dáta vznikli čistou náhodou.
  3. P-hodnota ani štatistická významnosť nemerajú veľkosť efektu ani dôležitosť výsledku.

Tretí bod je v praxi najnákladnejší. Štatisticky významný výsledok môže znamenať nárast konverzného pomeru o 0,05 percentuálneho bodu. Matematicky nespochybniteľný, biznisovo bezcenný. Pri dostatočne veľkej vzorke je významný takmer každý rozdiel. Preto sa pri vyhodnotení nikdy nedívajte len na „zelené číslo“, ale vždy aj na veľkosť efektu a jeho interval spoľahlivosti.

Hladina významnosti (α) a sila testu (1−β)

Dva parametre, ktoré si určujete pred testom, nie po ňom.

Hladina významnosti α je pravdepodobnosť, že vyhlásite rozdiel, ktorý v skutočnosti neexistuje, teda falošne pozitívny výsledok, chyba I. typu. Evan Miller ju vo svojej kalkulačke opisuje ako percento prípadov, v ktorých sa rozdiel deteguje, hoci neexistuje. Konvenčná hodnota je α = 0,05, teda 5 %. GrowthBook ju vo svojej dokumentácii uvádza ako predvolenú hodnotu (0,05, obojstranný test).

Sila testu (power, 1−β) je pravdepodobnosť, že efekt odhalíte, ak tam naozaj je. GrowthBook definuje silu ako pravdepodobnosť, že uvidíte štatisticky významný výsledok, ak vaša zmena má na metriku nejaký efekt, a používa priemyselný štandard 80 %. Opačná chyba (nevidíte efekt, ktorý existuje) je chyba II. typu.

Preložené do praxe: pri α = 5 % a sile 80 % akceptujete, že v 5 % prípadov vyhlásite víťaza, ktorý ním nie je, a v 20 % prípadov prehliadnete skutočného víťaza. To nie je nedostatok metódy, to je cena, ktorú platíte za konečnú veľkosť vzorky. Môžete ju znížiť, ale len tým, že nazbierate viac dát.

Minimálny detegovateľný efekt (MDE)

Minimálny detegovateľný efekt je najmenší rozdiel, ktorý je váš test schopný spoľahlivo odhaliť pri danej veľkosti vzorky, hladine významnosti a sile. Evan Miller ho definuje ako najmenší efekt, ktorý bude detegovaný v (1−β) % prípadov. GrowthBook ho opisuje ako najmenšiu veľkosť efektu, ktorá pri vašom rozptyle a veľkosti vzorky dosiahne aspoň 80 % silu.

MDE je najpraktickejší pojem z celej štatistiky A/B testovania, pretože obracia otázku správnym smerom. Nepýtate sa „ako dlho to má bežať“, ale „aký malý rozdiel sa mi vôbec vyplatí hľadať“.

Dve veci, na ktorých sa to v praxi láme:

MDE môže byť absolútny alebo relatívny. Absolútny MDE 1 percentuálny bod pri základnom konverznom pomere 2 % znamená cieľ 3 %. Relatívny MDE 1 % pri tom istom základe znamená cieľ 2,02 %, čiže päťdesiatkrát menší rozdiel a nesmierne väčšia vzorka. Kalkulačka Evana Millera ponúka obe možnosti ako samostatné prepínače. Vždy si overte, s ktorým variantom pracujete.

Čím menší MDE, tým väčšia vzorka, a vzťah nie je lineárny. Veľkosť vzorky rastie s druhou mocninou prevrátenej hodnoty efektu. Ak chcete detegovať polovičný rozdiel, potrebujete štvornásobnú vzorku. Toto je dôvod, prečo malé e-shopy nemôžu testovať malé zmeny.

Ako si vypočítať veľkosť vzorky

Evan Miller v texte How Not To Run An A/B Test uvádza orientačný vzorec pre potrebnú veľkosť vzorky na jednu variantu:

n = 16 × σ² / δ²

kde δ je minimálny detegovateľný efekt (v absolútnom vyjadrení) a σ² je očakávaný rozptyl vzorky. Pri konverznom pomere je rozptyl σ² = p × (1 − p), kde p je základný konverzný pomer.

Vzorec je aproximácia pre obvyklú kombináciu 5 % hladiny významnosti a 80 % sily. Na finálne plánovanie použite kalkulačku (Evan Miller, prípadne modul power analysis vo vašom nástroji). Presný výpočet dá zvyčajne mierne vyššie číslo. Na rozhodnutie „má to vôbec zmysel spúšťať?“ je ale vzorec úplne postačujúci a spočítate ho na mobile.

Štyri reálne scenáre s rozpísanou aritmetikou:

1. E-shop, konverzný pomer 2 %, chcem detegovať nárast na 3 % (absolútne +1 p. b., relatívne +50 %)

σ² = 0,02 × 0,98 = 0,0196
δ  = 0,01   →   δ² = 0,0001
n  = 16 × 0,0196 / 0,0001 = 3 136 návštevníkov na variantu

Celkovo ~6 300 návštevníkov. Pri 500 návštevách denne je to ~13 dní. Realizovateľné.

2. Ten istý e-shop, chcem detegovať nárast na 2,4 % (absolútne +0,4 p. b., relatívne +20 %)

σ² = 0,0196
δ  = 0,004   →   δ² = 0,000016
n  = 16 × 0,0196 / 0,000016 = 19 600 na variantu

Celkovo ~39 200 návštevníkov. Pri 500 návštevách denne je to ~78 dní. Na hrane. Ak nemáte vyššiu návštevnosť, tento test nespúšťajte.

3. PPC landing page, konverzný pomer 10 %, chcem detegovať nárast na 12 %

σ² = 0,10 × 0,90 = 0,09
δ  = 0,02   →   δ² = 0,0004
n  = 16 × 0,09 / 0,0004 = 3 600 na variantu

Celkovo ~7 200 kliknutí. Pri cene za klik 0,50 € je to ~3 600 € na preklikovom rozpočte. Spočítajte si to vopred: pri PPC testoch je veľkosť vzorky priamo peniaze.

4. B2B web, konverzný pomer formulára 1 %, chcem detegovať nárast na 1,3 %

σ² = 0,01 × 0,99 = 0,0099
δ  = 0,003   →   δ² = 0,000009
n  = 16 × 0,0099 / 0,000009 = 17 600 na variantu

Celkovo ~35 200 návštevníkov. Väčšina slovenských B2B webov toto za rozumný čas nenazbiera. Netestujte finálnu konverziu, ale mikrokonverziu s výrazne vyššou frekvenciou (kliknutie na CTA, otvorenie formulára, prehranie videa) a interpretujte ju opatrne.

Druhé, hrubšie pravidlo, ktoré sa dobre pamätá: GrowthBook vo svojich best practices odporúča aspoň 100 konverzných udalostí na variantu. Pri 10 % konverznom pomere a dvoch variantoch to vychádza na približne 2 000 účastníkov celkovo (1 000 na variantu). Ak toto nedosiahnete, výsledok nemá vypovedaciu hodnotu bez ohľadu na to, čo nástroj zobrazí.

Ak merate konverzie v Google Analytics 4, oplatí sa mať udalosti nastavené poriadne ešte pred prvým testom. Inak budete testovať na metrike, ktorej neveríte. Postup sme rozpísali v článku o nastavení a vyhodnocovaní udalostí v GA4.

Peeking problem: prečo sa test nesmie zastaviť pri prvej „významnosti“

Toto je najčastejšia a najdrahšia chyba v A/B testovaní a na slovenskom internete sa o nej takmer nepíše.

Klasický frekventistický test predpokladá, že veľkosť vzorky bola určená vopred a výsledok sa vyhodnocuje raz, na konci. Ak namiesto toho sledujete dashboard každý deň a test zastavíte v momente, keď sa objaví „95 % významnosť“, tento predpoklad ste porušili. Uvádzaná hladina významnosti prestáva platiť.

Nakoľko? Evan Miller to vyčíslil. V jeho príklade s logom pri 50 % konverznom pomere a nazeraní po každom jednom pozorovaní skutočná mieru falošne pozitívnych výsledkov vyskočí z 5 % na 26,1 %, teda viac než päťkrát toľko, než ste si mysleli. Inými slovami: viac než každý štvrtý „víťaz“ je čistý šum.

Pre bežnejší prípad, teda nazeranie niekoľkokrát počas testu, uvádza tabuľku, akú zobrazenú významnosť potrebujete, aby skutočná hladina ostala na 5 %:

Počet nazretí do testu Potrebná zobrazená významnosť
1 2,9 %
2 2,2 %
3 1,8 %
5 1,4 %
10 1,0 %

Čítajte to zdola: ak ste sa na test pozreli desaťkrát, p-hodnota 0,01, ktorá vyzerá ako vysoko spoľahlivý výsledok, je v skutočnosti len na úrovni 0,05.

Millerove odporúčania sú tri: určiť veľkosť vzorky vopred a držať sa jej, nenazerať, a (pokiaľ nástroj neimplementuje sekvenčný alebo bayesovský dizajn) nerobiť nič iné.

Sekvenčné a bayesovské testovanie — kedy nazerať môžete

Časť nástrojov tento problém rieši na úrovni štatistického modelu. Optimizely rozlišuje tri prístupy:

  • Frekventistický s fixným horizontom: klasika. Veľkosť vzorky a plán analýzy definujete pred začiatkom, výsledky vyhodnocujete až po nazbieraní všetkých dát. Kontroly v priebehu testu sú zakázané práve kvôli falošne pozitívnym výsledkom.
  • Bayesovský aktualizuje presvedčenie o hypotézach priebežne, ako pribúdajú dáta, čo umožňuje priebežné monitorovanie a skoršie rozhodnutia.
  • Sekvenčný (Optimizely Stats Engine) umožňuje analyzovať výsledky priebežne, ako dáta prichádzajú, namiesto čakania na konec experimentu, pričom platforma kontroluje false discovery rate.

Optimizely zároveň vysvetľuje, prečo významnosť v jeho rozhraní v čase kolíše: experiment delí na 100 časových „bucketov“, ktoré sa priebežne rozširujú a návštevníci sa medzi nimi premiešavajú. Výraznejšie prepady nastávajú, keď Stats Engine zaznamená sezónnosť alebo drift konverzných pomerov a štatistiku resetuje, aby nedošlo k nesprávnemu záveru.

GrowthBook používa ako predvolený prístup bayesovskú štatistiku a frekventistický engine ponúka s možnosťou zapnúť sekvenčné testovanie práve na riešenie peekingu. Dôležitá poznámka z ich dokumentácie: zapnutie sekvenčného testovania znižuje silu testu, takže test bude musieť bežať dlhšie. Nič nie je zadarmo: za možnosť nazerať platíte dlhším trvaním.

Praktický záver: zistite si, aký štatistický model váš nástroj používa. Ak fixný horizont, určite si vzorku vopred a do výsledkov sa nepozerajte (iba na technické kontroly, nie na víťaza). Ak sekvenčný alebo bayesovský, nazerať môžete, ale aj tak dodržte minimálne trvanie, pretože to rieši iný problém.

Ako dlho nechať test bežať

Veľkosť vzorky je prvá podmienka. Trvanie je druhá, nezávislá podmienka, a musia byť splnené obe.

Dôvod je jednoduchý: ľudia sa v pondelok chovajú inak než v sobotu, dopoludnia inak než v noci, pred výplatou inak než po nej. Ak test bežal tri dni, optimalizovali ste na tri konkrétne dni.

Čo odporúčajú primárne zdroje:

  • Optimizely: „You should run all tests for a minimum of one business cycle (seven days) to account for all kinds of user behavior.“ Minimálne jeden obchodný cyklus, čiže sedem dní.
  • GrowthBook: experiment nechať bežať aspoň 1 až 2 týždne, aby sa zachytili variácie v návštevnosti; zároveň upozorňuje na opatrnosť počas sviatkov.
  • Google Ads (pre experimenty s kampaňami): odporúča nechať experiment bežať aspoň 4 až 6 týždňov, aby sa nazbieralo dosť dát na vyhodnotenie; ak dáta ani potom nestačia, treba upraviť rozpočet alebo predĺžiť trvanie.

Z toho vyplývajú tri praktické pravidlá:

  1. Vždy celé týždne, nie „10 dní“. Ukončite test v rovnaký deň v týždni, v ktorý začal. Inak ste jeden deň v týždni nadvážili.
  2. Minimum 1–2 týždne aj pri vysokej návštevnosti. Aj keď vzorku nazbierate za dva dni, nechajte test bežať celý týždeň.
  3. Ak výpočet vyjde na viac ako ~6 týždňov, test nespúšťajte v tejto podobe. Dlhé testy zbierajú sezónne skreslenie, cookie expiráciu, zmeny v kampaniach a redizajny konkurencie. Namiesto toho zväčšite MDE (testujte odvážnejšiu zmenu), presuňte test na stránku s vyššou návštevnosťou alebo zmeňte cieľovú metriku na mikrokonverziu.

Efekt novosti a efekt prvenstva

Dva javy, ktoré skresľujú výsledok práve na začiatku testu, teda presne vtedy, keď máte najväčšiu chuť ho vyhlásiť za vyhraný.

Efekt novosti (novelty effect) je tendencia ľudí reagovať pozitívne na niečo nové. Nová varianta môže zo začiatku fungovať lepšie len preto, že je nová; s časom efekt vyprchá a výkon klesne. GrowthBook ako obranu odporúča nechať test bežať dlhšie, prípadne zmenu zavádzať postupne (staggered rollout), a vo svojom nástroji umožňuje nastaviť odklad merania metriky o hodiny až dni po expozícii.

Efekt prvenstva (primacy effect) je opačný: existujúci používatelia majú zabehnuté vzorce a nová verzia ich spočiatku spomaľuje, takže varianta vyzerá horšie, než je. Obrana podľa GrowthBooku: cieliť alebo segmentovať experiment len na nových používateľov, ktorých predchádzajúca verzia neovplyvnila.

Oba efekty sú argumentom pre to isté: nerobte závery z prvých dní.

Ako napísať hypotézu

Test bez hypotézy nie je experiment, ale hádanie s dashboardom. Hypotéza je to, čo rozhoduje o tom, či sa z testu niečo naučíte aj vtedy, keď prehrá.

GrowthBook uvádza, že dobrá hypotéza má byť špecifická, merateľná, relevantná, jasná, jednoduchá a falzifikovateľná, teda musí existovať výsledok, ktorý ju vyvráti.

Šablóna

Pretože [pozorovanie z dát alebo z používateľského výskumu],
predpokladáme, že [konkrétna zmena]
spôsobí [smer a približná veľkosť zmeny] v [primárna metrika]
u [segment / stránka],
pretože [mechanizmus — prečo by to malo fungovať].
Ak sa to nepotvrdí, naučíme sa, že [čo z toho vyplýva o vašich zákazníkoch].

Posledný riadok je ten, ktorý väčšina firiem vynechá, a práve on z prehraného testu robí užitočný prehraný test.

Príklady

Zlá hypotéza:

„Zmeníme tlačidlo na oranžové, lepšie vyniká.“

Prečo je zlá: neopiera sa o žiadne pozorovanie, nedefinuje metriku, nedefinuje veľkosť efektu, nedá sa z nej nič naučiť. Ak vyhrá, neviete prečo. Ak prehrá, neviete prečo.

Zlá hypotéza (zákerná verzia):

„Prerobíme produktovú stránku, aby bola modernejšia a dôveryhodnejšia, čím zvýšime konverzie.“

Prečo je zlá: mení naraz desať vecí. Ak vyhrá, neviete, ktorá z nich fungovala, a nemôžete to použiť nikde inde. (To neznamená, že redizajn netestovať; znamená to, že ho testujete ako split URL test s cieľom „nezhoršiť“, nie ako učebný experiment.)

Dobrá hypotéza:

Pretože 41 % návštevníkov produktovej stránky v nahrávkach sessions scrolluje k sekcii s dopravou a vracia sa späť nahor,
predpokladáme, že zobrazenie termínu dodania a ceny dopravy priamo pod tlačidlom „Do košíka“
zvýši pomer pridaní do košíka o aspoň 1 percentuálny bod (z 8,2 % na 9,2 %)
u návštevníkov produktových strániek na mobile,
pretože informácia o doprave je rozhodovací faktor, ktorý dnes musia hľadať a časť ich pri tom odpadne.
Ak sa to nepotvrdí, naučíme sa, že doprava nie je hlavná prekážka v tomto kroku a hľadáme ju inde (cena, dostupnosť, dôveryhodnosť).

Všimnite si: pozorovanie, konkrétna zmena, konkrétna metrika, kvantifikovaný MDE (z ktorého sa dá spočítať vzorka), segment, mechanizmus a poučenie z prehry.

Odkiaľ brať hypotézy

Hypotézy sa nevymýšľajú na porade. Zdroje, ktoré v praxi fungujú:

  • Nahrávky sessions a heatmapy. Kde ľudia zastanú, kde klikajú na neklikateľné, kde sa vracajú. Microsoft Clarity je podľa dokumentácie Microsoftu natrvalo bezplatná služba a ponúka nahrávky sessions, heatmapy, sledovanie udalostí a funnelov. Hotjar je dnes súčasťou Contentsquare.
  • Funnely v GA4. Kde presne padá najväčšie percento ľudí.
  • Interná vyhľadávanie na webe. Čo ľudia hľadajú a nenachádzajú.
  • Zákaznícka podpora a predaj. Otázky, ktoré sa opakujú, sú diery v obsahu stránky.
  • Search Console. Dopyty, na ktoré prichádzajú, ale ktoré stránka neodpovedá; prekrývanie s SEO optimalizáciou je tu veľké.
  • Vyhľadávacie dopyty a reklamné texty v PPC. Ak niečo funguje v PPC reklame, je to kandidát na nadpis landing page.

Clarity, Contentsquare ani GA4 nerobia A/B testy. Sú to nástroje na hľadanie hypotéz. Rozdiel je podstatný a v slovenských textoch sa často rozmazáva.

Čo testovať podľa typu webu

Prestaňme s „testujte tlačidlá“. Nasledujú konkrétne hypotézy zoradené podľa toho, kde je v danom type webu najviac stratenej hodnoty.

E-shop

Na e-shope je najviac návštevnosti a najkratšia spätná väzba, takže testovať sa dá najviac. Zoradené od najväčšieho dopadu:

Pokladňa a košík (najvyššia priorita, najmenej testovaná)

  • Počet krokov pokladne: jedna stránka vs. viackroková s indikátorom priebehu.
  • Objednávka bez registrácie ako predvolená voľba vs. ponuka registrácie.
  • Zobrazenie všetkých nákladov (doprava, dobierka) už v košíku vs. až v poslednom kroku.
  • Umiestnenie poľa na kupón: viditeľné vs. skryté pod odkazom (viditeľné pole posiela časť ľudí hľadať kupón na Google a tí sa nemusia vrátiť).
  • Počet povinných polí v adresnom formulári.
  • Poradie platobných a doručovacích metód.

Produktová stránka

  • Termín dodania a cena dopravy pri tlačidle vs. nižšie na stránke.
  • Dostupnosť vyjadrená počtom („na sklade 3 ks“) vs. stavom („na sklade“).
  • Sticky lišta s cenou a CTA na mobile vs. bez nej.
  • Recenzie nad popisom vs. pod popisom.
  • Fotogaléria: počet fotiek, poradie, prvá fotka na bielom pozadí vs. v použití.
  • Cross-sell pod tlačidlom vs. až na konci stránky (sledujte aj dopad na konverziu, nie len na priemernú hodnotu objednávky).

Kategória a listing

  • Predvolené radenie (odporúčané vs. najprodávanejšie vs. najnižšia cena).
  • Filtre otvorené vs. zbalené na mobile.
  • Počet produktov na obrazovku.
  • Zobrazenie dostupnosti priamo v dlaždici produktu.

Doprava a pravidlá

  • Prah pre bezplatnú dopravu: dve rôzne hodnoty (toto je test na maržu, nie na konverzný pomer; merajte zisk na návštevníka, nie konverzie).

Pri e-shope sledujte vždy aspoň dve metriky: primárnu (napr. dokončené objednávky) a kontrolnú/guardrail metriku (napr. priemerná hodnota objednávky alebo marža). Test, ktorý zvýši počet objednávok a zníži priemernú hodnotu o viac, je prehraný test, ktorý vyzerá ako vyhraný. GrowthBook preto guardrail metriky zobrazuje oddelene a nezaraďuje ich do korekcií p-hodnôt, aby zostali citlivé na negatívne trendy.

Ak e-shop ešte len staviate, vyplatí sa myslieť na testovateľnosť už pri zadaní. Rozpísali sme to v článku o cenách tvorby e-shopu.

B2B web so službami

Tu je hlavné obmedzenie málo konverzií. Preto: testujte mikrokonverzie, veľké zmeny a radšej menej testov.

  • Formulár: 3 polia vs. 7 polí. Klasika, ktorá funguje, ale pozor na guardrail. Ak krátky formulár prinesie dvakrát viac leadov s polovičnou kvalitou, nič ste nezískali. Merajte kvalifikované leady, nie odoslania.
  • Typ CTA: „Nezáväzná konzultácia“ vs. „Cenová ponuka do 24 h“ vs. „Chcem prepočet“.
  • Cenová transparentnosť: stránka s rozsahom cien („od – do“, modelové príklady) vs. bez cien. Toto je jeden z najväčších testovateľných rozdielov na slovenských B2B weboch.
  • Dĺžka služby stránky: krátka stránka s CTA vysoko vs. dlhá stránka s procesom, prípadmi, FAQ a CTA opakovane.
  • Sociálny dôkaz: logá klientov vs. konkrétne výsledky vs. menné referencie. (Používajte len skutočné; vymyslené referencie sú právny aj reputačný problém.)
  • Kontaktná cesta: formulár vs. formulár + priamy telefón + kalendár na rezerváciu termínu.
  • Obsahový vs. priamy vstup: ponuka stiahnuteľného podkladu (audit, checklist) ako alternatívna konverzia pre ľudí, ktorí ešte nie sú pripravení na kontakt.

Ak pracujete s dlhým cyklom, prepojte test s CRM. Bez toho testujete odoslania formulára, nie biznis. Súvisiacu mechaniku kanálov a rozpočtu sme rozpísali v článku o online marketingu pre firmy.

Landing page pre PPC

Landing page je najlepšie testovacie prostredie, aké máte: návštevnosť si kupujete, takže ju viete nasmerovať a dávkovať.

  • Súlad nadpisu s dopytom (message match). Nadpis, ktorý slovo za slovom zodpovedá vyhľadávanému dopytu a textu reklamy, vs. všeobecný brandový nadpis. Najčastejší víťazný test na PPC stránkach.
  • Formulár nad zlomom vs. po argumentoch.
  • Jedno CTA vs. viac ciest. Landing page s jedným cieľom vs. stránka s navigáciou na celý web (navigácia zvyčajne odvádza, ale overte to).
  • Dĺžka formulára vs. kvalita leadu.
  • Dôveryhodnostné prvky pri CTA (certifikáty, počet klientov, záruka) vs. bez nich.
  • Video vs. statická grafika v hero sekcii.
  • Cena uvedená na stránke vs. až po kontakte.

Dve špecifiká PPC testov:

  1. Vzorka = peniaze. Spočítajte si potrebný počet kliknutí a prenásobte ho CPC. Ak vám test vyjde na 4 000 €, zvážte, či nie je lepšie testovať odvážnejšiu zmenu s väčším MDE.
  2. Nemiešajte test stránky s testom reklamy. Ak súčasne testujete landing page a súbežne systém rotuje reklamné texty alebo mení bidding, nemáte čistý experiment. Jeden test, jedna zmena.
  3. Google Ads má vlastný mechanizmus. Stránka Experimenty v Google Ads umožňuje rozdeliť rozpočet alebo návštevnosť medzi pôvodnú kampaň a experiment a výsledky porovnať za určené obdobie. Podporuje okrem iného variácie reklám (ad variations), vlastné experimenty (custom experiments: Smart Bidding, typy zhody kľúčových slov, landing pages, audiences), experimenty pre Performance Max, Demand Gen a video. Ak testujete niečo, čo je v kampani (bidding, zhoda, audience), robte to tam, nie v CRO nástroji.

Technická stránka: čo nepokaziť

Flicker (blikanie originálu)

Klientské A/B testovanie funguje tak, že sa stránka načíta v pôvodnom stave a JavaScript ju prepíše. Ak sa skript načíta pomaly, návštevník na chvíľu uvidí originál a potom zmenu. Tento „flicker“ skresľuje výsledok (časť ľudí stihne odísť, časť si všimne, že sa niečo stalo) a zhoršuje vnímanú rýchlosť.

Riešenia: anti-flicker snippet načítaný synchrónne v <head>, server-side testovanie, alebo edge/CDN implementácia. Ak nástroj nasadzujete cez tag manager až po načítaní obsahu, flicker budete mať takmer isto.

Sample Ratio Mismatch (SRM)

SRM nastáva, keď očakávate určité rozdelenie návštevnosti (napr. 50/50), ale vidíte výrazne iné (napr. 46/54). GrowthBook túto kontrolu robí automaticky a upozorní, keď p-hodnota klesne pod 0,001, teda keď je rozdiel extrémne nepravdepodobný náhodou; technicky používa štandardný chí-kvadrát test porovnávajúci rozdelenie pozorovaných a očakávaných jednotiek.

SRM je červená vlajka, nie kozmetický problém. Znamená to, že niečo v implementácii je rozbité (bot traffic, chyba v randomizácii, redirect, ktorý zlyháva na časti zariadení, blokovaný skript). GrowthBook v takom prípade priamo odporúča výsledkom neveriť, nájsť a opraviť chybu a experiment spustiť odznova.

Kontrolujte rozdelenie návštevnosti ešte pred tým, než sa pozriete na víťaza. Toto je jediné „nazeranie“, ktoré je legitímne vždy.

A/A test

Pred prvým reálnym testom spustite A/A test: dve identické varianty. GrowthBook to uvádza ako odporúčaný štartovací bod: validuje, že vaša implementácia správne delí návštevnosť a produkuje štatisticky zdravé výsledky.

Čo z A/A testu zistíte: či sedí rozdelenie, či sa konverzie merajú v oboch variantách rovnako, či niekde nedochádza k dvojitému počítaniu. A zároveň sami uvidíte, ako veľmi vie „víťaz“ fluktuovať aj vtedy, keď medzi variantami nie je absolútne žiadny rozdiel. To je najlepšia možná vakcína proti peekingu.

A/B testovanie a SEO: čo o tom píše Google

Google má na testovanie samostatnú dokumentáciu v Search Central a jej obsah je pre CRO prekvapivo konkrétny.

Cloaking je zakázaný. Google definuje cloaking v spamových zásadách ako „prezentovanie odlišného obsahu používateľom a vyhľadávačom so zámerom manipulovať poradie vo vyhľadávaní a zavádzať používateľov“. V kontexte testovania to znamená: nevylučujte Googlebota z testu a nezobrazujte mu inú verziu než ľuďom. Googlebot má dostať to isté, čo dostane bežný návštevník zaradený do danej varianty. Rovnako sa nedá cloaking riešiť cez robots.txt.

Používajte rel="canonical". Google odporúča použiť atribút rel="canonical" na všetkých alternatívnych URL s odkazom na pôvodnú URL, aby bolo zrejmé, že originál je preferovaná verzia. Toto sa týka najmä split URL testov.

Pri presmerovaní použite 302, nie 301. Ak test presmerúva používateľov z pôvodnej URL na variantu, použite dočasné presmerovanie 302, nie trvalé 301. Signalizujete tým, že presmerovanie je dočasné a pôvodná URL má zostať v indexe.

Testujte len tak dlho, ako je potrebné. Google odporúča po skončení testu web aktualizovať na vybranú variantu a odstrániť všetky prvky testu čo najskôr. Nekonečne bežiaci „test“ je pre vyhľadávač podozrivý.

Googlebot a cookies. Google uvádza, že Googlebot vo všeobecnosti nepodporuje cookies. Uvidí teda len tú verziu obsahu, ktorá je dostupná používateľom s prehliadačom, ktorý cookies neakceptuje. Pri plánovaní testu s tým počítajte: ak vaša varianta závisí od cookie, Googlebot ju neuvidí.

Prakticky: štandardný A/B test na jednej URL s rozumným trvaním nie je pre SEO problém. Problémy vznikajú pri dlhodobých split URL testoch bez kanonikalizácie, pri 301 namiesto 302 a pri pokusoch „vylúčiť vyhľadávače z testu“.

Rýchlosť a Core Web Vitals

Každý A/B nástroj je ďalší skript. Ak ho nasadíte synchrónne (čo pri anti-flickeri musíte), ovplyvní načítanie. Zmerajte rýchlosť pred a po nasadení nástroja, a ak testujete dlhodobo, zvážte server-side alebo edge implementáciu. A nezabudnite skript odstrániť, keď prestanete testovať. Na mnohých weboch beží CRO nástroj z roku 2019, ktorý už nikto nepoužíva.

Nástroje na A/B testovanie v roku 2026

Toto je oblasť, v ktorej je väčšina slovenských článkov zastaraná. Nasleduje stav overený k 2. 10. 2026.

Čo sa stalo s Google Optimize

Google Optimize a Optimize 360 nie sú dostupné od 30. septembra 2023. Toto je presná formulácia z nápovedy Google: „Google Optimize and Optimize 360 are no longer available as of September 30, 2023.“

Čo Google odporúča namiesto toho: prechod na integrácie A/B testovacích nástrojov tretích strán. V nápovede menuje spolupracujúcich poskytovateľov AB Tasty, Optimizely a VWO a dodáva, že svoje API sprístupnil verejne, takže akýkoľvek A/B nástroj sa dá integrovať s Google Analytics.

Dôsledok pre čitateľa: ak niekde čítate návod, ktorý vám odporúča Google Optimize, ten návod je starší než tri roky a nemožno mu veriť ani v ostatných bodoch. Google Analytics 4 vlastný nástroj na A/B testovanie webu nemá; slúži na meranie, nie na rozdeľovanie návštevnosti.

Wingify (vzniklo spojením VWO a AB Tasty)

Najväčšia zmena na trhu od ukončenia Optimize. VWO a AB Tasty sa spojili a vystupujú pod jednou značkou Wingify. Spojenie bolo oznámené v januári 2026 na blogu spoločnosti; v septembri 2026 bola predstavená zjednotená platforma, nová identita a web. Doména vwo.com aj doména abtasty.com dnes trvalo presmerúvajú (301) na wingify.com.

Čo platforma ponúka podľa vlastného webu: šesť produktových oblastí: experimentovanie (A/B testovanie, split URL testovanie, multivariantné testovanie), personalizáciu, analytiku, feature management, commerce a customer engagement. K dispozícii je 30-dňová bezplatná skúšobná verzia bez platobnej karty.

V oznámení o spojení spoločnosť uvádza, že existujúce klientske vzťahy, zmluvy, cenníky, úrovne služieb a podpora zostávajú nezmenené. Ak ste doterajší klient jednej z dvoch platforiem, overte si aktuálny stav priamo u nich; migračné detaily sa môžu v čase meniť.

Optimizely

Veterán kategórie, dnes pod označením Optimizely Agentic Experimentation. Z testovacích typov na produktovej stránke explicitne nájdete multivariantné testy a bandity, k dispozícii je vizuálny editor pre web aj server-side riešenie. Platforma stavia na vlastnom Stats Engine so sekvenčným testovaním a kontrolou false discovery rate, čo je z hľadiska peeking problému jej najväčšia technická výhoda.

Cenník nie je zverejnený. Na produktovej stránke nie je uvedená ani cena, ani bezplatný plán, len formulár na demo. Reálnu cenu dostanete až po rozhovore s predajom; počítajte s enterprise úrovňou.

Nezávisle od toho, či nástroj použijete, jeho dokumentácia je jedným z najlepších verejne dostupných zdrojov o štatistike A/B testovania a odporúčame ju prečítať aj tým, ktorí testujú inde.

Kameleoon

Francúzska platforma. Podľa vlastného webu podporuje A/B testovanie, feature flagging, contextual bandit testovanie (dynamická alokácia návštevnosti) a UX experimenty pre web aj mobilné aplikácie, ponúka prompt-based experimentovanie cez AI agenta a automaticky detekuje Sample Ratio Mismatch. V oblasti súladu uvádza GDPR, CCPA a HIPAA, certifikáty ISO 27001 a SOC 2 a nástroj na správu súhlasov. Je dostupná bezplatná skúšobná verzia.

Pre firmy, pre ktoré je dôležité, aby spracovanie dát zostalo v EU, je európsky pôvod relevantný argument, ale overte si aktuálne podmienky spracovania priamo v DPA, nie z marketingovej stránky.

Convert Experiences

Menšia, zámerne privacy-first platforma. Podľa vlastného webu podporuje A/B testy, split URL (redirect) testy, multi-page (full-funnel) testy, multivariantné testy, cenové testovanie, multi-arm bandit testy a full-stack server-side experimentovanie so šiestimi SDK. Uvádza súlad s GDPR, TTDSG a BDSG, používanie výhradne first-party cookies, servery vo Frankfurte a certifikácie ISO 27001, SOC 2 Type 2, HIPAA a CCPA. K dispozícii je 15-dňová bezplatná skúšobná verzia bez platobnej karty.

Na webe je k 2. 10. 2026 uvedený vstupný plán od 399 USD mesačne. Ceny sa menia. Pred rozhodnutím si ju overte priamo na convert.com.

GrowthBook

Open-source platforma pre experimentovanie, feature flagy a produktovú analytiku, warehouse-native (počíta nad vaším dátovým skladom). Dostupná je bezplatná cloudová verzia aj self-hosted nasadenie s rovnakými funkciami, 100 % vo vašej infrastruktúre.

Štatisticky je z verejne dostupných nástrojov najtransparentnejšia: predvolene bayesovská (s možnosťou vlastných priorov), s frekventistickým enginom založeným na dvojvzorkových t-testoch, podporou CUPED na redukciu rozptylu a sekvenčným testovaním proti peekingu. Predvolené hodnoty: sila 80 %, α = 0,05, obojstranný test.

Pre koho: firmy s vývojovým tímom, ktoré chcú kontrolu nad dátami a plnú dohľadateľnosť výpočtu. Pre marketingový tím bez vývojára to nie je prvá voľba; nástroj nemá klasický „klikací“ vizuálny editor ako primárny spôsob práce.

PostHog

Produktová analytika s experimentmi postavenými nad feature flagmi. Podľa dokumentácie definujete varianty, zvolíte metriky a PostHog sa postará o randomizáciu, sledovanie používateľov a štatistickú analýzu (podporuje bayesovský aj frekventistický prístup). Experimenty využívajú udalosti a feature flagy, ktoré už v PostHogu máte, takže nepotrebujete novú implementáciu merania, a výsledky prepájajú nahrávky sessions s jednotlivými variantami.

Pre koho: produktové a SaaS tímy, ktoré v PostHogu už merajú. Pre e-shop na hotovej platforme bez vývojára to nie je vhodná voľba.

Testovanie v reklamných systémoch

Nie všetko sa testuje v CRO nástroji. Ak testujete niečo, čo je v kampani, testujte to tam:

  • Google Ads: stránka Experimenty. Rozdelí rozpočet alebo návštevnosť medzi pôvodnú a experimentálnu kampaň a výsledky porovná za určené obdobie. Typy zahŕňajú variácie reklám (text a responzívne reklamy vo Search), vlastné experimenty (Smart Bidding, typy zhody kľúčových slov, landing pages, audiences), experimenty pre Performance Max, Demand Gen, App a video experimenty (2–4 ramená). Odporúčané trvanie: 4 až 6 týždňov.

Pri prepájaní reklamných a webových testov platí jedno pravidlo: naraz jedna zmena na jednej úrovni. Ak súčasne meníte bidding v kampani a layout na landing page, nedozviete sa nič ani o jednom.

A/B testy v e-maile

E-mail má vlastnú mechaniku: vzorku poznáte vopred (veľkosť databázy), takže sa dá plánovať presnejšie než na webe.

Mailchimp podľa svojej nápovedy umožňuje v e-mailových A/B testoch porovnávať predmet, odosielateľa (from name), obsah a čas odoslania, a to až v 3 variantoch na testovanú premennú. Víťaza vie vybrať automaticky (podľa open rate, click rate alebo celkového príjmu) alebo manuálne na základe reportu. U SMS kampaní sa testuje len obsah.

Dôležité upozornenie: open rate je dnes pre Apple Mail Privacy Protection a podobné mechanizmy nespoľahlivá metrika. Rozhodujte podľa klikov a hlavne podľa konverzií za e-mailom, čo znamená, že test musíte prepojiť s webovou analytikou. Širší kontext sme rozpísali v kompletnom sprievodcovi e-mail marketingom.

Nástroje, ktoré A/B testy nerobia (ale bez nich netestujte)

  • Microsoft Clarity: nahrávky sessions, heatmapy, sledovanie udalostí a funnelov, Copilot nad dátami. Podľa dokumentácie Microsoftu je natrvalo bezplatná, bez povinnosti prechodu na platenú verziu. Najlepší pomer hodnoty a ceny na hľadanie hypotéz.
  • Contentsquare (predtým Hotjar). Hotjar je dnes súčasťou Contentsquare; obe platformy sa zlúčili do jednej. Contentsquare uvádza bezplatný plán s 200 000 sessions mesačne, heatmapami, session replay, dotazníkmi, monitorovaním chýb a výkonu, funnelmi a integráciami.
  • Google Analytics 4: meranie, segmentácia, funnely. Vlastný nástroj na A/B testovanie webu neobsahuje.

Tieto nástroje vám nedajú kauzálnu odpoveď. Dajú vám hypotézu, ktorú potom overíte testom.

Ako si vybrať

Rozhodovací postup, ktorý funguje:

  1. Koľko konverzií máte mesačne? Pod ~200 konverzií/mes. nemá zmysel kupovať nástroj. Investujte do nahrávok (Clarity, zadarmo), používateľského testovania a opráv zjavných chýb.
  2. Máte vývojára? Ak nie, potrebujete nástroj s vizuálnym editorom (Wingify, Convert, Kameleoon, Optimizely). Ak áno a chcete kontrolu nad dátami, pozrite GrowthBook alebo PostHog.
  3. Čo testujete prevažne? Marketingové stránky a e-shop → klientský nástroj s vizuálnym editorom. Produkt, ceny, algoritmy, aplikácia → server-side / feature flagy.
  4. Rieši váš nástroj peeking? Ak používa fixný horizont, musíte si disciplínu zabezpečiť sami. Ak sekvenčný alebo bayesovský prístup, je to bezpečnejšie.
  5. Aké sú požiadavky na spracovanie dát? Ak potrebujete EU hosting a first-party cookies, zúžte výber a overte si DPA.
  6. Vyskúšajte skúšobnú verziu na jednom reálnom teste. Nie na demo stránke, ale na vašej stránke, s vašou návštevnosťou.

Ako test vyhodnotiť a čo s výsledkom

Kontrolný zoznam pred tým, než sa pozriete na víťaza

Prejdite ho v tomto poradí. Ak zlyhá ktorýkoľvek bod, výsledok nečítajte.

  1. Dosiahli ste plánovanú veľkosť vzorky? Nie „približne“, ale áno/nie.
  2. Bežal test aspoň jeden celý týždeň a ukončili ste ho v rovnaký deň v týždni, v ktorý začal?
  3. Je rozdelenie návštevnosti v poriadku (žiadny SRM)?
  4. Nebolo v priebehu testu nič zmenené, ani varianta, ani cieľ, ani alokácia, ani cielenie? Optimizely k tomu uvádza, že zmena experimentu v priebehu môže viesť k nesprávnym záverom.
  5. Nekrížil sa test s inou kampaňou, výpredajom, PR výstupom alebo technickým incidentom? Ak áno, zapíšte to a zvážte vyradenie dotknutých dní (a potom test predĺžte, aby ste doplnili vzorku).
  6. Merali ste primárnu metriku, ktorú ste definovali vopred? Nie tú, ktorá nakoniec vyšla najkrajšie.
  7. Sledujete aj guardrail metriky?

Varianta vyhrala

„Vyhrala“ znamená: dosiahla vopred definovaný prah významnosti a veľkosť efektu je biznisovo relevantná a guardrail metriky sa nezhoršili.

Čo potom:

  • Nasaďte variantu natrvalo, v kóde, nie v A/B nástroji. Nechávať víťaza bežať v testovacom nástroji je technický dlh a Google explicitne odporúča prvky testu odstrániť čo najskôr.
  • Nerobte chybu, že sľúbite nameraný nárast ako budúci výsledok. Nameraný efekt je odhad s intervalom spoľahlivosti a reálny dlhodobý prínos bude typicky nižší (regresia k priemeru, vyprchanie efektu novosti). Komunikujte interval, nie bodovú hodnotu.
  • Zapíšte mechanizmus, nie len výsledok. „Zobrazenie termínu dodania pri CTA pomohlo“ je použiteľné poučenie: dá sa preniesť na kategórie, košík, e-mail aj reklamu.
  • Naplánujte iteráciu: ak vyhralo zobrazenie dopravy, otestujte jej formulovanie.

Varianta prehrala

Prehraný test nie je zmarený test. Je to ušetrené nasadenie zmeny, ktorá by vám bola uškodila. Dôležité je vyťažiť z neho poučenie:

  • Zapíšte, čo sa tým vyvrátilo. Práve na to slúžil posledný riadok šablóny hypotézy.
  • Pozrite si nahrávky sessions z prehrávajúcej varianty. Často odhalia, že zmena nebola zlá, len bola rozbitá (nefunkčné tlačidlo na iPhone, posunutý layout pri dlhých názvoch).
  • Pozrite segmenty: prehra celkovo môže znamenať výhru na mobile a veľkú prehru na desktope.

Test vyšiel nerozhodne (najčastejší prípad)

Toto je výsledok, s ktorým väčšina firiem nevie čo robiť, a preto ho nesprávne vyhlási za výhru alebo prehru.

Nerozhodný výsledok neznamená, že medzi variantami nie je rozdiel. Znamená, že váš test nemal dosť citlivosti, aby rozdiel odhalil, alebo že rozdiel je menší než váš MDE. GrowthBook to formuluje presne: chyba II. typu produkuje nejednoznačné dáta vtedy, keď dáta vyzerajú nejednoznačne, ale v skutočnosti víťaz existuje.

Rozhodovací postup:

  1. Pozrite sa na interval spoľahlivosti efektu, nie na p-hodnotu. Ak interval siaha napríklad od −3 % do +5 %, test vám nehovorí nič; rozdiel môže byť škodlivý aj výhodný. Ak siaha od −0,5 % do +0,8 %, dozvedeli ste sa niečo cenné: veľký efekt tam nie je. To je legitímny výsledok a dôvod prestať sa touto hypotézou zaoberať.
  2. Bol váš MDE realistický? Ak ste hľadali +0,2 p. b. na 2 % konverznom pomere pri 5 000 návštevníkoch, test nemal šancu. Chyba sa stala pri plánovaní, nie pri vyhodnotení.
  3. Predĺžiť, alebo nie? Predĺžte len vtedy, ak ste si dodatočnú vzorku a nové trvanie naplánovali ako samostatné rozhodnutie, nie ako „necháme to bežať, kým sa to neotočí“. To je peeking v najčistejšej forme.
  4. Nasaďte variantu, ktorá je lacnejšia alebo lepšia inak. Ak je efekt na konverzie nulový, ale nová varianta je rýchlejšia, prístupnejšia alebo jednoduchšia na správu, nasaďte ju. Nerozhodný test je povolenie rozhodnúť podľa iných kritérií.
  5. Zapíšte to do knowledge base. Negatívne a nulové výsledky majú rovnakú hodnotu ako pozitívne; ušetria vám opakovanie toho istého testu o rok.
  6. Testujte odvážnejšie. Opakovaná séria nerozhodných testov je takmer vždy signál, že testujete príliš malé zmeny. Prestaňte s odtieňmi tlačidiel a otestujte iný prístup k celej stránke.

Segmenty: kde sa skrývajú skutočné zistenia

Celkový výsledok je vážený priemer rôznych skupín. Pozrieť sa pod to je povinné, ale s dvoma pravidlami.

Pozerajte segmenty, ktoré ste si určili vopred (typicky mobil/desktop, nový/vracajúci sa návštevník, zdroj návštevnosti, prípadne kategória produktu). Každý ďalší segment, ktorý si pridáte dodatočne, je ďalší štatistický test, a čím viac testov urobíte, tým istejšie v nich nájdete „významný“ náhodný výsledok.

Segment preto nikdy neberte ako hotový záver, ale ako novú hypotézu na samostatný test. Ak varianta vyhrala len na mobile, nespúšťajte ju pre mobil s odôvodnením „test to dokázal“. Spustite nový test cielený na mobil.

Dokumentácia

Vedte jeden zdieľaný dokument so záznamom o každom teste: dátum od–do, URL, hypotéza (celá, aj s posledným riadkom), primárna a guardrail metrika, plánovaná veľkosť vzorky, dosiahnutá veľkosť vzorky, výsledok s intervalom, rozhodnutie a poučenie. Po dvanástich testoch to bude najcennejší marketingový dokument, aký vo firme máte, pretože obsahuje to jediné, čo sa o vašich zákazníkoch dá dokázať.

Najčastejšie chyby pri A/B testovaní

  1. Príliš malá vzorka. Najčastejšia chyba vôbec. Spočítajte si ju vopred vzorcom n = 16 × p(1−p) / δ² a ak vám vyjde mimo dosah, test nespúšťajte v tejto podobe.
  2. Príliš krátke trvanie. Tri dni nie sú týždeň. Minimum je jeden obchodný cyklus (7 dní) a vždy celé týždne.
  3. Zastavenie testu pri prvej „významnosti“. Pri nazeraní po každom pozorovaní vyskočí miera falošne pozitívnych výsledkov z 5 % na 26,1 %. Ak nástroj nepoužíva sekvenčný alebo bayesovský model, nenazerajte.
  4. Testovanie viacerých vecí naraz bez plánu. Ak zmeníte nadpis, obrázok aj CTA, dozviete sa, že „nová stránka je lepšia“, ale nie prečo, a nebudete to vedieť zopakovať nikde inde.
  5. Ignorovanie sezónnosti a kampaní. Black Friday, výpredaj, veľký PR výstup, výpadok platobnej brány, dovolenkové obdobie. Všetko to skresľuje. Zaznamenávajte do testu, čo sa v jeho priebehu dialo.
  6. Ignorovanie segmentov, alebo naopak ich prehľadávanie, kým sa niečo nenájde. Oba extrémy sú chyba. Segmenty definujte vopred a ostatné berte ako hypotézy.
  7. Zmena testu v priebehu. Zmena varianty, cieľa, alokácie alebo cielenia resetuje platnosť celého testu.
  8. Jedna metrika bez guardrailov. Test, ktorý zvýši objednávky a zníži maržu, je prehra prezlečená za výhru.
  9. Nekontrolovaný SRM a flicker. Technická chyba v implementácii dokáže vygenerovať „víťaza“ úplne spoľahlivo. Vždy skontrolujte rozdelenie návštevnosti pred čítaním výsledku.
  10. Testovanie bez hypotézy. Bez hypotézy nemáte z výsledku poučenie, len číslo.
  11. Prezentovanie nameraného nárastu ako záruky. Namerané +12 % s intervalom od +1 % do +23 % nie je „+12 % navždy“.
  12. Vymyslené čísla v reportingu. Ak nemáte dostatočnú vzorku, napíšte „nevieme“, nie „pravdepodobne +8 %“. Dôveryhodnosť celého CRO programu stojí na tom, že vaše čísla platia.

Ako začať, ak ešte netestujete

Realistický plán na prvých 90 dní:

Týždne 1–2: príprava merania. Skontrolujte, či máte v GA4 správne nastavené konverzie a e-commerce udalosti. Nasaďte Clarity (zadarmo). Zistite si základné čísla: návštevnosť najdôležitejších stránok, konverzný pomer, počet konverzií mesačne. Bez týchto čísel nespočítate vzorku.

Týždne 3–4: hypotézy a priorizácia. Z nahrávok, funnelov, podpory a predaja zozbierajte 15–25 hypotéz. Napíšte ich podľa šablóny. Pre každú spočítajte potrebnú vzorku a vyraďte tie, ktoré sa na vašej návštevnosti nedajú otestovať do 6 týždňov. Zoraďte zvyšok podľa očakávaného dopadu a náročnosti implementácie.

Týždeň 5: nástroj a A/A test. Vyberte nástroj, nasaďte ho, skontrolujte vplyv na rýchlosť a spustite A/A test. Nechajte ho bežať týždeň a overte, že rozdelenie a meranie fungujú.

Týždne 6–12: prvé dva až tri testy. Nie päť. Prvý test urobte na stránke s najväčšou návštevnosťou a s najodvážnejšou zmenou zo zoznamu; maximalizujete šancu, že nazbierate vzorku a uvidíte efekt. Každý test zdokumentujte.

Po 90 dňoch budete mať funkčný proces, jeden až tri reálne výsledky a, čo je dôležitejšie, realistickú predstavu o tom, čo sa na vašej návštevnosti dá a nedá testovať.

Ak si nie ste istí, či má vaša návštevnosť na testovanie dosť objemu, alebo chcete nastaviť celý CRO proces vrátane merania, napíšte nám. Povieme vám rovno, či sa vám testovanie vyplatí, alebo máte peniaze dať inam.

FAQ

Čo je A/B testovanie jednoducho? A/B testovanie je experiment, v ktorom návštevníkov webu náhodne rozdelíte na dve skupiny. Jedna vidí pôvodnú verziu stránky, druhá upravenú. Obe skupiny sa na webe pohybujú v rovnakom čase, takže rozdiel vo výsledku možno pripísať zmene, nie okolnostiam. Je to jediná metóda, ktorá o zmene dokáže povedať, že výsledok naozaj spôsobila.

Aký je rozdiel medzi A/B testom, multivariantným testom a split URL testom? A/B test porovnáva dve alebo viac variantov jednej zmeny na tej istej URL. Multivariantný test mení naraz viac prvkov a testuje všetky ich kombinácie, aby zistil, ktorá kombinácia funguje najlepšie a či medzi prvkami existujú interakcie; potrebuje preto výrazne viac návštevnosti. Split URL test porovnáva verzie hostované na rôznych URL a používa sa pri kompletnom redizajne stránky.

Koľko návštevníkov potrebujem na A/B test? Závisí od vášho konverzného pomeru a od toho, aký malý rozdiel chcete odhaliť. Orientačne n = 16 × p(1−p) / δ² na jednu variantu, kde p je základný konverzný pomer a δ absolútny minimálny detegovateľný efekt. Pri 2 % konverznom pomere a cieli odhaliť nárast na 3 % to je približne 3 100 návštevníkov na variantu. Pri cieli odhaliť nárast len na 2,4 % to je už ~19 600 na variantu. GrowthBook ako hrubé pravidlo odporúča aspoň 100 konverzných udalostí na variantu.

Ako dlho má bežať A/B test? Musia byť splnené dve podmienky naraz: nazbieraná plánovaná veľkosť vzorky a minimálne trvanie. Optimizely odporúča minimálne jeden obchodný cyklus, teda sedem dní, aby sa zachytili všetky typy chovania používateľov. GrowthBook odporúča 1 až 2 týždne. Vždy ukončite test v rovnaký deň v týždni, v ktorý začal. Ak vám výpočet vyjde na viac ako šesť týždňov, test v tejto podobe nespúšťajte.

Môžem test zastaviť, keď už ukazuje, že varianta B vyhráva? Pri klasickom (frekventistickom) nástroji s fixným horizontom nie. Evan Miller vyčíslil, že pri nazeraní po každom pozorovaní vyskočí skutočná miera falošne pozitívnych výsledkov z 5 % na 26,1 %. Pri desiatich nazretiach je zobrazená významnosť 1 % v skutočnosti len 5 %. Ak váš nástroj používa sekvenčný dizajn (napr. Optimizely Stats Engine) alebo bayesovský prístup, priebežné monitorovanie je v poriadku, ale minimálne trvanie aj tak dodržte.

Čo je minimálny detegovateľný efekt (MDE)? Najmenší rozdiel, ktorý je váš test schopný spoľahlivo odhaliť pri danej veľkosti vzorky, hladine významnosti a sile testu. Čím menší MDE, tým väčšia potrebná vzorka, a vzťah je kvadratický, takže polovičný efekt znamená štvornásobnú vzorku. Vždy si overte, či nástroj pracuje s absolútnym alebo relatívnym MDE; pri nízkych konverzných pomeroch je rozdiel enormný.

Čo keď A/B test vyjde nerozhodne? To je najčastejší výsledok a neznamená, že rozdiel neexistuje. Znamená, že ho váš test nedokázal odhaliť. Pozrite sa na interval spoľahlivosti efektu: ak je úzky a okolo nuly, dozvedeli ste sa, že veľký efekt tam nie je, a hypotézu môžete zavrieť. Ak je široký, test bol podmerovaný. Predlžujte len ako samostatné naplánované rozhodnutie, nikdy nie „kým sa to neotočí“. Ak je efekt nulový, rozhodnite podľa iných kritérií: rýchlosti, prístupnosti, náročnosti údržby.

Aký nástroj na A/B testovanie použiť po ukončení Google Optimize? Google Optimize a Optimize 360 nie sú dostupné od 30. septembra 2023. Google odporúča prechod na integrácie nástrojov tretích strán a v nápovede menuje AB Tasty, Optimizely a VWO; svoje API sprístupnil verejne, takže s Google Analytics sa dá integrovať akýkoľvek nástroj. Pozor: VWO a AB Tasty sa medzitým spojili pod značku Wingify. Ďalšie možnosti sú Kameleoon, Convert Experiences a z open-source riešení GrowthBook alebo PostHog. Google Analytics 4 vlastný nástroj na A/B testovanie webu neobsahuje.

Škodí A/B testovanie SEO? Pri správnej implementácii nie. Google má na testovanie samostatnú dokumentáciu a žiada štyri veci: nepoužívať cloaking (Googlebot má vidieť to isté ako používatelia), na alternatívnych URL použiť rel="canonical" s odkazom na originál, pri presmerovaní použiť dočasné 302 namiesto trvalého 301 a po skončení testu odstrániť všetky jeho prvky čo najskôr. Google tiež uvádza, že Googlebot vo všeobecnosti nepodporuje cookies, takže uvidí verziu dostupnú používateľom bez cookies.

Čo testovať na e-shope ako prvé? Pokladňu a košík. Je to miesto s najvyššou koncentráciou rozhodnutých zákazníkov a zároveň najmenej testované. Konkrétne: počet krokov pokladne, objednávka bez registrácie ako predvolená voľba, zobrazenie všetkých nákladov už v košíku, viditeľnosť pola na kupón a počet povinných polí v adresnom formulári. Vždy k primárnej metrike pridajte kontrolnú, napríklad priemernú hodnotu objednávky alebo maržu.

Zdroje

  1. Google Search Central — A/B Testing Best Practices for Search (Website testing) — https://developers.google.com/search/docs/crawling-indexing/website-testing
  2. Google Search Central — Spam policies for Google web search (cloaking) — https://developers.google.com/search/docs/essentials/spam-policies
  3. Google Optimize Help — Google Optimize and Optimize 360 are no longer available as of September 30, 2023 — https://support.google.com/optimize/answer/12979939
  4. Google Ads Help — About the „Experiments“ page — https://support.google.com/google-ads/answer/10682377
  5. Evan Miller — How Not To Run An A/B Test — https://www.evanmiller.org/how-not-to-run-an-ab-test.html
  6. Evan Miller — Sample Size Calculator — https://www.evanmiller.org/ab-testing/sample-size.html
  7. Ronald L. Wasserstein, Nicole A. Lazar — The ASA Statement on p-Values: Context, Process, and Purpose (American Statistical Association, 2016) — https://www.amstat.org/asa/files/pdfs/p-valuestatement.pdf
  8. Optimizely Support — Statistical analysis methods overview — https://support.optimizely.com/hc/en-us/articles/39714777161229-Statistical-analysis-methods-overview
  9. Optimizely Support — How and why statistical significance changes over time in Optimizely Experimentation — https://support.optimizely.com/hc/en-us/articles/4410289544589-How-and-why-statistical-significance-changes-over-time-in-Optimizely-Experimentation
  10. Optimizely — Web Experimentation / Agentic Experimentation — https://www.optimizely.com/products/experiment/web-experimentation/
  11. Wingify — oficiálny web (vznikol spojením VWO a AB Tasty) — https://wingify.com/
  12. Wingify Blog — VWO and AB Tasty: A New Chapter for Digital Experience Optimization — https://wingify.com/blog/vwo-and-ab-tasty-join-forces/
  13. Wingify Help — Types of Tests in Wingify — https://help.wingify.com/hc/en-us/articles/58790466788377-Types-of-Tests-in-Wingify
  14. Kameleoon — oficiálny web — https://www.kameleoon.com/
  15. Convert — oficiálny web (Convert Experiences) — https://www.convert.com/
  16. GrowthBook Documentation — Power and Minimum Detectable Effect — https://docs.growthbook.io/statistics/power
  17. GrowthBook Documentation — Statistics Overview — https://docs.growthbook.io/statistics/overview
  18. GrowthBook Documentation — Experimentation Best Practices — https://docs.growthbook.io/using/experimentation-best-practices
  19. GrowthBook Documentation — A/B Testing Fundamentals (novelty a primacy effect, hypotézy) — https://docs.growthbook.io/using/fundamentals
  20. GrowthBook Documentation — Experiment Results (Sample Ratio Mismatch, guardrail metriky) — https://docs.growthbook.io/app/experiment-results
  21. PostHog Documentation — Experiments — https://posthog.com/docs/experiments
  22. Microsoft Learn — Clarity Overview — https://learn.microsoft.com/en-us/clarity/about-clarity
  23. Contentsquare — Hotjar is now part of Contentsquare — https://contentsquare.com/hotjar/
  24. Mailchimp — About A/B Testing Campaigns — https://mailchimp.com/help/about-ab-testing-campaigns/