Co sprawdza test proporcji A/B?
Test proporcji A/B porównuje dwa udziały, np. konwersję wariantu A i wariantu B, odsetek odpowiedzi „tak” w dwóch grupach albo zdawalność w dwóch klasach. Wynik mówi, czy różnica między proporcjami jest statystycznie istotna przy wybranym poziomie α.
W kalkulatorze sukcesem może być dowolne zdarzenie: kliknięcie, zakup, rejestracja, odpowiedź ankietowa albo trafienie. Jeśli dopiero planujesz badanie, sprawdź wcześniej wielkość próby i margines błędu.
Wzór na test dwóch proporcji
Dla wariantów A i B obliczamy proporcje:
p̂A = xA / nA p̂B = xB / nB
W klasycznym teście hipotezy zerowej o równości proporcji używa się proporcji połączonej:
p̂ = (xA + xB) / (nA + nB)
Statystyka testowa ma postać:
z = (p̂B - p̂A) / √(p̂(1-p̂)(1/nA + 1/nB))
Różnica, lift i przedział ufności
Oprócz p-value kalkulator pokazuje różnicę w punktach procentowych oraz względny lift. Różnica mówi, o ile punktów procentowych zmienił się udział, a lift pokazuje zmianę względem wariantu A.
Przykład: A ma 10%, B ma 12%. Różnica to 2 punkty procentowe, a lift to 20%. To nie jest to samo. Do raportów z testów A/B warto podawać oba wskaźniki.
Jak interpretować p-value?
p-value mówi, jak nietypowa byłaby zaobserwowana różnica, gdyby w populacji proporcje A i B były równe. Jeśli p-value jest mniejsze od α, odrzucasz hipotezę zerową o równości proporcji.
Wynik istotny statystycznie nie oznacza automatycznie, że efekt jest duży biznesowo lub praktycznie. Przy dużych próbach nawet mała różnica może być istotna. Dlatego razem z p-value patrz na różnicę w punktach procentowych, lift i przedział ufności.
Test dwustronny czy jednostronny?
| Wariant | Kiedy używać? | Interpretacja |
|---|---|---|
| Dwustronny | gdy pytasz, czy A i B różnią się w dowolnym kierunku | najbezpieczniejszy wariant do standardowego raportu |
| B większe od A | gdy z góry testujesz poprawę wariantu B | liczy sygnał tylko w kierunku B > A |
| A większe od B | gdy z góry testujesz przewagę A | liczy sygnał tylko w kierunku A > B |
Test jednostronny powinien być ustalony przed analizą danych. Wybieranie kierunku dopiero po zobaczeniu wyniku to częsty błąd.
Założenia testu proporcji
- Dane są liczebnościami - wpisujesz sukcesy i całkowitą liczbę obserwacji, nie same procenty.
- Próby są niezależne - ta sama osoba nie powinna trafiać jednocześnie do A i B.
- Wystarczająco duże liczebności - w każdej grupie powinno być dość sukcesów i porażek.
- Stała definicja sukcesu - w A i B liczysz to samo zdarzenie.
- Brak podglądania wyniku co chwilę bez planu - wielokrotne sprawdzanie zwiększa ryzyko fałszywego alarmu.
Przykład testu A/B
Wariant A miał 1000 użytkowników i 120 konwersji, a wariant B miał 980 użytkowników i 145 konwersji. Konwersja A wynosi 12%, a B około 14,8%. Kalkulator oblicza różnicę, lift, statystykę z i p-value.
Jeśli p-value jest mniejsze od 0,05, można mówić o istotnej statystycznie różnicy na poziomie 5%. Jeśli p-value jest większe lub równe 0,05, wynik może być obiecujący, ale nie daje jeszcze podstaw do odrzucenia hipotezy o równości proporcji.
Test proporcji a test chi-kwadrat
Dla prostego porównania dwóch proporcji test z i test chi-kwadrat dla tabeli 2x2 są blisko powiązane. Test proporcji jest wygodniejszy, gdy interesuje Cię różnica A/B, lift i przedział ufności. Test chi-kwadrat jest bardziej uniwersalny dla większych tabel i wielu kategorii.
Jeśli porównujesz średnie zamiast udziałów, użyj testu t-Studenta. Jeśli liczysz zakres niepewności dla jednej średniej, przejdź do przedziału ufności dla średniej.
Zadania przykładowe
A ma 100 sukcesów na 1000, B ma 120 sukcesów na 1000. Jaka jest różnica?
Co oznacza lift 20%?
Kiedy odrzucasz H₀ przy α=0,05?
Czy mała, ale istotna różnica zawsze jest ważna praktycznie?
Najczęstsze błędy
- Wpisywanie procentów zamiast liczebności - test potrzebuje liczby sukcesów i obserwacji.
- Mylenie punktów procentowych z procentami - 10% do 12% to +2 p.p. i +20% lift.
- Wybór testu jednostronnego po fakcie - kierunek powinien być ustalony przed analizą.
- Przerywanie testu od razu po p < 0,05 - bez planu zwiększa to ryzyko błędnej decyzji.
- Ignorowanie wielkości próby - małe próby dają szerokie przedziały ufności.
Sprawdź także
Przed startem badania policz wielkość próby i margines błędu. Przy danych ankietowych użyj tabeli liczebności i częstości. Do większych tabel kategorii przyda się test chi-kwadrat, a do porównania średnich test t-Studenta.
Wskazówka od KalkulatorXXL
W raporcie z testu A/B zapisuj nie tylko zwycięzcę, ale też liczebności, konwersje, różnicę w punktach procentowych, lift, p-value i przedział ufności. To zabezpiecza przed pochopnym wnioskiem z samego procentu konwersji.
Cały pakiet statystyki i rozkładów
Ten kalkulator jest częścią większego pakietu narzędzi do statystyki, prawdopodobieństwa, rozkładów i analizy danych. Jeśli chcesz przejść od pojedynczego wyniku do szerszego zestawu metod, sprawdź Statystyka, prawdopodobieństwo i rozkłady - akademia obliczeń. Znajdziesz tam ścieżki do rozkładów dyskretnych i ciągłych, testów statystycznych, z-score, wartości odstających, ANOVA oraz narzędzi do oceny modeli.