A/B тестирование для дилетантов: почему ваши эксперименты – это статистический мусор
Большинство маркетологов обожают бросаться фразой “мы затестим это”. На практике их “A/B тест” – это смена цвета кнопки, которая крутилась три дня на трафике в 500 человек, после чего делается глубокомысленный вывод об увеличении конверсии на 15%. Это не аналитика, это шаманизм и статистическая безграмотность.
Если вы принимаете бизнес-решения на основе таких тестов, вы просто играете в рулетку, прикрываясь дашбордами.
Ошибка 1: Игнорирование Statistical Significance и Power Вы останавливаете тест, как только видите желаемый результат (peeking). Это классический p-hacking. В первые дни теста дисперсия огромна, и метрики скачут, как кардиограмма. Пока вы не достигли статистической значимости минимум 95% (p-value < 0.05) И достаточной статистической мощности (обычно 80%), ваши результаты – шум. Используйте калькуляторы размера выборки ДО запуска теста. Если вам нужно 100 000 посетителей на вариацию для фиксации MDE (Minimum Detectable Effect) в 2%, а у вас всего 5 000 трафика в месяц – забудьте про A/B тесты. Идите чинить продукт.
Ошибка 2: Тестирование бессмысленных гипотез Вы тестируете цвет кнопки CTA, когда у вас отваливается корзина на мобилках? Серьезно? Тестировать нужно макро-изменения: полностью разные value propositions, разные pricing models, радикальные изменения UX воронки. Микро-тесты имеют смысл, только когда у вас трафик Amazon.
Ошибка 3: Симпсонов парадокс и игнорирование сегментов Ваш тест показывает, что Вариант B лучше Варианта A на 10%. Но если разбить данные по устройствам, окажется, что Вариант B уничтожил конверсию на iOS (минус 30%), но случайно зацепил аномальный скачок трафика с Android. Если вы анализируете только агрегированные данные, вы слепы.
Как тестировать жестко и по правилам:
- Формулируйте гипотезу ДО теста: “Если мы сделаем X, метрика Y вырастет на Z%, потому что…”.
- Определяйте MDE и размер выборки заранее. Фиксируйте сроки проведения (не меньше полного бизнес-цикла, обычно 1-2 недели, чтобы исключить влияние дня недели).
- Следите за SRM (Sample Ratio Mismatch). Если трафик разделился не 50/50, а 48/52 – ваш сплиттер сломан, тест невалиден.
- Контролируйте secondary metrics. Вы подняли CTR баннера, но убили ARPU? Тест провален.
Прекратите играть в ученых, если не понимаете базовой теории вероятностей.