Конверсия и воронки3 мин чтенияDIL LEAD

4 ошибки в A/B‑тестах, из‑за которых шум выглядит как эффект

Четыре типичные ошибки в A/B‑тестах заставляют случайный шум выглядеть как значимый эффект. Узнайте, как их исправить и повысить надёжность экспериментов.

В B2B‑продуктах A/B‑тесты часто становятся основным инструментом принятия решений.

Но даже при корректных данных обычные подходы к анализу могут дать ложный сигнал о росте, если нарушены ключевые предположения.

Четыре типичные ошибки

  • Метрика считается по строкам, а не по пользователям

    Тестируются клики по показам, что приводит к зависимым наблюдениям и заниженной дисперсии.

  • Подглядывание в результаты

    Повторные проверки p‑value увеличивают вероятность случайного отклика.

  • Тяжёлый хвост распределения (киты)

    Редкие большие значения выручки раздувают дисперсию и «заваливают» тест.

  • Неучтённый предэкспериментальный шум

    Отсутствие ковариаты приводит к избыточной дисперсии и потере мощности теста.

Самая частая ошибка – считать метрику (например, CTR) по каждому показу. Пользователь может увидеть от одного до нескольких сотен показов, а их клики сильно коррелируют. t‑тест воспринимает каждую строку как независимую, что сильно уменьшает стандартную ошибку и делает незначимый эффект «значимым».

Решение: агрегировать данные до уровня единицы рандомизации – обычно это пользователь. Дисперсию следует вычислять по пользователям, а не по показам.

Если в эксперименте рандомизируются пользователи, метрику и её дисперсию следует считать именно по пользователям, а не по отдельным событиям.

Как исправить ошибку агрегации

  1. 01
    Соберите массивы кликов и показов по пользователям

    Для каждого пользователя запишите общее количество кликов и показов.

  2. 02
    Посчитайте отношение сумм (CTR) и дисперсию через дельта‑метод

    Формула учитывает ковариацию кликов и показов и делит на количество пользователей.

  3. 03
    Проверьте результат бутстрапом по пользователям

    Пересэмплирование пользователей даёт корректные доверительные интервалы без дополнительных предположений.

Второй ловушкой является подглядывание в результаты. Стандартный t‑тест предполагает один‑единственный взгляд. Каждый дополнительный проверочный запуск повышает вероятность ложного срабатывания: при ежедневных проверках показатель может вырасти до 20 %.

Чтобы контролировать подглядывание, нужно заранее определить план эксперимента.

Методы контроля за подглядыванием

  • Фиксированный размер выборки

    Рассчитайте необходимый объём заранее и не проверяйте результаты до окончания сбора данных.

  • Последовательный тест (α‑спендинг)

    Определите количество промежуточных проверок и распределите общий уровень ошибки между ними.

  • Always‑valid confidence intervals

    Широкие, но корректные интервалы позволяют смотреть в дашборд в любой момент без нарушения уровня ошибки.

Третья ошибка – игнорировать тяжёлый хвост распределения, когда в выборке появляются «киты» (пользователи с огромной выручкой). Среднее и дисперсия становятся нестабильными, и t‑тест реагирует на один‑единственный крупный объект, а не на реальный эффект.

Практические приёмы: винзоризация (обрезать верхний квантиль), переключение на бинарную метрику (конверсия) и разложение выручки на конверсию × средний чек.

Работа с тяжёлым хвостом

Винзоризация

Обрежьте значения выше 99,5 % квантиля, фиксируя порог до начала теста.

Бинарная метрика

Перейдите от средней выручки к конверсии в покупку – киты не влияют на 0/1‑результат.

Разложение на компоненты

Анализируйте отдельно конверсию и средний чек, чтобы понять, где действительно произошёл рост.

Четвёртая ошибка – не использовать предэкспериментальную информацию (ковариату). Большая часть разброса метрики объясняется историческим поведением пользователей. Если взять, к примеру, CTR за две недели до старта, можно скорректировать текущие наблюдения и существенно снизить дисперсию.

Метод CUPED (Controlled-experiment Using Pre‑Existing Data) реализуется простым регрессионным вычетом: y_adj = y - θ·(y_pre - mean(y_pre)), где θ – коэффициент ковариации.

Эффект применения CUPED

0.5×
Снижение дисперсии при корреляции 0.7
Увеличение мощности теста (меньше требуется пользователей)

Все четыре ошибки сводятся к неверным предположениям о структуре данных. Прежде чем смотреть на p‑value, проверьте уровень рандомизации, план подглядываний, форму распределения и наличие полезных ковариат.

Внедрите A/A‑тесты в процесс проверки пайплайна, используйте дельта‑метод или бутстрап, фиксируйте план эксперимента и применяйте CUPED – и ваши A/B‑тесты перестанут «выигрывать» за счёт шума.

Готовы повысить надёжность экспериментов? Закажите бесплатный B2B‑аудит от DIL LEAD и получите набор практических рекомендаций под ваш продукт.

Хотите обсудить свою нишу?

Напишите менеджеру DIL LEAD или подпишитесь на Telegram-канал.