Промпт · Эксперименты

Разбор результатов A/B

Промпт

Ты — продуктовый аналитик, который разбирает результаты A/B-тестов. Помоги интерпретировать данные эксперимента и решить, что делать с вариантом B.

Входные данные: — что тестируем: [вставьте гипотезу и описание вариантов A и B]; — данные теста: [вставьте цифры: размеры групп, конверсии или средние по главной метрике, длительность]; — план теста: [вставьте запланированные длительность, размер выборки и главную метрику, если фиксировались].

Разбери результат по структуре:

  1. Что показывают данные: посчитай разницу между вариантами по главной метрике — абсолютную и относительную. Покажи расчёт по данным из входа.
  2. Проверка на типичные ошибки: завершён ли тест по плану или его остановили раньше; достаточен ли объём групп; не рвётся ли эффект по сегментам; одинаковы ли условия групп; что с guardrail-метриками. Отметь, какие проверки возможны по имеющимся данным, а для каких данных не хватает.
  3. Интерпретация: подтверждается гипотеза, опровергается или данных пока недостаточно для вывода.
  4. Рекомендация: выкатывать B, продолжать тест, остановить или переделать — с обоснованием.
  5. Риски решения: что можно потерять или не заметить, если следовать рекомендации.

Ограничения: — не считай статистическую значимость, если входных данных для расчёта недостаточно; если значимость посчитать нельзя, скажи об этом прямо и напиши, каких данных не хватает; — не выдумывай числа: все расчёты делай только по входным данным и показывай их; — не объявляй победителя по промежуточным данным недоигранного теста; — если данных не хватает, отметь это.

Пример данных

Данные вымышлены. Замени их информацией о своей задаче.

Продукт: ЛингвоЛет — приложение для изучения испанского: короткие уроки и игровой streak за ежедневные занятия.
Что тестируем: гипотеза — если показывать в момент выхода из урока плашку «streak сгорит», то больше пользователей завершат урок. Вариант A (контроль): выход без плашки. Вариант B: плашка с предупреждением о сгорании streak.
Данные теста: идёт 5-й день из запланированных 14. Группа A — 21 400 пользователей, урок завершили 12 840. Группа B — 21 380 пользователей, урок завершили 13 350. Дополнительно: средняя длина сессии A — 9,4 минуты, B — 9,1 минуты; в поддержку от пользователей B пришла 214 жалоба «навязчивое предупреждение», от пользователей A — 31.

Пример ответа

Один из возможных результатов. Проверь факты и адаптируй текст перед использованием.

Что показывают данные

Главная метрика — доля пользователей, завершивших урок.

  • A: 12 840 / 21 400 = 0,6000 → 60,0%.
  • B: 13 350 / 21 380 = 0,6244 → 62,44%.
  • Абсолютная разница: 62,44 − 60,0 = +2,44 процентных пункта.
  • Относительная разница: 2,44 / 60,0 = +4,1% к конверсии контроля.

По этим цифрам B пока впереди.

Проверка на типичные ошибки

  • Подглядывание. Тест идёт 5-й день из 14 — срез промежуточный. Решение «B победил» по середине теста принимать нельзя: остановка на пике без заранее заданных правил последовательного анализа завышает шанс ложной победы. Значимость по этим цифрам посчитать можно — расчёт ниже, — но это описательная справка, а не основание останавливать тест.
  • Объём групп. Группы крупные и близкие по размеру (21 400 и 21 380). Но достаточность объёма определяется планом теста, а запланированный размер выборки во входных данных не задан — эту проверить по имеющимся данным нельзя.
  • Сегменты. Данных по сегментам (платформа, новый или давний пользователь, интенсивность занятий) во входных данных нет. Проверить, не рвётся ли эффект на сегментах, невозможно — данных не хватает.
  • Условия групп. Размеры групп симметричны, но данных о механизме рандомизации во входных данных нет — вывод о том, что группы одинаковы по составу, сделать нельзя.
  • Guardrail-метрики. Средняя длина сессии: A — 9,4 минуты, B — 9,1 минуты, то есть −0,3 минуты (0,3 / 9,4 = −3,2%). Жалобы «навязчивое предупреждение»: в B 214 из 21 380 (1,00%), в A 31 из 21 400 (0,14%) — в B примерно в 7 раз чаще (1,00 / 0,14). Обе guardrail-метрики шевелятся в худшую сторону.

Интерпретация

Номинальная значимость считается прямо по агрегатам: доли 60,0% (12 840 из 21 400) против 62,44% (13 350 из 21 380) дают по двухдолевому z-тесту z ≈ 5,2, p < 0,001 — на этом срезе сдвиг не похож на шум. Но тест рассчитан на 14 дней, а решение по фиксированному плану принимается после его завершения: досрочная остановка на пике без последовательного плана завышает долю ложных побед, поэтому победитель сейчас не объявляется — «доигрываем». Плюс на этом срезе ухудшаются обе guardrail-метрики, так что даже зафиксированный прирост имеет цену.

Рекомендация

Продолжать тест до плановых 14 дней. Вариант B не выкатывать и не останавливать. До конца теста следить за guardrail-метриками: если длина сессии продолжит падать, а жалобы расти, — обсуждать не «завершения урока», а переделку плашки: softer формулировку или показ реже одного раза за сессию.

Риски решения

  • Если выкатить B сейчас, можно принять случайный пик за эффект и закрепить плашку, которая раздражает пользователей.
  • Если остановить тест сейчас, запуск впустую: ответа на вопрос гипотезы не будет ни у A, ни у B.
  • Даже при финальной победе по завершениям рост может оказаться давлением в моменте: данных об удержании во входных данных нет, и удар по возвратам пользователей этот срез не увидит.

Проверьте факты

  • Пересчитай доли: 12 840 / 21 400 = 60,0% и 13 350 / 21 380 = 62,44%; разница +2,44 п.п., относительная +4,1%.
  • Проверить, что «урок завершили» во входных данных — пользователи, а не суммарные уроки: расчёт построен на пользователях.
  • Запланированный размер групп во входных данных отсутствует — достаточность объёма не оценена.
  • Жалобы отнесены к размеру групп; сверь с поддержкой, что все 214 и 31 жалоба касаются именно плашки.

Из главы: Аналитика и метрики