Подписывайтесь на Telegram-канал Анатолия Половинкина основателя компании TolkaDigital
Главная - Глоссарий - Доверительный интервал

Доверительный интервал

Confidence interval

Доверительный интервал — диапазон значений, внутри которого с заданной вероятностью находится истинный параметр генеральной совокупности. В цифровом маркетинге он показывает, насколько точен полученный показатель — конверсия, CTR, средний чек — и помогает не принимать решения на основе случайных колебаний в данных.

Что такое доверительный интервал

Когда вы запускаете A/B-тест или анализируете рекламную кампанию, вы всегда работаете с выборкой — подмножеством реальных пользователей, а не со всей аудиторией целиком. Выборка дает точечную оценку: например, конверсия = 3,7%. Но это не точное значение, а приближение к реальному. Доверительный интервал добавляет к этой цифре погрешность: «3,7% плюс-минус 0,5% с вероятностью 95%». Это значит, что если повторить измерение 100 раз при тех же условиях, в 95 случаях истинное значение окажется в диапазоне от 3,2% до 4,2%. Маркетолог, который видит только точечную оценку, рискует принять решение на основе шума — доверительный интервал возвращает ему понимание реальной точности числа. Это не украшение отчета, а инструмент управления риском.

История метода уходит корнями в 1930-е годы, когда статистик Ежи Нейман формализовал понятие интервального оценивания в противовес точечным оценкам. До Неймана статистики работали преимущественно с единственным числом — средним или пропорцией — и не имели строгого аппарата для описания неопределенности. Нейман предложил строить не одно значение, а диапазон, который будет «захватывать» истинный параметр с заданной частотой. Этот подход стал стандартом в экспериментальных науках, а позже перешел в бизнес-аналитику и маркетинговые исследования. Сегодня большинство платформ для A/B-тестирования — Optimizely, VWO, AB Tasty — строят доверительные интервалы автоматически, но далеко не все маркетологи понимают, что именно эти числа им говорят. Это создает разрыв между инструментом и решением.

В digital-маркетинге доверительный интервал особенно важен в трех контекстах: A/B-тестирование, прогнозирование и сегментный анализ. В A/B-тесте он отвечает на вопрос: «Превышение конверсии у варианта B реальное или случайное?». В прогнозировании он задает реалистичный коридор: не «трафик вырастет на 20%», а «трафик вырастет на 12-28% с вероятностью 90%» — принципиально разные вещи для бюджетирования. В сегментном анализе он показывает, можно ли доверять разнице между двумя группами — например, мобильными и десктопными пользователями. Аналитик без понимания этого инструмента видит цифры, но не знает, насколько им верить. Это прямо влияет на качество решений.

Бизнесу важно понимать доверительный интервал потому, что маркетинговые решения стоят денег. Перераспределить бюджет в пользу канала, который показал «лучший» CTR на маленькой выборке, значит рисковать тем, что разница оказалась случайной. Остановить A/B-тест раньше времени, увидев «выигравший» вариант с недостаточной выборкой — классическая ошибка peek problem, которая ведет к ложно-позитивным результатам. По расчетам Evan Miller, широко цитируемым в CRO-сообществе, преждевременная остановка тестов приводит к ложным выводам в 30-60% случаев в зависимости от методологии и момента остановки. Доверительный интервал — это способ заставить данные говорить честно: либо «я достаточно надежен, чтобы на меня опереться», либо «мне нужно больше наблюдений».

Как работает доверительный интервал

  1. Сбор выборки и определение параметра. Сначала нужно четко зафиксировать, что именно измеряется: пропорция (доля кликов, доля конверсий), среднее значение (средний чек, среднее время на сайте) или разница между двумя группами. Размер выборки критически важен: чем больше наблюдений, тем уже будет итоговый интервал. Для оценки конверсии в 3% с точностью плюс-минус 0,5% при уровне доверия 95% потребуется около 4500 сессий на вариант — это рассчитывается заранее через калькулятор мощности теста, например на сайте Evan Miller или в пакете statsmodels.
  2. Вычисление точечной оценки. По собранным данным рассчитывается центральная статистика — среднее значение для непрерывных метрик или пропорция для бинарных событий типа «купил / не купил». Эта цифра — лучшее приближение к истинному параметру на основе имеющейся выборки. Именно вокруг этой точки строится весь интервал, и именно ее погрешность предстоит оценить.
  3. Оценка стандартной ошибки. Стандартная ошибка показывает, насколько сильно точечная оценка может варьироваться от выборки к выборке. Для пропорции она вычисляется по формуле: корень из (p умноженное на (1 минус p), деленное на n), где p — оцениваемая пропорция, n — размер выборки. Чем больше n, тем меньше стандартная ошибка — именно поэтому большие выборки дают более узкие и практически полезные интервалы.
  4. Выбор уровня доверия и критического значения. Уровень доверия — это вероятность того, что интервал накроет истинный параметр при многократном повторении измерения. В маркетинге чаще всего используют 95%, которому соответствует критическое значение z = 1,96 для нормального распределения. Уровень 90% дает более узкий интервал, но и меньше уверенности; 99% — шире, но надежнее. Выбор зависит от цены ошибки: для теста нового call-to-action хватает 95%, для пересмотра ценовой модели или воронки продаж стоит поднять до 99%.
  5. Расчет границ интервала. Нижняя граница = точечная оценка минус (критическое значение, умноженное на стандартную ошибку). Верхняя граница = точечная оценка плюс то же произведение. Например, если конверсия = 3,7%, стандартная ошибка = 0,26%, z = 1,96, то интервал: [3,7% — 0,51%; 3,7% + 0,51%] = [3,19%; 4,21%]. Это и есть 95-процентный доверительный интервал для данной конверсии.
  6. Интерпретация и принятие решения. Если доверительные интервалы двух тестируемых вариантов не пересекаются — разница статистически значима и можно действовать. Если пересекаются — разница может быть случайной, нужно либо продолжить тест, либо признать, что вариантов нет ощутимой разницы. Важно помнить: статистическая значимость не равна практической — разница в 0,05% конверсии может быть значимой на гигантской выборке, но экономически бессмысленной при любом бюджете.

Виды доверительного интервала

  • Двусторонний доверительный интервал. Самый распространенный вид: ограничивает диапазон как снизу, так и сверху. Используется тогда, когда заранее неизвестно, в какую сторону может отклониться истинный параметр. В A/B-тестировании это стандарт: вариант B может оказаться как лучше, так и хуже контрола, и обе стороны одинаково важны. Например, двусторонний интервал для конверсии нового лендинга скажет: «Мы уверены на 95%, что реальное значение от 2,8% до 4,2%».
  • Односторонний доверительный интервал. Ограничивает диапазон только с одной стороны — снизу или сверху. Применяется, когда важна только одна сторона: например, нужно убедиться, что новый вариант не хуже текущего. Нижняя односторонняя граница выше нуля — это минимальный гарантированный эффект. В маркетинге уместен, если задача звучит так: «Нужно подтвердить, что CTR нового баннера не ниже 1,5%».
  • Интервал для среднего значения. Строится для непрерывных метрик: средний чек, среднее время на сайте, среднее количество страниц за сессию. При малых выборках до 30 наблюдений вместо z-критерия используется t-критерий Стьюдента — он дает более широкие границы, честно отражая неопределенность на небольших данных. Например, если средний чек на выборке 50 заказов составил 3200 рублей, 95-процентный интервал с t-критерием может быть [2940; 3460] рублей — это практически важный диапазон для планирования выручки.
  • Интервал для пропорции. Применяется для бинарных метрик: конверсия, CTR, доля отказов. При очень низких (до 5%) или очень высоких (выше 95%) пропорциях классический метод Вальда дает ненадежные результаты — интервал может выйти за пределы [0%; 100%]. В таких случаях лучше использовать метод Уилсона или Клоппера-Пирсона, которые поддерживают современные платформы тестирования. Это особенно актуально для e-commerce с низкой конверсией в покупку.
  • Бутстреп-интервал. Непараметрический метод: вместо теоретических формул многократно — обычно от 1000 до 10000 раз — пересэмплирует исходные данные с возвращением и строит распределение статистики. Особенно полезен для нестандартных метрик: медианный чек, 90-й перцентиль времени загрузки, коэффициент удержания пользователей. Не требует допущений о форме распределения, поэтому применим там, где классические методы работают ненадежно — e-commerce с длинным хвостом чеков, SaaS с неравномерным LTV.
  • Байесовский доверительный интервал. Строится на основе байесовского подхода и интерпретируется иначе: «истинный параметр находится в этом диапазоне с вероятностью 95%» — утверждение, которое интуитивно понятнее классического. Платформы Optimizely и AB Tasty перешли на байесовский подход, потому что он позволяет мониторить тест в реальном времени без риска ложных срабатываний. Для команды это означает более прозрачные выводы и возможность остановить тест раньше без потери надежности.

Сравнение доверительного интервала с p-значением

Параметр Доверительный интервал p-значение
Что показывает Диапазон правдоподобных значений параметра с заданной вероятностью Вероятность получить такой же или более экстремальный результат при истинной нулевой гипотезе
Практическая значимость Виден масштаб эффекта и его точность — ширина интервала говорит о надежности оценки Не показывает размер эффекта — два результата с одинаковым p могут иметь разный практический смысл
Интерпретация Интуитивно понятна: «от 2,8% до 4,2%» — цифры говорят сами за себя Требует статистической подготовки: «если p меньше 0,05, отклоняем нулевую гипотезу»
Риск неверного вывода Дает контекст: широкий интервал сигнализирует о недостатке данных Бинарный вывод «значимо / не значимо» скрывает неопределенность и провоцирует упрощение
Рекомендации стандартов Рекомендован APA как основной инструмент начиная с 2010 года Американская статистическая ассоциация в 2016 году призвала не опираться только на p-значение

Пример использования

Интернет-магазин строительных материалов с трафиком около 22 000 визитов в месяц провел A/B-тест карточки товара: вариант A — стандартная страница с ценой и кнопкой «Купить», вариант B — та же страница с добавленным блоком «Часто берут вместе» и калькулятором расхода материала. За три недели теста вариант A собрал 9800 сессий с конверсией 1,9% (186 заказов), вариант B — 9600 сессий с конверсией 2,6% (250 заказов). Точечная разница выглядела обнадеживающей — плюс 0,7%, но команда не спешила с выводами, потому что знала: выборка может давать флуктуации.

Аналитик рассчитал 95-процентный доверительный интервал для разницы конверсий: [+0,2%; +1,2%]. Нижняя граница положительная, интервалы двух вариантов не перекрываются — разница статистически значима. Практический вывод: даже в худшем сценарии вариант B дает прирост конверсии на 0,2 процентных пункта, что на объеме 22 000 визитов означает около 44 дополнительных заказа в месяц. При среднем чеке 8400 рублей это прирост выручки от 370 000 рублей в месяц только за счет изменения карточки товара. Команда внедрила вариант B как основной и через 60 дней зафиксировала стабильный рост конверсии до 2,5% — в пределах прогнозного интервала.

Частые вопросы

Какой уровень доверия выбрать: 90%, 95% или 99%?

Выбор уровня доверия зависит от цены ошибки и стоимости сбора данных. Уровень 95% (z = 1,96) — индустриальный стандарт для большинства маркетинговых тестов: он балансирует между точностью и необходимым объемом наблюдений. Уровень 90% (z = 1,645) дает более узкий интервал и требует меньше данных — оправдан, когда стоимость ошибки невысока: тест микрокопии кнопки или иконки. Уровень 99% (z = 2,576) уместен, когда ставки высоки: переработка ценовой модели, редизайн воронки, изменение алгоритма рекомендаций. Повышение уровня доверия с 95% до 99% увеличивает необходимый объем выборки примерно на 70%, поэтому выбирать 99% «на всякий случай» — значит замедлять скорость принятия решений и держать тест дольше, чем нужно. Правило простое: чем необратимее решение, тем выше должен быть уровень доверия.

Как размер выборки влияет на ширину интервала и что делать, если интервал слишком широкий?

Ширина доверительного интервала обратно пропорциональна корню из размера выборки. Это означает, что для вдвое более узкого интервала нужно не вдвое, а в четыре раза больше наблюдений — нелинейная зависимость, которую часто недооценивают при планировании тестов. Если интервал получился слишком широким и решение по нему невозможно, есть три пути. Первый — накопить больше данных: честное, но медленное решение. Второй — снизить уровень доверия с 95% до 90%, что сузит интервал без дополнительных данных, но повысит риск ложно-позитивного вывода. Третий — сегментировать аудиторию и тестировать на более однородных группах: трафик из одного источника или одно устройство дают меньший разброс и позволяют раньше получить надежный результат. Для предотвращения этой ситуации используйте калькулятор мощности теста до запуска — он покажет, сколько именно наблюдений нужно для нужной точности.

Можно ли сравнивать два сегмента напрямую по их отдельным доверительным интервалам?

Это частая ошибка в аналитике: если интервалы двух сегментов перекрываются, многие делают вывод о незначимости разницы. Но перекрытие отдельных интервалов не означает незначимости разницы между сегментами — это методологически некорректный способ сравнения. Правильный подход — строить доверительный интервал именно для разницы между двумя параметрами. Например, если конверсия мобильных пользователей 1,8% с интервалом [1,5%; 2,1%] и десктопных 2,4% с интервалом [2,1%; 2,7%], интервалы пересекаются в точке 2,1%. Но 95-процентный интервал для разницы 0,6% может оказаться [+0,2%; +1,0%] — полностью в положительной зоне, что подтверждает значимость различия между сегментами. Для корректного сравнения используйте двухвыборочный z-тест или t-тест — большинство аналитических платформ предоставляют этот расчет автоматически.

Все термины