Проверка гипотез

18.03.2026 Обновлено: 18.03.2026
автор

Лекция 7: Проверка статистических гипотез

1. Постановка задачи проверки гипотез

1.1. Гипотезы H0H_0 и H1H_1

Для каждой ситуации формулируются два предположения:

  • Нулевая гипотеза (H0H_0) — предположение «по умолчанию». Если рассматриваются какие-то явления, то по умолчанию они никак не связаны; если рассматривается некоторый показатель — он принимает типичное значение.
  • Альтернативная гипотеза (H1H_1) — наше «подозрение», то, что мы хотим доказать.
Note

Сумма H0H_0 и H1H_1 не всегда даёт всё пространство возможностей — то есть не обязательно H0H1=ΩH_0 \cup H_1 = \Omega.

1.2. Определение статистического критерия

Статистический критерий (statistical test) — это функция, возвращающая одно из двух решений: принять H0H_0 или отвергнуть H0H_0.

Формально объявим декларацию функции:

δ(X,H0,H1,α){accept H0, reject H0}\delta(X, H_0, H_1, \alpha) \to \{\text{accept } H_0,\ \text{reject } H_0\}

где:

  • XXвыборка в широком смысле. Это не обязательно простейшая выборка из независимых одинаково распределённых случайных величин; в общем случае это произвольный датафрейм (например, аргументация прокурора и защиты в суде).
  • H0H_0 — нулевая гипотеза.
  • H1H_1 — альтернативная гипотеза.
  • α\alphaуровень значимости (significance level). Типичные значения: 0.1, 0.05, 0.01, 0.0010.1,\ 0.05,\ 0.01,\ 0.001 (хотя можно задавать любые).
Warning
  • «Принять H0H_0» не означает доказательства истинности H0H_0. Это означает лишь, что данные не противоречат нулевой гипотезе относительно заданной альтернативы.
  • «Отвергнуть H0H_0» автоматически не доказывает истинности H1H_1. Это лишь говорит, что данные скорее противоречат нулевой гипотезе и свидетельствуют в пользу альтернативы.

Стат-тест — не «серебряная пуля», а скорее средство аргументации.

Пример (аналогия с уголовным судом)

Если подсудимый подозревается в убийстве, и в ходе разбирательства приводятся факты о мошенничестве, судья скажет «невиновен» — потому что рассматривается именно дело об убийстве, а не о мошенничестве. То есть «принять H0H_0» = «H0H_0 не опровергнуто относительно данной альтернативы».


2. Принцип работы статистического критерия

2.1. Статистика критерия

Под капотом критерия работает функция T(X)T(X)статистика критерия.

Принцип выбора статистики:

Статистику критерия выбирают так, чтобы её распределение в точности имело или стремилось (при nn \to \infty) к некоторому «хорошему» распределению — при условии истинности нулевой гипотезы.

Important

Распределение T(X)T(X) рассматривается именно при условии истинности H0H_0.

2.2. Область принятия и критическая область

Множество всех значений случайной величины TT разбивается на две непересекающиеся области:

supp(T)=T0(α)T1(α)\text{supp}(T) = T_0(\alpha) \sqcup T_1(\alpha)
  • T0(α)T_0(\alpha)область принятия нулевой гипотезы.
  • T1(α)T_1(\alpha)критическая область.

Распределение вероятностной массы:

P(T(X)T0(α)H0)=1αP(T(X) \in T_0(\alpha) \mid H_0) = 1 - \alpha

P(T(X)T1(α)H0)=αP(T(X) \in T_1(\alpha) \mid H_0) = \alpha

Для асимптотических критериев равенство выполняется в пределе.

2.3. Основной if-statement критерия

if T(x)T0(α)принять H0,иначеотвергнуть H0\text{if } T(x) \in T_0(\alpha) \Rightarrow \text{принять } H_0,\quad \text{иначе} \Rightarrow \text{отвергнуть } H_0

Здесь xx (маленькое) — конкретная реализация выборки.

Пример с монеткой

Если кинуть монетку 100 раз и получить 95 решек — мы скорее скажем, что монетка нечестная. Но гипотетически для честной монетки такой исход возможен (хоть и с очень малой вероятностью). Поэтому выводы носят нестрогий характер.

2.4. Недостатки прямого if-statement

  • У разных тестов разные распределения TT.
  • Сама статистика устроена по-разному (где-то суммируем, где-то усредняем).
  • Критические области бывают трёх типов.

Хотелось бы унифицированный показатель — это p-value (см. ниже).


3. Три типа критических областей

Критические области выбираются не произвольно — почти во всех тестах встречается одна из трёх ситуаций.

3.1. Правосторонний тест

  • Справа выделяется вероятностная масса α\alpha.
  • Слева выделяется 1α1 - \alpha.
T0(α)=(, q1α]T_0(\alpha) = (-\infty,\ q_{1-\alpha}]

где q1αq_{1-\alpha} — квантиль порядка 1α1 - \alpha.

Называется правосторонним, потому что критическая область находится справа.

3.2. Левосторонний тест

  • Слева выделяется вероятностная масса α\alpha.
  • Справа 1α1 - \alpha.
T0(α)=[qα, +)T_0(\alpha) = [q_{\alpha},\ +\infty)

(или до супремума носителя случайной величины — в общем случае). Критическая область слева.

3.3. Двусторонний тест

  • И слева, и справа выделяется по α/2\alpha/2.
T0(α)=[qα/2, q1α/2]T_0(\alpha) = [q_{\alpha/2},\ q_{1-\alpha/2}]

Критическая область — с обеих сторон.

Info

Гипотетически возможны и более экзотические ситуации (например, разбиение на 3 куска), но в практически интересных тестах встречаются только эти три типа.


4. p-value

p-value — унифицированный показатель, позволяющий заменить громоздкий if-statement на простое сравнение с α\alpha.

4.1. Определения p-value по типам тестов

Правосторонний случай:

p-valueright=P(T(X)>TнаблH0)p\text{-value}_{\text{right}} = P\big(T(X) > T_{\text{набл}} \mid H_0\big)

Левосторонний случай:

p-valueleft=P(T(X)<TнаблH0)p\text{-value}_{\text{left}} = P\big(T(X) < T_{\text{набл}} \mid H_0\big)

Двусторонний случай:

p-value=2min(p-valueleft, p-valueright)p\text{-value} = 2 \cdot \min\big(p\text{-value}_{\text{left}},\ p\text{-value}_{\text{right}}\big)
Tip

Если распределение TT симметрично относительно нуля, формулу для двустороннего случая можно упростить (это часто встречается в литературе).

4.2. Геометрический смысл (правосторонний случай)

Допустим, наблюдаемое значение T1T_1 попало в область принятия T0(α)T_0(\alpha). Тогда:

p-value(T1)>αp\text{-value}(T_1) > \alpha

Если T2T_2 попало в правый хвост (критическую область):

p-value(T2)<αp\text{-value}(T_2) < \alpha

4.3. Геометрический смысл (двусторонний случай)

Допустим:

  • T1T_1 — в области принятия (центр):
    • p-valueright>α/2p\text{-value}_{\text{right}} > \alpha/2
    • p-valueleft>α/2p\text{-value}_{\text{left}} > \alpha/2
    • p-value(T1)>α\Rightarrow p\text{-value}(T_1) > \alpha
  • T2T_2 — в правом хвосте:
    • p-valueleft>α/2p\text{-value}_{\text{left}} > \alpha/2, p-valueright<α/2p\text{-value}_{\text{right}} < \alpha/2
    • min<α/2p-value(T2)<α\min < \alpha/2 \Rightarrow p\text{-value}(T_2) < \alpha
  • T3T_3 — в левом хвосте:
    • p-valueright>α/2p\text{-value}_{\text{right}} > \alpha/2, p-valueleft<α/2p\text{-value}_{\text{left}} < \alpha/2
    • p-value(T3)<α\Rightarrow p\text{-value}(T_3) < \alpha

4.4. Унифицированный if-statement через p-value

if p-value>αпринять H0,иначеотвергнуть H0\text{if } p\text{-value} > \alpha \Rightarrow \text{принять } H_0,\quad \text{иначе} \Rightarrow \text{отвергнуть } H_0

p-value всегда лежит в [0,1][0, 1] (это вероятность), что делает критерий универсальным.

4.5. Неформальная интерпретация p-value

Danger

p-value НЕ является вероятностью того, что H0H_0 верна (или что мы её примем). С вероятностью принятия гипотезы p-value никак не связан.

Правильная интерпретация:

p-value — это вероятность того, что статистика критерия примет более экстремальное значение относительно наблюдаемого (при условии истинности H0H_0).

«Экстремальные» значения — это значения, попадающие в хвост(ы):

  • В правостороннем тесте: значения больше наблюдаемого.
  • В двустороннем тесте — значения, большие по модулю наблюдаемого.

5. Терминология: статистическая значимость

Если мы отвергаем H0H_0, говорят, что результат является статистически значимым.

Например: «доказана нечестность монетки с уровнем значимости α=0.05\alpha = 0.05» = «отвергнута нулевая гипотеза о честности с α=0.05\alpha = 0.05».

Отсюда и название α\alphaуровень значимости.


6. Ошибки I и II рода

6.1. Таблица ошибок

Реальность: H0H_0Реальность: H1H_1
Тест: H0H_0True Negative ✅False Negative ❌ (ошибка II рода)
Тест: H1H_1False Positive ❌ (ошибка I рода)True Positive ✅
Note

К этой таблице нужно относиться философски — ведь мы говорили, что отвержение H0H_0 ≠ доказательство H1H_1. Здесь предполагается, что в реальности либо H0H_0, либо H1H_1 верно (при хорошей формулировке гипотез). Гипотетически возможна ситуация, когда ни H0H_0, ни H1H_1 не верны, но при разумной формулировке гипотез после предварительного анализа данных такого не возникает.

6.2. Ошибка I рода (False Positive)

Определение: тест отверг H0H_0, но в реальности H0H_0 верна.

P(ошибка I рода)=αP(\text{ошибка I рода}) = \alpha

То есть, регулируя уровень значимости, мы регулируем ошибку I рода.

6.3. Ошибка II рода (False Negative)

Определение: тест принял H0H_0, но в реальности верна H1H_1.

β=P(T(X)T0(α)H1)\beta = P\big(T(X) \in T_0(\alpha) \mid H_1\big)

β\beta — вероятность ошибки II рода.

6.4. Состоятельность критерия

Критерий состоятелен, если:

β0 при n\beta \to 0 \text{ при } n \to \infty

6.5. Мощность критерия

Мощность — это 1β1 - \beta, то есть вероятность отвергнуть H0H_0, если в действительности верна H1H_1.

Мощность=1β=P(T(X)T1(α)H1)\text{Мощность} = 1 - \beta = P\big(T(X) \in T_1(\alpha) \mid H_1\big)

6.6. Терминология Positive/Negative (аналогия с медициной)

Аналогия: пациент пришёл к врачу.

  • H0H_0: пациент здоров.
  • H1H_1: пациент болен.

Положительный анализ → есть аномалия → выбираем H1H_1Positive. Отрицательный анализ → нет аномалии → выбираем H0H_0Negative.

Реальность \ ТестТест: H0H_0 (Negative)Тест: H1H_1 (Positive)
H0H_0 вернаTrue NegativeFalse Positive (ошибка I рода)
H1H_1 вернаFalse Negative (ошибка II рода)True Positive

7. Связь между α\alpha и β\beta

«Сделаем α\alpha маленьким, и будет нам счастье» — не работает!

Пример: спам-классификатор

  • H0H_0: письмо не является спамом.
  • H1H_1: письмо является спамом.

Классификатор A — всё помещает во «Входящие» (всегда выбирает H0H_0):

  • α=0\alpha = 0 (ошибка I рода исключена).
  • Но β\beta велико — спам попадает во «Входящие».

Классификатор B — всё помещает в «Спам» (всегда выбирает H1H_1):

  • β=0\beta = 0 (ошибка II рода исключена).
  • Но α\alpha велико — нормальные письма попадают в спам.

Мораль

Как правило, чем меньше α\alpha, тем больше β\beta. В общем случае аналитическую зависимость α\alpha от β\beta написать нельзя, но в некоторых хороших ситуациях можно.

Стандартный подход

На практике:

  1. Фиксируется допустимый порог ошибки I рода (α\alpha).
  2. Среди тестов с заданным α\alpha выбирается тот, у которого β\beta минимален (то есть мощность максимальна).

8. Связь доверительных интервалов и стат-тестов

8.1. Напоминание о доверительных интервалах

Чтобы построить доверительный интервал для параметра θ\theta, рассматривается статистика G(X,θ)G(X, \theta), которая имеет (или стремится к) распределение случайной величины UU, не зависящее от θ\theta.

Затем зажимаем статистику между квантилями:

P(qα/2G(X,θ)q1α/2)=1αP\big(q_{\alpha/2} \le G(X, \theta) \le q_{1-\alpha/2}\big) = 1 - \alpha

Это очень похоже на область принятия нулевой гипотезы!

8.2. Преобразование в стат-тест

Рассмотрим гипотезы:

  • H0: θ=θ0H_0:\ \theta = \theta_0
  • H1: θθ0H_1:\ \theta \ne \theta_0

При H0H_0 подставляем θ0\theta_0 вместо θ\theta:

P(qα/2G(X,θ0)q1α/2)=1αP\big(q_{\alpha/2} \le G(X, \theta_0) \le q_{1-\alpha/2}\big) = 1 - \alpha

8.3. Эквивалентность

Important

Принять H0H_0 с уровнем значимости α\alpha равносильно тому, что значение θ0\theta_0 попадает в доверительный интервал уровня доверия 1α1 - \alpha.

То есть: разрешая неравенство относительно θ0\theta_0, мы получаем доверительный интервал, и принятие H0H_0 означает попадание θ0\theta_0 в этот интервал.


9. Z-тест для одной выборки (тест о математическом ожидании)

9.1. Постановка

Пусть выборка достаточно большая. Хотим проверить:

  • H0: E[X]=μ0H_0:\ E[X] = \mu_0

Альтернатива может быть трёх видов (в зависимости от наших подозрений):

  • H1: E[X]>μ0H_1:\ E[X] > \mu_0 — правосторонний тест
  • H1: E[X]<μ0H_1:\ E[X] < \mu_0 — левосторонний тест
  • H1: E[X]μ0H_1:\ E[X] \ne \mu_0 — двусторонний тест

9.2. Статистика критерия

Используется та же статистика, что и для построения асимптотического доверительного интервала для матожидания:

T(X)=n(Xˉμ0)SdN(0,1)T(X) = \frac{\sqrt{n}\,(\bar{X} - \mu_0)}{S} \xrightarrow{d} \mathcal{N}(0, 1)

где SS — выборочное стандартное отклонение.

9.3. Выбор типа критической области

При H0H_0 (E[X]=μ0E[X] = \mu_0) статистика принимает значения около нуля (правило 3-х сигм для N(0,1)\mathcal{N}(0, 1): на диапазон [3,3][-3, 3] приходится ≈ 99.73% массы).

Куда попадает статистика при истинной альтернативе?

  • H1: E[X]>μ0H_1:\ E[X] > \mu_0XˉE[X]>μ0\bar{X} \to E[X] > \mu_0 → числитель >0> 0 → статистика смещена вправокритическая область справа (правосторонний тест).
  • H1: E[X]<μ0H_1:\ E[X] < \mu_0 → статистика смещена влево → левосторонний тест.
  • H1: E[X]μ0H_1:\ E[X] \ne \mu_0 → статистика может быть как слева, так и справа → двусторонний тест.

9.4. Доказательство состоятельности (правосторонний случай)

Покажем, что β0\beta \to 0 при nn \to \infty.

Вероятность ошибки II рода:

β=P ⁣(n(Xˉμ0)Sq1αE[X]>μ0)\beta = P\!\left(\frac{\sqrt{n}\,(\bar{X} - \mu_0)}{S} \le q_{1-\alpha} \,\Big|\, E[X] > \mu_0\right)

Прибавим и вычтем истинное мат. ожидание E[X]E[X] в числителе:

β=P ⁣(n(XˉE[X])S+n(E[X]μ0)Sq1αE[X]>μ0)\beta = P\!\left(\frac{\sqrt{n}\,(\bar{X} - E[X])}{S} + \frac{\sqrt{n}\,(E[X] - \mu_0)}{S} \le q_{1-\alpha} \,\Big|\, E[X] > \mu_0\right)

Перенесём:

β=P ⁣(n(XˉE[X])Sq1αn(E[X]μ0)SE[X]>μ0)\beta = P\!\left(\frac{\sqrt{n}\,(\bar{X} - E[X])}{S} \le q_{1-\alpha} - \frac{\sqrt{n}\,(E[X] - \mu_0)}{S} \,\Big|\, E[X] > \mu_0\right)

По ЦПТ (и её следствиям) первая дробь сходится к N(0,1)\mathcal{N}(0, 1), поэтому при больших nn:

βΦ ⁣(q1αn(E[X]μ0)S)\beta \approx \Phi\!\left(q_{1-\alpha} - \frac{\sqrt{n}\,(E[X] - \mu_0)}{S}\right)

Анализ аргумента:

  • q1αq_{1-\alpha} — константа.
  • E[X]μ0>0E[X] - \mu_0 > 0 (по альтернативе).
  • SσS \to \sigma (выборочное стандартное отклонение сходится к теоретическому).
  • n\sqrt{n} \to \infty.

Значит, n(E[X]μ0)S+\frac{\sqrt{n}(E[X] - \mu_0)}{S} \to +\infty, и аргумент функции Φ\Phi уходит на -\infty.

Φ()=0β0\Phi(-\infty) = 0 \Rightarrow \beta \to 0

Критерий состоятелен. ✅

9.5. Терминология: Z-тест

Z-тест — это критерий, у которого статистика критерия точно имеет или сходится к нормальному распределению. Жаргон сложился исторически (от обозначения нормальной величины через ZZ).

Вышеописанный тест — Z-тест для одной выборки, проверяющий гипотезу о математическом ожидании.


10. Важный частный случай: распределение Бернулли

10.1. Постановка

Пусть X1,,XnX_1, \dots, X_n — выборка из распределения Бернулли с параметром pp.

Параметр pp распределения Бернулли = матожидание этого распределения.

Гипотезы:

  • H0: p=p0H_0:\ p = p_0
  • H1H_1: одна из трёх (p>p0p > p_0, p<p0p < p_0, pp0p \ne p_0).

10.2. Статистика критерия

Поскольку для Бернулли дисперсия D[X]=p(1p)D[X] = p(1-p), статистика принимает более конкретный вид (теоретическая дисперсия известна при H0H_0):

T(X)=n(Xˉp0)p0(1p0)dN(0,1)T(X) = \frac{\sqrt{n}\,(\bar{X} - p_0)}{\sqrt{p_0(1 - p_0)}} \xrightarrow{d} \mathcal{N}(0, 1)

10.3. Тип критической области

Аналогично общему случаю Z-теста:

  • H1: p>p0H_1:\ p > p_0 — правосторонний.
  • H1: p<p0H_1:\ p < p_0 — левосторонний.
  • H1: pp0H_1:\ p \ne p_0 — двусторонний.

10.4. Применение: проверка честности монетки

Для честной монетки p=1/2p = 1/2, поэтому p0=1/2p_0 = 1/2.

В зависимости от подозрений:

  • «Орёл выпадает чаще» → H1: p>1/2H_1:\ p > 1/2.
  • «Решка выпадает чаще» → H1: p<1/2H_1:\ p < 1/2.
  • «Монетка просто нечестная» → H1: p1/2H_1:\ p \ne 1/2.

11. Как выбирать тип альтернативы — пример с врачами

Тип теста (одно- или двусторонний) зависит от того, что мы хотим доказать.

Пример: измерения температуры пациента.

  • Участковый врач-терапевт: пришёл пациент с жалобой «мне плохо». Терапевт хочет понять — есть ли вообще отклонение от нормы (36.6°C). Альтернатива: E[T]36.6E[T] \ne 36.6двусторонний тест.

  • Врач-инфекционист: ищет инфекцию, для которой характерна повышенная температура. Альтернатива: E[T]>36.6E[T] > 36.6правосторонний тест.

  • Врач, ищущий болезнь с пониженной температурой: альтернатива E[T]<36.6E[T] < 36.6левосторонний тест.

Summary

Альтернатива зависит от того, что именно мы хотим доказать. Тип критической области определяется и сутью теста, и формулировкой альтернативы.


12. Итоговая схема работы стат-критерия

  1. Сформулировать H0H_0 и H1H_1.
  2. Зафиксировать уровень значимости α\alpha.
  3. Выбрать статистику критерия T(X)T(X) с известным распределением при H0H_0.
  4. Определить тип критической области (право-/лево-/двусторонний — зависит от H1H_1).
  5. Вычислить T(x)T(x) на конкретной реализации.
  6. Вычислить p-value.
  7. Принять решение:
    • p-value>αp\text{-value} > \alpha → принять H0H_0.
    • p-valueαp\text{-value} \le \alpha → отвергнуть H0H_0.
  8. (При необходимости) проверить состоятельность критерия: β0\beta \to 0 при nn \to \infty.

13. Что дальше

В следующих лекциях:

  • Стат-тесты, связанные с доверительными интервалами и нормальным распределением.
  • Конкретные ситуации, где можно явно выписать зависимость α\alpha от β\beta и определить оптимальный критерий.