Карточки Anki
Скачайте колоды для интервального повторения
Лекция 7: Проверка статистических гипотез
1. Постановка задачи проверки гипотез
1.1. Гипотезы и
Для каждой ситуации формулируются два предположения:
- Нулевая гипотеза () — предположение «по умолчанию». Если рассматриваются какие-то явления, то по умолчанию они никак не связаны; если рассматривается некоторый показатель — он принимает типичное значение.
- Альтернативная гипотеза () — наше «подозрение», то, что мы хотим доказать.
Сумма и не всегда даёт всё пространство возможностей — то есть не обязательно .
1.2. Определение статистического критерия
Статистический критерий (statistical test) — это функция, возвращающая одно из двух решений: принять или отвергнуть .
Формально объявим декларацию функции:
где:
- — выборка в широком смысле. Это не обязательно простейшая выборка из независимых одинаково распределённых случайных величин; в общем случае это произвольный датафрейм (например, аргументация прокурора и защиты в суде).
- — нулевая гипотеза.
- — альтернативная гипотеза.
- — уровень значимости (significance level). Типичные значения: (хотя можно задавать любые).
- «Принять » не означает доказательства истинности . Это означает лишь, что данные не противоречат нулевой гипотезе относительно заданной альтернативы.
- «Отвергнуть » автоматически не доказывает истинности . Это лишь говорит, что данные скорее противоречат нулевой гипотезе и свидетельствуют в пользу альтернативы.
Стат-тест — не «серебряная пуля», а скорее средство аргументации.
Пример (аналогия с уголовным судом)
Если подсудимый подозревается в убийстве, и в ходе разбирательства приводятся факты о мошенничестве, судья скажет «невиновен» — потому что рассматривается именно дело об убийстве, а не о мошенничестве. То есть «принять » = « не опровергнуто относительно данной альтернативы».
2. Принцип работы статистического критерия
2.1. Статистика критерия
Под капотом критерия работает функция — статистика критерия.
Принцип выбора статистики:
Статистику критерия выбирают так, чтобы её распределение в точности имело или стремилось (при ) к некоторому «хорошему» распределению — при условии истинности нулевой гипотезы.
Распределение рассматривается именно при условии истинности .
2.2. Область принятия и критическая область
Множество всех значений случайной величины разбивается на две непересекающиеся области:
- — область принятия нулевой гипотезы.
- — критическая область.
Распределение вероятностной массы:
Для асимптотических критериев равенство выполняется в пределе.
2.3. Основной if-statement критерия
Здесь (маленькое) — конкретная реализация выборки.
Пример с монеткой
Если кинуть монетку 100 раз и получить 95 решек — мы скорее скажем, что монетка нечестная. Но гипотетически для честной монетки такой исход возможен (хоть и с очень малой вероятностью). Поэтому выводы носят нестрогий характер.
2.4. Недостатки прямого if-statement
- У разных тестов разные распределения .
- Сама статистика устроена по-разному (где-то суммируем, где-то усредняем).
- Критические области бывают трёх типов.
Хотелось бы унифицированный показатель — это p-value (см. ниже).
3. Три типа критических областей
Критические области выбираются не произвольно — почти во всех тестах встречается одна из трёх ситуаций.
3.1. Правосторонний тест
- Справа выделяется вероятностная масса .
- Слева выделяется .
где — квантиль порядка .
Называется правосторонним, потому что критическая область находится справа.
3.2. Левосторонний тест
- Слева выделяется вероятностная масса .
- Справа .
(или до супремума носителя случайной величины — в общем случае). Критическая область слева.
3.3. Двусторонний тест
- И слева, и справа выделяется по .
Критическая область — с обеих сторон.
Гипотетически возможны и более экзотические ситуации (например, разбиение на 3 куска), но в практически интересных тестах встречаются только эти три типа.
4. p-value
p-value — унифицированный показатель, позволяющий заменить громоздкий if-statement на простое сравнение с .
4.1. Определения p-value по типам тестов
Правосторонний случай:
Левосторонний случай:
Двусторонний случай:
Если распределение симметрично относительно нуля, формулу для двустороннего случая можно упростить (это часто встречается в литературе).
4.2. Геометрический смысл (правосторонний случай)
Допустим, наблюдаемое значение попало в область принятия . Тогда:
Если попало в правый хвост (критическую область):
4.3. Геометрический смысл (двусторонний случай)
Допустим:
- — в области принятия (центр):
- — в правом хвосте:
- ,
- — в левом хвосте:
- ,
4.4. Унифицированный if-statement через p-value
p-value всегда лежит в (это вероятность), что делает критерий универсальным.
4.5. Неформальная интерпретация p-value
p-value НЕ является вероятностью того, что верна (или что мы её примем). С вероятностью принятия гипотезы p-value никак не связан.
Правильная интерпретация:
p-value — это вероятность того, что статистика критерия примет более экстремальное значение относительно наблюдаемого (при условии истинности ).
«Экстремальные» значения — это значения, попадающие в хвост(ы):
- В правостороннем тесте: значения больше наблюдаемого.
- В двустороннем тесте — значения, большие по модулю наблюдаемого.
5. Терминология: статистическая значимость
Если мы отвергаем , говорят, что результат является статистически значимым.
Например: «доказана нечестность монетки с уровнем значимости » = «отвергнута нулевая гипотеза о честности с ».
Отсюда и название — уровень значимости.
6. Ошибки I и II рода
6.1. Таблица ошибок
| Реальность: | Реальность: | |
|---|---|---|
| Тест: | True Negative ✅ | False Negative ❌ (ошибка II рода) |
| Тест: | False Positive ❌ (ошибка I рода) | True Positive ✅ |
К этой таблице нужно относиться философски — ведь мы говорили, что отвержение ≠ доказательство . Здесь предполагается, что в реальности либо , либо верно (при хорошей формулировке гипотез). Гипотетически возможна ситуация, когда ни , ни не верны, но при разумной формулировке гипотез после предварительного анализа данных такого не возникает.
6.2. Ошибка I рода (False Positive)
Определение: тест отверг , но в реальности верна.
То есть, регулируя уровень значимости, мы регулируем ошибку I рода.
6.3. Ошибка II рода (False Negative)
Определение: тест принял , но в реальности верна .
— вероятность ошибки II рода.
6.4. Состоятельность критерия
Критерий состоятелен, если:
6.5. Мощность критерия
Мощность — это , то есть вероятность отвергнуть , если в действительности верна .
6.6. Терминология Positive/Negative (аналогия с медициной)
Аналогия: пациент пришёл к врачу.
- : пациент здоров.
- : пациент болен.
Положительный анализ → есть аномалия → выбираем → Positive. Отрицательный анализ → нет аномалии → выбираем → Negative.
| Реальность \ Тест | Тест: (Negative) | Тест: (Positive) |
|---|---|---|
| верна | True Negative | False Positive (ошибка I рода) |
| верна | False Negative (ошибка II рода) | True Positive |
7. Связь между и
«Сделаем маленьким, и будет нам счастье» — не работает!
Пример: спам-классификатор
- : письмо не является спамом.
- : письмо является спамом.
Классификатор A — всё помещает во «Входящие» (всегда выбирает ):
- (ошибка I рода исключена).
- Но велико — спам попадает во «Входящие».
Классификатор B — всё помещает в «Спам» (всегда выбирает ):
- (ошибка II рода исключена).
- Но велико — нормальные письма попадают в спам.
Мораль
Как правило, чем меньше , тем больше . В общем случае аналитическую зависимость от написать нельзя, но в некоторых хороших ситуациях можно.
Стандартный подход
На практике:
- Фиксируется допустимый порог ошибки I рода ().
- Среди тестов с заданным выбирается тот, у которого минимален (то есть мощность максимальна).
8. Связь доверительных интервалов и стат-тестов
8.1. Напоминание о доверительных интервалах
Чтобы построить доверительный интервал для параметра , рассматривается статистика , которая имеет (или стремится к) распределение случайной величины , не зависящее от .
Затем зажимаем статистику между квантилями:
Это очень похоже на область принятия нулевой гипотезы!
8.2. Преобразование в стат-тест
Рассмотрим гипотезы:
При подставляем вместо :
8.3. Эквивалентность
Принять с уровнем значимости равносильно тому, что значение попадает в доверительный интервал уровня доверия .
То есть: разрешая неравенство относительно , мы получаем доверительный интервал, и принятие означает попадание в этот интервал.
9. Z-тест для одной выборки (тест о математическом ожидании)
9.1. Постановка
Пусть выборка достаточно большая. Хотим проверить:
Альтернатива может быть трёх видов (в зависимости от наших подозрений):
- — правосторонний тест
- — левосторонний тест
- — двусторонний тест
9.2. Статистика критерия
Используется та же статистика, что и для построения асимптотического доверительного интервала для матожидания:
где — выборочное стандартное отклонение.
9.3. Выбор типа критической области
При () статистика принимает значения около нуля (правило 3-х сигм для : на диапазон приходится ≈ 99.73% массы).
Куда попадает статистика при истинной альтернативе?
- → → числитель → статистика смещена вправо → критическая область справа (правосторонний тест).
- → статистика смещена влево → левосторонний тест.
- → статистика может быть как слева, так и справа → двусторонний тест.
9.4. Доказательство состоятельности (правосторонний случай)
Покажем, что при .
Вероятность ошибки II рода:
Прибавим и вычтем истинное мат. ожидание в числителе:
Перенесём:
По ЦПТ (и её следствиям) первая дробь сходится к , поэтому при больших :
Анализ аргумента:
- — константа.
- (по альтернативе).
- (выборочное стандартное отклонение сходится к теоретическому).
- .
Значит, , и аргумент функции уходит на .
Критерий состоятелен. ✅
9.5. Терминология: Z-тест
Z-тест — это критерий, у которого статистика критерия точно имеет или сходится к нормальному распределению. Жаргон сложился исторически (от обозначения нормальной величины через ).
Вышеописанный тест — Z-тест для одной выборки, проверяющий гипотезу о математическом ожидании.
10. Важный частный случай: распределение Бернулли
10.1. Постановка
Пусть — выборка из распределения Бернулли с параметром .
Параметр распределения Бернулли = матожидание этого распределения.
Гипотезы:
- : одна из трёх (, , ).
10.2. Статистика критерия
Поскольку для Бернулли дисперсия , статистика принимает более конкретный вид (теоретическая дисперсия известна при ):
10.3. Тип критической области
Аналогично общему случаю Z-теста:
- — правосторонний.
- — левосторонний.
- — двусторонний.
10.4. Применение: проверка честности монетки
Для честной монетки , поэтому .
В зависимости от подозрений:
- «Орёл выпадает чаще» → .
- «Решка выпадает чаще» → .
- «Монетка просто нечестная» → .
11. Как выбирать тип альтернативы — пример с врачами
Тип теста (одно- или двусторонний) зависит от того, что мы хотим доказать.
Пример: измерения температуры пациента.
Участковый врач-терапевт: пришёл пациент с жалобой «мне плохо». Терапевт хочет понять — есть ли вообще отклонение от нормы (36.6°C). Альтернатива: → двусторонний тест.
Врач-инфекционист: ищет инфекцию, для которой характерна повышенная температура. Альтернатива: → правосторонний тест.
Врач, ищущий болезнь с пониженной температурой: альтернатива → левосторонний тест.
Альтернатива зависит от того, что именно мы хотим доказать. Тип критической области определяется и сутью теста, и формулировкой альтернативы.
12. Итоговая схема работы стат-критерия
- Сформулировать и .
- Зафиксировать уровень значимости .
- Выбрать статистику критерия с известным распределением при .
- Определить тип критической области (право-/лево-/двусторонний — зависит от ).
- Вычислить на конкретной реализации.
- Вычислить p-value.
- Принять решение:
- → принять .
- → отвергнуть .
- (При необходимости) проверить состоятельность критерия: при .
13. Что дальше
В следующих лекциях:
- Стат-тесты, связанные с доверительными интервалами и нормальным распределением.
- Конкретные ситуации, где можно явно выписать зависимость от и определить оптимальный критерий.