Карточки Anki
Скачайте колоды для интервального повторения
Лекция 9: Статистические критерии (продолжение)
1. Примеры применения базовых критериев
1.1. Проверка гипотезы о математическом ожидании (честная монета)
Постановка задачи: Монету подбросили раз, орёл выпал раз. Является ли монета честной?
Гипотезы:
- : (монета честная, — реальная вероятность успеха)
- : альтернатива может быть специфицирована тремя способами:
- правосторонняя:
- левосторонняя:
- двусторонняя:
По сути проверяется, верно ли, что математическое ожидание равняется конкретному значению.
Статистика критерия:
то есть (выборочное среднее минус мат. ожидание), делённое на корень квадратный из дисперсии, умноженное на корень из объёма выборки .
Распределение статистики: при условии истинности статистика имеет стандартное нормальное распределение.
p-value: напоминание — это вероятность того, что мы получим более экстремальные значения относительно наблюдаемого.
- Для правосторонней альтернативы — правосторонний p-value
- Для левосторонней альтернативы — левосторонний p-value
- Для двусторонней альтернативы — двусторонний p-value
Пример вывода: при каком уровне значимости мы опровергнем нулевую гипотезу? Иными словами, p-value должен быть меньше уровня значимости. Если уровень значимости больше чем — гипотеза будет отвергнута.
Технический момент: в коде используется модуль
scipy.stats(импортируется как подмодульstatsизscipy).
1.2. Проверка гипотезы о дисперсии (сеть магазинов)
Постановка задачи: Есть сеть магазинов, известно среднее время и стандартное отклонение. Открыли новый магазин, посмотрели на случайных покупателей. На уровне значимости проверить гипотезу о том, что стандартное отклонение времени в новом магазине больше, чем во всей сети.
Гипотезы:
- :
- : (подозреваем большее отклонение — это идёт в альтернативу)
Статистика: распределена по с степенями свободы (по теореме Фишера).
Тип критерия: правосторонний (это было показано на теории).
Расчёт p-value:
Результат: получили p-value — гипотеза принимается.
1.3. F-тест на равенство дисперсий двух выборок
Постановка задачи: Есть две выборки. Для каждой даны среднее и стандартное отклонение. Проверить равенство дисперсий.
Метод: F-тест.
Критическая область: двусторонняя.
Результат: p-value большой — нулевая гипотеза принимается.
1.4. T-тест для сравнения математических ожиданий двух выборок
Использовали T-тест для двух выборок (рассматривали в одной из прошлых лекций).
Результат: p-value , при уровне значимости — нулевая гипотеза отвергается. Тест показал статистически значимый результат: средние не равны.
1.5. T-тест для парных выборок
Постановка: есть парная выборка (условно «до» и «после»). Хотим проверить, верно ли, что математическое ожидание «после» больше, чем «до».
Метод: альтернативная гипотеза формулируется в терминах разности — фактически в терминах третьей, новой выборки. Используется t-test для парных выборок.
Результат: нулевая гипотеза принимается.
1.6. Простой критерий согласия Пирсона (число )
Рассмотрен пример про распределение цифр в десятичной записи числа .
Результат: статистика дала p-value — это больше типичного уровня значимости, гипотеза принимается.
2. Критерий согласия Пирсона для сложной гипотезы
2.1. Отличие от простого критерия
В простом критерии согласия Пирсона у нас была простая гипотеза вида:
где — конкретное значение (например, вектор вероятностей). В предыдущих примерах мы спрашивали: «верно ли, что вектор вероятностей равен вектору, состоящему из » (для цифр ).
В сложной гипотезе зависит от параметра :
2.2. Статистика критерия
Рассматривается статистика , аналогичная простому случаю:
где — вектор вероятностей, зависящий от .
2.3. Проблема и решение
Проблема: — неизвестная величина.
Что можно сделать? Заменить на выборочную оценку. Точнее — на оценку максимального правдоподобия (ОМП).
При некоторых ограничениях предельное распределение остаётся «хорошим».
2.4. Утверждение (теорема о сложном критерии Пирсона)
Пусть:
- — вектор размерности параметров
- (строго меньше)
- непрерывна
- дважды непрерывна
- Матрица , где (большое ), (маленькое ), имеет ранг
Тогда статистика при подстановке ОМП сходится к распределению с числом степеней свободы:
Здесь — это то же, что было в простом критерии согласия Пирсона, а — размерность параметра, который мы дополнительно оценили.
2.5. Пример: семьи с двумя детьми
Данные: семей с двумя детьми. Среди них:
- пар — два мальчика
- пар — две девочки (в восстановленных данных , в записи прозвучало с уточнением «по две девочки»)
- пар — один мальчик и одна девочка ()
Вопрос: верно ли, что количество мальчиков в таких семьях можно считать случайной величиной с биномиальным распределением с соответствующими параметрами?
Тип гипотезы: сложная (надо оценить параметр ).
Размерность параметра: .
ОМП для биномиального распределения: выборочное среднее, делённое пополам:
то есть нули умножаем на количество нулей, единицы на количество единичек, двойки на количество двоек, и делим на .
Степени свободы для :
- Простой критерий дал бы
- Учитывая оценку :
Результат: p-value — существенно больше типичных уровней значимости, нулевая гипотеза принимается.
Замечание о коде: иногда библиотечный код эволюционирует, и в новых версиях нужно писать иначе, чем раньше. Этот пример будет более детально разобран в следующий раз.
3. Критерий однородности
3.1. Постановка задачи
Имеется независимых выборок. Чтобы задача об однородности была содержательной, предполагаем, что величины в каждой из выборок принимают одинаковые значения.
Пример некорректной постановки: если выборка 1 — это «мальчик/девочка», а выборка 2 — это «средний балл», то задача о проверке однородности вряд ли будет содержательной.
Обозначения:
- Значения, которые могут принимать величины: от до
- — вектор вероятностей для -й выборки
- — объём -й выборки
- — количество значений типа в -й выборке
3.2. Гипотезы
(назовём это общее значение — это просто обозначение, удобное для формулы)
3.3. Статистика критерия
Критерий однородности — это модификация критерия согласия Пирсона.
где локальный :
Поскольку в нулевой гипотезе все вероятности равны, в формуле стоит общее .
3.4. Оценка
Проблема: конкретное значение нам неизвестно.
Решение: оцениваем методом максимального правдоподобия:
То есть берём суммарное количество элементов типа по всем выборкам и делим на общий объём .
3.5. Распределение статистики и степени свободы
Шаг 1. Предположим на секунду, что известно и фиксировано. Тогда:
- Локальный имеет степень свободы
- Поскольку выборки независимы, степени свободы складываются (по формальному определению как суммы квадратов гауссовских случайных величин)
- Получаем: степеней свободы
Шаг 2. Вспоминаем, что на самом деле неизвестно, и мы его оценили. От количества степеней свободы нужно отнять размерность вектора неизвестных параметров.
Сколько неизвестных в векторе ? Не , а (есть уравнение связи: сумма вероятностей равна ).
Итоговое количество степеней свободы:
Формула, которую несложно запомнить:
В пределе:
Критическая область: правосторонняя.
3.6. Пример: два потока абитуриентов
Постановка: два потока абитуриентов получили какие-то результаты вступительных экзаменов. Можно ли считать эти потоки одинаковыми?
Метод: критерий однородности .
Степени свободы: значения, выборки .
Результат: p-value — нулевая гипотеза принимается (потоки можно считать однородными).
4. Критерий независимости
4.1. Постановка задачи
Хотим проверить, что две случайные величины независимы.
Имеется парная выборка: .
Предположения:
- принимает значения от до
- принимает значения от до
Обозначения:
- — количество пар, где ,
- — вероятность того, что
- — вероятность того, что
- — вероятность того, что и
4.2. Гипотезы
В терминах вероятностей условие независимости:
Нулевая гипотеза:
Альтернатива:
4.3. Таблица сопряжённости (Contingency Table)
Для визуализации критерия строим таблицу:
В ячейках — количество пар с соответствующими значениями. В дополнительном столбце — суммы по строкам (), в дополнительной строке — суммы по столбцам ().
Контроль: сумма по последнему столбцу = сумма по последней строке = объём выборки .
4.4. Статистика критерия
Записываем в общем виде:
Подставляем ():
4.5. Оценки вероятностей
Проблема: и нам не даны.
Оценки (по аналогии с предыдущим критерием):
То есть берём соответствующие маргинальные суммы из таблицы сопряжённости и делим на .
4.6. Степени свободы
Шаг 1. Если и известны:
- Количество значений:
- Степеней свободы:
Шаг 2. На самом деле и неизвестны:
- Количество неизвестных в : (с учётом уравнения связи)
- Количество неизвестных в :
Итог:
Раскладываем (выносим за скобку):
Критическая область: правосторонняя (как и во всех модификациях критерия согласия Пирсона).
4.7. Зачем нам нужны степени свободы?
Степени свободы нужны для того, чтобы:
- Посчитать критическую область: для правосторонней области рассматриваем квантиль уровня распределения , а это распределение задаётся именно числом степеней свободы.
- Посчитать p-value: — функция распределения тоже зависит от количества степеней свободы.
4.8. Пример: вакцина и здоровье (данные о болезни)
В коде использована готовая реализация, которая считает таблицу сопряжённости автоматически.
Результат:
- Статистика
- p-value очень маленький
Вывод: гипотеза независимости отвергается можно говорить о том, что вакцина влияет на здоровье.
Замечание (тизер): в примере с вакцинами интереснее доказать не просто, что вакцина влияет, а что она влияет в положительную сторону. Критерий можно соответствующим образом модифицировать. Это будет рассмотрено в следующих лекциях.