Карточки Anki
Скачайте колоды для интервального повторения
Лекция 10: Статистические тесты
1. Критерий на коэффициент корреляции Пирсона
Постановка задачи
Пусть имеется парная выборка:
При условии: выборка пришла из двумерного нормального (гауссовского) распределения.
Гипотезы
- Нулевая гипотеза : , что эквивалентно (теоретический коэффициент корреляции равен нулю).
- Альтернативная гипотеза : , или (альтернативу можно специфицировать).
Статистика критерия
где — выборочный коэффициент корреляции Пирсона:
Распределение статистики
При условии истинности статистика имеет распределение Стьюдента с степенями свободы.
Замечание Ивана Александровича: формальный вывод этого факта довольно громоздкий, поэтому на лекции даётся только формулировка.
Важное замечание о связи с независимостью
Вспомним общее соотношение:
- Из независимости некоррелированность (всегда верно).
- Обратная импликация в общем случае неверна.
Однако для компонент гауссовского вектора обратная стрелочка работает: некоррелированность независимость. Это один из специальных случаев.
Следствия:
- Если — гауссовский вектор, то критерий проверяет независимость (по-честному).
- Гипотетически тест Стьюдента можно использовать и для негауссовской выборки, но тогда проверяется только некоррелированность (более слабое условие).
- Для негауссовских выборок критерий лучше использовать при достаточно больших , поскольку при больших распределение Стьюдента становится близким к стандартному нормальному (вспомните формальное определение распределения Стьюдента).
Уточнение: «достаточно большое » относится именно ко второму случаю (негауссовская выборка). Если выборка гауссовская — критерий работает при любом .
2. Критерий квантилей
Постановка задачи
Заданы:
- Числа
- Числа
Выборка пришла из непрерывного распределения.
Гипотезы
Нулевая гипотеза :
То есть проверяется, что — квантиль порядка для всех .
Альтернативная гипотеза : отрицание .
Замечание: в общем случае не обязательно является отрицанием , но в этой конкретной ситуации это так.
Дополнительные обозначения
Введём:
- ,
- ,
Разобьём вещественную ось на полуинтервалы:
Введём приращения вероятностей:
Эквивалентная формулировка
Система равносильна тому, что:
То есть вероятность попадания в каждый интервал равна .
Сведение к критерию согласия Пирсона
Пусть — количество элементов выборки, попавших в промежуток . Тогда задача сводится к критерию согласия Пирсона со статистикой:
где — объём выборки.
Распределение статистики и критическая область
При условии истинности :
То есть распределение с степенями свободы (количество интервалов минус 1, как для простой гипотезы в критерии Пирсона).
Тип критической области: правосторонний (как и в критерии согласия Пирсона).
3. Критерий знаков (как частный случай критерия квантилей)
Постановка
Возьмём , . Тогда получаем критерий знаков.
Гипотеза
Проверяется:
То есть верно ли, что медиана равна заданной константе .
Статистика критерия
Поскольку у только одна степень свободы, можно думать о статистике как о квадрате стандартной гауссовской величины. Поэтому используем без квадрата:
где — количество чисел в выборке, меньших потенциальной медианы (то есть попавших в ).
Не возводим в квадрат, потому что хотим извлечь корень — рассматриваем сразу величину, сходящуюся к стандартному нормальному распределению по ЦПТ.
Распределение
При (по ЦПТ):
Альтернативы
Поскольку в пределе стандартное гауссовское распределение, альтернативы можно специфицировать:
- (двусторонняя)
- (правосторонняя)
- (левосторонняя)
Историческое замечание: ранее (в курсе) уже доказывался критерий согласия Пирсона для случая двух значений — и там получалось и , что как раз согласуется с настоящей формулировкой.
4. Применение критерия знаков к парной выборке
Постановка
Пусть имеется парная выборка:
где обе компоненты имеют непрерывные распределения.
Гипотеза
То есть и :
- независимы
- одинаково распределены
Метод
Составляем новую выборку из разностей:
Найдём при условии :
При совместная плотность есть произведение одинаковых одномерных плотностей:
Тогда:
Почему ? При перемене местами и подынтегральная функция не меняется. А плоскость разбивается на две равные части, и интеграл по всей плоскости равен 1. Значит, по симметрии каждый интеграл равен .
Аналогично .
Вывод
Это означает, что 0 является медианой распределения .
Поэтому к новой выборке применяем критерий знаков с .
Важное замечание: критерий знаков для такой задачи годится для предварительного анализа (по словам Ивана Александровича, неформально).
5. Ранговые критерии
Понятие ранга
Ранг элемента выборки — это его индекс в вариационном ряде (отсортированная по возрастанию выборка).
Проблема повторов
Если в выборке есть повторяющиеся значения, ранг можно определить разными способами:
Пример: выборка .
Вариационный ряд: .
Возможные подходы определения ранга:
- Минимальный ранг — берётся минимальный из возможных рангов для группы повторов.
- Ранг тройки = 5, ранг единицы = 1, ранг двойки = 4.
- Максимальный ранг.
- Ранг тройки = 6, ранг единицы = 3, ранг двойки = 4.
- Средний (среднеарифметический) ранг.
- Ранг тройки = 5.5, ранг единицы = 2, ранг двойки = 4.
- Различие между одинаковыми элементами — присваиваем разным «единичкам» разные ранги в порядке появления:
- Получится, например: для исходной .
Практическое замечание: при использовании рангового стат-теста нужно внимательно смотреть, как авторы/разработчики поступают с дублированными рангами. Дальнейшее изложение предполагает, что все ранги уникальны.
6. Критерий Уилкоксона / Манна–Уитни (Wilcoxon–Mann–Whitney)
Замечание: формально это два разных теста, но они очень тесно связаны (аналогично критериям Колмогорова–Смирнова), поэтому их объединяют.
Постановка
Пусть есть две независимые выборки:
(возможно, разных объёмов).
Действие: объединяем их в одну выборку (union to one sample). Пусть — ранг в объединённой выборке.
Статистика Уилкоксона
(сумма рангов первой выборки в объединённой).
Статистика Манна–Уитни
где — индикаторная функция (1, если ; 0 иначе).
Связь между статистиками
Эти две статистики связаны линейно:
Это соотношение даётся без доказательства («просто так работает»).
Гипотезы (для критерия Манна–Уитни)
Нулевая гипотеза : выборки однородны — распределение совпадает с распределением .
Математическое ожидание
Если верна (то есть и имеют одинаковое распределение, и обсуждавшимся выше способом), то:
Отсюда:
Обозначим . При : .
Дисперсия
Альтернативы
Альтернативы формулируются через или, эквивалентно, через медиану разности:
Это эквивалентно условию (то есть сдвиг распределения).
Важная ремарка: критерий Манна–Уитни хорошо ловит именно сдвиги распределений.
Распределение статистики
- При малых и — критическая область табулирована.
- При больших и :
7. Коэффициент корреляции Спирмена
Постановка
Парная выборка .
Сопоставим каждому элементу его ранг в своей выборке:
- — ранг среди
- — ранг среди
Определение
Коэффициент корреляции Спирмена — это выборочный коэффициент корреляции Пирсона между рангами:
Замечание: для уникальных рангов существуют упрощённые формулы для подсчёта (см. Ивченко–Медведев, Кобзарь).
Гипотезы
- : корреляция равна 0
- : корреляция , или
В зависимости от альтернативы выбирается тип критической области (двусторонняя, правосторонняя, левосторонняя).
Распределение статистики
- При малых — табулировано.
- При больших при условии :
8. Коэффициент корреляции Кендалла
Подготовка
Имеется последовательность пар рангов .
Шаг 1. Рассмотрим эти пары как датафрейм с двумя столбцами и отсортируем по первому атрибуту. После сортировки первый столбец становится , а второй столбец — некоторая перестановка .
Определение
Коэффициент корреляции Кендалла:
где — функция знака:
Интуиция
После сортировки по первому ключу мы смотрим на вторую строку и считаем количество инверсий (точнее, разность между конкордантными и дисконкордантными парами).
Предельные случаи
| Ситуация после сортировки | Кол-во инверсий | |
|---|---|---|
| Полностью отсортировано по возрастанию | 0 | |
| Полностью отсортировано по убыванию | (максимум) | |
| Перемешано случайно | около среднего | около 0 |
Смысл: чем ближе к 0, тем более «случайной» (независимой) считается выборка. Количество инверсий — это мера случайности, мера отсутствия зависимости.
Распределение
- При малых — табулировано.
- При больших — нормальная аппроксимация:
Гипотезы
- : корреляции нет
- : корреляция , или
Замечание о тестах Спирмена и Кендалла
Оба теста (Спирмена и Кендалла) хорошо ловят монотонную зависимость.
Предостережение Ивана Александровича: будут показаны примеры в notebook, где тест принимает (отсутствие зависимости), но выборки на самом деле зависимы (немонотонная зависимость).
9. Критерий инверсий
Зачем нужен этот критерий
До сих пор все рассмотренные тесты предполагали работу с моделью простейшей выборки (одной или нескольких). Но это сильное предположение — далеко не все выборки простейшие. Есть тесты, которые проверяют согласованность данных с моделью простейшей выборки.
Что такое модель простейшей выборки
Случайные величины независимы и одинаково распределены (i.i.d.).
Постановка
Пусть имеются — непрерывные случайные величины (это важное предположение).
Гипотезы
: величины :
- (а) независимы
- (б) одинаково распределены
То есть совместная функция распределения есть произведение одномерных и при этом они одинаковые. Иными словами, числа соответствуют модели простейшей выборки.
: .
Определение инверсии
Пара при образует инверсию, если .
Иными словами, в вариационном ряду предшествует .
Статистика
- — количество инверсий для (т.е. число пар при , образующих инверсию).
- — количество инверсий для .
- — количество инверсий для .
Статистика теста:
— общее количество инверсий во всей выборке.
Идея критерия
Если верна, то:
То есть все возможные расстановки равновероятны.
Предельные случаи
| Ситуация | Количество инверсий |
|---|---|
| Выборка отсортирована по возрастанию | 0 |
| Выборка отсортирована по убыванию | |
| Перемешана случайно | около среднего |
Если числа полностью отсортированы — индикатор того, что они вряд ли случайны. Если перемешаны — скорее случайны.
Распределение
При малых — распределение табулировано.
При больших — нормальная аппроксимация:
Уточнение: мат. ожидание — это ровно половина максимального количества инверсий.
Откуда формулы: во-первых, независимы между собой; во-вторых, формулы можно получить через производящие функции (тесно связанные с характеристическими функциями). Подробный вывод см. в Ивченко–Медведев.
Заключительные замечания
Сводка рассмотренных тестов на лекции
| Тест | Что проверяет | Ключевое предположение |
|---|---|---|
| Критерий Пирсона (на корреляцию) | гауссовский вектор | |
| Критерий квантилей | непрерывное распределение | |
| Критерий знаков | медиана | непрерывное распределение |
| Манна–Уитни / Уилкоксона | однородность двух выборок | независимость выборок, ловит сдвиг |
| Спирмена | независимость в парной выборке | монотонная зависимость |
| Кендалла | независимость в парной выборке | монотонная зависимость |
| Критерий инверсий | модель простейшей выборки (i.i.d.) | непрерывные случайные величины |
Главная мысль Ивана Александровича
Хотя тестов было рассмотрено много, на самом деле это лишь малая часть. Самое важное на этом этапе — уловить общий принцип работы стат-теста. Тогда при необходимости в конкретной задаче вы сможете самостоятельно подобрать подходящий тест и разобраться с ним.
Что дальше
Со следующего занятия начнётся новая большая тема — линейные статистические модели. Метод наименьших квадратов и линейная регрессия будут рассмотрены со статистической точки зрения.