Карточки Anki
Скачайте колоды для интервального повторения
Лекция 13. Линейные модели. Однофакторный дисперсионный анализ, метод главных компонент, взвешенный МНК
Организационная часть
- На прошлой лекции была допущена опечатка в формуле статистики, выражающейся через коэффициент детерминации .
- Для рассматриваемой модели верная формула:
- Ранее коэффициент находили вручную для простого случая (двух переменных), затем переходили к более общим случаям.
1. Однофакторный дисперсионный анализ (One-way ANOVA)
1.1. Постановка задачи
В классической линейной регрессии переменные были количественными. Однако часто встречаются ситуации, когда переменная факторная (категориальная).
Категориальная переменная — переменная, которая может принимать конечное число различных значений (уровней фактора).
Примеры:
- Буква в паспорте (М или Ж)
- Номер курса (1, 2, 3, 4)
- Специальность
Для каждого значения категориальной переменной у нас есть некий набор наблюдений.
1.2. Формальная модель
Рассмотрим модель вида:
где:
- — ошибки, , независимы
- — уровни фактора (значения категориальной переменной)
- — индекс наблюдения внутри группы
- — количество наблюдений на уровне
- — среднее влияние фактора на уровне
Объём выборки:
Замечание: для каждой группы количество наблюдений может быть разным.
1.3. Гипотезы
Хотим проверить, влияет ли фактор на показатель.
Нулевая гипотеза (фактор не влияет):
То есть среднее влияние не зависит от значения категориальной переменной.
Альтернативная гипотеза:
(существуют такие, что )
1.4. Кодирование категориальной переменной
Один из самых простых способов кодирования — сопоставление значениям категориальной переменной векторов из нулей и единиц (one-hot encoding):
После такого кодирования модель сводится к общей модели линейной регрессии:
И гипотезы такого типа можно проверять с помощью F-теста.
1.5. F-статистика в общем виде
где — количество степеней свободы.
Можно вывести из общего вида линейной регрессии, однако вывод получится громоздким. Решим задачу иначе — будет понятно, почему фигурирует слово «дисперсионный».
1.6. Вывод F-статистики через дисперсии
Разминка: безусловный минимум
Рассмотрим:
Минимизируем эту функцию. Сумма разбивается на внешнюю (по ) и внутреннюю (по ). При различных переменные независимы, поэтому каждую локальную сумму можно оптимизировать отдельно:
Где достигается минимум?
Выражение — это с точностью до множителя матожидание квадрата разности. Минимум достигается при среднем:
Если бы стоял модуль вместо квадрата, ответом была бы медиана.
Внутригрупповая дисперсия
Подставив в , получаем:
Это внутригрупповая дисперсия (within-group variance) — индекс от within.
Степени свободы (безусловный случай)
Общая формула:
(от количества наблюдений отнимаем количество групп)
Нередко все группы одинакового размера: . Тогда:
Минимум при условии
При истинности все равны общему :
Минимум достигается при общем выборочном среднем:
Степени свободы при
Количество линейно независимых ограничений в гипотезе
равно (а не общее число попарных уравнений, поскольку из и следует ).
1.7. Разложение дисперсии
Введём обозначения:
- — общая дисперсия (когда подставлено )
- — внутригрупповая дисперсия
- — межгрупповая дисперсия (between):
Разложение:
Идейное обоснование (через формулу полного матожидания)
Из теории вероятностей — формула разложения дисперсии:
- соответствует — дисперсия внутри групп, усреднённая;
- соответствует — разброс групповых средних относительно общего.
Действительно:
- при фиксированной группе — внутренняя сумма в ;
- внешняя сумма по — это операция взятия матожидания;
- , а матожидание этой величины равно .
1.8. Итоговая F-статистика
При условии истинности :
(распределение Фишера со степенями свободы и ).
Тест правосторонний — это частный случай общего F-критерия, рассмотренного на прошлой лекции.
1.9. Обобщения
- Two-way ANOVA — две факторные переменные;
- Многофакторный дисперсионный анализ — больше двух факторов;
- ANCOVA (ковариационный анализ) — есть и числовые, и категориальные переменные.
Соответствующие соотношения становятся гораздо более громоздкими; реализованы в стат-пакетах.
2. Метод главных компонент (PCA)
2.1. Мотивация
В модели линейной регрессии предполагалось, что не вырождена (отсутствие мультиколлинеарности — линейная независимость переменных).
Две проблемы:
- Чисто гипотетически матрица может оказаться вырожденной — переменные линейно зависимы. Одна выражается через другие.
- При вычислении оценки наименьших квадратов нужно обращать . С численной точки зрения существуют показатели, от которых зависит скорость сходимости алгоритмов обращения. Может оказаться, что матрица обратима формально, но обращается очень медленно — это означает, что переменные почти линейно зависимы.
Подробнее об этом — в курсе численных методов на 3-м курсе.
2.2. Идея метода
Обозначим . Эта матрица:
- напоминает ковариационную матрицу;
- неотрицательно определена.
Из неотрицательной определённости:
- собственные числа неотрицательны: ;
- собственные векторы можно выбрать ортонормированными ( линейно независимых).
2.3. Спектральное разложение
где:
- — диагональная матрица собственных чисел, отсортированных по убыванию ();
- — ортонормированные собственные векторы.
Поскольку ортогональная, , поэтому:
2.4. Введение новых переменных
Вводим новые переменные:
Посчитаем :
(использовали , поскольку ортогональна).
Получили:
— это диагональная матрица.
2.5. Свойства новых переменных
Поскольку диагональна:
- новые переменные линейно независимы (некоррелированы) — недиагональные элементы нулевые;
- новые переменные отсортированы по убыванию дисперсии — на диагонали матрицы ковариаций стоят дисперсии.
В матричной форме:
Каждый получается умножением старых переменных на -й столбец матрицы :
- — самая большая дисперсия;
- — поменьше;
- и т.д.
2.6. Снижение размерности
Идея: дисперсия — мера разброса от матожидания. Если у переменной маленькая дисперсия, она почти не изменяется, фактически ведёт себя как константа — особой роли в модели не играет.
Алгоритм: оставляем только переменные с большой дисперсией; остальные отбрасываем.
Критерии остановки
- Порог по отдельной дисперсии: оставляем , для которых (порог).
- Кумулятивный порог: суммируем по убыванию, пока сумма не достигнет заданного порога.
2.7. Что получили
С помощью PCA борются с:
- некоррелированностью (точнее, с проблемой мультиколлинеарности — делаем переменные некоррелированными);
- большим количеством переменных — снижаем размерность.
3. Взвешенный метод наименьших квадратов (взвешенный МНК)
3.1. Мотивация
Ранее предполагали, что дисперсии у ошибок одинаковые (гомоскедастичность). Однако дисперсии могут различаться — модель гетероскедастичная.
Пусть теперь матрица ковариаций для — диагональная матрица с разными элементами:
Обычная оценка наименьших квадратов уже не будет оптимальной.
3.2. Новая функция ошибок
Введём взвешенную сумму квадратов:
(каждое слагаемое умножается на — учитываем веса).
3.3. Поиск оптимального
Дифференцируем по :
Приравниваем к нулю:
3.4. Матричная запись
Введём диагональную матрицу весов:
Полученные уравнения переписываются в матричном виде:
Это упражнение на вспоминание определения умножения матриц.
Отсюда:
3.5. Свойства оценки
- Является наилучшей несмещённой линейной оценкой (доказывается аналогично теореме Гаусса—Маркова).
- При одинаковых дисперсиях () формула превращается в обычную оценку МНК: , множители и сокращаются:
3.6. Что делать с неизвестными дисперсиями?
В формуле использованы дисперсии , но они неизвестны. Вместо них можно подставить их оценки — при некоторых условиях формулы будут корректно работать.
Подробнее об этом сейчас не углубляемся.
3.7. Когда применять
Взвешенный МНК работает, когда модель не является гомоскедастичной.
4. Замечание о проверке предположений модели
В стандартной линейной регрессии предполагали:
- ошибки распределены нормально;
- ошибки не коррелированы;
- гомоскедастичность (одинаковые дисперсии).
Для проверки этих предположений существуют специально предназначенные стат-тесты:
- тесты на гомоскедастичность;
- тесты на отсутствие корреляции ошибок;
- тесты на нормальность распределения.
В рамках курса подробно не разбираем; кому интересно — можно изучить самостоятельно.
5. Анонс следующих лекций
- Тест отношения правдоподобия (идейно новая вещь)
- Различные модификации линейных моделей