Карточки Anki
Скачайте колоды для интервального повторения
Лекция 14: Обобщённые линейные модели и критерий отношения правдоподобия
Введение
В предыдущих линейных моделях, которые рассматривались, выходная переменная была количественной. Однако выходная переменная не всегда количественная — она может быть и категориальной, в частности, бинарной.
Сегодня рассматриваются:
- Один из простейших алгоритмов бинарной классификации — логистическая регрессия (с точки зрения статистики)
- Регрессия Пуассона
- Критерий отношения правдоподобия (простой и общий случай)
- Лемма Неймана-Пирсона
- Проверка значимости моделей
1. Логистическая регрессия
1.1. Постановка задачи
Вход:
- — матрица переменных (как и ранее)
- — вектор наблюдений зависимой переменной
Особенность: принимает только два значения: или .
То есть, если до сей поры мог принимать любое количество значений, то теперь — вектор-столбец, в каждой компоненте которого записано или .
1.2. Сигмоида
Для построения модели предлагается рассмотреть функцию:
Эта функция называется сигмоидой.
Свойства графика сигмоиды:
- При :
- При :
- В нуле:
1.3. Модель логистической регрессии
Будем воспринимать как реализацию бернуллиевской случайной величины:
То есть — это бернуллиевская случайная величина с параметром успеха (вероятностью единички), равным сигмоиде от линейной функции.
Цель: оценить коэффициенты .
1.4. Оценка параметров методом максимального правдоподобия
Найдём точечную оценку параметров с помощью метода максимального правдоподобия (ММП).
Предполагаем, что наблюдения независимы. Тогда функция правдоподобия:
Берём минус логарифм функции правдоподобия:
Для нахождения оценки максимального правдоподобия нужно максимизировать функцию правдоподобия, то есть минимизировать минус логарифм.
Важно: аналитического решения здесь нет. Оптимизация проводится численными методами (например, градиентным спуском).
1.5. Связь с машинным обучением
Возможно, в других курсах при рассмотрении простейших алгоритмов бинарной классификации упомянут модель логистической регрессии и связанную с ней функцию потерь (loss function).
Эта стандартная функция потерь есть не что иное, как минус логарифм функции правдоподобия для модели логистической регрессии.
1.6. Свойства оценок
Поскольку оценки получены ММП, они являются асимптотически нормальными:
Это позволяет:
- Строить доверительные интервалы для
- Проверять гипотезы о значениях
Проверка значимости всей модели обсуждается позже.
2. Регрессия Пуассона
2.1. Постановка задачи
Вход: такой же, как раньше, но — категориальная переменная, принимающая значения
2.2. Модель
Случайную величину воспринимаем как пуассоновскую с параметром:
2.3. Обобщённые линейные модели
До этого рассматривались линейные модели: .
Здесь рассматриваются так называемые обобщённые линейные модели:
- В предыдущем случае: бернуллиевская величина от сигмоиды от линейной функции
- В пуассоновской регрессии: пуассоновская величина (от экспоненты) от линейной функции
2.4. Оценка параметров
Коэффициенты оцениваются точно так же — методом максимального правдоподобия:
- Записываем логарифм функции правдоподобия
- Находим максимальное значение
Аналитического решения нет — только численное решение.
Оценки являются асимптотически нормальными, поэтому:
- Можно строить доверительные интервалы
- Можно проверять гипотезы
3. Критерий отношения правдоподобия (простой случай)
3.1. Простые гипотезы
Рассмотрим случай простых гипотез:
где и — непрерывны.
Что такое ? У нас есть простая выборка из какого-то распределения, и мы хотим проверить эти две гипотезы.
3.2. Статистика отношения правдоподобия
Введём функцию:
— правдоподобие при первой гипотезе делим на правдоподобие при нулевой.
Решающее правило:
Логика: если , значит правдоподобие при больше, чем при , поэтому принимаем .
Вопрос: из каких соображений выбирать пороговую константу ?
3.3. Выбор константы C
Рассмотрим функцию:
Какое событие она описывает?
Когда , мы принимаем . При условии истинности это ошибка первого рода.
То есть — это вероятность ошибки первого рода.
Свойства:
Рассмотрим ещё:
С другой стороны, это интеграл от плотности:
По условию , поэтому:
Откуда:
В частности, .
3.4. Подбор C под заданный уровень значимости
Предположение: функция непрерывна.
Тогда для любого существует такое, что:
Таким образом, можно подобрать порог так, чтобы вероятность ошибки первого рода в точности равнялась .
4. Лемма Неймана-Пирсона
4.1. Формулировка
Лемма Неймана-Пирсона. Пусть выполнено условие выше. Тогда критерий отношения правдоподобия является оптимальным, то есть имеет минимальную вероятность ошибки второго рода среди всех тестов, которые проверяют данные гипотезы и имеют вероятность ошибки первого рода .
Хотя это и лемма, на самом деле это фундаментальное утверждение.
4.2. Доказательство
Обозначения: рассмотрим другой тест с вероятностью ошибки первого рода . Пусть:
- — статистика этого теста
- — область принятия
- — критическая область
Выкладка №1
Рассмотрим вероятность:
Обозначим .
Тогда:
(по построению ).
С другой стороны, у второго теста вероятность ошибки первого рода тоже :
Итого получаем:
Выкладка №2
Теперь посчитаем при условии :
Для этого множества выполнено , поэтому:
Используя выкладку №1:
Анализ события
Для из этого множества , но не выполнено , т.е. .
Это означает: .
Воспользуемся этим неравенством:
Завершение доказательства
Прибавим к обеим частям :
То есть мощность критерия отношения правдоподобия больше мощности любого другого теста. А мощность — это вероятность ошибки второго рода.
5. Пример: проверка простых гипотез о среднем нормального закона
5.1. Постановка
- : выборка из
- : выборка из
5.2. Вычисление отношения правдоподобия
После сокращения:
5.3. Преобразование неравенства
Берём логарифм:
Обозначим :
5.4. Распределение тестовой статистики
При условии :
При условии :
5.5. Условие на вероятность ошибки первого рода
где — функция распределения стандартного нормального закона.
Дальше остаётся разрешить уравнение относительно .
5.6. Геометрическая интерпретация
Имеем две гауссианы:
- Гауссиана №1 — плотность (при )
- Гауссиана №2 — плотность (при )
Отметим на оси константу (обозначим её через две волны ).
Вероятность ошибки первого рода ():
- Это ситуация: опровергаем , но она верна
- На графике: площадь под первой гауссианой справа от черты
Вероятность ошибки второго рода ():
- Это ситуация: принимаем , но верна
- На графике: площадь под второй гауссианой слева от черты
5.7. Анализ trade-off
Если параметр варьировать:
- Двигаем вправо: уменьшается, увеличивается
- Двигаем влево: увеличивается, уменьшается
Лемма Неймана-Пирсона утверждает: если в критерии отношения правдоподобия для простых гипотез подобрать константу так, чтобы в точности равнялась заданной величине, то этот критерий оптимален в плане минимизации .
6. Общий критерий отношения правдоподобия
6.1. Постановка (сложные параметрические гипотезы)
Пусть имеется параметрическая гипотеза:
То есть — некоторое подмножество параметров, а альтернатива — его дополнение.
6.2. Статистика
Здесь, в отличие от случая простых гипотез, нужна оптимизация:
- Числитель: условная оптимизация ()
- Знаменатель: безусловная оптимизация по всему
6.3. Асимптотическое распределение
Предположение: оценки максимального правдоподобия асимптотически нормальные (это выполняется в рамках условий регулярности).
Тогда:
где:
- — размерность (всего пространства параметров)
- — размерность
6.4. Почему именно ? (объяснение «на пальцах»)
- Минус: в классическом критерии отношения правдоподобия было «наоборот» — наверху правдоподобие при , внизу при . Минус условно «переворачивает» дробь.
- Логарифм: упрощает работу с произведениями
- Двойка: , а логарифм произведения это сумма. Получается похоже на сумму квадратов — отсюда и -распределение.
7. Применение: проверка значимости логистической регрессии
7.1. Постановка
Возвращаемся к модели логистической регрессии:
Что значит проверить значимость модели? Хотим выяснить, действительно ли переменные влияют на .
7.2. Гипотезы
Нулевая гипотеза (по умолчанию: переменные не влияют):
В этом случае остаётся только свободный коэффициент , поэтому размерность равна 1.
Альтернативная гипотеза (формально):
7.3. Размерности
- (модель описывается параметром: )
- (остался только )
7.4. Отношение правдоподобия
По сути спрашиваем: действительно ли наша выборка — просто бернуллиевские величины, или же зависит от ?
Замечание про размерности. Вся — это все возможные значения , их штука, поэтому размерность . В все при занулены, остался только — размерность 1.
7.5. Аналогично для регрессии Пуассона
Нулевая гипотеза: все коэффициенты, кроме , равны нулю. Альтернатива — отрицание .
8. Построение критерия
Известно:
Решающее правило:
Если , то принимаем , иначе .
В терминах (знак неравенства меняется):
В качестве пороговой константы берём квантиль -распределения с степенями свободы.