Карточки Anki
Скачайте колоды для интервального повторения
Лекция 11: Линейная регрессия. Метод наименьших квадратов. Теорема Гаусса–Маркова
Введение
Сегодня начинается разговор про линейные модели, в частности — про линейную регрессию. Многие уже сталкивались с линейной регрессией и методом наименьших квадратов в других контекстах. Оказывается, эту, казалось бы, простую модель можно рассмотреть и со статистической точки зрения, чем мы и займёмся.
Постановка задачи
Рассмотрим модель в матричном виде:
Раскроем смысл каждого объекта.
Матрица переменных
— это матрица с вещественными коэффициентами. Это матрица переменных, где:
- — количество наблюдений, доступных нам;
- — количество переменных.
При этом воспринимается как не случайная величина — это какой-то конкретный детерминированный набор.
Вектор коэффициентов
— неизвестный вектор коэффициентов (вектор из компонент).
Ошибка
— это ошибка, поскольку идеальная линейная зависимость встречается редко. Ошибка воспринимается как случайная величина.
— это вектор длины :
где соответствует -му наблюдению.
Предположения на ошибку
На ошибку накладываются следующие предположения:
Нулевое математическое ожидание:
То есть в среднем ошибка равна нулю — это означает, что модель «более-менее адекватная».
Некоррелированность (но не независимость!):
На интуитивном уровне — мы независимо наблюдаем и -ю, и -ю строчку. Замечание: студент предложил предположение независимости и одинаковой распределённости, но Иван Александрович уточнил, что независимость пока не предполагается — только некоррелированность.
Гомоскедастичность — одинаковые дисперсии у ошибок:
Слово гомоскедастичность означает, что дисперсии у ошибок одинаковые. При этом неизвестна.
Вектор наблюдений
— наблюдение зависимой переменной.
Глобальная цель
Цель — «оценить» вектор коэффициентов и величину (которая называется остаточная дисперсия).
Слово «оценить» написано в кавычках, потому что:
- Можно дать точечную оценку;
- Можно построить доверительный интервал;
- Можно проверять гипотезы.
То есть можно решать всякие разные статистические задачи касательно и .
Пример: цена недвижимости
Допустим, рассматриваем цену недвижимости. Цена недвижимости (это ) может зависеть от разных факторов:
- расстояние от центра города;
- расстояние до ближайшего метро;
- и так далее.
Эти переменные образуют матрицу :
- Первая строчка — значение переменных для первого наблюдения;
- Вторая строчка — для второго наблюдения; и т. д.
Например, столбец — это flat\_price (). Переменные:
distance\_to\_center: ;distance\_to\_nearest\_subway: ;- и т. д.
Предполагаем, что цена линейно зависит от факторов:
Грубо говоря, — это значимость (коэффициент) при соответствующей переменной. Цель — оценить эти коэффициенты.
Замечание про свободный коэффициент
Часто в линейных моделях фигурирует свободный коэффициент . Однако его введение не умаляет общности записи. Если ввести , то это частный случай рассмотренной ситуации:
— то есть мы добавляем фиктивную переменную, равную единице для всех наблюдений. Поэтому общий вид покрывает и случай со свободным членом.
Вспомогательная матрица
Введём матрицу:
На что она похожа? Это похоже на «ковариацию» между переменными (в кавычках!).
Действительно, строчка матрицы — это столбец переменной. Если поделить на , то получится почти выборочная ковариация. Формально это не совсем ковариация, но нечто, очень сильно напоминающее её. На интуитивном уровне про матрицу можно думать как про вариацию между переменными.
Свойства матрицы
- — матрица по построению.
- Предполагаем: .
Это означает, что переменные линейно независимы. В контексте регрессионного анализа это называется отсутствие мультиколлинеарности.
⟺ переменные линейно независимы ⟺ отсутствует мультиколлинеарность.
Также предполагаем, что количество наблюдений существенно больше количества переменных: .
Оценка наименьших квадратов
Рассмотрим квадратическую ошибку:
Или в матричном виде:
Оценка наименьших квадратов — это оценка, которая минимизирует квадратическую ошибку:
Утверждение: формула для
В рамках наших предположений можно написать точную формулу:
Доказательство
Обычно доказательство ведётся через дифференцирование по и приравнивание градиента к нулю. Однако докажем «в лоб» — по ходу доказательства получим важное соотношение, которое будет использовано в дальнейшем.
Рассмотрим , где — некоторое приращение. Распишем:
Сгруппируем так:
Раскрываем скобки:
Анализ перекрёстных членов
Распишем , подставляя :
Поскольку и обратима (по предположению о ранге):
Поэтому:
Аналогично второй перекрёстный член:
Итоговое соотношение
Таким образом:
Заметим, что — скалярное произведение вектора на себя.
Поскольку , матрица не вырождена, значит, она строго положительно определена. Это означает: если , то , то есть:
Тем самым доказано, что действительно является минимумом. ∎
Важное соотношение, полученное по ходу доказательства
Если положить , , то , и мы получили:
Это соотношение будет использоваться в дальнейших выкладках.
Практическое замечание
С вычислительной точки зрения формула не самая удобная: нужно обращать матрицы, перемножать их. На практике обычно используются численные методы:
- оптимизация исходной функции ошибок;
- численное решение уравнения градиент = 0.
Теорема Гаусса–Маркова
Это фундаментальная теорема в рамках линейных моделей. Традиционно она формулируется для самой оценки наименьших квадратов, но здесь рассмотрим более общее утверждение.
Постановка
Рассмотрим линейную функцию от вектора коэффициентов:
где — матрица , , .
Если взять (единичная матрица), получим теорему Гаусса–Маркова для обычной оценки наименьших квадратов.
Введём оценку:
Зачем нужно ?
В дальнейшем будут проверяться гипотезы о векторе при линейных ограничениях. Соотношение как раз задаёт линейное ограничение. В качестве нулевой гипотезы стат-теста будет выступать предположение, что удовлетворяет каким-то линейным ограничениям.
Формулировка
При выполнении всех предположений (некоррелированность ошибок, нулевое мат. ожидание, гомоскедастичность):
(а) — несмещённая оценка для :
(б) Матрица ковариаций , и — оптимальная оценка для в классе линейных по несмещённых оценок.
Доказательство (а): несмещённость
, , — константы, выносим за знак мат. ожидания:
(поскольку , а — константа). Учитывая :
Доказательство (б): матрица ковариаций
Замечание (вопрос студента): в одномерном случае , но в многомерном случае матрица ковариаций — это . Это именно матрица ковариаций, а не дисперсия в квадрате, потому что — это случайный вектор (многомерная величина).
Считаем :
Симметрия : симметрична (), значит, тоже симметрична. Поэтому .
Считаем :
— константа, сдвиг на матрицу ковариаций не влияет (аналогично одномерному случаю, где ):
Поскольку компоненты некоррелированы и имеют одинаковую дисперсию :
Подставляем:
Итого:
Введём обозначение:
(к этому обозначению вернёмся позже).
Доказательство (б): оптимальность
Напоминание: критерий оптимальности
Для несмещённых оценок: оценка оптимальна, если у неё минимальная дисперсия. В многомерном случае оптимизируется:
Можно показать, что:
где — след матрицы (сумма диагональных элементов), а .
Это обобщение одномерной формулы .
В нашем случае оценка несмещённая, поэтому — нужно минимизировать .
Шаг A: произвольная линейная несмещённая оценка
Пусть — произвольная линейная по несмещённая оценка для :
С другой стороны:
Поскольку , получаем для любого . Отсюда:
Шаг B: переобозначение
Прибавим и вычтем :
Введём . Тогда:
Дополнительное соотношение
Из домножим обе части на справа… нет, у нас уже . Подставим :
Отсюда:
Транспонируя: .
Шаг C: матрица ковариаций для
Распишем , подставляя :
Раскрываем:
Используем и — средние два слагаемых обнуляются:
Финальный шаг: оптимизация следа
Получили:
Считаем след:
(диагональный элемент — это -я строка, скалярно умноженная на саму себя, то есть сумма квадратов её элементов).
Минимум суммы квадратов достигается при для всех , то есть . А это в точности означает, что — то есть, что .
Таким образом, оценка наименьших квадратов оптимальна в классе линейных несмещённых оценок. ∎
Точечная оценка для
Найдём несмещённую оценку для остаточной дисперсии .
Шаг 1: вычислим
Поскольку :
Используем:
Итого:
Шаг 2: вычислим
Используем выведенное ранее соотношение:
(подставили , , , но из-за симметрии знак не важен).
Расписываем по компонентам:
По линейности мат. ожидания (и поскольку — несмещённость):
Замечание о матрице ковариаций
В теореме Гаусса–Маркова матрица ковариаций равна . Подставляя , получаем:
Поэтому .
Продолжение вычислений
Используя симметрию : , и заметим:
(строка матрицы умножается на столбец — это диагональный элемент произведения ).
Итого:
Шаг 3: окончательная формула
Из шагов 1 и 2:
Откуда:
Таким образом, несмещённая оценка остаточной дисперсии:
Аналогия с выборочной дисперсией
Можно провести параллель с обычной выборочной дисперсией. Когда мы считали выборочную дисперсию, делённую на , она оказывалась смещённой; чтобы сделать её несмещённой, мы делили на .
Здесь аналогично: если бы мы делили квадратическую ошибку на , оценка была бы смещённой. А деление на (разность между количеством наблюдений и количеством переменных) даёт несмещённую оценку .
Анонс следующей лекции
Сегодня были рассмотрены точечные оценки для и . В следующий раз будут рассмотрены:
- Интервальное оценивание (доверительные интервалы);
- Проверка различных статистических гипотез.