Линейные модели

29.04.2026 Обновлено: 29.04.2026
автор

Лекция 13. Линейные модели. Однофакторный дисперсионный анализ, метод главных компонент, взвешенный МНК

Организационная часть

  • На прошлой лекции была допущена опечатка в формуле статистики, выражающейся через коэффициент детерминации R2R^2.
  • Для рассматриваемой модели верная формула: F=nmm1R21R2F = \frac{n-m}{m-1} \cdot \frac{R^2}{1-R^2}
  • Ранее коэффициент R2R^2 находили вручную для простого случая (двух переменных), затем переходили к более общим случаям.

1. Однофакторный дисперсионный анализ (One-way ANOVA)

1.1. Постановка задачи

В классической линейной регрессии переменные были количественными. Однако часто встречаются ситуации, когда переменная факторная (категориальная).

Категориальная переменная — переменная, которая может принимать конечное число различных значений (уровней фактора).

Примеры:

  • Буква в паспорте (М или Ж)
  • Номер курса (1, 2, 3, 4)
  • Специальность

Для каждого значения категориальной переменной у нас есть некий набор наблюдений.

1.2. Формальная модель

Рассмотрим модель вида:

yij=μi+εijy_{ij} = \mu_i + \varepsilon_{ij}

где:

  • εij\varepsilon_{ij} — ошибки, εijN(0,σ2)\varepsilon_{ij} \sim N(0, \sigma^2), независимы
  • i=1,,Ii = 1, \ldots, I — уровни фактора (значения категориальной переменной)
  • j=1,,Jij = 1, \ldots, J_i — индекс наблюдения внутри группы ii
  • JiJ_i — количество наблюдений на уровне ii
  • μi\mu_i — среднее влияние фактора на уровне ii

Объём выборки:

n=J1+J2++JIn = J_1 + J_2 + \ldots + J_I

Замечание: для каждой группы количество наблюдений может быть разным.

1.3. Гипотезы

Хотим проверить, влияет ли фактор на показатель.

Нулевая гипотеза (фактор не влияет):

H0:μ1=μ2==μIH_0: \mu_1 = \mu_2 = \ldots = \mu_I

То есть среднее влияние не зависит от значения категориальной переменной.

Альтернативная гипотеза:

H1:¬H0H_1: \neg H_0

(существуют i,ki, k такие, что μiμk\mu_i \neq \mu_k)

1.4. Кодирование категориальной переменной

Один из самых простых способов кодирования — сопоставление значениям категориальной переменной векторов из нулей и единиц (one-hot encoding):

1(1,0,0,,0)1 \to (1, 0, 0, \ldots, 0)

2(0,1,0,,0)2 \to (0, 1, 0, \ldots, 0)

\vdots

I(0,0,,0,1)I \to (0, 0, \ldots, 0, 1)

После такого кодирования модель сводится к общей модели линейной регрессии:

y=Xβ+εy = X\beta + \varepsilon

И гипотезы такого типа можно проверять с помощью F-теста.

1.5. F-статистика в общем виде

F=S^2H0S^2S^2nmkF = \frac{\hat{S}^2|_{H_0} - \hat{S}^2}{\hat{S}^2} \cdot \frac{n - m}{k}

где kk — количество степеней свободы.

Можно вывести из общего вида линейной регрессии, однако вывод получится громоздким. Решим задачу иначе — будет понятно, почему фигурирует слово «дисперсионный».

1.6. Вывод F-статистики через дисперсии

Разминка: безусловный минимум

Рассмотрим:

S2(μ)=i=1Ij=1Ji(yijμi)2S^2(\mu) = \sum_{i=1}^{I} \sum_{j=1}^{J_i} (y_{ij} - \mu_i)^2

Минимизируем эту функцию. Сумма разбивается на внешнюю (по ii) и внутреннюю (по jj). При различных ii переменные μi\mu_i независимы, поэтому каждую локальную сумму можно оптимизировать отдельно:

j=1J1(y1jμ1)2,j=1J2(y2jμ2)2,\sum_{j=1}^{J_1} (y_{1j} - \mu_1)^2, \quad \sum_{j=1}^{J_2} (y_{2j} - \mu_2)^2, \quad \ldots

Где достигается минимум?

Выражение j(yjμ)2\sum_j (y_j - \mu)^2 — это с точностью до множителя матожидание квадрата разности. Минимум достигается при среднем:

μ^i=1Jij=1Jiyij=yˉi\hat{\mu}_i = \frac{1}{J_i} \sum_{j=1}^{J_i} y_{ij} = \bar{y}_{i*}

Если бы стоял модуль вместо квадрата, ответом была бы медиана.

Внутригрупповая дисперсия

Подставив μ^i\hat{\mu}_i в S2S^2, получаем:

SW2=S2(μ^)=i=1Ij=1Ji(yijyˉi)2S^2_W = S^2(\hat{\mu}) = \sum_{i=1}^{I} \sum_{j=1}^{J_i} (y_{ij} - \bar{y}_{i*})^2

Это внутригрупповая дисперсия (within-group variance) — индекс WW от within.

Степени свободы (безусловный случай)

Общая формула:

dfW=nIdf_W = n - I

(от количества наблюдений отнимаем количество групп)

Нередко все группы одинакового размера: J1=J2==JI=JJ_1 = J_2 = \ldots = J_I = J. Тогда:

dfW=IJI=I(J1)df_W = I \cdot J - I = I(J - 1)

Минимум при условии H0H_0

При истинности H0H_0 все μi\mu_i равны общему μ\mu:

S2(μ)=i=1Ij=1Ji(yijμ)2S^2(\mu) = \sum_{i=1}^{I} \sum_{j=1}^{J_i} (y_{ij} - \mu)^2

Минимум достигается при общем выборочном среднем:

μ^H0=yˉ\hat{\mu}|_{H_0} = \bar{y}

Степени свободы при H0H_0

Количество линейно независимых ограничений в гипотезе

μ1=μ2==μI\mu_1 = \mu_2 = \ldots = \mu_I

равно I1I - 1 (а не общее число попарных уравнений, поскольку из μ1=μ2\mu_1 = \mu_2 и μ1=μ3\mu_1 = \mu_3 следует μ2=μ3\mu_2 = \mu_3).

1.7. Разложение дисперсии

Введём обозначения:

  • S2S^2 — общая дисперсия (когда подставлено yˉ\bar{y})
  • SW2S^2_W — внутригрупповая дисперсия
  • SB2S^2_B — межгрупповая дисперсия (between):
SB2=i=1IJi(yˉiyˉ)2S^2_B = \sum_{i=1}^{I} J_i (\bar{y}_{i*} - \bar{y})^2

Разложение:

S2=SW2+SB2S^2 = S^2_W + S^2_B

Идейное обоснование (через формулу полного матожидания)

Из теории вероятностей — формула разложения дисперсии:

D(Y)=E[D(YX)]+D[E(YX)]D(Y) = E[D(Y|X)] + D[E(Y|X)]
  • SW2S^2_W соответствует E[D(YX)]E[D(Y|X)] — дисперсия внутри групп, усреднённая;
  • SB2S^2_B соответствует D[E(YX)]D[E(Y|X)] — разброс групповых средних относительно общего.

Действительно:

  • D(YX)D(Y|X) при фиксированной группе — внутренняя сумма в SW2S^2_W;
  • внешняя сумма по ii — это операция взятия матожидания;
  • E(YX=i)=yˉiE(Y|X = i) = \bar{y}_{i*}, а матожидание этой величины равно yˉ\bar{y}.

1.8. Итоговая F-статистика

F=SB2/(I1)SW2/(nI)F = \frac{S^2_B / (I - 1)}{S^2_W / (n - I)}

При условии истинности H0H_0:

FF(I1,nI)F \sim F(I - 1, \, n - I)

(распределение Фишера со степенями свободы I1I-1 и nIn-I).

Тест правосторонний — это частный случай общего F-критерия, рассмотренного на прошлой лекции.

1.9. Обобщения

  • Two-way ANOVA — две факторные переменные;
  • Многофакторный дисперсионный анализ — больше двух факторов;
  • ANCOVA (ковариационный анализ) — есть и числовые, и категориальные переменные.

Соответствующие соотношения становятся гораздо более громоздкими; реализованы в стат-пакетах.


2. Метод главных компонент (PCA)

2.1. Мотивация

В модели линейной регрессии предполагалось, что XTXX^T X не вырождена (отсутствие мультиколлинеарности — линейная независимость переменных).

Две проблемы:

  1. Чисто гипотетически матрица может оказаться вырожденной — переменные линейно зависимы. Одна выражается через другие.
  2. При вычислении оценки наименьших квадратов нужно обращать XTXX^T X. С численной точки зрения существуют показатели, от которых зависит скорость сходимости алгоритмов обращения. Может оказаться, что матрица обратима формально, но обращается очень медленно — это означает, что переменные почти линейно зависимы.

Подробнее об этом — в курсе численных методов на 3-м курсе.

2.2. Идея метода

Обозначим A=XTXA = X^T X. Эта матрица:

  • напоминает ковариационную матрицу;
  • неотрицательно определена.

Из неотрицательной определённости:

  • собственные числа неотрицательны: λi0\lambda_i \geq 0;
  • собственные векторы можно выбрать ортонормированными (nn линейно независимых).

2.3. Спектральное разложение

Λ=UTAU\Lambda = U^T A U

где:

  • Λ=diag(λ1,λ2,,λn)\Lambda = \text{diag}(\lambda_1, \lambda_2, \ldots, \lambda_n) — диагональная матрица собственных чисел, отсортированных по убыванию (λ1λ20\lambda_1 \geq \lambda_2 \geq \ldots \geq 0);
  • U=[u1u2un]U = [u_1 \, u_2 \, \ldots \, u_n] — ортонормированные собственные векторы.

Поскольку UU ортогональная, U1=UTU^{-1} = U^T, поэтому:

A=UΛUTA = U \Lambda U^T

2.4. Введение новых переменных

Вводим новые переменные:

W=XUW = X U

Посчитаем WTWW^T W:

WTW=(XU)T(XU)=UTXTXU=UTAU=UT(UΛUT)U=(UTU)Λ(UTU)=ΛW^T W = (XU)^T (XU) = U^T X^T X U = U^T A U = U^T (U \Lambda U^T) U = (U^T U) \Lambda (U^T U) = \Lambda

(использовали UTU=IU^T U = I, поскольку UU ортогональна).

Получили:

WTW=ΛW^T W = \Lambda

— это диагональная матрица.

2.5. Свойства новых переменных

Поскольку WTWW^T W диагональна:

  • новые переменные линейно независимы (некоррелированы) — недиагональные элементы нулевые;
  • новые переменные отсортированы по убыванию дисперсии — на диагонали матрицы ковариаций стоят дисперсии.

В матричной форме:

(w1w2wm)=(x1x2xn)U\begin{pmatrix} w_1 & w_2 & \ldots & w_m \end{pmatrix} = \begin{pmatrix} x_1 & x_2 & \ldots & x_n \end{pmatrix} \cdot U

Каждый wkw_k получается умножением старых переменных на kk-й столбец матрицы UU:

  • w1w_1 — самая большая дисперсия;
  • w2w_2 — поменьше;
  • и т.д.

2.6. Снижение размерности

Идея: дисперсия — мера разброса от матожидания. Если у переменной маленькая дисперсия, она почти не изменяется, фактически ведёт себя как константа — особой роли в модели не играет.

Алгоритм: оставляем только переменные с большой дисперсией; остальные отбрасываем.

Критерии остановки

  1. Порог по отдельной дисперсии: оставляем wiw_i, для которых λi>τ\lambda_i > \tau (порог).
  2. Кумулятивный порог: суммируем λi\lambda_i по убыванию, пока сумма не достигнет заданного порога.

2.7. Что получили

С помощью PCA борются с:

  • некоррелированностью (точнее, с проблемой мультиколлинеарности — делаем переменные некоррелированными);
  • большим количеством переменных — снижаем размерность.

3. Взвешенный метод наименьших квадратов (взвешенный МНК)

3.1. Мотивация

Ранее предполагали, что дисперсии у ошибок одинаковые (гомоскедастичность). Однако дисперсии могут различаться — модель гетероскедастичная.

Пусть теперь матрица ковариаций для ε\varepsilon — диагональная матрица с разными элементами:

Cov(ε)=diag(σ12,σ22,,σn2)\text{Cov}(\varepsilon) = \text{diag}(\sigma_1^2, \sigma_2^2, \ldots, \sigma_n^2)

Обычная оценка наименьших квадратов уже не будет оптимальной.

3.2. Новая функция ошибок

Введём взвешенную сумму квадратов:

S2(c)=i=1n1σi2(j=1mxijcjyi)2S^2(c) = \sum_{i=1}^{n} \frac{1}{\sigma_i^2} \left( \sum_{j=1}^{m} x_{ij} c_j - y_i \right)^2

(каждое слагаемое умножается на 1/σi21/\sigma_i^2 — учитываем веса).

3.3. Поиск оптимального cc

Дифференцируем по ckc_k:

S2(c)ck=i=1n2σi2(j=1mxijcjyi)xik\frac{\partial S^2(c)}{\partial c_k} = \sum_{i=1}^{n} \frac{2}{\sigma_i^2} \left( \sum_{j=1}^{m} x_{ij} c_j - y_i \right) x_{ik}

Приравниваем к нулю:

i=1n1σi2xikj=1mxijcj=i=1n1σi2xikyi\sum_{i=1}^{n} \frac{1}{\sigma_i^2} x_{ik} \sum_{j=1}^{m} x_{ij} c_j = \sum_{i=1}^{n} \frac{1}{\sigma_i^2} x_{ik} y_i

3.4. Матричная запись

Введём диагональную матрицу весов:

W=diag(1σ12,1σ22,,1σn2)W = \text{diag}\left( \frac{1}{\sigma_1^2}, \frac{1}{\sigma_2^2}, \ldots, \frac{1}{\sigma_n^2} \right)

Полученные уравнения переписываются в матричном виде:

XTWXc=XTWyX^T W X \cdot c = X^T W \cdot y

Это упражнение на вспоминание определения умножения матриц.

Отсюда:

c^=(XTWX)1XTWy\boxed{\hat{c} = (X^T W X)^{-1} X^T W y}

3.5. Свойства оценки

  • Является наилучшей несмещённой линейной оценкой (доказывается аналогично теореме Гаусса—Маркова).
  • При одинаковых дисперсиях (σi2=σ2\sigma_i^2 = \sigma^2) формула превращается в обычную оценку МНК: W=1σ2IW = \frac{1}{\sigma^2} I, множители σ2\sigma^2 и σ2\sigma^{-2} сокращаются:
c^=(XTX)1XTy\hat{c} = (X^T X)^{-1} X^T y

3.6. Что делать с неизвестными дисперсиями?

В формуле использованы дисперсии σi2\sigma_i^2, но они неизвестны. Вместо них можно подставить их оценки — при некоторых условиях формулы будут корректно работать.

Подробнее об этом сейчас не углубляемся.

3.7. Когда применять

Взвешенный МНК работает, когда модель не является гомоскедастичной.


4. Замечание о проверке предположений модели

В стандартной линейной регрессии предполагали:

  • ошибки распределены нормально;
  • ошибки не коррелированы;
  • гомоскедастичность (одинаковые дисперсии).

Для проверки этих предположений существуют специально предназначенные стат-тесты:

  • тесты на гомоскедастичность;
  • тесты на отсутствие корреляции ошибок;
  • тесты на нормальность распределения.

В рамках курса подробно не разбираем; кому интересно — можно изучить самостоятельно.


5. Анонс следующих лекций

  • Тест отношения правдоподобия (идейно новая вещь)
  • Различные модификации линейных моделей