Регрессия: интервалы

22.04.2026 Обновлено: 22.04.2026
автор

Лекция 11: Линейная регрессия. Доверительные интервалы и проверка гипотез

Восстановление контекста

Рассматривается линейная модель:

y=Xc+εy = Xc + \varepsilon

где:

  • cc — вектор коэффициентов
  • XX — матрица с элементами (матрица плана)
  • yy — вектор значений
  • ε\varepsilon — вектор ошибок

Базовые предположения

  1. E[ε]=0\mathbb{E}[\varepsilon] = 0 — математическое ожидание ошибки равно нулю
  2. Матрица ковариаций ошибок: Cov(ε)=σ2E\text{Cov}(\varepsilon) = \sigma^2 \cdot E, где EE — единичная матрица

Это означает, что модель гомоскедастичная: матрица ковариаций диагональная, и на диагонали стоит одна и та же дисперсия.

Что было получено ранее

Найдена оценка наименьших квадратов (ОНК):

c^=A1XTy\hat{c} = A^{-1} X^T y

где A=XTXA = X^T X.

Теорема Гаусса—Маркова (повторение):

  • c^\hat{c} — несмещённая оценка
  • c^\hat{c} — оптимальная (эффективная) в классе линейных несмещённых оценок

Также получена несмещённая оценка остаточной дисперсии:

σ^2=S2(c^)nm\hat{\sigma}^2 = \frac{S^2(\hat{c})}{n - m}

где S2(c^)S^2(\hat{c}) — квадратическая ошибка для ОНК, nn — число наблюдений, mm — число переменных.

До этого мы научились находить точечные оценки для cc и для остаточной дисперсии. Теперь будем строить доверительные интервалы.


Усиление предположений: гауссовские ошибки

До сих пор: E[ε]=0\mathbb{E}[\varepsilon] = 0 и диагональная матрица ковариаций.

Усиление: ε\varepsilon теперь — гауссовская величина:

εN(0,σ2E)\varepsilon \sim \mathcal{N}(0, \sigma^2 E)

Так как yy — линейное преобразование гауссовской величины, то yy тоже гауссовская:

yN(Xc,σ2E)y \sim \mathcal{N}(Xc, \sigma^2 E)

Функция правдоподобия

Запишем плотность yy при фиксированных cc и σ2\sigma^2 (многомерное нормальное распределение):

L(c,σ2)=1(2π)nσnexp(12σ2(yXc)T(yXc))L(c, \sigma^2) = \frac{1}{(\sqrt{2\pi})^n \cdot \sigma^n} \exp\left(-\frac{1}{2\sigma^2}(y - Xc)^T(y - Xc)\right)

Здесь:

  • Определитель диагональной матрицы σ2E\sigma^2 E равен σ2n\sigma^{2n}, корень даёт σn\sigma^n
  • Обратная матрица к σ2E\sigma^2 E — это 1σ2E\frac{1}{\sigma^2} E

Связь МНК и метода максимального правдоподобия

Зафиксируем σ2\sigma^2. Тогда максимизация LL по cc равносильна максимизации аргумента экспоненты, то есть минимизации выражения:

(yXc)T(yXc)=S2(c)(y - Xc)^T(y - Xc) = S^2(c)

Это и есть квадратическая ошибка! Минимум достигается на ОНК.

Вывод: При добавлении предположения о нормальности оценка наименьших квадратов совпадает с оценкой максимального правдоподобия:

c^ОНК=c^ММП\hat{c}_{\text{ОНК}} = \hat{c}_{\text{ММП}}

Следствие: Ранее было показано, что оценка максимального правдоподобия эффективна в классе всех несмещённых оценок (а не только линейных). То есть:

  • В теореме Гаусса—Маркова (минимальные предположения): ОНК эффективна в классе линейных несмещённых оценок
  • При добавлении нормальности: ОНК эффективна в классе всех несмещённых оценок

Теорема о нормальной регрессии

Условия: выполнены все предположения, плюс ошибка распределена нормально.

Утверждения:

  1. c^N(c,σ2A1)\hat{c} \sim \mathcal{N}(c, \sigma^2 A^{-1})

  2. S2(c^)σ2χnm2\dfrac{S^2(\hat{c})}{\sigma^2} \sim \chi^2_{n-m} (хи-квадрат с nmn - m степенями свободы)

  3. S2(c)S2(c^)σ2χm2\dfrac{S^2(c) - S^2(\hat{c})}{\sigma^2} \sim \chi^2_{m} (хи-квадрат с mm степенями свободы)

  4. Пары c^\hat{c} и S2(c^)S^2(\hat{c})независимы (несмотря на то, что S2(c^)S^2(\hat{c}) зависит от c^\hat{c})

Эту теорему можно воспринимать как переформулировку теоремы Фишера (которая использовалась при построении доверительных интервалов для параметров нормального закона).


Доверительный интервал для дисперсии σ2\sigma^2

Используем результат 2 теоремы.

Запишем:

P(qα/2S2(c^)σ2q1α/2)=1α\mathbb{P}\left(q_{\alpha/2} \leq \frac{S^2(\hat{c})}{\sigma^2} \leq q_{1-\alpha/2}\right) = 1 - \alpha

где qα/2q_{\alpha/2}, q1α/2q_{1-\alpha/2} — квантили распределения χnm2\chi^2_{n-m}.

Разрешая неравенство относительно σ2\sigma^2:

S2(c^)q1α/2σ2S2(c^)qα/2\frac{S^2(\hat{c})}{q_{1-\alpha/2}} \leq \sigma^2 \leq \frac{S^2(\hat{c})}{q_{\alpha/2}}

Проверка гипотезы о дисперсии

Гипотеза: H0:σ2=σ02H_0: \sigma^2 = \sigma_0^2

Статистика критерия:

T=S2(c^)σ02T = \frac{S^2(\hat{c})}{\sigma_0^2}

При истинности H0H_0: Tχnm2T \sim \chi^2_{n-m}.

Виды альтернатив и критические области

Альтернатива H1H_1Тип критерияКритическая область
σ2σ02\sigma^2 \neq \sigma_0^2Двусторонний[0,qα/2][q1α/2,+)[0, q_{\alpha/2}] \cup [q_{1-\alpha/2}, +\infty)
σ2>σ02\sigma^2 > \sigma_0^2Правосторонний[q1α,+)[q_{1-\alpha}, +\infty)
σ2<σ02\sigma^2 < \sigma_0^2Левосторонний[0,qα][0, q_\alpha]

Замечание о терминологии. Везде в записи используются квантили. В практических таблицах часто используются критические значения, которые могут обозначаться как QαQ_\alpha (то, что в записи через квантили является q1αq_{1-\alpha}). Важно понимать смысл и не путать.

Замечание о носителе. Распределение χ2\chi^2 имеет носитель [0,+)[0, +\infty) (как сумма квадратов), поэтому отрицательных значений быть не может.


Доверительный интервал для коэффициента cic_i

Из результата 1 теоремы:

c^iciσ2(A1)iiN(0,1)\frac{\hat{c}_i - c_i}{\sqrt{\sigma^2 (A^{-1})_{ii}}} \sim \mathcal{N}(0, 1)

Но σ2\sigma^2 неизвестна — оценим её через σ^2=S2(c^)nm\hat{\sigma}^2 = \dfrac{S^2(\hat{c})}{n-m}.

Подставляя оценку, получаем:

nm(c^ici)S2(c^)(A1)iitnm\frac{\sqrt{n-m}(\hat{c}_i - c_i)}{\sqrt{S^2(\hat{c}) \cdot (A^{-1})_{ii}}} \sim t_{n-m}

Почему распределение Стьюдента?

По формальному определению: tk=ξχk2/kt_k = \dfrac{\xi}{\sqrt{\chi^2_k / k}}, где ξN(0,1)\xi \sim \mathcal{N}(0,1).

В числителе у нас стандартная гауссовская величина, а в знаменателе — корень из хи-квадрата, делённого на число степеней свободы. Получается распределение Стьюдента с nmn-m степенями свободы.

Доверительный интервал

cic^i±t1α/2,nmS2(c^)(A1)iinmc_i \in \hat{c}_i \pm t_{1-\alpha/2, \, n-m} \cdot \sqrt{\frac{S^2(\hat{c}) \cdot (A^{-1})_{ii}}{n-m}}

Величина S2(c^)(A1)iinm\sqrt{\dfrac{S^2(\hat{c}) \cdot (A^{-1})_{ii}}{n-m}} называется стандартной ошибкой.

Используется симметричность распределения Стьюдента относительно нуля.


tt-тест значимости коэффициента линейной регрессии

Идея: проверить, действительно ли ii-я переменная влияет на модель.

Нулевая гипотеза: H0:ci=0H_0: c_i = 0 (фактор не влияет)

Альтернативы (зависят от подозрений):

  • ci0c_i \neq 0 (двусторонняя)
  • ci>0c_i > 0 (правосторонняя)
  • ci<0c_i < 0 (левосторонняя)

Статистика критерия:

T=nmc^iS2(c^)(A1)iiT = \frac{\sqrt{n-m} \cdot \hat{c}_i}{\sqrt{S^2(\hat{c}) \cdot (A^{-1})_{ii}}}

При H0H_0: TtnmT \sim t_{n-m}.

Примеры выбора альтернативы

Пример 1. Цена недвижимости в зависимости от расстояния до центра. Подозрение: чем меньше расстояние, тем больше цена → левосторонняя альтернатива (ci<0c_i < 0).

Пример 2. Стоимость авто в зависимости от мощности. Подозрение: чем больше мощность, тем больше цена → правосторонняя альтернатива (ci>0c_i > 0).


Предсказание новых значений

До сих пор имели “тренировочный набор”: y=Xc+εy = Xc + \varepsilon, по которому оценили cc и σ2\sigma^2.

Теперь — новое наблюдение:

yν=xνc+ενy_\nu = x_\nu c + \varepsilon_\nu

где:

  • xνx_\nu — новая строка наблюдений
  • ενN(0,σ2)\varepsilon_\nu \sim \mathcal{N}(0, \sigma^2)
  • εν\varepsilon_\nu и ε\varepsilon независимы

На уровне модели: yνN(xνc,σ2)y_\nu \sim \mathcal{N}(x_\nu c, \sigma^2).

Оценка нового значения

y^ν=xνc^\hat{y}_\nu = x_\nu \hat{c}

Распределение y^ν\hat{y}_\nu:

y^νN(xνc,σ2xνA1xνT)\hat{y}_\nu \sim \mathcal{N}(x_\nu c, \sigma^2 x_\nu A^{-1} x_\nu^T)

Здесь это дисперсия (число), а не матрица, потому что xνx_\nu — строка.

Независимость y^ν\hat{y}_\nu и yνy_\nu

  • c^\hat{c} — функция от старого yy, который функция от старого ε\varepsilon
  • yνy_\nu — функция от нового εν\varepsilon_\nu
  • Старый и новый ε\varepsilon независимы → y^ν\hat{y}_\nu и yνy_\nu независимы

Распределение разности

y^νyνN(0,σ2(1+xνA1xνT))\hat{y}_\nu - y_\nu \sim \mathcal{N}\left(0, \, \sigma^2 (1 + x_\nu A^{-1} x_\nu^T)\right)

(дисперсии складываются при независимости)

Стандартизация:

y^νyνσ2(1+xνA1xνT)N(0,1)\frac{\hat{y}_\nu - y_\nu}{\sqrt{\sigma^2 (1 + x_\nu A^{-1} x_\nu^T)}} \sim \mathcal{N}(0, 1)

Заменяя σ2\sigma^2 на оценку:

nm(y^νyν)S2(c^)(1+xνA1xνT)tnm\frac{\sqrt{n-m}(\hat{y}_\nu - y_\nu)}{\sqrt{S^2(\hat{c})(1 + x_\nu A^{-1} x_\nu^T)}} \sim t_{n-m}

Отсюда стандартным образом строится доверительный интервал для yνy_\nu (зажимаем между квантилями и разрешаем неравенство).


Условные оценки наименьших квадратов

Понадобятся для описания FF-критерия.

Постановка: вектор cc удовлетворяет линейным ограничениям:

Tc=t0Tc = t_0

где:

  • TT — матрица k×mk \times m, kmk \leq m
  • rank(T)=k\text{rank}(T) = k (ограничения линейно независимы)

Определение условной ОНК:

c^T=argminTc=t0S2(c)\hat{c}_T = \arg\min_{Tc = t_0} S^2(c)

Это задача оптимизации квадратичной функции при линейных ограничениях.

Аналитическая формула

c^T=c^A1TTD1(Tc^t0)\hat{c}_T = \hat{c} - A^{-1} T^T D^{-1} (T\hat{c} - t_0)

где:

D=TA1TTD = T A^{-1} T^T

(матрица DD возникала в теореме Гаусса—Маркова).

Матрица DD симметрична: DT=DD^T = D, поэтому (D1)T=D1(D^{-1})^T = D^{-1}. D1D^{-1} существует, потому что rank(T)=k\text{rank}(T) = k.

Идея вывода

Аналогично доказательству обычной ОНК. Показывается:

S2(c^T+h)>S2(c^T)S^2(\hat{c}_T + h) > S^2(\hat{c}_T)

для любого h0h \neq 0 такого, что Th=0T h = 0 (приращение в допустимом направлении).

Упражнение: показать, что Tc^T=t0T \hat{c}_T = t_0 (выполняется в одну строчку).

Ключевое наблюдение

Из результата прошлой лекции:

S2(c)S2(c^)=(cc^)TA(cc^)S^2(c) - S^2(\hat{c}) = (c - \hat{c})^T A (c - \hat{c})

Подставляя c=c^Tc = \hat{c}_T:

S2(c^T)S2(c^)=(c^Tc^)TA(c^Tc^)S^2(\hat{c}_T) - S^2(\hat{c}) = (\hat{c}_T - \hat{c})^T A (\hat{c}_T - \hat{c})

Используя формулу для c^Tc^=A1TTD1(Tc^t0)\hat{c}_T - \hat{c} = -A^{-1} T^T D^{-1}(T\hat{c} - t_0):

S2(c^T)S2(c^)=(Tc^t0)TD1TA1TT=DD1(Tc^t0)S^2(\hat{c}_T) - S^2(\hat{c}) = (T\hat{c} - t_0)^T D^{-1} \underbrace{T A^{-1} T^T}_{= D} D^{-1} (T\hat{c} - t_0)=(Tc^t0)TD1(Tc^t0)= (T\hat{c} - t_0)^T D^{-1} (T\hat{c} - t_0)

Это квадратичная форма от c^\hat{c}. Так как c^\hat{c} имеет нормальное распределение, и квадратичная форма построена с матрицей ранга kk, эта величина связана с распределением χk2\chi^2_kчисло степеней свободы равно kk.


FF-критерий для линейной модели

Общая формулировка

Гипотезы:

  • H0:Tc=t0H_0: Tc = t_0
  • H1:Tct0H_1: Tc \neq t_0

Статистика критерия:

F=[S2(c^T)S2(c^)]/kS2(c^)/(nm)F = \frac{[S^2(\hat{c}_T) - S^2(\hat{c})] / k}{S^2(\hat{c}) / (n-m)}

При истинности H0H_0: FFk,nmF \sim F_{k, \, n-m} (распределение Фишера).

Обоснование правосторонней критической области

Знаменатель:

E[S2(c^)nm]=σ2\mathbb{E}\left[\frac{S^2(\hat{c})}{n-m}\right] = \sigma^2

— всегда, независимо от истинности H0H_0.

Числитель: математическое ожидание разности квадратичных ошибок.

E[1k(S2(c^T)S2(c^))]=1kE[(Tc^t0)TD1(Tc^t0)]\mathbb{E}\left[\frac{1}{k}(S^2(\hat{c}_T) - S^2(\hat{c}))\right] = \frac{1}{k} \mathbb{E}\left[(T\hat{c} - t_0)^T D^{-1} (T\hat{c} - t_0)\right]

Расписываем как сумму:

=1ki,j(D1)ijE[(Tc^t0)i(Tc^t0)j]= \frac{1}{k} \sum_{i,j} (D^{-1})_{ij} \, \mathbb{E}\left[(T\hat{c} - t_0)_i (T\hat{c} - t_0)_j\right]

Используя E[XY]=Cov(X,Y)+E[X]E[Y]\mathbb{E}[XY] = \text{Cov}(X, Y) + \mathbb{E}[X]\mathbb{E}[Y], получаем две части:

Часть 1 (с ковариациями):

1ki,j(D1)ijCov((Tc^t0)i,(Tc^t0)j)\frac{1}{k} \sum_{i,j} (D^{-1})_{ij} \, \text{Cov}((T\hat{c} - t_0)_i, (T\hat{c} - t_0)_j)

Так как t0t_0 — константа, ковариация определяется только Tc^T\hat{c}. Матрица ковариации Tc^T\hat{c}:

Cov(Tc^)=TCov(c^)TT=Tσ2A1TT=σ2D\text{Cov}(T\hat{c}) = T \cdot \text{Cov}(\hat{c}) \cdot T^T = T \cdot \sigma^2 A^{-1} \cdot T^T = \sigma^2 D

Подставляя:

1ki,j(D1)ijσ2Dij=σ2ktr(D1D)=σ2kk=σ2\frac{1}{k} \sum_{i,j} (D^{-1})_{ij} \cdot \sigma^2 D_{ij} = \frac{\sigma^2}{k} \cdot \text{tr}(D^{-1} D) = \frac{\sigma^2}{k} \cdot k = \sigma^2

Здесь использовано: i,j(D1)ijDij=tr(D1D)=tr(Ek)=k\sum_{i,j}(D^{-1})_{ij} D_{ij} = \text{tr}(D^{-1} D) = \text{tr}(E_k) = k.

Часть 2 (с произведениями матожиданий):

Используя E[c^]=c\mathbb{E}[\hat{c}] = c:

1k(Tct0)TD1(Tct0)\frac{1}{k}(Tc - t_0)^T D^{-1} (Tc - t_0)

Итого:

E[1k(S2(c^T)S2(c^))]=σ2+1k(Tct0)TD1(Tct0)\mathbb{E}\left[\frac{1}{k}(S^2(\hat{c}_T) - S^2(\hat{c}))\right] = \sigma^2 + \frac{1}{k}(Tc - t_0)^T D^{-1} (Tc - t_0)

Анализ:

  • Если H0H_0 верна (Tc=t0Tc = t_0): математическое ожидание числителя равно σ2\sigma^2
  • Если H0H_0 не верна: математическое ожидание числителя строго больше σ2\sigma^2

Знаменатель всегда в среднем равен σ2\sigma^2. Поэтому:

  • При H0H_0: E[F]1\mathbb{E}[F] \approx 1
  • При H1H_1: E[F]>1\mathbb{E}[F] > 1

Критическая область — правосторонняя.


FF-критерий “по умолчанию” (значимость модели в целом)

Стандартная модель

yi=c0+xi1c1+xi2c2++ximcm+εiy_i = c_0 + x_{i1} c_1 + x_{i2} c_2 + \ldots + x_{im} c_m + \varepsilon_i

В библиотеках c0c_0 (свободный член) обычно выделяется отдельно.

Гипотеза по умолчанию

Нулевая гипотеза: все коэффициенты, кроме свободного, равны нулю:

H0:c1=c2==cm=0H_0: c_1 = c_2 = \ldots = c_m = 0

Альтернатива: H1H_1: хотя бы один ci0c_i \neq 0 (то есть ¬H0\neg H_0).

Это проверка значимости модели в целом.


Коэффициент детерминации R2R^2

Определение. Множественный коэффициент корреляции — это коэффициент корреляции между yy и y^\hat{y}:

R=corr(y,y^)R = \text{corr}(y, \hat{y})

где y^=Xc^\hat{y} = X\hat{c}.

Коэффициент детерминации:

R2=R2(множественный)R^2 = R^2(\text{множественный})

Связь с остаточной дисперсией

Имеет место соотношение:

S2(c^)=(1R2)i=1n(yiyˉ)2S^2(\hat{c}) = (1 - R^2) \sum_{i=1}^{n} (y_i - \bar{y})^2

Правая сумма — константа, зависящая от датасета.

Интерпретация

R2R^2Остаточная дисперсияКачество модели
Близко к 1МаленькаяМодель адекватная
Близко к 0БольшаяМодель не очень адекватная

FF-статистика через R2R^2

Для гипотезы по умолчанию FF-статистика выражается через коэффициент детерминации:

F=R2/m(1R2)/(nm1)F = \frac{R^2 / m}{(1 - R^2) / (n - m - 1)}

Замечание Ивана Александровича: возможны небольшие неточности в коэффициентах — нужно перепроверить.

Что планируется на следующей лекции

  • Модель однофакторного дисперсионного анализа
  • Обобщения линейных моделей
  • Как проверять исходные предположения
  • Что делать, если матрица AA необратима или плохо обратима