Гипотезы

11.03.2026 Обновлено: 11.03.2026
автор

Лекция 6: Доверительные интервалы и введение в проверку статистических гипотез

Повторение: определение доверительного интервала

Формальное определение. Доверительный интервал [L(x),R(x)][L(x), R(x)] задаётся условием:

P(θ[L(x),R(x)])1αP(\theta \in [L(x), R(x)]) \geq 1 - \alpha

где 1α1 - \alphaуровень доверия.

Содержательная интерпретация. Если уровень доверия 95% и мы рассматриваем 100 выборок, для каждой считаем доверительный интервал, то хотя бы в 95 случаях из 100 реальное значение параметра окажется в построенном доверительном интервале.

Что было раньше: на прошлой лекции рассматривались доверительные интервалы для параметров нормального закона:

  • для мат. ожидания при известной дисперсии
  • для мат. ожидания при неизвестной дисперсии
  • для дисперсии при известном мат. ожидании
  • для дисперсии при неизвестном мат. ожидании

Задача 5: Доверительный интервал для разности мат. ожиданий (известные дисперсии)

Постановка

Даны две независимые выборки:

  • x1,,xnx_1, \ldots, x_n из N(μx,σx2)N(\mu_x, \sigma_x^2)
  • y1,,ymy_1, \ldots, y_m из N(μy,σy2)N(\mu_y, \sigma_y^2)

Дисперсии σx2\sigma_x^2 и σy2\sigma_y^2 известны. Нужно построить доверительный интервал для τ=μyμx\tau = \mu_y - \mu_x.

Построение

Шаг 1. Распределения выборочных средних:

xˉN ⁣(μx,σx2n),yˉN ⁣(μy,σy2m)\bar{x} \sim N\!\left(\mu_x, \frac{\sigma_x^2}{n}\right), \qquad \bar{y} \sim N\!\left(\mu_y, \frac{\sigma_y^2}{m}\right)

Шаг 2. Из независимости выборок:

yˉxˉN ⁣(μyμx, σy2m+σx2n)\bar{y} - \bar{x} \sim N\!\left(\mu_y - \mu_x,\ \frac{\sigma_y^2}{m} + \frac{\sigma_x^2}{n}\right)

⚠️ Важное замечание. Дисперсия суммы (или разности) независимых случайных величин — это сумма дисперсий, независимо от того, плюс это или минус. Если бы здесь стоял минус, то могло бы получиться отрицательное значение, что невозможно для дисперсии.

Шаг 3. Центрируем и нормируем:

yˉxˉτσy2m+σx2nN(0,1)\frac{\bar{y} - \bar{x} - \tau}{\sqrt{\dfrac{\sigma_y^2}{m} + \dfrac{\sigma_x^2}{n}}} \sim N(0, 1)

Шаг 4. Зажимаем статистику между квантилями (используем симметрию стандартного нормального закона) и разрешаем неравенство относительно τ\tau.

Ответ

  τyˉxˉ±u1α/2σy2m+σx2n  \boxed{\;\tau \in \bar{y} - \bar{x} \pm u_{1 - \alpha/2}\sqrt{\frac{\sigma_y^2}{m} + \frac{\sigma_x^2}{n}}\;}

Задача 6: Доверительный интервал для разности мат. ожиданий (равные неизвестные дисперсии)

Постановка

Те же две независимые гауссовские выборки, но теперь:

  • дисперсии неизвестны
  • известно, что σx2=σy2=σ2\sigma_x^2 = \sigma_y^2 = \sigma^2

Цель та же: построить доверительный интервал для τ=μyμx\tau = \mu_y - \mu_x.

Идея

В предыдущей задаче мы получили стандартную гауссовскую величину. Сейчас её знаменатель содержит неизвестное σ2\sigma^2. Идея — построить статистику с распределением Стьюдента.

Напоминание определения t-распределения: в числителе — стандартная гауссовская величина, в знаменателе — корень квадратный из χ2\chi^2, делённого на число степеней свободы; числитель и знаменатель независимы.

Применение теоремы Фишера

По теореме Фишера:

nsx2σ2χn12,msy2σ2χm12\frac{n s_x^{*2}}{\sigma^2} \sim \chi^2_{n-1}, \qquad \frac{m s_y^{*2}}{\sigma^2} \sim \chi^2_{m-1}

где s2s^{*2} — смещённая выборочная дисперсия.

Поскольку xx и yy независимы, при сложении степени свободы складываются:

nsx2+msy2σ2χn+m22\frac{n s_x^{*2} + m s_y^{*2}}{\sigma^2} \sim \chi^2_{n + m - 2}

При этом числитель (выборочные средние) и знаменатель (выборочные дисперсии) независимы — также по теореме Фишера.

Построение статистики

T=yˉxˉτσ2/m+σ2/n1n+m2 ⁣(nsx2σ2+msy2σ2)tn+m2T = \frac{\dfrac{\bar{y} - \bar{x} - \tau}{\sqrt{\sigma^2/m + \sigma^2/n}}}{\sqrt{\dfrac{1}{n+m-2}\!\left(\dfrac{n s_x^{*2}}{\sigma^2} + \dfrac{m s_y^{*2}}{\sigma^2}\right)}} \sim t_{n+m-2}

Ключевой момент: σ2\sigma^2 в числителе и знаменателе сокращаются.

После упрощения:

T=(yˉxˉτ)(n+m2)mn(m+n)(nsx2+msy2)tn+m2T = \frac{(\bar{y} - \bar{x} - \tau)\sqrt{(n+m-2)\, mn}}{\sqrt{(m+n)(n s_x^{*2} + m s_y^{*2})}} \sim t_{n+m-2}

Зажатие между квантилями

P ⁣(t1α/2Tt1α/2)=1αP\!\left(-t_{1-\alpha/2} \leq T \leq t_{1-\alpha/2}\right) = 1 - \alpha

Это работает потому, что распределение Стьюдента симметрично относительно нуля.

Ответ

  τyˉxˉ±t1α/2(nsx2+msy2)(m+n)mn(n+m2)  \boxed{\;\tau \in \bar{y} - \bar{x} \pm t_{1-\alpha/2}\sqrt{\frac{(n s_x^{*2} + m s_y^{*2})(m+n)}{mn(n+m-2)}}\;}

💡 Замечание Ивана Александровича. Это самая громоздкая задача на сегодня — дальше будет проще.

⚠️ Если дисперсии неравны и неизвестны — задача формально неразрешима в таком виде (в общем случае точного решения нет — это так называемая проблема Беренса–Фишера).


Задача 7: Доверительный интервал для отношения дисперсий (мат. ожидания неизвестны)

Постановка

Две независимые гауссовские выборки x1,,xnx_1, \ldots, x_n и y1,,ymy_1, \ldots, y_m. Мат. ожидания μx,μy\mu_x, \mu_y неизвестны. Построить доверительный интервал для σy2/σx2\sigma_y^2 / \sigma_x^2.

Применение теоремы Фишера

(n1)sx2σx2χn12,(m1)sy2σy2χm12\frac{(n-1) s_x^2}{\sigma_x^2} \sim \chi^2_{n-1}, \qquad \frac{(m-1) s_y^2}{\sigma_y^2} \sim \chi^2_{m-1}

(здесь s2s^2 — несмещённая выборочная дисперсия)

Построение F-статистики

По определению F-распределения (отношение двух χ2\chi^2, делённых на свои степени свободы):

Fn,m=(n1)sx2σx21n1(m1)sy2σy21m1=sx2/σx2sy2/σy2=sx2sy2σy2σx2Fn1,m1F_{n,m} = \frac{\dfrac{(n-1) s_x^2}{\sigma_x^2} \cdot \dfrac{1}{n-1}}{\dfrac{(m-1) s_y^2}{\sigma_y^2} \cdot \dfrac{1}{m-1}} = \frac{s_x^2 / \sigma_x^2}{s_y^2 / \sigma_y^2} = \frac{s_x^2}{s_y^2} \cdot \frac{\sigma_y^2}{\sigma_x^2} \sim F_{n-1,\, m-1}

Зажатие между квантилями

P ⁣(Fα/2sx2sy2σy2σx2F1α/2)=1αP\!\left(F_{\alpha/2} \leq \frac{s_x^2}{s_y^2} \cdot \frac{\sigma_y^2}{\sigma_x^2} \leq F_{1-\alpha/2}\right) = 1 - \alpha

⚠️ Распределение Фишера не симметрично относительно нуля, поэтому используются обе квантили: Fα/2F_{\alpha/2} и F1α/2F_{1-\alpha/2}.

Ответ

После разрешения относительно σy2/σx2\sigma_y^2 / \sigma_x^2 (важно: при делении на дробь неравенство переворачивается):

  σy2σx2[Fα/2sy2sx2, F1α/2sy2sx2]  \boxed{\;\frac{\sigma_y^2}{\sigma_x^2} \in \left[F_{\alpha/2}\, \frac{s_y^2}{s_x^2},\ F_{1-\alpha/2}\, \frac{s_y^2}{s_x^2}\right]\;}

Задача 8: Доверительный интервал для отношения дисперсий (мат. ожидания известны)

Постановка

То же, но μx\mu_x и μy\mu_y известны.

Идея

Формально можно использовать прежнюю статистику, но при малом объёме выборки лучше иметь больше степеней свободы.

Используем тот факт, что:

k=1n(xkμx)2σx2χn2,k=1m(ykμy)2σy2χm2\sum_{k=1}^{n} \frac{(x_k - \mu_x)^2}{\sigma_x^2} \sim \chi^2_n, \qquad \sum_{k=1}^{m} \frac{(y_k - \mu_y)^2}{\sigma_y^2} \sim \chi^2_m

(степеней свободы на одну больше, чем в задаче 7)

Построение F-статистики

F=1nk=1n(xkμx)2σx21mk=1m(ykμy)2σy2Fn,mF = \frac{\dfrac{1}{n}\sum_{k=1}^{n} \dfrac{(x_k - \mu_x)^2}{\sigma_x^2}}{\dfrac{1}{m}\sum_{k=1}^{m} \dfrac{(y_k - \mu_y)^2}{\sigma_y^2}} \sim F_{n,m}

Дальше — стандартная процедура: зажатие между квантилями и разрешение относительно σy2/σx2\sigma_y^2 / \sigma_x^2.


«Универсальный» рецепт (в кавычках)

Постановка

Пусть x1,,xnx_1, \ldots, x_n — выборка из непрерывного распределения с функцией распределения FθF_\theta.

Утверждение (а)

Случайная величина ui=Fθ(xi)u_i = F_\theta(x_i) имеет равномерное распределение на [0,1][0, 1].

Доказательство. Для строго возрастающей FθF_\theta:

P(uit)=P(Fθ(xi)t)=P(xiFθ1(t))=Fθ(Fθ1(t))=tP(u_i \leq t) = P(F_\theta(x_i) \leq t) = P(x_i \leq F_\theta^{-1}(t)) = F_\theta(F_\theta^{-1}(t)) = t

(для t[0,1]t \in [0, 1]). Это функция распределения равномерного закона на [0,1][0, 1].

Утверждение (б)

vi=lnuiv_i = -\ln u_i распределено по экспоненциальному закону с параметром 1.

Доказательство. Для t>0t > 0:

P(vit)=P(lnuit)=P(lnuit)=P(uiet)=1etP(v_i \leq t) = P(-\ln u_i \leq t) = P(\ln u_i \geq -t) = P(u_i \geq e^{-t}) = 1 - e^{-t}

Это функция распределения экспоненциального закона с параметром 1.

Утверждение (в)

i=1nvi=i=1nlnFθ(xi)Γ(n,1)\sum_{i=1}^{n} v_i = -\sum_{i=1}^{n} \ln F_\theta(x_i) \sim \Gamma(n, 1)

(сумма независимых экспоненциальных случайных величин с одним параметром даёт гамма-распределение).

Почему «в кавычках»?

Формально мы получили статистику с хорошим (известным) распределением для очень широкого класса задач. Но дальше нужно зажимать между квантилями и разрешать неравенство относительно θ\theta. На статистику навешан и логарифм, и функция распределения — получается неравенство, которое часто либо очень трудно разрешимо, либо в принципе неразрешимо относительно θ\theta.

Пример: Fθ(t)=12+1πarctan(tθ)F_\theta(t) = \dfrac{1}{2} + \dfrac{1}{\pi}\arctan(t - \theta) (распределение Коши со сдвигом). Статистика:

i=1nln ⁣(12+1πarctan(xiθ))-\sum_{i=1}^{n} \ln\!\left(\frac{1}{2} + \frac{1}{\pi}\arctan(x_i - \theta)\right)

Зажать это между квантилями и разрешить относительно θ\theta — крайне неприятная задача.


Асимптотические доверительные интервалы

Определение

[L(x),R(x)][L(x), R(x)]асимптотический доверительный интервал, если:

limnP(θ[L(x),R(x)])1α\lim_{n \to \infty} P(\theta \in [L(x), R(x)]) \geq 1 - \alpha

Общая схема построения

  1. Находим статистику g(x,θ)g(x, \theta), у которой существует предельное распределение, не зависящее от θ\theta.
  2. Зажимаем статистику между квантилями предельного распределения:
P(qα/2g(x,θ)q1α/2)1αP(q_{\alpha/2} \leq g(x, \theta) \leq q_{1-\alpha/2}) \approx 1 - \alpha
  1. Разрешаем неравенство относительно θ\theta.

Применение А: Асимптотический ДИ для мат. ожидания

Условие

Существует дисперсия.

Использование

Выборочная средняя — асимптотически нормальная оценка:

n(xˉμ)sdN(0,1)\frac{\sqrt{n}(\bar{x} - \mu)}{s} \xrightarrow{d} N(0, 1)

Зажатие между квантилями

u1α/2n(xˉμ)su1α/2-u_{1-\alpha/2} \leq \frac{\sqrt{n}(\bar{x} - \mu)}{s} \leq u_{1-\alpha/2}

Ответ

  μxˉ±u1α/2sn  \boxed{\;\mu \in \bar{x} \pm u_{1-\alpha/2}\, \frac{s}{\sqrt{n}}\;}

Стандартная ошибка

💡 Определение. В контексте доверительных интервалов стандартной ошибкой называется величина, на которую умножается квантиль, — то есть sn\dfrac{s}{\sqrt{n}}.


Частный случай: ДИ для параметра распределения Бернулли

Постановка

Выборка из распределения Бернулли с параметром pp. Мат. ожидание = pp, дисперсия = p(1p)p(1-p).

Сходимость

n(xˉp)p(1p)dN(0,1)\frac{\sqrt{n}(\bar{x} - p)}{\sqrt{p(1-p)}} \xrightarrow{d} N(0, 1)

Проблема

В знаменателе pp — неизвестно. Если оставить как есть, при разрешении неравенства pp окажется и в числителе, и в знаменателе, да ещё под корнем.

Решение — подстановка состоятельной оценки

Подставляем выборочную оценку p^=xˉ\hat{p} = \bar{x} (она же — оценка методом моментов и оценка максимального правдоподобия). Сходимость к стандартной гауссовской величине сохраняется.

Ответ

  pxˉ±u1α/2xˉ(1xˉ)n  \boxed{\;p \in \bar{x} \pm u_{1-\alpha/2}\sqrt{\frac{\bar{x}(1 - \bar{x})}{n}}\;}

⚠️ Когда такая подстановка допустима? Только если оценка состоятельна. В асимптотическом ДИ оценки близки к реальному значению, и сходимость сохраняется.


Применение Б: Асимптотический ДИ для медианы

Условие

Выборка из непрерывного распределения.

Использование

Выборочная медиана (порядковая статистика с номером n/2\lfloor n/2 \rfloor) — асимптотически нормальная оценка теоретической медианы:

nf(m)x(n/2)m1/21/2dN(0,1)\sqrt{n} \cdot f(m) \cdot \frac{x_{(\lfloor n/2 \rfloor)} - m}{\sqrt{1/2 \cdot 1/2}} \xrightarrow{d} N(0, 1)

где mm — теоретическая медиана, ff — плотность.

Ответ

  mx(n/2)±u1α/22nf(m)  \boxed{\;m \in x_{(\lfloor n/2 \rfloor)} \pm \frac{u_{1-\alpha/2}}{2\sqrt{n}\, f(m)}\;}

Проблема и решение

В формуле присутствует f(m)f(m) — неизвестная плотность в неизвестной точке. Решение — подставить состоятельные оценки: вместо mm использовать выборочную медиану x(n/2)x_{(\lfloor n/2 \rfloor)}.

💡 Это типичный приём: подстановка состоятельной оценки на место неизвестной величины.


Применение В: Асимптотический ДИ для дисперсии

Использование

Выборочная дисперсия — асимптотически нормальная оценка:

n(s2σ2)β^4s4dN(0,1)\frac{\sqrt{n}(s^{*2} - \sigma^2)}{\sqrt{\hat{\beta}_4 - s^{*4}}} \xrightarrow{d} N(0, 1)

где β^4=(xxˉ)4\hat{\beta}_4 = \overline{(x - \bar{x})^4} — четвёртый выборочный центральный момент.

Ответ

  σ2s2±u1α/2nβ^4s4  \boxed{\;\sigma^2 \in s^{*2} \pm \frac{u_{1-\alpha/2}}{\sqrt{n}}\sqrt{\hat{\beta}_4 - s^{*4}}\;}

Тонкость

⚠️ Левая граница может оказаться отрицательной, что для дисперсии бессмысленно.

Для мат. ожидания это нормально, для дисперсии — нет. Поэтому такой подход работает только при очень большом объёме выборки: при nn \to \infty дробь 1n0\dfrac{1}{\sqrt{n}} \to 0, и левая граница перестаёт быть отрицательной.


Применение Г: ДИ через оценку максимального правдоподобия

Утверждение

Если θ^\hat{\theta} — оценка максимального правдоподобия для θ\theta, и модель регулярна, то:

n(θ^θ)dN ⁣(0,1i(θ))\sqrt{n}(\hat{\theta} - \theta) \xrightarrow{d} N\!\left(0, \frac{1}{i(\theta)}\right)

где i(θ)i(\theta)информация Фишера.

Применение

Подставив состоятельную оценку θ^\hat{\theta} в информацию Фишера:

i(θ^)n(θ^θ)dN(0,1)\sqrt{i(\hat{\theta})} \cdot \sqrt{n}(\hat{\theta} - \theta) \xrightarrow{d} N(0, 1)

Отсюда стандартным образом извлекается доверительный интервал для θ\theta.


Применение Д: ДИ через порядковые статистики (экзотический рецепт)

Утверждения

Для выборки из непрерывного распределения:

nF(x())dΓ(,1)n \cdot F(x_{(\ell)}) \xrightarrow{d} \Gamma(\ell, 1)n(1F(x(n+1s)))dΓ(s,1)n \cdot (1 - F(x_{(n+1-s)})) \xrightarrow{d} \Gamma(s, 1)

где \ell и ss — фиксированные.

Эти соотношения встречались при изучении порядковых статистик. Чисто гипотетически из них можно извлекать асимптотические доверительные интервалы.

Упражнения для самостоятельного решения

  • Для равномерного распределения U[0,θ]U[0, \theta] построить ДИ для θ\theta через порядковые статистики (применение Д).
  • Для распределения Пуассона Pois(λ)\mathrm{Pois}(\lambda) построить асимптотический ДИ для λ\lambda через ОМП (применение Г).

Часть 2. Введение в проверку статистических гипотез

🔍 Это пока предварительные мысли о формулировке задачи. Строгая постановка будет на следующей лекции.

Установка для размышления

Иван Александрович просит рассуждать:

  1. Максимально рационально.
  2. С точки зрения человека, у которого нет опыта в данной предметной области (как «рациональный инопланетянин»).

В каждой ситуации нужно выделить:

  • Дефолтное предположение (по умолчанию).
  • Альтернативное предположение.

Ситуация 1. Уголовный суд

Контекст: сферическая страна в вакууме с континентальной системой права (суд опирается на законы; в отличие от прецедентной системы, как в Великобритании или США, где суд опирается на предыдущие решения по похожим делам).

Происходит уголовное дело, подсудимого обвиняют в убийстве. Вы — судья.

  • H0H_0 (по умолчанию): человек не виновен.
  • H1H_1 (альтернатива): человек виновен в убийстве (в конкретном преступлении!).

Тонкий момент. Альтернатива конкретна. Если по ходу дела выяснится, что подсудимый занимался мошенничеством, но обвинение в убийстве не доказано, — судья скажет «не виновен» относительно данной альтернативы. Это другая задача.


Ситуация 2. Робот кидает монетку

  • H0H_0: монетка честная.
  • H1H_1: монетка нечестная (например, выпадает слишком много орлов или слишком много решек).

Ситуация 3. Измерение температуры

Хотим понять, здоров человек или болен, измеряя температуру.

  • H0H_0: человек не болен (средняя температура =36,6= 36{,}6).
  • H1H_1: человек болен (средняя температура 36,6\neq 36{,}6).

Уточнения альтернативы в зависимости от контекста

КонтекстАльтернатива
Общий случайсредняя 36,6\neq 36{,}6
Инфекционная больница (для инфекций характерна повышенная температура)средняя >36,6> 36{,}6
Заболевания с пониженной температуройсредняя <36,6< 36{,}6

Ситуация 4. Влияет ли вещество на здоровье

  • H0H_0: вещество не влияет на здоровье.
  • H1H_1: возможны разные варианты:
    • Просто влияет (любым образом).
    • Влияет положительно (если мы фармацевты).
    • Влияет отрицательно (если разрабатываем биооружие).

💡 Вывод. Альтернатива формулируется в зависимости от того, что именно мы хотим проверить.


Общая схема: H0H_0 и H1H_1

Нулевая гипотеза H0H_0

Это предположение по умолчанию. Конкретные проявления:

  • Если изучаем связь явлений: H0H_0 = явления не связаны.
  • Если замеряем показатель: H0H_0 = показатель принимает типичное значение.
  • Если сравниваем две совокупности: H0H_0 = они одинаковые.

Альтернативная гипотеза H1H_1

Это то, что мы хотим «доказать» (в кавычках, потому что стат-тесты — это не строгий метод доказательства, а статистический метод валидации данных).

  • Подозреваем некую аномалию — отклонение от нормы.
  • Подозреваем, что связь есть.
  • Подозреваем, что показатель принимает аномальные значения.

Важное замечание

⚠️ H0H_0 и H1H_1 не всегда дополняют друг друга до полного пространства возможностей.

Пример из суда: H0H_0 = «не виновен», H1H_1 = «виновен в убийстве». Но возможны и другие сценарии (например, мошенничество), которые не покрываются ни H0H_0, ни H1H_1.

В курсе будут рассматриваться ситуации, где H1H_1 — это отрицание H0H_0, но это далеко не всегда так.


Зачем нужны эти содержательные рассуждения

Стат-тесты нужно правильно применять. Чтобы их применять, надо понимать, из каких соображений формулируются H0H_0 и H1H_1 для каждой конкретной ситуации.

План на следующую лекцию: строгая математическая постановка задачи проверки статистических гипотез и описание общей схемы процедуры проверки, которая выдаёт ответ «H0H_0» или «H1H_1».