Рао–Крамер

04.03.2026 Обновлено: 04.03.2026
автор

Лекция 5: Информация Фишера, неравенство Рао–Крамера и доверительные интервалы

1. Информация Фишера: напоминание определений

В прошлый раз была введена информация Фишера.

Информация Фишера для всей выборки определяется как дисперсия логарифмической функции правдоподобия:

In(θ)=D(lnL(x,θ)θ)I_n(\theta) = D\left(\frac{\partial \ln L(x, \theta)}{\partial \theta}\right)

Для одного наблюдения:

i(θ)=D(lnp(x,θ)θ)i(\theta) = D\left(\frac{\partial \ln p(x, \theta)}{\partial \theta}\right)

В силу того, что математическое ожидание этой величины равно нулю, дисперсия совпадает с математическим ожиданием квадрата:

i(θ)=E[(lnp(x,θ)θ)2]i(\theta) = E\left[\left(\frac{\partial \ln p(x, \theta)}{\partial \theta}\right)^2\right]

Альтернативная формула (через вторую производную):

i(θ)=E[2lnp(x,θ)θ2]i(\theta) = -E\left[\frac{\partial^2 \ln p(x, \theta)}{\partial \theta^2}\right]

2. Пример 1. Распределение Бернулли

Рассмотрим выборку из распределения Бернулли. Плотность (точнее, вероятность):

p(x,p)=px(1p)1xp(x, p) = p^x (1-p)^{1-x}

где x{0,1}x \in \{0, 1\}: исход 11 с вероятностью pp, исход 00 с вероятностью 1p1-p.

Шаг 1. Логарифм:

lnp(x,p)=xlnp+(1x)ln(1p)\ln p(x, p) = x \ln p + (1-x) \ln(1-p)

Шаг 2. Первая производная по pp:

lnpp=xp1x1p\frac{\partial \ln p}{\partial p} = \frac{x}{p} - \frac{1-x}{1-p}

Шаг 3. Вторая производная по pp:

2lnpp2=xp21x(1p)2\frac{\partial^2 \ln p}{\partial p^2} = -\frac{x}{p^2} - \frac{1-x}{(1-p)^2}

Шаг 4. Информация Фишера для одного наблюдения (используем формулу через вторую производную, со знаком минус):

i(p)=E[2lnpp2]=E[xp2+1x(1p)2]i(p) = -E\left[\frac{\partial^2 \ln p}{\partial p^2}\right] = E\left[\frac{x}{p^2} + \frac{1-x}{(1-p)^2}\right]

Пользуемся линейностью матожидания и тем, что E[x]=pE[x] = p:

i(p)=pp2+1p(1p)2=1p+11p=1p(1p)i(p) = \frac{p}{p^2} + \frac{1-p}{(1-p)^2} = \frac{1}{p} + \frac{1}{1-p} = \frac{1}{p(1-p)}

Итог: для распределения Бернулли

i(p)=1p(1p)\boxed{i(p) = \frac{1}{p(1-p)}}

Информация Фишера для всей выборки:

In(p)=np(1p)I_n(p) = \frac{n}{p(1-p)}

3. Пример 2. Равномерное распределение

Здесь нужно быть внимательным. Информация Фишера не определена, так как не выполняются условия регулярности.

Необходимое условие регулярности: множество значений случайной величины не должно зависеть от параметра.

Для равномерного распределения множество значений зависит от параметра — поэтому модель нерегулярна и информация Фишера для неё не определяется.


4. Многомерная информация Фишера

Если параметр θ\theta не одномерный, а многомерный, формулу можно обобщить. Информационная матрица Фишера:

I(θ)ij=E[2lnp(x,θ)θiθj]I(\theta)_{ij} = -E\left[\frac{\partial^2 \ln p(x, \theta)}{\partial \theta_i \, \partial \theta_j}\right]

5. Пример 3. Нормальное распределение N(μ,b)N(\mu, b)

Здесь b=σ2b = \sigma^2 — дисперсия. Плотность:

p(x,μ,b)=12πbexp((xμ)22b)p(x, \mu, b) = \frac{1}{\sqrt{2\pi b}} \exp\left(-\frac{(x - \mu)^2}{2b}\right)

Логарифм плотности:

lnp(x,μ,b)=12ln(2π)12lnb(xμ)22b\ln p(x, \mu, b) = -\frac{1}{2} \ln(2\pi) - \frac{1}{2} \ln b - \frac{(x-\mu)^2}{2b}

Первые производные

По μ\mu (первые два слагаемых обнуляются):

lnpμ=xμb\frac{\partial \ln p}{\partial \mu} = \frac{x - \mu}{b}

По bb:

lnpb=12b+(xμ)22b2\frac{\partial \ln p}{\partial b} = -\frac{1}{2b} + \frac{(x-\mu)^2}{2b^2}

Вторые производные

По μ\mu дважды:

2lnpμ2=1b\frac{\partial^2 \ln p}{\partial \mu^2} = -\frac{1}{b}

Смешанная (по μ\mu и bb):

2lnpμb=xμb2\frac{\partial^2 \ln p}{\partial \mu \, \partial b} = -\frac{x - \mu}{b^2}

По bb дважды:

2lnpb2=12b2(xμ)2b3\frac{\partial^2 \ln p}{\partial b^2} = \frac{1}{2b^2} - \frac{(x-\mu)^2}{b^3}

Информационная матрица

Берём E[]-E[\cdot] от каждой второй производной.

  • E[1b]=1b-E\left[-\dfrac{1}{b}\right] = \dfrac{1}{b}
  • Смешанная: E[xμb2]=1b2E[xμ]=0-E\left[-\dfrac{x - \mu}{b^2}\right] = \dfrac{1}{b^2} \cdot E[x - \mu] = 0 (т. к. E[x]=μE[x] = \mu)
  • По bb дважды: E[12b2(xμ)2b3]=12b2+E[(xμ)2]b3=12b2+bb3=12b2-E\left[\dfrac{1}{2b^2} - \dfrac{(x-\mu)^2}{b^3}\right] = -\dfrac{1}{2b^2} + \dfrac{E[(x-\mu)^2]}{b^3} = -\dfrac{1}{2b^2} + \dfrac{b}{b^3} = \dfrac{1}{2b^2}

Здесь использовано, что E[(xμ)2]=D(x)=bE[(x-\mu)^2] = D(x) = b.

Итог — информационная матрица для нормального распределения:

I(μ,b)=(1b0012b2)\boxed{I(\mu, b) = \begin{pmatrix} \dfrac{1}{b} & 0 \\ 0 & \dfrac{1}{2b^2} \end{pmatrix}}

6. Неравенство Рао–Крамера

Эта теорема устанавливает нетривиальную нижнюю границу дисперсии несмещённой оценки.

Формулировка

Пусть выполнены условия:

  • модель регулярна (в смысле, обсуждавшемся ранее);
  • τ(θ)\tau(\theta) — оцениваемая функция, τC1\tau \in C^1 (непрерывно дифференцируема);
  • в частном случае τ(θ)=θ\tau(\theta) = \theta — оценивается сам параметр;
  • T(x)T(x) — оценка функции τ(θ)\tau(\theta);
  • E[T(x)]=τ(θ)E[T(x)] = \tau(\theta) (оценка несмещённая).

Тогда:

D(T(x))(τ(θ))2ni(θ)D(T(x)) \geq \frac{(\tau'(\theta))^2}{n \cdot i(\theta)}

Доказательство

Стартуем из:

τ(θ)=E[T(x)]=T(x)L(x,θ)dx\tau(\theta) = E[T(x)] = \int T(x) \cdot L(x, \theta) \, dx

Модель регулярна — продифференцируем тождество по θ\theta (регулярность позволяет вносить производную под интеграл):

τ(θ)=T(x)L(x,θ)θdx\tau'(\theta) = \int T(x) \cdot \frac{\partial L(x, \theta)}{\partial \theta} \, dx

Трюк: домножим и разделим на функцию правдоподобия:

τ(θ)=T(x)lnL(x,θ)θL(x,θ)dx\tau'(\theta) = \int T(x) \cdot \frac{\partial \ln L(x, \theta)}{\partial \theta} \cdot L(x, \theta) \, dx

Здесь использовано: lnLθ=1LLθ\dfrac{\partial \ln L}{\partial \theta} = \dfrac{1}{L} \cdot \dfrac{\partial L}{\partial \theta} — логарифмическая производная.

То есть это матожидание произведения:

τ(θ)=E[T(x)V(x,θ)]\tau'(\theta) = E[T(x) \cdot V(x, \theta)]

где V(x,θ)=lnL(x,θ)θV(x, \theta) = \dfrac{\partial \ln L(x, \theta)}{\partial \theta}вклад выборки.

В прошлый раз было показано, что E[V(x,θ)]=0E[V(x, \theta)] = 0. Значит,

τ(θ)=E[T(x)V(x,θ)]E[T(x)]E[V(x,θ)]=0=Cov(T(x),V(x,θ))\tau'(\theta) = E[T(x) \cdot V(x, \theta)] - E[T(x)] \cdot \underbrace{E[V(x, \theta)]}_{= 0} = \mathrm{Cov}(T(x), V(x, \theta))

Возведём в квадрат:

(τ(θ))2=Cov2(T(x),V(x,θ))(\tau'(\theta))^2 = \mathrm{Cov}^2(T(x), V(x, \theta))

Применяем вероятностный аналог неравенства Коши–Буняковского для ковариации:

Cov2(T,V)D(T)D(V)\mathrm{Cov}^2(T, V) \leq D(T) \cdot D(V)

А D(V(x,θ))D(V(x, \theta)) — это в точности ni(θ)n \cdot i(\theta) (информация Фишера для всей выборки). Отсюда

(τ(θ))2D(T(x))ni(θ)D(T(x))(τ(θ))2ni(θ)(\tau'(\theta))^2 \leq D(T(x)) \cdot n \cdot i(\theta) \quad \Longrightarrow \quad D(T(x)) \geq \frac{(\tau'(\theta))^2}{n \cdot i(\theta)}

Что и требовалось доказать. \blacksquare


7. Замечания к неравенству Рао–Крамера

Замечание 1. Связь с MSE

Вспомним:

MSE=D(T)+(смещение)2\mathrm{MSE} = D(T) + (\text{смещение})^2

Если оценка несмещённая, то MSE=D(T)\mathrm{MSE} = D(T). Значит, при выполнении условий регулярности и несмещённости оценки можно дать нижнюю границу не только для дисперсии, но и для MSE.

Если в регулярной модели несмещённая оценка достигает нижней границы Рао–Крамера, то она оптимальная.

То есть в несмещённой ситуации в регулярной модели оценка оптимальна тогда и только тогда, когда её дисперсия достигает нижней границы Рао–Крамера.

Замечание 2. Многомерная формулировка

Пусть τ(θ)\tau(\theta) — функция из RdR\mathbb{R}^d \to \mathbb{R}, и T(x)T(x) — несмещённая оценка для τ(θ)\tau(\theta). Тогда:

D(T(x))1nτ(θ)I1(θ)τ(θ)D(T(x)) \geq \frac{1}{n} \cdot \nabla \tau(\theta)^\top \cdot I^{-1}(\theta) \cdot \nabla \tau(\theta)

8. Возвращение к примерам — проверка оптимальности

Бернулли

Получили: i(p)=1p(1p)i(p) = \dfrac{1}{p(1-p)}. Нижняя граница Рао–Крамера:

D(p^)p(1p)nD(\hat{p}) \geq \frac{p(1-p)}{n}

Стандартная оценка — выборочное среднее p^=xˉ\hat{p} = \bar{x} (доля единиц). Это несмещённая оценка, и

D(xˉ)=1nD(Bern)=p(1p)nD(\bar{x}) = \frac{1}{n} D(\text{Bern}) = \frac{p(1-p)}{n}

Дисперсия совпадает с нижней границей \Rightarrow выборочное среднее — оптимальная оценка для pp в распределении Бернулли.

Вопрос из аудитории: а если бы дисперсия не совпала? Ответ: если бы дисперсия была больше, мы бы сказали, что оценка не оптимальна. В общем случае задача поиска оптимальной оценки не разрешима, но известно, что оценка максимального правдоподобия в регулярном случае асимптотически эффективна (см. ниже).

Нормальное распределение, оценка для μ\mu

Пусть τ(μ,b)=μ\tau(\mu, b) = \mu. Градиент: τ=(1,0)\nabla \tau = (1, 0)^\top.

Информационная матрица I=(1/b001/(2b2))I = \begin{pmatrix} 1/b & 0 \\ 0 & 1/(2b^2)\end{pmatrix}. Обратная: I1=(b002b2)I^{-1} = \begin{pmatrix} b & 0 \\ 0 & 2b^2\end{pmatrix}.

Нижняя граница:

D(μ^)1n(1,0)(b002b2)(10)=bnD(\hat{\mu}) \geq \frac{1}{n} (1, 0) \begin{pmatrix} b & 0 \\ 0 & 2b^2 \end{pmatrix} \begin{pmatrix} 1 \\ 0 \end{pmatrix} = \frac{b}{n}

Стандартная оценка матожидания — μ^=xˉ\hat{\mu} = \bar{x} (выборочное среднее). Это несмещённая оценка с D(xˉ)=bnD(\bar{x}) = \dfrac{b}{n}.

Снова дисперсия совпала с нижней границей \Rightarrow выборочное среднее — оптимальная оценка для матожидания нормального закона.


9. Асимптотическая нормальность ОМП

Формулировка теоремы

Условия:

  • 3lnp(x,θ)θ3M(x)\left|\dfrac{\partial^3 \ln p(x, \theta)}{\partial \theta^3}\right| \leq M(x), причём E[M(x)]<E[M(x)] < \infty;
  • модель регулярна.

Утверждение:

n(θ^θ)dN(0,i1(θ))\sqrt{n}(\hat{\theta} - \theta) \xrightarrow{d} N\left(0, \, i^{-1}(\theta)\right)

Здесь θ^\hat{\theta}оценка максимального правдоподобия.

Интерпретация

Неформально: при больших nn

θ^N(θ,1ni(θ))\hat{\theta} \approx N\left(\theta, \, \frac{1}{n \cdot i(\theta)}\right)

То есть асимптотическая дисперсия ОМП совпадает с нижней границей Рао–Крамера. Поэтому можно говорить, что оценки максимального правдоподобия асимптотически эффективны.


10. Переход к доверительным интервалам

Точечное оценивание даёт оценку в виде конкретного числа. Но число не всегда наглядно. Иногда удобнее давать оценку в виде диапазона — это и есть доверительные интервалы (confidence intervals).

Определение

Пусть выборка x1,,xnx_1, \dots, x_n из распределения FF с параметром θ\theta (одномерным). Рассмотрим две статистики L(x)L(x) и R(x)R(x).

Будем говорить, что (L(x),R(x))(L(x), R(x)) образуют доверительный интервал уровня доверия 1α1 - \alpha, если

P(θ(L(x),R(x)))1αP(\theta \in (L(x), R(x))) \geq 1 - \alpha

Практическая интерпретация

Обычно 1α1 - \alpha берут 90%90\%, 95%95\% или 99%99\%.

Пример. Пусть уровень доверия 95%95\%. Если провести 100 экспериментов и для каждой выборки построить свой доверительный интервал, то хотя бы в 95 случаях из 100 реальное значение параметра попадёт в построенный интервал. То есть «хорошими» в этом смысле будут не менее 95 из 100 интервалов.

Замечание об обозначениях. Уровень доверия часто обозначают буквой γ=1α\gamma = 1 - \alpha. Тогда квантили будут порядка 1γ2\dfrac{1 - \gamma}{2} слева и 1+γ2\dfrac{1 + \gamma}{2} справа. В лекции используется обозначение через α\alpha — это связано с другой задачей (проверка гипотез), которую рассмотрим позже.


11. Общая схема построения доверительного интервала

Шаг 1. Найти функцию g(x,θ)g(x, \theta) — статистику, аналитически зависящую от выборки и параметра, такую что распределение g(x,θ)g(x, \theta) не зависит от θ\theta.

Шаг 2. Записать вероятность

P(Lg(x,θ)R)=1αP(L \leq g(x, \theta) \leq R) = 1 - \alpha

Шаг 3. На графике плотности отсечь:

  • слева вероятностную массу α/2\alpha/2;
  • справа вероятностную массу α/2\alpha/2;
  • посередине останется 1α1 - \alpha.

Тогда:

L=qα/2,R=q1α/2L = q_{\alpha/2}, \quad R = q_{1 - \alpha/2}

— квантили распределения статистики gg.

Шаг 4. Разрешить неравенство относительно θ\theta — получится доверительный интервал.


12. Доверительный интервал для матожидания при известной дисперсии

Условия: выборка x1,,xnx_1, \dots, x_n из N(μ,σ2)N(\mu, \sigma^2), причём σ2\sigma^2 известна. Строим доверительный интервал для μ\mu.

Рецепт 1 (плохой). Использование одного элемента

Статистика:

g1(x)=x1μσN(0,1)g_1(x) = \frac{x_1 - \mu}{\sigma} \sim N(0, 1)

Её распределение не зависит от μ\mu.

Зажимаем квантилями стандартного нормального (распределение симметрично относительно 0):

q1α/2x1μσq1α/2-q_{1 - \alpha/2} \leq \frac{x_1 - \mu}{\sigma} \leq q_{1 - \alpha/2}

Разрешаем относительно μ\mu:

μ(x1σq1α/2, x1+σq1α/2)\boxed{\mu \in \left(x_1 - \sigma \cdot q_{1 - \alpha/2}, \ x_1 + \sigma \cdot q_{1 - \alpha/2}\right)}

Рецепт 2 (хороший). Использование всей выборки

Статистика:

g2(x)=nxˉμσN(0,1)g_2(x) = \sqrt{n} \cdot \frac{\bar{x} - \mu}{\sigma} \sim N(0, 1)

(центрировали и нормировали — снова стандартное нормальное).

Зажимаем квантилями:

q1α/2nxˉμσq1α/2-q_{1 - \alpha/2} \leq \sqrt{n} \cdot \frac{\bar{x} - \mu}{\sigma} \leq q_{1 - \alpha/2}

Разрешаем относительно μ\mu:

μxˉ±σq1α/2n\boxed{\mu \in \bar{x} \pm \frac{\sigma \cdot q_{1 - \alpha/2}}{\sqrt{n}}}

Сравнение

Какой интервал лучше? Второй, потому что:

  • в нём участвует вся выборка (а не только первый элемент);
  • длина интервала уменьшается с ростом nn (за счёт деления на n\sqrt{n});
  • середина интервала (xˉ\bar{x}) при увеличении объёма выборки становится всё ближе к реальному значению параметра.

Оба интервала имеют один и тот же уровень доверия 1α1 - \alpha, но второй — содержательно лучше.

Терминология

В контексте доверительных интервалов выражения вида «оценка ±\pm что-то» возникают часто. Величина перед квантилью называется стандартной ошибкой (SESE, Standard Error).

Для квантилей нормального закона нередко используют букву zz (вместо qq). На лекции используется qq, но из контекста всегда понятно, какое распределение имеется в виду.


13. Три важных вспомогательных распределения

Перед тем как переходить к следующим задачам, нужно ввести три распределения, играющих ключевую роль в статистике.

A. Распределение хи-квадрат χn2\chi^2_n

Пусть x1,x2,,xnx_1, x_2, \dots, x_n — независимые случайные величины, каждая со стандартным нормальным распределением N(0,1)N(0, 1). Тогда

k=1nxk2χn2\sum_{k=1}^{n} x_k^2 \sim \chi^2_n

Параметр nnчисло степеней свободы (это просто количество независимых слагаемых).

Связь с гамма-распределением: χn2\chi^2_n — это гамма-распределение с параметрами (n2,12)\left(\dfrac{n}{2}, \dfrac{1}{2}\right). То есть класс распределений χ2\chi^2 содержится в классе гамма-распределений.

B. Распределение Стьюдента tnt_n

Пусть x0,x1,,xnx_0, x_1, \dots, x_n — независимые N(0,1)N(0, 1). Рассмотрим:

Tn=x01nk=1nxk2T_n = \frac{x_0}{\sqrt{\dfrac{1}{n} \sum\limits_{k=1}^{n} x_k^2}}

Тогда TnT_n имеет распределение Стьюдента (tt-распределение) с nn степенями свободы: TntnT_n \sim t_n.

Под корнем стоит усреднённый χ2\chi^2.

Свойства распределения Стьюдента

  1. Симметрично относительно нуля. Числитель — стандартное гауссовское (симметрично), знаменатель — неотрицательная константа.
  2. При больших nn близко к нормальному. По закону больших чисел знаменатель 1\to 1, и остаётся гауссовская величина. То есть при больших nn: tnN(0,1)t_n \approx N(0, 1).

C. Распределение Фишера Fn,mF_{n, m}

Пусть χn2\chi^2_n имеет распределение хи-квадрат с nn степенями свободы, а χm2\chi^2_m — независимая случайная величина с распределением хи-квадрат с mm степенями свободы. Тогда

Fn,m=χn2/nχm2/mF_{n, m} = \frac{\chi^2_n / n}{\chi^2_m / m}

имеет распределение Фишера с параметрами nn и mm.

Где используются эти распределения

  • Нормальное — при построении доверительного интервала для матожидания, если дисперсия известна (или, забегая вперёд, при больших объёмах выборки — по ЦПТ).
  • χ2\chi^2 — при построении доверительного интервала для дисперсии.
  • Стьюдент — при построении доверительного интервала для матожидания, если дисперсия неизвестна.
  • Фишер — при построении доверительного интервала для отношения дисперсий.

14. Доверительный интервал для дисперсии при известном матожидании

Условия: выборка из N(μ,σ2)N(\mu, \sigma^2), μ\mu известно, строим интервал для σ2\sigma^2.

Почему нельзя использовать прежнюю статистику

Если попробовать взять g(x)=nxˉμσg(x) = \sqrt{n} \cdot \dfrac{\bar{x} - \mu}{\sigma}, то при разрешении неравенства относительно σ\sigma возникнут проблемы: xˉμ\bar{x} - \mu может быть как положительным, так и отрицательным, и при делении/умножении на эту величину знаки неравенств будут меняться по-разному. Это неудобно.

Правильная статистика

Заметим, что xkμσN(0,1)\dfrac{x_k - \mu}{\sigma} \sim N(0, 1). Значит, по определению χ2\chi^2:

k=1n(xkμ)2σ2χn2\sum_{k=1}^{n} \frac{(x_k - \mu)^2}{\sigma^2} \sim \chi^2_n

Это распределение не зависит от σ\sigma.

Зажимаем квантилями

Распределение χn2\chi^2_n не симметрично относительно нуля (плотность сосредоточена на [0,)[0, \infty), асимметрична), поэтому обе квантили нужно считать честно:

qα/2k=1n(xkμ)2σ2q1α/2q_{\alpha/2} \leq \sum_{k=1}^{n} \frac{(x_k - \mu)^2}{\sigma^2} \leq q_{1 - \alpha/2}

где qq — квантили распределения χn2\chi^2_n.

Разрешаем относительно σ2\sigma^2

Из неравенства k(xkμ)2/σ2q1α/2\sum_k (x_k - \mu)^2 / \sigma^2 \leq q_{1 - \alpha/2} получаем σ2k(xkμ)2q1α/2\sigma^2 \geq \dfrac{\sum_k (x_k - \mu)^2}{q_{1 - \alpha/2}}.

Аналогично с другой стороны.

Итог:

σ2(k=1n(xkμ)2q1α/2, k=1n(xkμ)2qα/2)\boxed{\sigma^2 \in \left(\frac{\sum\limits_{k=1}^{n}(x_k - \mu)^2}{q_{1 - \alpha/2}}, \ \frac{\sum\limits_{k=1}^{n}(x_k - \mu)^2}{q_{\alpha/2}}\right)}

где квантили — распределения χn2\chi^2_n.


15. Теорема Фишера

Перед следующей задачей понадобится ключевая теорема. В разных источниках в неё включают разные пункты, приведём основные.

Условия: выборка x1,,xnx_1, \dots, x_n из гауссовского закона N(μ,σ2)N(\mu, \sigma^2).

Пункт 1

nS2σ2=(n1)S2σ2χn12\frac{n \cdot S^2}{\sigma^2} = \frac{(n-1) \cdot S^{*2}}{\sigma^2} \sim \chi^2_{n-1}

где

  • S2=1nk=1n(xkxˉ)2S^2 = \dfrac{1}{n} \sum\limits_{k=1}^{n}(x_k - \bar{x})^2смещённая выборочная дисперсия;
  • S2=1n1k=1n(xkxˉ)2S^{*2} = \dfrac{1}{n-1} \sum\limits_{k=1}^{n}(x_k - \bar{x})^2несмещённая выборочная дисперсия.

Неформально, почему n1n - 1. В каждом слагаемом (xkxˉ)2(x_k - \bar{x})^2 участвует выборочное среднее xˉ\bar{x}, которое «портит» независимость слагаемых. За счёт этой связи число степеней свободы уменьшается на единицу.

Пункт 2

xˉ\bar{x} и S2S^2 независимы (а также xˉ\bar{x} и S2S^{*2} независимы).

Это не очевидное наблюдение: в обеих статистиках на первый взгляд участвует xˉ\bar{x} — казалось бы, они должны быть зависимы. Однако для выборок из нормального закона эти статистики независимы. Это нетривиальное свойство именно гауссовского распределения.

Эти два пункта потребуются для решения следующих задач.


16. Доверительный интервал для дисперсии при неизвестном матожидании

Условия: выборка из N(μ,σ2)N(\mu, \sigma^2), μ\mu неизвестно, строим интервал для σ2\sigma^2.

Здесь нельзя использовать предыдущий рецепт, поскольку в нём фигурировало μ\mu. На помощь приходит теорема Фишера.

По теореме Фишера:

nS2σ2χn12\frac{n \cdot S^{*2}}{\sigma^2} \sim \chi^2_{n-1}

(Замечание Ивана Александровича: в записи может быть как S2S^2, так и S2S^{*2} — нужно следить, что именно записано: смещённая или несмещённая дисперсия. Здесь идёт зажатие именно этой статистики.)

Зажимаем квантилями

qα/2nS2σ2q1α/2q_{\alpha/2} \leq \frac{n \cdot S^{*2}}{\sigma^2} \leq q_{1 - \alpha/2}

где квантили — распределения χn12\chi^2_{n-1}.

Разрешаем относительно σ2\sigma^2

σ2(nS2q1α/2, nS2qα/2)\boxed{\sigma^2 \in \left(\frac{n \cdot S^{*2}}{q_{1 - \alpha/2}}, \ \frac{n \cdot S^{*2}}{q_{\alpha/2}}\right)}

где квантили распределения χn12\chi^2_{n-1}.


17. Доверительный интервал для матожидания при неизвестной дисперсии

Условия: выборка из N(μ,σ2)N(\mu, \sigma^2), дисперсия неизвестна, строим интервал для μ\mu.

Здесь нельзя использовать рецепт со стандартным нормальным, поскольку в нём фигурирует σ\sigma.

Подбираем статистику

Рассмотрим:

T=n1xˉμS=nxˉμST = \sqrt{n - 1} \cdot \frac{\bar{x} - \mu}{S} = \sqrt{n} \cdot \frac{\bar{x} - \mu}{S^*}

Почему SS, а не S2S^2? Физически xˉμ\bar{x} - \mu — это «метры», а S2S^2 — это «метры в квадрате». Математически: при нормировании мы делим на стандартное отклонение, а не на дисперсию.

Распределение этой статистики

Перепишем:

T=n(xˉμ)/σS2/σ2T = \frac{\sqrt{n} \cdot (\bar{x} - \mu) / \sigma}{\sqrt{S^{*2} / \sigma^2}}
  • В числителе: nxˉμσN(0,1)\sqrt{n} \cdot \dfrac{\bar{x} - \mu}{\sigma} \sim N(0, 1) — стандартная гауссовская величина.
  • В знаменателе под корнем: S2σ2\dfrac{S^{*2}}{\sigma^2} связано с χn12\chi^2_{n-1} по теореме Фишера, причём поделенным на число степеней свободы.
  • По теореме Фишера числитель и знаменатель независимы.

По определению распределения Стьюдента (отношение нормального к корню из «усреднённого χ2\chi^2») получаем:

Ttn1T \sim t_{n-1}

Доверительный интервал

Распределение Стьюдента симметрично относительно нуля, поэтому:

q1α/2nxˉμSq1α/2-q_{1 - \alpha/2} \leq \sqrt{n} \cdot \frac{\bar{x} - \mu}{S^*} \leq q_{1 - \alpha/2}

где qq — квантили распределения tn1t_{n-1}.

Разрешая относительно μ\mu:

μxˉ±Sq1α/2n\boxed{\mu \in \bar{x} \pm \frac{S^* \cdot q_{1 - \alpha/2}}{\sqrt{n}}}

где q1α/2q_{1 - \alpha/2} — квантиль распределения Стьюдента tn1t_{n-1}.

Это доверительный интервал для матожидания нормального закона при неизвестной дисперсии — в нём как раз и используется распределение Стьюдента.


18. Итоговая таблица: сводка доверительных интервалов для N(μ,σ2)N(\mu, \sigma^2)

ПараметрЧто известноИспользуемое распределениеДоверительный интервал
μ\muσ2\sigma^2 известноN(0,1)N(0, 1)xˉ±σq1α/2n\bar{x} \pm \dfrac{\sigma \cdot q_{1 - \alpha/2}}{\sqrt{n}}
μ\muσ2\sigma^2 неизвестноtn1t_{n-1}xˉ±Sq1α/2n\bar{x} \pm \dfrac{S^* \cdot q_{1 - \alpha/2}}{\sqrt{n}}
σ2\sigma^2μ\mu известноχn2\chi^2_n((xkμ)2q1α/2,(xkμ)2qα/2)\left(\dfrac{\sum (x_k - \mu)^2}{q_{1 - \alpha/2}}, \dfrac{\sum (x_k - \mu)^2}{q_{\alpha/2}}\right)
σ2\sigma^2μ\mu неизвестноχn12\chi^2_{n-1}(nS2q1α/2,nS2qα/2)\left(\dfrac{n S^{*2}}{q_{1 - \alpha/2}}, \dfrac{n S^{*2}}{q_{\alpha/2}}\right)

19. Что будет в следующий раз

  • Доверительный интервал для разности матожиданий двух выборок.
  • Доверительный интервал для отношения дисперсий (здесь будет работать распределение Фишера).
  • Ивана Александровича обещал прислать листинг с конкретными числовыми примерами.