Метод моментов

18.02.2026 Обновлено: 18.02.2026
автор

Лекция 3: Точечное оценивание параметров. Метод моментов

Общая постановка задачи

Пусть имеется модель простейшей выборки. С теоретической точки зрения это набор независимых одинаково распределённых случайных величин, распределение которых задаётся функцией распределения.

При этом будем предполагать, что функция распределения параметризуется неким параметром θ\theta:

F(x;θ),θΘRdF(x; \theta), \quad \theta \in \Theta \subseteq \mathbb{R}^d

где Θ\Theta — множество допустимых значений параметра, а θ\theta может быть dd-мерным вектором.

Мотивация: часто есть основания предполагать, что выборка пришла из какого-то класса распределений. Например:

  • В биологии сами данные или их логарифмы аппроксимируются нормальным законом.
  • Для потоков событий нередко используется распределение Пуассона.

Цель: оценить неизвестный параметр θ\theta в виде θ^\hat{\theta}, где θ^\hat{\theta} — это какая-то функция от выборки.

Напоминание: функция от выборки кратко называется статистикой.

Нам бы какая оценка не годится — хотелось, чтобы она удовлетворяла каким-то хорошим свойствам.


Свойства оценок

1. Состоятельность (consistency)

Неформально: при увеличении объёма выборки оценка становится ближе к истинному значению.

Определение: оценка θ^\hat{\theta} называется состоятельной, если она сходится по вероятности к θ\theta:

θ^Pθ\hat{\theta} \xrightarrow{P} \theta

По-английски: consistency. Это базовое свойство, говорящее о том, что оценка вообще разумна.

2. Смещённость / несмещённость (bias / unbiasedness)

Смещение оценки определяется как:

bias(θ^)=E[θ^]θ\text{bias}(\hat{\theta}) = \mathbb{E}[\hat{\theta}] - \theta
  • Оценка несмещённая (unbiased) ⟺ bias(θ^)=0\text{bias}(\hat{\theta}) = 0
  • Оценка смещённаяbias(θ^)0\text{bias}(\hat{\theta}) \neq 0
  • Оценка асимптотически несмещённаяbias(θ^)0\text{bias}(\hat{\theta}) \to 0 при nn \to \infty

Пример: обычная выборочная дисперсия — смещённая оценка теоретической дисперсии, но асимптотически несмещённая.

3. Асимптотическая нормальность

Оценка θ^\hat{\theta} называется асимптотически нормальной, если:

n(θ^θ)dN(0,Σ)\sqrt{n}(\hat{\theta} - \theta) \xrightarrow{d} \mathcal{N}(0, \Sigma)

то есть в пределе по распределению получается гауссовская величина с нулевым математическим ожиданием и какой-то матрицей ковариации Σ\Sigma.

4. Оптимальность и эффективность

Гипотетический вопрос: если у нас есть несколько оценок, то как сравнить, какая оценка лучше? Нужна метрика.

Среднеквадратическая ошибка (Mean Squared Error)

MSE(θ^)=Eθ^θ2\text{MSE}(\hat{\theta}) = \mathbb{E}\|\hat{\theta} - \theta\|^2

где x2=xTx=ixi2\|x\|^2 = x^T x = \sum_i x_i^2 — норма вектора x=(x1,,xn)x = (x_1, \ldots, x_n).

⚠️ Важная ремарка: среднеквадратическая ошибка (MSE) и среднее квадратическое отклонение — разные вещи! Хоть в русском языке слова “ошибка” и “отклонение” синонимы, в статистике они означают совершенно разное:

  • MSE — это Eθ^θ2\mathbb{E}\|\hat{\theta} - \theta\|^2
  • Среднее квадратическое отклонение — это Var(θ^)\sqrt{\text{Var}(\hat{\theta})} (корень из дисперсии)

Определение оптимальной (эффективной) оценки

Оценка θ^\hat{\theta} называется оптимальной (эффективной) в классе T\mathcal{T}, если:

θ^=argminθ~TMSE(θ~)\hat{\theta} = \arg\min_{\tilde{\theta} \in \mathcal{T}} \text{MSE}(\tilde{\theta})

Например, T\mathcal{T} может быть классом несмещённых оценок: оценка называется эффективной, если у неё наименьшая среднеквадратическая ошибка среди всех несмещённых оценок.

Важное замечание про терминологию

Понятия оптимальности и эффективности часто отождествляют. Однако в некоторых книгах эти понятия различают:

  • Оптимальная оценка — минимизирует MSE.
  • Эффективная оценка в другом определении: θ^\hat{\theta} — эффективная оценка, если
θ^=argminθ~Ttr(Σθ~)\hat{\theta} = \arg\min_{\tilde{\theta} \in \mathcal{T}} \text{tr}(\Sigma_{\tilde{\theta}})

где tr\text{tr} — след матрицы (trace), а Σ\Sigma — матрица ковариации оценки.

Уточнение: argmin\arg\min — это значение аргумента, при котором достигается минимум функции. Класс T\mathcal{T} — это произвольный класс оценок, в котором мы ищем оптимум (например, класс несмещённых, класс линейных оценок и т.д.). Например, при изучении линейных моделей будет теорема Гаусса–Маркова про эффективность в классе линейных несмещённых оценок.


Связь свойств: разложение MSE

Распишем MSE

MSE(θ^)=E[(θ^θ)T(θ^θ)]\text{MSE}(\hat{\theta}) = \mathbb{E}\left[(\hat{\theta} - \theta)^T(\hat{\theta} - \theta)\right]

Применим приём “плюс-минус Eθ^\mathbb{E}\hat{\theta}”:

θ^θ=(θ^Eθ^)+(Eθ^θ)\hat{\theta} - \theta = (\hat{\theta} - \mathbb{E}\hat{\theta}) + (\mathbb{E}\hat{\theta} - \theta)

Раскрывая скобки и используя линейность математического ожидания, получим четыре слагаемых:

  1. E[(θ^Eθ^)T(θ^Eθ^)]\mathbb{E}\left[(\hat{\theta} - \mathbb{E}\hat{\theta})^T(\hat{\theta} - \mathbb{E}\hat{\theta})\right]
  2. E[(Eθ^θ)T(Eθ^θ)]\mathbb{E}\left[(\mathbb{E}\hat{\theta} - \theta)^T(\mathbb{E}\hat{\theta} - \theta)\right]
  3. E[(θ^Eθ^)T(Eθ^θ)]\mathbb{E}\left[(\hat{\theta} - \mathbb{E}\hat{\theta})^T(\mathbb{E}\hat{\theta} - \theta)\right]
  4. E[(Eθ^θ)T(θ^Eθ^)]\mathbb{E}\left[(\mathbb{E}\hat{\theta} - \theta)^T(\hat{\theta} - \mathbb{E}\hat{\theta})\right]

Анализ слагаемых

Слагаемые 3 и 4 равны нулю. Рассуждение:

  • θ\theta — константа.
  • Eθ^\mathbb{E}\hat{\theta} — это число (не случайная величина), значит тоже константа.
  • Следовательно, Eθ^θ\mathbb{E}\hat{\theta} - \theta — константа, которую можно вынести из-под знака математического ожидания.
  • Остаётся E[θ^Eθ^]=Eθ^Eθ^=0\mathbb{E}[\hat{\theta} - \mathbb{E}\hat{\theta}] = \mathbb{E}\hat{\theta} - \mathbb{E}\hat{\theta} = 0.

Транспонирование константы — это тоже константа (транспонированная), не важно, строчка или вектор.

Слагаемое 2 — это уже константа, поэтому E\mathbb{E} снимается. Оно равно квадрату нормы смещения:

bias(θ^)2=Eθ^θ2\|\text{bias}(\hat{\theta})\|^2 = \|\mathbb{E}\hat{\theta} - \theta\|^2

Слагаемое 1 — расписав покомпонентно:

i=1dE[(θ^iEθ^i)2]=i=1dVar(θ^i)=tr(Σθ^)\sum_{i=1}^{d} \mathbb{E}\left[(\hat{\theta}_i - \mathbb{E}\hat{\theta}_i)^2\right] = \sum_{i=1}^{d} \text{Var}(\hat{\theta}_i) = \text{tr}(\Sigma_{\hat{\theta}})

(на диагонали матрицы ковариации стоят как раз дисперсии).

Итоговая формула

MSE(θ^)=tr(Σθ^)+bias(θ^)2\boxed{\text{MSE}(\hat{\theta}) = \text{tr}(\Sigma_{\hat{\theta}}) + \|\text{bias}(\hat{\theta})\|^2}

Соображение №1: эффективность через след матрицы ковариации

Если оценка несмещённая, то bias=0\text{bias} = 0, и тогда:

MSE(θ^)=tr(Σθ^)\text{MSE}(\hat{\theta}) = \text{tr}(\Sigma_{\hat{\theta}})

То есть для несмещённых оценок оптимизация MSE — это то же самое, что оптимизация следа матрицы ковариации. Это объясняет, почему в некоторых книгах эффективность определяется именно через минимизацию следа матрицы ковариации.

Спойлер: если оценка несмещённая (и выполняются некоторые условия, о которых будет сказано позже), то можно указать нетривиальную нижнюю границу для дисперсии оценки. Тривиальная граница — это, понятно, 00.


Связь свойств: асимптотическая несмещённость + дисперсия → 0 ⟹ состоятельность

Для простоты рассмотрим случай размерности d=1d = 1. Для общего dd рассуждения аналогичны.

Утверждение

Пусть:

  1. bias(θ^)0\text{bias}(\hat{\theta}) \to 0 (асимптотическая несмещённость),
  2. Var(θ^)0\text{Var}(\hat{\theta}) \to 0.

Тогда θ^\hat{\theta} — состоятельная оценка.

Доказательство

Хотим оценить P(θ^θ>ε)P(|\hat{\theta} - \theta| > \varepsilon).

Запишем цепочку неравенств. Сначала “плюс-минус” Eθ^\mathbb{E}\hat{\theta}:

ε<θ^θ=(θ^Eθ^)+(Eθ^θ)\varepsilon < |\hat{\theta} - \theta| = |(\hat{\theta} - \mathbb{E}\hat{\theta}) + (\mathbb{E}\hat{\theta} - \theta)|

По неравенству треугольника:

θ^θθ^Eθ^+Eθ^θ|\hat{\theta} - \theta| \leq |\hat{\theta} - \mathbb{E}\hat{\theta}| + |\mathbb{E}\hat{\theta} - \theta|

Второе слагаемое — это смещение, которое стремится к нулю. Поэтому, начиная с некоторого nn, оно становится меньше ε/2\varepsilon/2:

ε<θ^Eθ^+ε2\varepsilon < |\hat{\theta} - \mathbb{E}\hat{\theta}| + \frac{\varepsilon}{2}

Откуда:

θ^Eθ^>ε2|\hat{\theta} - \mathbb{E}\hat{\theta}| > \frac{\varepsilon}{2}

Если из AA следует BB, то P(A)P(B)P(A) \leq P(B). Значит:

P(θ^θ>ε)P(θ^Eθ^>ε2)P(|\hat{\theta} - \theta| > \varepsilon) \leq P\left(|\hat{\theta} - \mathbb{E}\hat{\theta}| > \frac{\varepsilon}{2}\right)

Применяем неравенство Чебышёва:

P(θ^Eθ^>ε2)4Var(θ^)ε2n0P\left(|\hat{\theta} - \mathbb{E}\hat{\theta}| > \frac{\varepsilon}{2}\right) \leq \frac{4 \, \text{Var}(\hat{\theta})}{\varepsilon^2} \xrightarrow{n \to \infty} 0

Значит, θ^Pθ\hat{\theta} \xrightarrow{P} \theta, что и требовалось показать. ∎


Связь свойств: асимптотическая нормальность ⟹ состоятельность

Утверждение

Если θ^\hat{\theta} — асимптотически нормальная оценка, то она состоятельна.

Формальное доказательство

По определению асимптотической нормальности:

n(θ^θ)dN(0,σ2)\sqrt{n}(\hat{\theta} - \theta) \xrightarrow{d} \mathcal{N}(0, \sigma^2)

Распишем вероятность:

P(θ^θ<ε)=P(n(θ^θ)<εn)P(|\hat{\theta} - \theta| < \varepsilon) = P(|\sqrt{n}(\hat{\theta} - \theta)| < \varepsilon\sqrt{n})

В силу асимптотической нормальности:

P(n(θ^θ)<εn)FN(0,σ2)(εn)FN(0,σ2)(εn)P(|\sqrt{n}(\hat{\theta} - \theta)| < \varepsilon\sqrt{n}) \to F_{\mathcal{N}(0,\sigma^2)}(\varepsilon\sqrt{n}) - F_{\mathcal{N}(0,\sigma^2)}(-\varepsilon\sqrt{n})

При nn \to \infty:

  • FN(0,σ2)(+)=1F_{\mathcal{N}(0,\sigma^2)}(+\infty) = 1
  • FN(0,σ2)()=0F_{\mathcal{N}(0,\sigma^2)}(-\infty) = 0

Значит, выражение стремится к 10=11 - 0 = 1. То есть оценка действительно состоятельна. ∎

Неформально про асимптотическую несмещённость

Из

n(θ^θ)N(0,σ2)\sqrt{n}(\hat{\theta} - \theta) \approx \mathcal{N}(0, \sigma^2)

неформально получаем:

θ^θN(0,σ2n)\hat{\theta} - \theta \approx \mathcal{N}\left(0, \frac{\sigma^2}{n}\right)

При nn \to \infty это распределение “сжимается” в точку 00. Это неформальное рассуждение.

⚠️ Важное замечание: обратное неверно! Из состоятельности не следует даже асимптотическая несмещённость. Существует экзотический контрпример (его рассмотрим в следующий раз).


Метод моментов

Это первый из методов точечного оценивания параметров.

Постановка

Пусть имеется модель простейшей выборки X1,,XnX_1, \ldots, X_n, теоретическая функция распределения параметризуется параметром θ=(θ1,,θd)\theta = (\theta_1, \ldots, \theta_d)dd-мерный параметр.

Алгоритм метода моментов

Шаг 1. Вводим функции g1,,gdg_1, \ldots, g_d такие, что существуют математические ожидания:

E[g1(X1)],E[g2(X1)],,E[gd(X1)]\mathbb{E}[g_1(X_1)], \quad \mathbb{E}[g_2(X_1)], \quad \ldots, \quad \mathbb{E}[g_d(X_1)]

Шаг 2. Поскольку распределение зависит от θ\theta, эти моментные характеристики тоже зависят от θ\theta:

E[gk(X1)]=mk(θ1,,θd),k=1,,d\mathbb{E}[g_k(X_1)] = m_k(\theta_1, \ldots, \theta_d), \quad k = 1, \ldots, d

Шаг 3. Переходим к эмпирическим аналогам. Заменяем теоретические математические ожидания выборочными средними:

gk(X)=1ni=1ngk(Xi)\overline{g_k(X)} = \frac{1}{n} \sum_{i=1}^{n} g_k(X_i)

Шаг 4. Получаем систему уравнений на оценки θ^1,,θ^d\hat{\theta}_1, \ldots, \hat{\theta}_d:

{g1(X)=m1(θ^1,,θ^d)g2(X)=m2(θ^1,,θ^d)gd(X)=md(θ^1,,θ^d)\begin{cases} \overline{g_1(X)} = m_1(\hat{\theta}_1, \ldots, \hat{\theta}_d) \\ \overline{g_2(X)} = m_2(\hat{\theta}_1, \ldots, \hat{\theta}_d) \\ \vdots \\ \overline{g_d(X)} = m_d(\hat{\theta}_1, \ldots, \hat{\theta}_d) \end{cases}

Это система dd уравнений на dd неизвестных.

Шаг 5. Предположим, что существует и притом единственное решение. Тогда:

θ^k=αk(g1(X),,gd(X)),k=1,,d\hat{\theta}_k = \alpha_k\left(\overline{g_1(X)}, \ldots, \overline{g_d(X)}\right), \quad k = 1, \ldots, d

Это решение и называется оценкой метода моментов.

Почему “метод моментов”

По умолчанию в качестве функций gkg_k берут степенные:

gk(x)=xkg_k(x) = x^k

Тогда E[gk(X)]=E[Xk]\mathbb{E}[g_k(X)] = \mathbb{E}[X^k] — это kk-й момент. Отсюда и название.

Свойства оценок метода моментов

1. Состоятельность. Если:

  • gk(X)\overline{g_k(X)} — состоятельные оценки E[gk(X)]\mathbb{E}[g_k(X)],
  • функции αk\alpha_k непрерывны,

то оценка метода моментов состоятельна.

Это обычно выполняется.

2. Асимптотическая нормальность. Если:

  • gk(X)\overline{g_k(X)} — асимптотически нормальные оценки,
  • функции αk\alpha_k гладкие,

то имеет место асимптотическая нормальность по дельта-методу.

3. Смещённость. В общем случае про смещённость и несмещённость сказать ничего нельзя.

Плюсы и минусы метода

Плюсы:

  • Идея метода достаточно проста.

Минусы:

  • Часто получаются не очень эффективные оценки (это будет видно даже на учебных примерах).

Примеры применения метода моментов

Пример 1. Распределение Бернулли

Робот много раз кидает монетку, на входе последовательность нулей и единичек. Оценить вероятность pp выпадения единички.

Берём дефолтную функцию g(x)=xg(x) = x. Математическое ожидание распределения Бернулли:

E[X]=p\mathbb{E}[X] = p

Переходим к эмпирическому аналогу:

X=p^\overline{X} = \hat{p}

Здесь всё разрешилось тривиально. Получили:

p^=X=1ni=1nXi\boxed{\hat{p} = \overline{X} = \frac{1}{n}\sum_{i=1}^{n} X_i}

То есть оценка вероятности успеха — это просто выборочное среднее (количество успехов / общее количество экспериментов).

Свойства: про выборочное среднее знаем, что это состоятельная, несмещённая, асимптотически нормальная оценка. Забегая вперёд — даже эффективная.


Пример 2. Распределение Пуассона

Вариант 1: g(x)=xg(x) = x

Математическое ожидание распределения Пуассона:

E[X]=λ\mathbb{E}[X] = \lambda

Эмпирический аналог:

λ^1=X\hat{\lambda}_1 = \overline{X}

Вариант 2: g(x)=x2g(x) = x^2

Используем то, что:

E[X2]=Var(X)+(E[X])2=λ+λ2\mathbb{E}[X^2] = \text{Var}(X) + (\mathbb{E}[X])^2 = \lambda + \lambda^2

Эмпирический аналог:

λ^2+λ^X2=0\hat{\lambda}^2 + \hat{\lambda} - \overline{X^2} = 0

Это квадратное уравнение. Решаем:

λ^=1±1+4X22\hat{\lambda} = \frac{-1 \pm \sqrt{1 + 4\overline{X^2}}}{2}

Формально два корня, но по смыслу задачи λ>0\lambda > 0, поэтому выбираем положительный корень (с плюсом):

λ^2=1+1+4X22\boxed{\hat{\lambda}_2 = \frac{-1 + \sqrt{1 + 4\overline{X^2}}}{2}}

Свойства: получилась гладкая (на области определения) функция от второго выборочного момента. Поэтому оценка состоятельная и асимптотически нормальная. Про смещённость конкретно сказать сложно.

Какая оценка лучше? Та, у которой меньше MSE. Забегая вперёд — первая оценка λ^1=X\hat{\lambda}_1 = \overline{X} будет эффективной.

Это хорошо иллюстрирует минус метода: разные функции gg дают разные оценки, и не все они одинаково хороши.


Пример 3. Нормальное распределение N(μ,b)\mathcal{N}(\mu, b)

Здесь bb — дисперсия. Два неизвестных параметра, поэтому нужны два уравнения.

Берём:

  • g1(x)=xg_1(x) = x,
  • g2(x)=x2g_2(x) = x^2.

Теоретические соотношения:

E[X]=μ\mathbb{E}[X] = \muE[X2]=Var(X)+(E[X])2=b+μ2\mathbb{E}[X^2] = \text{Var}(X) + (\mathbb{E}[X])^2 = b + \mu^2

Эмпирические аналоги:

X=μ^\overline{X} = \hat{\mu}X2=b^+μ^2\overline{X^2} = \hat{b} + \hat{\mu}^2

Отсюда:

μ^=X,b^=X2(X)2\boxed{\hat{\mu} = \overline{X}, \qquad \hat{b} = \overline{X^2} - (\overline{X})^2}

А X2(X)2\overline{X^2} - (\overline{X})^2 — это выборочная дисперсия S2S^{*2}.

Свойства:

  • μ^=X\hat{\mu} = \overline{X} — несмещённая оценка.
  • b^=S2\hat{b} = S^{*2} — смещённая оценка (но асимптотически несмещённая).
  • Обе оценки состоятельные и асимптотически нормальные.

Это иллюстрирует, что в общем случае про смещённость метода моментов ничего конкретного сказать нельзя — здесь одна оценка несмещённая, другая смещённая.


Пример 4. Равномерное распределение U[a,b]U[a, b]

Берём те же функции g1(x)=xg_1(x) = x, g2(x)=x2g_2(x) = x^2.

Математическое ожидание равномерного закона:

E[X]=a+b2\mathbb{E}[X] = \frac{a + b}{2}

Дисперсия:

Var(X)=(ba)212\text{Var}(X) = \frac{(b - a)^2}{12}

Тогда:

E[X2]=(ba)212+(a+b2)2\mathbb{E}[X^2] = \frac{(b - a)^2}{12} + \left(\frac{a + b}{2}\right)^2

Эмпирические соотношения:

X=a^+b^2\overline{X} = \frac{\hat{a} + \hat{b}}{2}X2=(b^a^)212+(a^+b^2)2\overline{X^2} = \frac{(\hat{b} - \hat{a})^2}{12} + \left(\frac{\hat{a} + \hat{b}}{2}\right)^2

Из второго уравнения, подставляя первое:

(b^a^)212=X2(X)2=S2\frac{(\hat{b} - \hat{a})^2}{12} = \overline{X^2} - (\overline{X})^2 = S^{*2}

Снова получили выборочную дисперсию! Откуда:

(b^a^)2=12S2(\hat{b} - \hat{a})^2 = 12 \cdot S^{*2}b^a^=±23S\hat{b} - \hat{a} = \pm 2\sqrt{3} \cdot S^*

где S=S2S^* = \sqrt{S^{*2}}.

Выбираем знак “+”, так как ba>0b - a > 0.

Имеем систему:

{a^+b^=2Xb^a^=23S\begin{cases} \hat{a} + \hat{b} = 2\overline{X} \\ \hat{b} - \hat{a} = 2\sqrt{3} \cdot S^* \end{cases}

Решая (сложение и вычитание):

a^=X3S,b^=X+3S\boxed{\hat{a} = \overline{X} - \sqrt{3} \cdot S^*, \qquad \hat{b} = \overline{X} + \sqrt{3} \cdot S^*}

Пример 5 (демонстрационный). Равномерное распределение U[θ,θ]U[-\theta, \theta]

Здесь интересный случай: функция g(x)=xg(x) = x не подходит, потому что:

E[X]=0\mathbb{E}[X] = 0

— математическое ожидание не зависит от θ\theta, поэтому уравнение бессмысленно.

Берём g(x)=x2g(x) = x^2:

E[X2]=θ23\mathbb{E}[X^2] = \frac{\theta^2}{3}

Эмпирический аналог даёт явное выражение для оценки θ^\hat{\theta}.

На демонстрации в Google Colab было показано: при объёме выборки 10 разброс оценки большой, а при объёме 10000 разброс существенно меньше, и распределение оценки концентрируется около реального параметра. Это иллюстрирует состоятельность и асимптотическую нормальность.


Что дальше

В следующий раз:

  1. Будет приведён экзотический контрпример, показывающий, что из состоятельности не следует даже асимптотическая несмещённость.
  2. Перейдём к следующему методу — методу максимального правдоподобия (maximum likelihood).