Правдоподобие

25.02.2026 Обновлено: 25.02.2026
автор

Лекция 4: Метод максимального правдоподобия и информация Фишера

1. Контрпример: асимптотическая нормальность ⇏ асимптотическая несмещённость

Напоминание из прошлой лекции

В прошлый раз были рассмотрены свойства оценок:

  • состоятельность,
  • эффективность,
  • асимптотическая нормальность,
  • несмещённость.

Было показано: если оценка асимптотически нормальная, то она состоятельна.

Сегодня покажем (обещанный контрпример), что из асимптотической нормальности в общем случае НЕ следует асимптотическая несмещённость (хотя обычно эта импликация имеет место). Пример экзотический, но формально корректный.

Построение контрпримера

Пусть выборка X1,,XnX_1, \ldots, X_n из нормального распределения N(0,σ2)\mathcal{N}(0, \sigma^2).

Выборочное среднее Xˉ\bar{X} — состоятельная, несмещённая, асимптотически нормальная оценка для 00 (поскольку матожидание здесь равно 00).

Модифицируем оценку. Положим:

θ^={Xˉ,с вероятностью 11nn,с вероятностью 1n\hat{\theta} = \begin{cases} \bar{X}, & \text{с вероятностью } 1 - \tfrac{1}{n} \\ n, & \text{с вероятностью } \tfrac{1}{n} \end{cases}

Доказательство асимптотической нормальности θ^\hat{\theta}

Рассмотрим функцию распределения nθ^\sqrt{n}\,\hat{\theta} в точке tt:

P(nθ^t)=P(nθ^tслучилось событие с вер. 11n)(11n)+P(nθ^tслучилось событие с вер. 1n)1nP(\sqrt{n}\,\hat{\theta} \le t) = P\left(\sqrt{n}\,\hat{\theta} \le t \mid \text{случилось событие с вер. } 1-\tfrac{1}{n}\right)\cdot\left(1 - \tfrac{1}{n}\right) + P\left(\sqrt{n}\,\hat{\theta} \le t \mid \text{случилось событие с вер. } \tfrac{1}{n}\right)\cdot \tfrac{1}{n}

Это эквивалентно:

P(nXˉt)(11n)+P(nnt)1nP(\sqrt{n}\,\bar{X} \le t)\cdot\left(1 - \tfrac{1}{n}\right) + P\left(\sqrt{n}\cdot n \le t\right)\cdot \tfrac{1}{n}

При nn \to \infty:

  • (11n)1\left(1 - \tfrac{1}{n}\right) \to 1,
  • 1n0\tfrac{1}{n} \to 0,
  • P(nXˉt)Φ0,σ2(t)P(\sqrt{n}\,\bar{X} \le t) \to \Phi_{0,\sigma^2}(t) (т.к. выборочное среднее — асимптотически нормальная оценка),
  • второе слагаемое (ограниченная вероятность ×1n\times \tfrac{1}{n}) стремится к 00.

Итог: nθ^dN(0,σ2)\sqrt{n}\,\hat{\theta} \xrightarrow{d} \mathcal{N}(0, \sigma^2).

То есть θ^\hat{\theta} — асимптотически нормальная оценка, а значит и состоятельная.

Проверка асимптотической несмещённости

E[θ^]=E[Xˉ](11n)+n1n=0+1=1\mathbb{E}[\hat{\theta}] = \mathbb{E}[\bar{X}]\cdot\left(1 - \tfrac{1}{n}\right) + n \cdot \tfrac{1}{n} = 0 + 1 = 1

Таким образом, E[θ^]=10\mathbb{E}[\hat{\theta}] = 1 \ne 0 для любого nn, асимптотической несмещённости нет.

Note

Контрпример показывает: из асимптотической нормальности не следует асимптотическая несмещённость, хотя состоятельность из неё следует. Контринтуитивно, но формально верно.


2. Метод максимального правдоподобия

Нотация: дискретный и непрерывный случаи

На практике работают либо с дискретными, либо с непрерывными распределениями.

СлучайФункцияОбозначение
ДискретныйФункция вероятностейPMF (probability mass function)
НепрерывныйПлотность вероятностиPDF (probability density function)
Info

В контексте метода максимального правдоподобия оба случая объединяются — будем использовать термин «плотность» и одну букву pp для обоих случаев. Рассуждения в дискретном и непрерывном случаях идентичны.

Постановка задачи

Имеется простейшая выборка X1,X2,,XnX_1, X_2, \ldots, X_n — независимые одинаково распределённые случайные величины с распределением, зависящим от параметра θ\theta. Задача: оценить θ\theta как функцию от выборки.

Функция правдоподобия

Поскольку элементы выборки независимы, совместная плотность есть произведение плотностей:

L(X,θ)=k=1np(Xk,θ)L(X, \theta) = \prod_{k=1}^{n} p(X_k, \theta)

Эта совместная плотность называется функцией правдоподобия.

Идея метода

На интуитивном уровне L(X,θ)L(X, \theta) — это «вероятность выборки». Метод максимального правдоподобия предлагает подобрать θ\theta так, чтобы эта вероятность была наибольшей.

Определение оценки максимального правдоподобия

Important

θ^\hat{\theta} — это значение θ\theta, при котором достигается максимум функции правдоподобия:

θ^=argmaxθL(X,θ)\hat{\theta} = \arg\max_{\theta} L(X, \theta)

3. Алгоритм поиска оценки максимального правдоподобия

Пункт 0. Посмотреть и подумать

Возможно, удастся найти ответ, внимательно посмотрев на функцию правдоподобия — без вычислений (см. примеры с равномерным распределением и распределением Лапласа ниже).

Пункт 1. Логарифмирование

Используется свойство: производная логарифма функции

(lnf(x))=f(x)f(x)(\ln f(x))' = \frac{f'(x)}{f(x)}

Логарифм — строго монотонная функция, поэтому точка максимума не меняется. Удобно работать с lnL\ln L потому, что произведение превращается в сумму.

Пункт 2. Исследование на максимум

  1. Рассмотреть lnL(X,θ)\ln L(X, \theta).
  2. Вычислить производную lnLθ\dfrac{\partial \ln L}{\partial \theta}.
  3. Приравнять к нулю.
  4. Проверить достаточные условия максимума.

4. Примеры применения метода максимального правдоподобия

Пример 1. Равномерное распределение U[θ1,θ2]U[\theta_1, \theta_2]

Плотность равномерного распределения:

p(x,θ1,θ2)=1θ2θ11{x[θ1,θ2]}p(x, \theta_1, \theta_2) = \frac{1}{\theta_2 - \theta_1} \cdot \mathbb{1}\{x \in [\theta_1, \theta_2]\}

Функция правдоподобия:

L(X,θ1,θ2)=1(θ2θ1)n1{X1[θ1,θ2],X2[θ1,θ2],,Xn[θ1,θ2]}L(X, \theta_1, \theta_2) = \frac{1}{(\theta_2 - \theta_1)^n}\cdot \mathbb{1}\{X_1 \in [\theta_1, \theta_2], X_2 \in [\theta_1, \theta_2], \ldots, X_n \in [\theta_1, \theta_2]\}
Tip

Произведение индикаторов k1{Xk[θ1,θ2]}\prod_k \mathbb{1}\{X_k \in [\theta_1, \theta_2]\} равно 11 тогда и только тогда, когда все XkX_k попадают в отрезок. Поэтому оно равно одному индикатору пересечения событий.

Анализ. Чтобы максимизировать LL:

  • Мысль А. Индикатор должен быть равен 11, т.е. θ1minkXk\theta_1 \le \min_k X_k и θ2maxkXk\theta_2 \ge \max_k X_k.
  • Мысль Б. Знаменатель (θ2θ1)n(\theta_2 - \theta_1)^n должен быть минимальным, т.е. θ2θ1\theta_2 - \theta_1 — минимально.

Совмещая:

θ^1=minkXk,θ^2=maxkXk\hat{\theta}_1 = \min_{k} X_k, \qquad \hat{\theta}_2 = \max_{k} X_k

Пример 2. Распределение Лапласа

Плотность:

p(x,θ)=12exθp(x, \theta) = \tfrac{1}{2}\, e^{-|x - \theta|}

(Распределение Лапласа с масштабным параметром 11.)

Функция правдоподобия:

L(X,θ)=12nk=1neXkθ=12nek=1nXkθL(X, \theta) = \frac{1}{2^n}\cdot \prod_{k=1}^{n} e^{-|X_k - \theta|} = \frac{1}{2^n}\cdot e^{-\sum_{k=1}^{n} |X_k - \theta|}

Множитель 12n\tfrac{1}{2^n} — константа. Чтобы максимизировать LL, нужно максимизировать аргумент экспоненты, то есть минимизировать:

k=1nXkθ    minθ\sum_{k=1}^{n} |X_k - \theta| \;\longrightarrow\; \min_\theta

Поделив на nn, получим EF^n[Xθ]\mathbb{E}_{\hat{F}_n}[|X - \theta|] — матожидание относительно эмпирического распределения.

Important

Медиана минимизирует среднее абсолютное отклонение.

Поэтому:

θ^=медиана выборки\hat{\theta} = \text{медиана выборки}

Пример 3. Биномиальное распределение Bin(m,p)\mathrm{Bin}(m, p), mm известно

Функция вероятностей:

p(x,p)=Cmxpx(1p)mxp(x, p) = C_m^x \cdot p^x \cdot (1-p)^{m-x}

Функция правдоподобия:

L(X,p)=k=1nCmXkpXk(1p)mXkL(X, p) = \prod_{k=1}^{n} C_m^{X_k}\cdot p^{X_k}\cdot (1-p)^{m - X_k}

Логарифм:

lnL(X,p)=k=1n[lnCmXk+Xklnp+(mXk)ln(1p)]\ln L(X, p) = \sum_{k=1}^{n}\left[\ln C_m^{X_k} + X_k \ln p + (m - X_k)\ln(1-p)\right]

Дифференцируем по pp (член с CmXkC_m^{X_k} не зависит от pp):

lnLp=k=1n[XkpmXk1p]\frac{\partial \ln L}{\partial p} = \sum_{k=1}^{n}\left[\frac{X_k}{p} - \frac{m - X_k}{1 - p}\right]

Приведём к общему знаменателю p(1p)p(1-p):

1p(1p)k=1n[Xk(1p)p(mXk)]=1p(1p)k=1n[Xkpm]\frac{1}{p(1-p)}\sum_{k=1}^{n}\left[X_k(1-p) - p(m - X_k)\right] = \frac{1}{p(1-p)}\sum_{k=1}^{n}\left[X_k - p\cdot m\right]

Вынесем nn и mm:

=nmp(1p)[Xˉmp]= \frac{n\cdot m}{p(1-p)}\left[\frac{\bar{X}}{m} - p\right]

Приравнивая к нулю:

p^=Xˉm\hat{p} = \frac{\bar{X}}{m}

Проверка максимума: при p<Xˉ/mp < \bar{X}/m производная положительна (функция возрастает), при p>Xˉ/mp > \bar{X}/m — отрицательна (функция убывает). Значит, это точка максимума.

Note

Если m=1m = 1 — распределение Бернулли. Тогда p^=Xˉ\hat{p} = \bar{X} — доля единиц в выборке.

Пример 4. Нормальное распределение N(μ,b)\mathcal{N}(\mu, b)

Здесь bb — дисперсия (а не σ2\sigma^2). Плотность:

p(x,μ,b)=12πbe(xμ)22bp(x, \mu, b) = \frac{1}{\sqrt{2\pi b}}\, e^{-\frac{(x - \mu)^2}{2b}}

Логарифм функции правдоподобия:

lnL(X,μ,b)=k=1n[12ln(2π)12lnb(Xkμ)22b]\ln L(X, \mu, b) = \sum_{k=1}^{n}\left[-\tfrac{1}{2}\ln(2\pi) - \tfrac{1}{2}\ln b - \frac{(X_k - \mu)^2}{2b}\right]

Шаг 1. Зафиксируем bb, найдём μ^\hat{\mu} (ленивый вариант)

При фиксированном bb максимизация lnL\ln L эквивалентна минимизации:

k=1n(Xkμ)2    minμ\sum_{k=1}^{n}(X_k - \mu)^2 \;\longrightarrow\; \min_\mu

Поделив на nn, получаем EF^n[(Xμ)2]\mathbb{E}_{\hat{F}_n}[(X - \mu)^2] — матожидание квадрата отклонения.

Important

Эта величина минимизируется при μ=E[X]\mu = \mathbb{E}[X] (для эмпирического распределения это выборочное среднее).

(Точкой минимума является матожидание, а само минимальное значение — дисперсия.)

Поэтому:

μ^=Xˉ\hat{\mu} = \bar{X}

Шаг 2. Найдём b^\hat{b}

Дифференцируем lnL\ln L по bb:

lnLb=k=1n12b+k=1n(Xkμ^)22b2=0\frac{\partial \ln L}{\partial b} = -\sum_{k=1}^{n}\frac{1}{2b} + \sum_{k=1}^{n}\frac{(X_k - \hat{\mu})^2}{2b^2} = 0

Откуда:

b^=1nk=1n(Xkμ^)2=S2\hat{b} = \frac{1}{n}\sum_{k=1}^{n}(X_k - \hat{\mu})^2 = S^{*2}

Это выборочная дисперсия (со звёздочкой).

Summary

μ^=Xˉ,b^=S2\hat{\mu} = \bar{X}, \qquad \hat{b} = S^{*2}

Оценками максимального правдоподобия для параметров нормального закона являются выборочное среднее и выборочная дисперсия.

(Это «ленивый» вариант: строго следовало бы исследовать функцию двух переменных через гессиан.)

Пример 5. Дискретное распределение на mm значениях

Пусть выборка из дискретного распределения, принимающего значения 1,2,,m1, 2, \ldots, m с вероятностями p1,p2,,pmp_1, p_2, \ldots, p_m.

Сколько неизвестных? m1m - 1 (так как pk=1\sum p_k = 1).

Группировка. Пусть νk\nu_k — количество элементов выборки, равных kk. Тогда:

k=1mνk=n\sum_{k=1}^{m} \nu_k = n

Функция правдоподобия:

L(X,p)=p1ν1p2ν2pmνmL(X, p) = p_1^{\nu_1}\cdot p_2^{\nu_2}\cdot \ldots \cdot p_m^{\nu_m}

с ограничением p1+p2++pm=1p_1 + p_2 + \ldots + p_m = 1.

Tip

Можно было бы использовать множители Лагранжа, но т.к. ограничение одно, проще выразить pm=1p1pm1p_m = 1 - p_1 - \ldots - p_{m-1} и работать с функцией m1m-1 переменной.

Подставляем:

lnL(X,p)=k=1m1νklnpk+νmln(1p1pm1)\ln L(X, p) = \sum_{k=1}^{m-1}\nu_k \ln p_k + \nu_m \ln\left(1 - p_1 - \ldots - p_{m-1}\right)

Дифференцируем по pjp_j (j{1,,m1}j \in \{1, \ldots, m-1\}):

lnLpj=νjpjνmpm=0\frac{\partial \ln L}{\partial p_j} = \frac{\nu_j}{p_j} - \frac{\nu_m}{p_m} = 0

Откуда:

νjpm=νmpjдля всех j=1,,m1\nu_j \cdot p_m = \nu_m \cdot p_j \quad \text{для всех } j = 1, \ldots, m-1

Просуммируем все эти уравнения (по jj от 11 до m1m-1):

pm(ν1++νm1)=νm(p1++pm1)p_m\cdot(\nu_1 + \ldots + \nu_{m-1}) = \nu_m\cdot(p_1 + \ldots + p_{m-1})

Используя ν1++νm1=nνm\nu_1 + \ldots + \nu_{m-1} = n - \nu_m и p1++pm1=1pmp_1 + \ldots + p_{m-1} = 1 - p_m:

pm(nνm)=νm(1pm)p_m\cdot(n - \nu_m) = \nu_m\cdot(1 - p_m)pmnpmνm=νmνmpmp_m\cdot n - p_m\cdot \nu_m = \nu_m - \nu_m\cdot p_mp^m=νmn\boxed{\hat{p}_m = \frac{\nu_m}{n}}

Подставляя обратно в νjpm=νmpj\nu_j p_m = \nu_m p_j:

p^j=νjnдля всех j\hat{p}_j = \frac{\nu_j}{n} \quad \text{для всех } j
Summary

Чтобы оценить вероятность исхода типа jj, нужно количество исходов типа jj разделить на общее количество испытаний. Это пример, на который будем ссылаться в дальнейшем.


5. Информация Фишера

Условия регулярности

Информация Фишера определяется в рамках условий регулярности (для одномерного случая, θR\theta \in \mathbb{R}).

Warning

В разных книжках условия регулярности могут немного отличаться. То, что ниже — один из стандартных вариантов.

Условие 1. Если θ1θ2\theta_1 \ne \theta_2, то распределение при θ1\theta_1 не равно распределению при θ2\theta_2 (идентифицируемость).

Условие 2. Носитель распределения не зависит от θ\theta.

  • Множество значений случайной величины не зависит от параметра.
  • Пример: равномерное распределение U[θ1,θ2]U[\theta_1, \theta_2] — НЕ регулярно, т.к. носитель зависит от параметров.

Условие 3. Функция p(x,θ)p(x, \theta) дифференцируема по θ\theta столько раз, сколько нужно.

Условие 4. Внесение дифференцирования по θ\theta под знак интеграла — законная операция:

θdx=θdx\frac{\partial}{\partial \theta}\int \ldots\, dx = \int \frac{\partial}{\partial \theta}\ldots\, dx

(не всегда верно в общем случае, но мы работаем там, где верно).

Условие 5. E[V2(X,θ)]<\mathbb{E}[V^2(X, \theta)] < \infty (вводится далее).

Вклад выборки

Definition

V(X,θ)=lnL(X,θ)θV(X, \theta) = \frac{\partial \ln L(X, \theta)}{\partial \theta}

— логарифмическая производная функции правдоподобия.

Интуиция термина «вклад выборки»

Аналитически найти точку максимума LL удаётся не всегда — иногда задача решается только численно. Один из простейших численных методов — градиентный спуск:

xk+1=xkαf(xk)x_{k+1} = x_k - \alpha \cdot f'(x_k)

Здесь:

  • если мы правее минимума — f(xk)>0f'(x_k) > 0 и сдвиг идёт влево (правильно);
  • если мы левее минимума — f(xk)<0f'(x_k) < 0 и сдвиг идёт вправо (правильно);
  • чем больше f|f'|, тем больше шаг — тем быстрее сходимость.

В многомерном случае вместо производной — градиент (вектор частных производных).

Применяя к функции правдоподобия: чем больше по модулю V(X,θ)V(X, \theta), тем быстрее численный метод сойдётся к оценке. Поэтому VV называется «вкладом выборки» — чем больше вклад, тем лучше (быстрее находится оценка).

Проблема: V(X,θ)V(X, \theta) — случайная величина (зависит от XX). Хотим унифицировать в виде числовой характеристики.

Матожидание вклада выборки

Рассмотрим тождество:

1=L(X,θ)dX1 = \int L(X, \theta)\, dX

(плотность интегрируется в 11).

Дифференцируем по θ\theta:

0=θL(X,θ)dX=L(X,θ)θdX0 = \frac{\partial}{\partial \theta}\int L(X, \theta)\, dX = \int \frac{\partial L(X, \theta)}{\partial \theta}\, dX

Воспользуемся трюком: умножим и разделим на LL:

0=L/θLLdX=lnLθLdX=V(X,θ)L(X,θ)dX0 = \int \frac{\partial L / \partial \theta}{L}\cdot L\, dX = \int \frac{\partial \ln L}{\partial \theta}\cdot L\, dX = \int V(X, \theta)\cdot L(X, \theta)\, dX

Это есть матожидание VV:

E[V(X,θ)]=0\boxed{\mathbb{E}[V(X, \theta)] = 0}

В среднем вклад выборки равен нулю. Не очень информативно — рассмотрим другую характеристику.

Определение информации Фишера

Мера разброса относительно нуля — дисперсия.

Definition

I(θ)=Var[V(X,θ)]=Var[lnL(X,θ)θ]I(\theta) = \mathrm{Var}[V(X, \theta)] = \mathrm{Var}\left[\frac{\partial \ln L(X, \theta)}{\partial \theta}\right]

Свойство 1. Аддитивность по выборке

V(X,θ)=lnLθ=k=1nlnp(Xk,θ)θV(X, \theta) = \frac{\partial \ln L}{\partial \theta} = \sum_{k=1}^{n}\frac{\partial \ln p(X_k, \theta)}{\partial \theta}

(логарифм произведения = сумма логарифмов).

Так как XkX_k независимы, слагаемые независимы. Дисперсия суммы независимых = сумма дисперсий:

I(θ)=k=1nVar[lnp(Xk,θ)θ]I(\theta) = \sum_{k=1}^{n}\mathrm{Var}\left[\frac{\partial \ln p(X_k, \theta)}{\partial \theta}\right]

Все слагаемые одинаково распределены, поэтому:

I(θ)=ni(θ)\boxed{I(\theta) = n\cdot i(\theta)}

где i(θ)i(\theta)информация Фишера для одного наблюдения:

i(θ)=Var[lnp(X,θ)θ]i(\theta) = \mathrm{Var}\left[\frac{\partial \ln p(X, \theta)}{\partial \theta}\right]

Свойство 2. Информация Фишера через матожидание квадрата

Поскольку E[lnp(X,θ)θ]=0\mathbb{E}\left[\dfrac{\partial \ln p(X, \theta)}{\partial \theta}\right] = 0, а дисперсия при нулевом матожидании совпадает с матожиданием квадрата:

i(θ)=E[(lnp(X,θ)θ)2]i(\theta) = \mathbb{E}\left[\left(\frac{\partial \ln p(X, \theta)}{\partial \theta}\right)^2\right]

Свойство 3. Альтернативная формула через вторую производную

Продифференцируем тождество lnpθpdx=0\int \dfrac{\partial \ln p}{\partial \theta}\cdot p\, dx = 0 ещё раз по θ\theta (для одного наблюдения, индекс kk опускаем — все XkX_k одинаково распределены):

0=θlnp(X,θ)θp(X,θ)dX0 = \frac{\partial}{\partial \theta}\int \frac{\partial \ln p(X, \theta)}{\partial \theta}\cdot p(X, \theta)\, dX

Вносим производную под интеграл и применяем правило произведения:

0=2lnpθ2pdX+lnpθpθdX0 = \int \frac{\partial^2 \ln p}{\partial \theta^2}\cdot p\, dX + \int \frac{\partial \ln p}{\partial \theta}\cdot \frac{\partial p}{\partial \theta}\, dX

Во втором интеграле умножим и разделим на pp:

lnpθp/θppdX=(lnpθ)2pdX=E[(lnpθ)2]\int \frac{\partial \ln p}{\partial \theta}\cdot \frac{\partial p / \partial \theta}{p}\cdot p\, dX = \int \left(\frac{\partial \ln p}{\partial \theta}\right)^2\cdot p\, dX = \mathbb{E}\left[\left(\frac{\partial \ln p}{\partial \theta}\right)^2\right]

Получаем:

0=E[2lnpθ2]+E[(lnpθ)2]0 = \mathbb{E}\left[\frac{\partial^2 \ln p}{\partial \theta^2}\right] + \mathbb{E}\left[\left(\frac{\partial \ln p}{\partial \theta}\right)^2\right]

Второе слагаемое равно i(θ)i(\theta), откуда:

Important

i(θ)=E[2lnp(X,θ)θ2]\boxed{i(\theta) = -\mathbb{E}\left[\frac{\partial^2 \ln p(X, \theta)}{\partial \theta^2}\right]}

Часто удобнее для вычислений, чем определение через дисперсию.

Замечание о записи

В выкладках для одного наблюдения индекс kk можно опустить — поскольку все XkX_k одинаково распределены, можно считать k=1k = 1 или просто писать XX без индекса.


Что будет в следующей лекции

  1. Конкретные примеры вычисления информации Фишера для разных распределений.
  2. Связь информации Фишера с методом максимального правдоподобия.
  3. Связь информации Фишера с оптимальностью оценок (в частности, неравенство Крамера-Рао).