Карточки Anki
Скачайте колоды для интервального повторения
Лекция 4: Метод максимального правдоподобия и информация Фишера
1. Контрпример: асимптотическая нормальность ⇏ асимптотическая несмещённость
Напоминание из прошлой лекции
В прошлый раз были рассмотрены свойства оценок:
- состоятельность,
- эффективность,
- асимптотическая нормальность,
- несмещённость.
Было показано: если оценка асимптотически нормальная, то она состоятельна.
Сегодня покажем (обещанный контрпример), что из асимптотической нормальности в общем случае НЕ следует асимптотическая несмещённость (хотя обычно эта импликация имеет место). Пример экзотический, но формально корректный.
Построение контрпримера
Пусть выборка из нормального распределения .
Выборочное среднее — состоятельная, несмещённая, асимптотически нормальная оценка для (поскольку матожидание здесь равно ).
Модифицируем оценку. Положим:
Доказательство асимптотической нормальности
Рассмотрим функцию распределения в точке :
Это эквивалентно:
При :
- ,
- ,
- (т.к. выборочное среднее — асимптотически нормальная оценка),
- второе слагаемое (ограниченная вероятность ) стремится к .
Итог: .
То есть — асимптотически нормальная оценка, а значит и состоятельная.
Проверка асимптотической несмещённости
Таким образом, для любого , асимптотической несмещённости нет.
Контрпример показывает: из асимптотической нормальности не следует асимптотическая несмещённость, хотя состоятельность из неё следует. Контринтуитивно, но формально верно.
2. Метод максимального правдоподобия
Нотация: дискретный и непрерывный случаи
На практике работают либо с дискретными, либо с непрерывными распределениями.
| Случай | Функция | Обозначение |
|---|---|---|
| Дискретный | Функция вероятностей | PMF (probability mass function) |
| Непрерывный | Плотность вероятности | PDF (probability density function) |
В контексте метода максимального правдоподобия оба случая объединяются — будем использовать термин «плотность» и одну букву для обоих случаев. Рассуждения в дискретном и непрерывном случаях идентичны.
Постановка задачи
Имеется простейшая выборка — независимые одинаково распределённые случайные величины с распределением, зависящим от параметра . Задача: оценить как функцию от выборки.
Функция правдоподобия
Поскольку элементы выборки независимы, совместная плотность есть произведение плотностей:
Эта совместная плотность называется функцией правдоподобия.
Идея метода
На интуитивном уровне — это «вероятность выборки». Метод максимального правдоподобия предлагает подобрать так, чтобы эта вероятность была наибольшей.
Определение оценки максимального правдоподобия
— это значение , при котором достигается максимум функции правдоподобия:
3. Алгоритм поиска оценки максимального правдоподобия
Пункт 0. Посмотреть и подумать
Возможно, удастся найти ответ, внимательно посмотрев на функцию правдоподобия — без вычислений (см. примеры с равномерным распределением и распределением Лапласа ниже).
Пункт 1. Логарифмирование
Используется свойство: производная логарифма функции
Логарифм — строго монотонная функция, поэтому точка максимума не меняется. Удобно работать с потому, что произведение превращается в сумму.
Пункт 2. Исследование на максимум
- Рассмотреть .
- Вычислить производную .
- Приравнять к нулю.
- Проверить достаточные условия максимума.
4. Примеры применения метода максимального правдоподобия
Пример 1. Равномерное распределение
Плотность равномерного распределения:
Функция правдоподобия:
Произведение индикаторов равно тогда и только тогда, когда все попадают в отрезок. Поэтому оно равно одному индикатору пересечения событий.
Анализ. Чтобы максимизировать :
- Мысль А. Индикатор должен быть равен , т.е. и .
- Мысль Б. Знаменатель должен быть минимальным, т.е. — минимально.
Совмещая:
Пример 2. Распределение Лапласа
Плотность:
(Распределение Лапласа с масштабным параметром .)
Функция правдоподобия:
Множитель — константа. Чтобы максимизировать , нужно максимизировать аргумент экспоненты, то есть минимизировать:
Поделив на , получим — матожидание относительно эмпирического распределения.
Медиана минимизирует среднее абсолютное отклонение.
Поэтому:
Пример 3. Биномиальное распределение , известно
Функция вероятностей:
Функция правдоподобия:
Логарифм:
Дифференцируем по (член с не зависит от ):
Приведём к общему знаменателю :
Вынесем и :
Приравнивая к нулю:
Проверка максимума: при производная положительна (функция возрастает), при — отрицательна (функция убывает). Значит, это точка максимума.
Если — распределение Бернулли. Тогда — доля единиц в выборке.
Пример 4. Нормальное распределение
Здесь — дисперсия (а не ). Плотность:
Логарифм функции правдоподобия:
Шаг 1. Зафиксируем , найдём (ленивый вариант)
При фиксированном максимизация эквивалентна минимизации:
Поделив на , получаем — матожидание квадрата отклонения.
Эта величина минимизируется при (для эмпирического распределения это выборочное среднее).
(Точкой минимума является матожидание, а само минимальное значение — дисперсия.)
Поэтому:
Шаг 2. Найдём
Дифференцируем по :
Откуда:
Это выборочная дисперсия (со звёздочкой).
Оценками максимального правдоподобия для параметров нормального закона являются выборочное среднее и выборочная дисперсия.
(Это «ленивый» вариант: строго следовало бы исследовать функцию двух переменных через гессиан.)
Пример 5. Дискретное распределение на значениях
Пусть выборка из дискретного распределения, принимающего значения с вероятностями .
Сколько неизвестных? (так как ).
Группировка. Пусть — количество элементов выборки, равных . Тогда:
Функция правдоподобия:
с ограничением .
Можно было бы использовать множители Лагранжа, но т.к. ограничение одно, проще выразить и работать с функцией переменной.
Подставляем:
Дифференцируем по ():
Откуда:
Просуммируем все эти уравнения (по от до ):
Используя и :
Подставляя обратно в :
Чтобы оценить вероятность исхода типа , нужно количество исходов типа разделить на общее количество испытаний. Это пример, на который будем ссылаться в дальнейшем.
5. Информация Фишера
Условия регулярности
Информация Фишера определяется в рамках условий регулярности (для одномерного случая, ).
В разных книжках условия регулярности могут немного отличаться. То, что ниже — один из стандартных вариантов.
Условие 1. Если , то распределение при не равно распределению при (идентифицируемость).
Условие 2. Носитель распределения не зависит от .
- Множество значений случайной величины не зависит от параметра.
- Пример: равномерное распределение — НЕ регулярно, т.к. носитель зависит от параметров.
Условие 3. Функция дифференцируема по столько раз, сколько нужно.
Условие 4. Внесение дифференцирования по под знак интеграла — законная операция:
(не всегда верно в общем случае, но мы работаем там, где верно).
Условие 5. (вводится далее).
Вклад выборки
— логарифмическая производная функции правдоподобия.
Интуиция термина «вклад выборки»
Аналитически найти точку максимума удаётся не всегда — иногда задача решается только численно. Один из простейших численных методов — градиентный спуск:
Здесь:
- если мы правее минимума — и сдвиг идёт влево (правильно);
- если мы левее минимума — и сдвиг идёт вправо (правильно);
- чем больше , тем больше шаг — тем быстрее сходимость.
В многомерном случае вместо производной — градиент (вектор частных производных).
Применяя к функции правдоподобия: чем больше по модулю , тем быстрее численный метод сойдётся к оценке. Поэтому называется «вкладом выборки» — чем больше вклад, тем лучше (быстрее находится оценка).
Проблема: — случайная величина (зависит от ). Хотим унифицировать в виде числовой характеристики.
Матожидание вклада выборки
Рассмотрим тождество:
(плотность интегрируется в ).
Дифференцируем по :
Воспользуемся трюком: умножим и разделим на :
Это есть матожидание :
В среднем вклад выборки равен нулю. Не очень информативно — рассмотрим другую характеристику.
Определение информации Фишера
Мера разброса относительно нуля — дисперсия.
Свойство 1. Аддитивность по выборке
(логарифм произведения = сумма логарифмов).
Так как независимы, слагаемые независимы. Дисперсия суммы независимых = сумма дисперсий:
Все слагаемые одинаково распределены, поэтому:
где — информация Фишера для одного наблюдения:
Свойство 2. Информация Фишера через матожидание квадрата
Поскольку , а дисперсия при нулевом матожидании совпадает с матожиданием квадрата:
Свойство 3. Альтернативная формула через вторую производную
Продифференцируем тождество ещё раз по (для одного наблюдения, индекс опускаем — все одинаково распределены):
Вносим производную под интеграл и применяем правило произведения:
Во втором интеграле умножим и разделим на :
Получаем:
Второе слагаемое равно , откуда:
Часто удобнее для вычислений, чем определение через дисперсию.
Замечание о записи
В выкладках для одного наблюдения индекс можно опустить — поскольку все одинаково распределены, можно считать или просто писать без индекса.
Что будет в следующей лекции
- Конкретные примеры вычисления информации Фишера для разных распределений.
- Связь информации Фишера с методом максимального правдоподобия.
- Связь информации Фишера с оптимальностью оценок (в частности, неравенство Крамера-Рао).