Карточки Anki
Скачайте колоды для интервального повторения
Лекция 3: Точечное оценивание параметров. Метод моментов
Общая постановка задачи
Пусть имеется модель простейшей выборки. С теоретической точки зрения это набор независимых одинаково распределённых случайных величин, распределение которых задаётся функцией распределения.
При этом будем предполагать, что функция распределения параметризуется неким параметром :
где — множество допустимых значений параметра, а может быть -мерным вектором.
Мотивация: часто есть основания предполагать, что выборка пришла из какого-то класса распределений. Например:
- В биологии сами данные или их логарифмы аппроксимируются нормальным законом.
- Для потоков событий нередко используется распределение Пуассона.
Цель: оценить неизвестный параметр в виде , где — это какая-то функция от выборки.
Напоминание: функция от выборки кратко называется статистикой.
Нам бы какая оценка не годится — хотелось, чтобы она удовлетворяла каким-то хорошим свойствам.
Свойства оценок
1. Состоятельность (consistency)
Неформально: при увеличении объёма выборки оценка становится ближе к истинному значению.
Определение: оценка называется состоятельной, если она сходится по вероятности к :
По-английски: consistency. Это базовое свойство, говорящее о том, что оценка вообще разумна.
2. Смещённость / несмещённость (bias / unbiasedness)
Смещение оценки определяется как:
- Оценка несмещённая (unbiased) ⟺
- Оценка смещённая ⟺
- Оценка асимптотически несмещённая ⟺ при
Пример: обычная выборочная дисперсия — смещённая оценка теоретической дисперсии, но асимптотически несмещённая.
3. Асимптотическая нормальность
Оценка называется асимптотически нормальной, если:
то есть в пределе по распределению получается гауссовская величина с нулевым математическим ожиданием и какой-то матрицей ковариации .
4. Оптимальность и эффективность
Гипотетический вопрос: если у нас есть несколько оценок, то как сравнить, какая оценка лучше? Нужна метрика.
Среднеквадратическая ошибка (Mean Squared Error)
где — норма вектора .
⚠️ Важная ремарка: среднеквадратическая ошибка (MSE) и среднее квадратическое отклонение — разные вещи! Хоть в русском языке слова “ошибка” и “отклонение” синонимы, в статистике они означают совершенно разное:
- MSE — это
- Среднее квадратическое отклонение — это (корень из дисперсии)
Определение оптимальной (эффективной) оценки
Оценка называется оптимальной (эффективной) в классе , если:
Например, может быть классом несмещённых оценок: оценка называется эффективной, если у неё наименьшая среднеквадратическая ошибка среди всех несмещённых оценок.
Важное замечание про терминологию
Понятия оптимальности и эффективности часто отождествляют. Однако в некоторых книгах эти понятия различают:
- Оптимальная оценка — минимизирует MSE.
- Эффективная оценка в другом определении: — эффективная оценка, если
где — след матрицы (trace), а — матрица ковариации оценки.
Уточнение: — это значение аргумента, при котором достигается минимум функции. Класс — это произвольный класс оценок, в котором мы ищем оптимум (например, класс несмещённых, класс линейных оценок и т.д.). Например, при изучении линейных моделей будет теорема Гаусса–Маркова про эффективность в классе линейных несмещённых оценок.
Связь свойств: разложение MSE
Распишем MSE
Применим приём “плюс-минус ”:
Раскрывая скобки и используя линейность математического ожидания, получим четыре слагаемых:
Анализ слагаемых
Слагаемые 3 и 4 равны нулю. Рассуждение:
- — константа.
- — это число (не случайная величина), значит тоже константа.
- Следовательно, — константа, которую можно вынести из-под знака математического ожидания.
- Остаётся .
Транспонирование константы — это тоже константа (транспонированная), не важно, строчка или вектор.
Слагаемое 2 — это уже константа, поэтому снимается. Оно равно квадрату нормы смещения:
Слагаемое 1 — расписав покомпонентно:
(на диагонали матрицы ковариации стоят как раз дисперсии).
Итоговая формула
Соображение №1: эффективность через след матрицы ковариации
Если оценка несмещённая, то , и тогда:
То есть для несмещённых оценок оптимизация MSE — это то же самое, что оптимизация следа матрицы ковариации. Это объясняет, почему в некоторых книгах эффективность определяется именно через минимизацию следа матрицы ковариации.
Спойлер: если оценка несмещённая (и выполняются некоторые условия, о которых будет сказано позже), то можно указать нетривиальную нижнюю границу для дисперсии оценки. Тривиальная граница — это, понятно, .
Связь свойств: асимптотическая несмещённость + дисперсия → 0 ⟹ состоятельность
Для простоты рассмотрим случай размерности . Для общего рассуждения аналогичны.
Утверждение
Пусть:
- (асимптотическая несмещённость),
- .
Тогда — состоятельная оценка.
Доказательство
Хотим оценить .
Запишем цепочку неравенств. Сначала “плюс-минус” :
По неравенству треугольника:
Второе слагаемое — это смещение, которое стремится к нулю. Поэтому, начиная с некоторого , оно становится меньше :
Откуда:
Если из следует , то . Значит:
Применяем неравенство Чебышёва:
Значит, , что и требовалось показать. ∎
Связь свойств: асимптотическая нормальность ⟹ состоятельность
Утверждение
Если — асимптотически нормальная оценка, то она состоятельна.
Формальное доказательство
По определению асимптотической нормальности:
Распишем вероятность:
В силу асимптотической нормальности:
При :
Значит, выражение стремится к . То есть оценка действительно состоятельна. ∎
Неформально про асимптотическую несмещённость
Из
неформально получаем:
При это распределение “сжимается” в точку . Это неформальное рассуждение.
⚠️ Важное замечание: обратное неверно! Из состоятельности не следует даже асимптотическая несмещённость. Существует экзотический контрпример (его рассмотрим в следующий раз).
Метод моментов
Это первый из методов точечного оценивания параметров.
Постановка
Пусть имеется модель простейшей выборки , теоретическая функция распределения параметризуется параметром — -мерный параметр.
Алгоритм метода моментов
Шаг 1. Вводим функции такие, что существуют математические ожидания:
Шаг 2. Поскольку распределение зависит от , эти моментные характеристики тоже зависят от :
Шаг 3. Переходим к эмпирическим аналогам. Заменяем теоретические математические ожидания выборочными средними:
Шаг 4. Получаем систему уравнений на оценки :
Это система уравнений на неизвестных.
Шаг 5. Предположим, что существует и притом единственное решение. Тогда:
Это решение и называется оценкой метода моментов.
Почему “метод моментов”
По умолчанию в качестве функций берут степенные:
Тогда — это -й момент. Отсюда и название.
Свойства оценок метода моментов
1. Состоятельность. Если:
- — состоятельные оценки ,
- функции непрерывны,
то оценка метода моментов состоятельна.
Это обычно выполняется.
2. Асимптотическая нормальность. Если:
- — асимптотически нормальные оценки,
- функции гладкие,
то имеет место асимптотическая нормальность по дельта-методу.
3. Смещённость. В общем случае про смещённость и несмещённость сказать ничего нельзя.
Плюсы и минусы метода
Плюсы:
- Идея метода достаточно проста.
Минусы:
- Часто получаются не очень эффективные оценки (это будет видно даже на учебных примерах).
Примеры применения метода моментов
Пример 1. Распределение Бернулли
Робот много раз кидает монетку, на входе последовательность нулей и единичек. Оценить вероятность выпадения единички.
Берём дефолтную функцию . Математическое ожидание распределения Бернулли:
Переходим к эмпирическому аналогу:
Здесь всё разрешилось тривиально. Получили:
То есть оценка вероятности успеха — это просто выборочное среднее (количество успехов / общее количество экспериментов).
Свойства: про выборочное среднее знаем, что это состоятельная, несмещённая, асимптотически нормальная оценка. Забегая вперёд — даже эффективная.
Пример 2. Распределение Пуассона
Вариант 1:
Математическое ожидание распределения Пуассона:
Эмпирический аналог:
Вариант 2:
Используем то, что:
Эмпирический аналог:
Это квадратное уравнение. Решаем:
Формально два корня, но по смыслу задачи , поэтому выбираем положительный корень (с плюсом):
Свойства: получилась гладкая (на области определения) функция от второго выборочного момента. Поэтому оценка состоятельная и асимптотически нормальная. Про смещённость конкретно сказать сложно.
Какая оценка лучше? Та, у которой меньше MSE. Забегая вперёд — первая оценка будет эффективной.
Это хорошо иллюстрирует минус метода: разные функции дают разные оценки, и не все они одинаково хороши.
Пример 3. Нормальное распределение
Здесь — дисперсия. Два неизвестных параметра, поэтому нужны два уравнения.
Берём:
- ,
- .
Теоретические соотношения:
Эмпирические аналоги:
Отсюда:
А — это выборочная дисперсия .
Свойства:
- — несмещённая оценка.
- — смещённая оценка (но асимптотически несмещённая).
- Обе оценки состоятельные и асимптотически нормальные.
Это иллюстрирует, что в общем случае про смещённость метода моментов ничего конкретного сказать нельзя — здесь одна оценка несмещённая, другая смещённая.
Пример 4. Равномерное распределение
Берём те же функции , .
Математическое ожидание равномерного закона:
Дисперсия:
Тогда:
Эмпирические соотношения:
Из второго уравнения, подставляя первое:
Снова получили выборочную дисперсию! Откуда:
где .
Выбираем знак “+”, так как .
Имеем систему:
Решая (сложение и вычитание):
Пример 5 (демонстрационный). Равномерное распределение
Здесь интересный случай: функция не подходит, потому что:
— математическое ожидание не зависит от , поэтому уравнение бессмысленно.
Берём :
Эмпирический аналог даёт явное выражение для оценки .
На демонстрации в Google Colab было показано: при объёме выборки 10 разброс оценки большой, а при объёме 10000 разброс существенно меньше, и распределение оценки концентрируется около реального параметра. Это иллюстрирует состоятельность и асимптотическую нормальность.
Что дальше
В следующий раз:
- Будет приведён экзотический контрпример, показывающий, что из состоятельности не следует даже асимптотическая несмещённость.
- Перейдём к следующему методу — методу максимального правдоподобия (maximum likelihood).