Карточки Anki
Скачайте колоды для интервального повторения
Лекция 1. Введение в математическую статистику
Что изучает математическая статистика
В этом семестре изучается математическая статистика. Чтобы понять её предмет, полезно сравнить с теорией вероятностей.
Теория вероятностей (грубо говоря): есть некоторая модель, задаётся распределение базовых параметров, и на основе этого находятся числовые характеристики или распределения функций этих параметров.
Математическая статистика имеет другую глобальную задачу. Допустим, есть совокупность всех студентов, и по тем или иным причинам нельзя обследовать каждый объект из этого набора. В контексте статистики такой полный набор называется генеральной совокупностью. Чтобы сделать вывод о генеральной совокупности, берут конечный поднабор из неё, который называется выборкой, и на основе выборки делают более-менее содержательные выводы о всей генеральной совокупности.
Иллюстрирующие примеры
Пример 1. Подбрасывание монеты роботом
Робот кидает монетку, мы видим результат: последовательность нулей и единиц. Какие задачи можно решать?
- Точечная оценка вероятности орла — оценить вероятность орла в виде числа. Резонной оценкой является:
В статистике под словом «резонная» понимается «разумная». Можно оценивать в виде числа.
Интервальная оценка — указать интервал, в котором, скорее всего, лежит реальная вероятность орла. Иногда интервал нагляднее одного числа.
Проверка гипотезы о честности монеты — честно ли робот кидает монетку? Интуитивно: если доля орлов больше некоторого числа , то монетка нечестная. Но как выбрать порог ? Кто-то скажет 0.51, кто-то 0.01, кто-то 0.1, 0.5 — всё это берётся «с потолка». Методы статистики позволяют формально и обоснованно выбрать этот порог.
Также в статистике есть показатель p-value (пэ-вэлю), который мы будем обсуждать. В терминах p-value тоже можно переписать критерий «if».
Пример 2. Клинические испытания вакцины/лекарства
Проводятся клинические испытания нового лекарства. Есть набор людей, для каждого из которых известны два атрибута:
- болен / здоров
- получил вакцину / не получил вакцину
Методы математической статистики позволяют привести аргумент в пользу того, что вакцина действительно положительно влияет на здоровье человека.
Пример 3. Цена квартиры
От чего может зависеть цена квартиры?
- размер (площадь)
- ситуация на рынке
- регион (region)
- расстояние до центра (distance)
- возможно, какие-то другие факторы
Методы статистики позволяют сказать, действительно ли указанные факторы влияют на цену, или это ошибочные предположения.
Важное замечание: статистика — не серебряная пуля
Статистика не доказывает формальные утверждения так, как это делается в чистой фундаментальной математике.
Пример из медицины. Допустим, фармацевт провёл клиническое испытание, получил хорошие результаты, провёл статистический тест, p-value получилось меньше нужного значения. Он отправляет статью в журнал — и редактор её отклоняет (reject). Почему? Потому что был грубо нарушен протокол, принятый в медицинском сообществе. Нельзя в медицине «просто провести стат-тест и сказать, что вакцина эффективна».
Вывод: в каждой предметной области есть свои протоколы применения статистических методов. Курс посвящён именно самим статистическим методам, но нужно понимать, что в каждой предметной области есть своя специфика.
Репрезентативность выборки
Вопрос: какое свойство выборки позволяет сделать содержательные выводы о всей генеральной совокупности?
Ответ: репрезентативность.
Важно: к утверждению «чем больше объём выборки, тем она репрезентативнее» нужно подходить очень осторожно.
Пример нерепрезентативной выборки
Социологический опрос жителей России. Анкета размещена только в интернете, заполнили сотни тысяч человек. Является ли выборка репрезентативной?
Нет, потому что есть люди, которые по тем или иным причинам не любят заполнять анкеты в интернете. Тем самым проигнорирован существенный кластер людей.
Виды выборок (на примере социологии)
- Чисто случайная выборка — объекты берутся случайно из генеральной совокупности.
- Стратифицированная выборка — есть кластеры (страты), которые заранее известны. В рамках каждого класса случайно выбираются люди, потом всё объединяется в одну выборку. Например, делим людей на группы по возрасту, профессии и т.п., и из каждой группы случайно выбираем некоторое количество людей.
Это сильно зависит от дизайна исследования и предметной области.
Главный вывод: утверждение «чем больше объём выборки, тем она репрезентативнее» далеко не всегда правда.
Простейшая выборка
Определение
Пусть имеется вещественных чисел. Будем воспринимать их как независимых одинаково распределённых случайных величин:
Распределение задаётся теоретической функцией распределения .
Почему случайные величины? Потому что в разных экспериментах могут получаться разные результаты. Например, выбираем 5 случайных студентов и измеряем рост — получаем один результат; выбираем других 5 — получаем другой результат.
Почему «простейшая»? Потому что величины независимы и одинаково распределены.
Цель
Оценить неизвестную функцию распределения на основе выборки.
Обозначения
- Большие буквы — элементы выборки как случайные величины.
- Маленькие буквы — конкретная реализация выборки (когда важно подчеркнуть, что речь идёт о конкретных числах).
- Краткая запись: — выборка из распределения .
- Иногда указывается конкретный класс распределений:
- — нормальное распределение с матожиданием и дисперсией
- — экспоненциальное распределение с параметром
Пример: запись означает выборку из нормального закона с неизвестными и .
В первой части семестра почти всегда «выборка» = «простейшая выборка».
Эмпирическая функция распределения
Определение
Введём вспомогательную величину:
— это количество элементов выборки, не превосходящих .
Эмпирическая функция распределения:
— это доля (отношение) количества элементов выборки, не превосходящих , к общему объёму выборки .
Терминология: называется объём выборки (или размер выборки).
График
График — это ступенчатая функция. Высота скачка зависит от количества элементов выборки в данной точке.
Замечание. В разных учебниках функция распределения может быть непрерывна слева либо непрерывна справа. Здесь рассматривается непрерывная справа версия (знак ).
Эмпирическая ФР как случайная величина
Сама выборка — случайные величины, поэтому — это функция от выборки, то есть тоже случайная величина. В разных экспериментах будет получаться своя . Значит, можно говорить о её распределении и числовых характеристиках.
Свойства эмпирической ФР
Распределение индикатора
Индикатор принимает значения или . Это распределение Бернулли с параметром:
Это и есть теоретическая функция распределения.
Распределение
— сумма бернуллиевских величин, значит:
Отсюда:
Несмещённость
В среднем эмпирическая функция распределения совпадает с теоретической.
Определение. Свойство несмещённости: математическое ожидание оценки равняется самому оцениваемому параметру.
Практический смысл: отсутствует систематическая ошибка. Можно получить оценку больше или меньше истинного значения, но в среднем — попадаешь в цель.
Состоятельность (закон больших чисел)
— усреднённая сумма независимых одинаково распределённых случайных величин. По закону больших чисел:
Определение. Свойство состоятельности: оценка сходится по вероятности к параметру при .
Практический смысл: оценка вообще «разумная» — при увеличении объёма выборки она становится всё ближе к реальному значению оцениваемого параметра.
Асимптотическая нормальность (ЦПТ)
По центральной предельной теореме:
Или, после преобразований (вынося из числителя):
Определение. Свойство асимптотической нормальности: домноженная на и нормированная разность между оценкой и оцениваемым параметром сходится по распределению к стандартной гауссовской величине.
Применение: построение доверительного интервала
Задача
Дано вещественное число . Найти такое , чтобы:
(можем считать достаточно большим).
Решение через ЦПТ
Преобразуем выражение под вероятностью, домножив на :
При больших распределение этой величины близко к стандартному нормальному:
Используя свойства функции распределения стандартного нормального закона:
Проблема и её решение
В аргументе содержится неизвестное выражение — а ведь как раз и хотим оценить.
Идея: оценить сверху.
Функция — парабола ветвями вниз с точкой максимума в . Её максимум на равен .
Значит:
В силу строгой монотонности :
Требуем:
Использование квантилей
Определение. Квантиль порядка — такое число , что:
Геометрически: под плотностью вещественная прямая делится на две части: слева от — масса , справа — масса .
Обозначение. Для квантилей будет использоваться буква (хотя для нормального закона иногда используется ).
Из неравенства получаем:
Спойлер: это и есть доверительный интервал для теоретической функции распределения. К этой теме мы вернёмся в своё время.
Дополнительные теоремы для эмпирической ФР
Теорема Гливенко–Кантелли
Условия: простейшая выборка, — теоретическая ФР, — эмпирическая ФР.
Утверждение:
То есть с вероятностью 1 супремум модуля разности между эмпирической и теоретической ФР стремится к нулю.
Теорема Колмогорова
Условия: простейшая выборка, теоретическая ФР должна быть непрерывной.
Важно: теорема Колмогорова работает только для непрерывных распределений; для дискретных она не имеет места быть.
Обозначение:
Утверждение: имеет предельное распределение, задаваемое функцией распределения Колмогорова:
где аналитический вид:
Эта функция табулирована и реализована во многих статистических пакетах и библиотеках. Она используется для построения критерия Колмогорова.
Теорема Смирнова
Условия: есть две независимые выборки:
- (непрерывное распределение)
- — выборка того же распределения
, — соответствующие эмпирические ФР.
Замечание о независимости выборок: если объединить обе выборки в одну, всё должно быть независимо. Например, функции от и от независимы.
Обозначение:
Утверждение: при :
— то же самое распределение Колмогорова .
Поэтому в статистических пакетах два соответствующих критерия (Колмогорова и Смирнова) часто объединены в одну функцию.
Визуализация выборки
Способы визуализировать выборку:
График эмпирической функции распределения (ступенчатая функция).
Гистограмма. При построении в любой системе важно понимать: можно нормировать, можно не нормировать.
Зачем нормировать? Пример: гистограмма оценок мальчиков и девочек. Если девочек меньше, чем мальчиков, ненормированная гистограмма для мальчиков будет явно выше. При сравнении двух гистограмм на одной картинке лучше нормировать.
Существуют эмпирические (эвристические) принципы выбора оптимального количества интервалов в зависимости от объёма выборки.
При увеличении объёма выборки гистограмма для непрерывного распределения стремится к теоретической плотности.
Полигон частот. Используется для дискретных величин: откладываются частоты, точки соединяются. Особой мудрости здесь нет; обычно гистограмма нагляднее.
Кумулята (упомянута вскользь). Если эмпирическую ФР «сгладить» прямыми через границы интервалов, получим кумуляту.
Эмпирическое распределение
Если зафиксировать конкретную реализацию , то — это функция, которая:
- монотонно возрастает,
- непрерывна справа,
- стремится к 1 на , к 0 на ,
то есть удовлетворяет всем свойствам функции распределения. Значит, она задаёт некоторое распределение — называемое эмпирическим распределением.
Описание эмпирического распределения
Случайная величина принимает значения со следующими вероятностями:
— количество элементов выборки, равных , делённое на .
Скачки эмпирической ФР
Если упорядочить элементы выборки и обозначить точку (, скажем, лежит между и ), то величина скачка в точке равна:
- Для дискретного распределения: при росте величины скачков сходятся к реальным вероятностям .
- Для непрерывного распределения: скачки уходят в 0.
Выборочные моменты
Теоретические моменты
Модель простейшей выборки .
Теоретические моменты:
- Начальный момент порядка :
- Центральный момент порядка :
Поскольку величины одинаково распределены:
Предполагаем, что нужные моменты существуют. Напоминание: есть распределения, где у матожидания и дисперсии большие проблемы. Например, распределение Коши — у него не существует матожидания и дисперсии.
Выборочные моменты
Начальный выборочный момент порядка :
Один из важнейших начальных выборочных моментов — выборочное среднее:
Важное предостережение! Когда люди (либо не до конца разобравшись, либо специально желая ввести в заблуждение) приводят только средние — этого далеко не достаточно. Нужны и другие характеристики.
Центральный выборочный момент порядка :
Выборочная дисперсия — наиболее важный центральный выборочный момент:
Выборочное стандартное отклонение (выборочное среднее квадратическое отклонение):
Выборочные моменты как моменты эмпирического распределения
Предположим для простоты, что все различны. Тогда формула выборочного среднего:
— это среднее арифметическое, или, иными словами, сумма , где — вероятности значений в эмпирическом распределении.
Ключевое наблюдение: выборочный момент — не что иное, как матожидание относительно эмпирического распределения.
Это позволяет переносить «теоретические» формулы на «выборочные»:
Почему? Потому что выборочные моменты — моменты относительно эмпирического распределения, и формула дисперсии переносится непосредственно.
Удобная нотация
Пусть — некоторая функция. Введём обозначение:
Тогда:
- (взять )
- (взять )
Это just notation — просто обозначение, которое будет активно эксплуатироваться.
Свойства начальных выборочных моментов
Выборка — случайная, поэтому моменты — тоже случайные величины. Можно говорить об их распределении.
Несмещённость
Начальный выборочный момент — несмещённая оценка теоретического начального момента.
Состоятельность (закон больших чисел)
— усреднённая сумма независимых одинаково распределённых случайных величин . По закону больших чисел:
Оценка состоятельная.
Асимптотическая нормальность (ЦПТ)
По центральной предельной теореме:
или, расписав дисперсию:
То есть:
Замена теоретических моментов выборочными в знаменателе
Проблема
В знаменателе ЦПТ-формулы стоят неизвестные характеристики . Это будет мешать решать статистические задачи (например, оценивать ).
Замечание про знак: выражение — это дисперсия, она не отрицательна (но может быть равна 0).
Решение: подставить выборочные аналоги
Утверждение: если в знаменатель подставить выборочные моменты вместо теоретических, сходимость к нормальному закону сохранится.
Рассматриваем модифицированную статистику:
Определение. Статистика — это функция от выборки (для математически строгих — измеримая функция). Внимание: «статистика» — не только название предмета, но и термин!
Доказательство сходимости (схема)
Преобразуем (умножаем и делим на теоретический корень):
Почему второй множитель сходится по вероятности к 1?
- (состоятельность)
- (состоятельность)
- Возведение в квадрат, разность, деление, извлечение корня — всё это непрерывные функции на области определения.
- Непрерывные функции сохраняют сходимость по вероятности.
Поэтому .
Используя свойство сходимости (произведение случайной величины, сходящейся по распределению, на величину, сходящуюся по вероятности к константе):
Зачем нужна эта замена
В исходной записи в знаменателе стоят неизвестные характеристики — это потенциально мешает оценивать . Чтобы упростить себе жизнь в оценивании , теоретические характеристики заменяются выборочными, и оказывается, что данная величина также сходится к стандартной гауссовской величине.
Этот результат зафиксируем. Он понадобится в дальнейшем — в частности, для построения асимптотических доверительных интервалов для математического ожидания и для проверки различных статистических гипотез о матожидании.
Что будет на следующей лекции
В следующий раз:
- Разговор о центральных выборочных моментах.
- В частности, поймём, зачем нужны две выборочные дисперсии (есть две выборочные дисперсии, и обе важны).