Описательная статистика

11.02.2026 Обновлено: 11.02.2026
автор

Лекция 2: Описательная статистика. Выборочные моменты, квантили и асимптотические свойства

Повторение материала прошлой лекции

Модель простейшей выборки

С математической точки зрения простейшая выборка — это набор случайных величин, которые:

  • независимы
  • одинаково распределены (i.i.d.)

Распределение этих величин описывается теоретической функцией распределения F(x)F(x).

Эмпирическая функция распределения

В прошлый раз научились оценивать F(x)F(x) с помощью эмпирической функции распределения:

F^n(x)=1ni=1nI{Xix}\hat{F}_n(x) = \frac{1}{n}\sum_{i=1}^{n} \mathbb{I}\{X_i \leq x\}

Словами: это доля элементов выборки, которые не превосходят заданного аргумента xx.

Свойства эмпирической функции распределения

  1. Состоятельность: при nn \to \infty эмпирическая функция F^n(x)\hat{F}_n(x) всё лучше оценивает теоретическую — F^n(x)PF(x)\hat{F}_n(x) \xrightarrow{P} F(x) по вероятности (в силу закона больших чисел).

    • Состоятельность означает: оценка стремится к оцениваемому параметру.
  2. Несмещённость: E[F^n(x)]=F(x)\mathbb{E}[\hat{F}_n(x)] = F(x) — в среднем эмпирическая функция распределения равна теоретической.

    • С практической точки зрения это означает отсутствие систематической ошибки.
  3. Асимптотическая нормальность (по ЦПТ):

    nF^n(x)F(x)F(x)(1F(x))dN(0,1)\sqrt{n} \cdot \frac{\hat{F}_n(x) - F(x)}{\sqrt{F(x)(1 - F(x))}} \xrightarrow{d} \mathcal{N}(0, 1)

Также упоминались:

  • Теорема Гливенко–Кантелли
  • Теорема Колмогорова–Смирнова
  • Гистограмма как графическая оценка теоретической плотности — при увеличении объёма выборки в силу ЗБЧ её график становится всё более похожим на график реальной плотности.

Выборочные начальные моменты

Обозначения:

  • αk=E[X1k]\alpha_k = \mathbb{E}[X_1^k] — теоретический kk-й начальный момент
  • α^k=Xk=1nj=1nXjk\hat{\alpha}_k = \overline{X^k} = \frac{1}{n}\sum_{j=1}^{n} X_j^k — выборочный kk-й начальный момент

Свойства: α^k\hat{\alpha}_k является:

  • состоятельной оценкой αk\alpha_k
  • несмещённой
  • асимптотически нормальной

Центральные выборочные моменты

Определения

Теоретический центральный kk-й момент:

βk=E[(X1EX1)k]\beta_k = \mathbb{E}[(X_1 - \mathbb{E}X_1)^k]

Выборочный центральный kk-й момент:

β^k=(XX)k=1nj=1n(XjX)k\hat{\beta}_k = \overline{(X - \overline{X})^k} = \frac{1}{n}\sum_{j=1}^{n}(X_j - \overline{X})^k

В частности, для k=2k=2:

β^2=1nj=1n(XjX)2\hat{\beta}_2 = \frac{1}{n}\sum_{j=1}^{n}(X_j - \overline{X})^2

Ключевое наблюдение

Выборочный момент — это не просто формулка, а момент относительно эмпирического распределения. Поэтому свойства и соотношения, справедливые для теоретических моментов, справедливы и для выборочных.

Например, аналог формулы дисперсии:

β^2=X2X2\hat{\beta}_2 = \overline{X^2} - \overline{X}^2

(среднее от квадрата минус квадрат среднего)

Состоятельность центральных выборочных моментов

Идея: произвольный kk-й выборочный центральный момент — это некоторый полином от выборочных начальных моментов α^1,α^2,,α^k\hat{\alpha}_1, \hat{\alpha}_2, \ldots, \hat{\alpha}_k.

Поскольку:

  • начальные выборочные моменты сходятся к теоретическим по вероятности,
  • полином — непрерывная функция,

по теореме о сходимости непрерывной функции от сходящихся величин:

β^kPβk\hat{\beta}_k \xrightarrow{P} \beta_k

Таким образом, состоятельность есть.

Несмещённость — есть проблемы (на примере дисперсии)

Введём обозначение выборочной дисперсии со звёздочкой:

S2=β^2=X2X2S^{*2} = \hat{\beta}_2 = \overline{X^2} - \overline{X}^2

Вычислим математическое ожидание:

E[S2]=E[X2]E[X2]\mathbb{E}[S^{*2}] = \mathbb{E}[\overline{X^2}] - \mathbb{E}[\overline{X}^2]
  • Первое слагаемое: E[X2]=α2\mathbb{E}[\overline{X^2}] = \alpha_2 (поскольку начальный выборочный момент несмещён).
  • Второе слагаемое (используем E[Y2]=DY+(EY)2\mathbb{E}[Y^2] = \mathbb{D}Y + (\mathbb{E}Y)^2): E[X2]=D[X]+(EX)2=β2n+α12\mathbb{E}[\overline{X}^2] = \mathbb{D}[\overline{X}] + (\mathbb{E}\overline{X})^2 = \frac{\beta_2}{n} + \alpha_1^2

Подставляя:

E[S2]=α2β2nα12=β2β2n=n1nβ2\mathbb{E}[S^{*2}] = \alpha_2 - \frac{\beta_2}{n} - \alpha_1^2 = \beta_2 - \frac{\beta_2}{n} = \frac{n-1}{n}\beta_2

Вывод: E[S2]β2\mathbb{E}[S^{*2}] \neq \beta_2 — выборочная дисперсия является смещённой.

Исправленная (несмещённая) выборочная дисперсия

Чтобы убрать смещение, вводят:

S2=nn1S2=1n1j=1n(XjX)2S^2 = \frac{n}{n-1} S^{*2} = \frac{1}{n-1}\sum_{j=1}^{n}(X_j - \overline{X})^2

Эта величина называется исправленной выборочной дисперсией. Её свойство:

E[S2]=β2\mathbb{E}[S^2] = \beta_2

Таким образом, выборочных дисперсий две штуки: S2S^{*2} и S2S^2.

Выборочное стандартное отклонение: S=S2S = \sqrt{S^2}.

Промежуточный итог

У центральных выборочных моментов:

  • состоятельность ✓
  • несмещённость нарушается (требуется поправка)

Дельта-метод

Зачем нужен

Для асимптотической нормальности начальных выборочных моментов и эмпирической функции распределения мы напрямую применяли ЦПТ. Но для центральных моментов это не работает: слагаемые вида (XjX)k(X_j - \overline{X})^k не являются независимыми, потому что везде присутствует X\overline{X}. Поэтому ЦПТ напрямую не применима — нужен дельта-метод.

Одномерная версия дельта-метода

Постановка. Пусть случайные величины ξn\xi_n удовлетворяют:

n(ξna)dN(0,σ2)\sqrt{n}(\xi_n - a) \xrightarrow{d} \mathcal{N}(0, \sigma^2)

Пусть φ:RR\varphi: \mathbb{R} \to \mathbb{R} — достаточно гладкая функция (столько раз дифференцируемая, сколько потребуется).

Вопрос: к чему сходится n(φ(ξn)φ(a))\sqrt{n}(\varphi(\xi_n) - \varphi(a))?

Обоснование одномерного дельта-метода

Шаг 0: ξnaP0\xi_n - a \xrightarrow{P} 0.

Действительно, рассмотрим:

P(ξna<ε)=P(nξna<nε)\mathbb{P}(|\xi_n - a| < \varepsilon) = \mathbb{P}(\sqrt{n}|\xi_n - a| < \sqrt{n}\varepsilon)

Поскольку n(ξna)dN(0,σ2)\sqrt{n}(\xi_n - a) \xrightarrow{d} \mathcal{N}(0,\sigma^2), имеем:

P(nξna<nε)Φ0,σ2(+)Φ0,σ2()=10=1\mathbb{P}(\sqrt{n}|\xi_n - a| < \sqrt{n}\varepsilon) \to \Phi_{0,\sigma^2}(+\infty) - \Phi_{0,\sigma^2}(-\infty) = 1 - 0 = 1

Значит, ξnPa\xi_n \xrightarrow{P} a.

Шаг 1. Раскладываем по формуле Тейлора с остатком в форме Лагранжа:

φ(ξn)φ(a)=φ(a)(ξna)+φ(ξ~n)2(ξna)2\varphi(\xi_n) - \varphi(a) = \varphi'(a)(\xi_n - a) + \frac{\varphi''(\tilde{\xi}_n)}{2}(\xi_n - a)^2

где ξ~n\tilde{\xi}_n — между aa и ξn\xi_n.

Шаг 2. Домножим на n\sqrt{n}:

n(φ(ξn)φ(a))=φ(a)n(ξna)+φ(ξ~n)2n(ξna)2\sqrt{n}(\varphi(\xi_n) - \varphi(a)) = \varphi'(a) \cdot \sqrt{n}(\xi_n - a) + \frac{\varphi''(\tilde{\xi}_n)}{2}\sqrt{n}(\xi_n - a)^2
  • Первое слагаемое: φ(a)n(ξna)dN(0,(φ(a))2σ2)\varphi'(a) \cdot \sqrt{n}(\xi_n-a) \xrightarrow{d} \mathcal{N}(0, (\varphi'(a))^2 \sigma^2)
  • Второе слагаемое: n(ξna)2=n(ξna)N(0,σ2)(ξna)P0P0\sqrt{n}(\xi_n - a)^2 = \underbrace{\sqrt{n}(\xi_n - a)}_{\to \mathcal{N}(0,\sigma^2)} \cdot \underbrace{(\xi_n - a)}_{\xrightarrow{P} 0} \xrightarrow{P} 0, причём ξ~nPa\tilde{\xi}_n \xrightarrow{P} a, φ(ξ~n)\varphi''(\tilde{\xi}_n) — ограничено.

В итоге всё второе слагаемое сходится к нулю по вероятности.

Результат (одномерный дельта-метод)

n(φ(ξn)φ(a))dN(0,(φ(a))2σ2)\boxed{\sqrt{n}(\varphi(\xi_n) - \varphi(a)) \xrightarrow{d} \mathcal{N}(0,\, (\varphi'(a))^2 \sigma^2)}

Многомерная версия дельта-метода

Постановка: ξn\xi_n — теперь случайный вектор, и

n(ξna)dN(0,Σ)\sqrt{n}(\xi_n - a) \xrightarrow{d} \mathcal{N}(0, \Sigma)

где Σ\Sigma — матрица ковариаций. Пусть φ:RdR\varphi: \mathbb{R}^d \to \mathbb{R} — гладкая (непрерывно дифференцируемая) функция dd переменных.

Утверждение:

n(φ(ξn)φ(a))dN(0,φ(a)Σφ(a))\sqrt{n}(\varphi(\xi_n) - \varphi(a)) \xrightarrow{d} \mathcal{N}(0,\, \nabla\varphi(a)^\top \Sigma\, \nabla\varphi(a))

где φ(a)\nabla\varphi(a) — градиент (строчка из частных производных). Размерность согласуется: строчка × матрица × столбец = число.

Замечание: матрица ковариаций — это аналог дисперсии в многомерном случае.

Многомерная ЦПТ (для удобства использования)

Пусть X1,,XnX_1, \ldots, X_n — независимые одинаково распределённые случайные векторы, EX1=a\mathbb{E}X_1 = a, DX1=Σ\mathbb{D}X_1 = \Sigma. Пусть Sn=k=1nXkS_n = \sum_{k=1}^n X_k. Тогда:

SnnandN(0,Σ)\frac{S_n - na}{\sqrt{n}} \xrightarrow{d} \mathcal{N}(0, \Sigma)

В удобной для статистики форме:

n(Snna)dN(0,Σ)\sqrt{n}\left(\frac{S_n}{n} - a\right) \xrightarrow{d} \mathcal{N}(0, \Sigma)

Теорема об асимптотической нормальности функций от начальных выборочных моментов

Постановка

Пусть X1,,XnX_1, \ldots, X_n — простейшая выборка (одномерные величины). Обозначим:

a=(EX1,EX12,,EX1k)a = (\mathbb{E}X_1,\, \mathbb{E}X_1^2,\, \ldots,\, \mathbb{E}X_1^k)

— вектор математических ожиданий случайного вектора (X1,X12,,X1k)(X_1, X_1^2, \ldots, X_1^k).

Σ=D(X1,X12,,X1k)\Sigma = \mathbb{D}(X_1, X_1^2, \ldots, X_1^k)

— матрица ковариаций этого случайного вектора.

a^=(X,X2,,Xk)\hat{a} = (\overline{X},\, \overline{X^2},\, \ldots,\, \overline{X^k})

— выборочный аналог aa (это в точности Sn/nS_n/n).

К a^\hat{a} применима многомерная ЦПТ.

Пусть φ:RkR\varphi: \mathbb{R}^k \to \mathbb{R} — гладкая функция.

Утверждение 1

n(φ(a^)φ(a))dN(0,φ(a)Σφ(a))\sqrt{n}(\varphi(\hat{a}) - \varphi(a)) \xrightarrow{d} \mathcal{N}\bigl(0,\, \nabla\varphi(a)^\top \Sigma\, \nabla\varphi(a)\bigr)

Это напрямую следует из дельта-метода.

Утверждение 2 (важно для практики)

Положим:

σ2=φ(a)Σφ(a)\sigma^2 = \nabla\varphi(a)^\top \Sigma\, \nabla\varphi(a)

Эта величина — функция от EX1,EX12,,EX12k\mathbb{E}X_1, \mathbb{E}X_1^2, \ldots, \mathbb{E}X_1^{2k} (поскольку на диагонали матрицы Σ\Sigma стоит DX1k=EX12k(EX1k)2\mathbb{D}X_1^k = \mathbb{E}X_1^{2k} - (\mathbb{E}X_1^k)^2).

Будем считать, что σ2\sigma^2непрерывная функция от своих аргументов. Тогда:

n(φ(a^)φ(a))σ(a^2k)dN(0,1)\frac{\sqrt{n}(\varphi(\hat{a}) - \varphi(a))}{\sigma(\hat{a}_{2k})} \xrightarrow{d} \mathcal{N}(0, 1)

где в знаменателе вместо теоретических моментов подставлены выборочные аналоги. Это работает, потому что знаменатель — непрерывная функция, и подстановка выборочных моментов сохраняет сходимость.


Асимптотическая нормальность выборочной дисперсии

Применение теоремы

Выборочная дисперсия:

S2=X2X2=φ(X,X2)S^{*2} = \overline{X^2} - \overline{X}^2 = \varphi(\overline{X}, \overline{X^2})

где φ(x1,x2)=x2x12\varphi(x_1, x_2) = x_2 - x_1^2.

Градиент:

φ(x1,x2)=(2x1,1)\nabla\varphi(x_1, x_2) = (-2x_1,\, 1)

В точке a=(EX1,EX12)a = (\mathbb{E}X_1, \mathbb{E}X_1^2):

φ(a)=(2EX1,1)\nabla\varphi(a) = (-2\mathbb{E}X_1,\, 1)

Применяем дельта-метод

n(S2DX1)dN(0,σ2)\sqrt{n}(S^{*2} - \mathbb{D}X_1) \xrightarrow{d} \mathcal{N}(0,\, \sigma^2)

где

σ2=(2EX1,1)(DX1cov(X1,X12)cov(X1,X12)DX12)(2EX11)\sigma^2 = (-2\mathbb{E}X_1,\, 1) \cdot \begin{pmatrix} \mathbb{D}X_1 & \mathrm{cov}(X_1, X_1^2) \\ \mathrm{cov}(X_1, X_1^2) & \mathbb{D}X_1^2 \end{pmatrix} \cdot \begin{pmatrix} -2\mathbb{E}X_1 \\ 1 \end{pmatrix}

Упрощение (упражнение)

После раскрытия:

σ2=E(XEX)4(DX)2=μ4β22\sigma^2 = \mathbb{E}(X - \mathbb{E}X)^4 - (\mathbb{D}X)^2 = \mu_4 - \beta_2^2

где μ4\mu_4 — четвёртый центральный момент.

Стандартизованный результат

n(S2DX)β^4(S2)2dN(0,1)\frac{\sqrt{n}(S^{*2} - \mathbb{D}X)}{\sqrt{\hat{\beta}_4 - (S^{*2})^2}} \xrightarrow{d} \mathcal{N}(0, 1)

где β^4\hat{\beta}_4 — четвёртый выборочный центральный момент.

Вывод: выборочная дисперсия — асимптотически нормальная оценка.


Парные выборки. Выборочная ковариация и корреляция

Теоретические понятия (повторение)

Ковариация:

cov(X,Y)=E[(XEX)(YEY)]=E[XY]EXEY\mathrm{cov}(X, Y) = \mathbb{E}[(X - \mathbb{E}X)(Y - \mathbb{E}Y)] = \mathbb{E}[XY] - \mathbb{E}X \cdot \mathbb{E}Y

Коэффициент корреляции:

ρ(X,Y)=cov(X,Y)DXDY\rho(X, Y) = \frac{\mathrm{cov}(X, Y)}{\sqrt{\mathbb{D}X \cdot \mathbb{D}Y}}

Парная выборка

В статистике часто возникает ситуация парной выборки — датафрейм длины nn с двумя атрибутами:

(X1,Y1),(X2,Y2),,(Xn,Yn)(X_1, Y_1), (X_2, Y_2), \ldots, (X_n, Y_n)

Выборочная ковариация

cov^(X,Y)=(XX)(YY)=XYXY\widehat{\mathrm{cov}}(X, Y) = \overline{(X - \overline{X})(Y - \overline{Y})} = \overline{XY} - \overline{X} \cdot \overline{Y}

Выборочный коэффициент корреляции (Пирсона)

ρ^(X,Y)=(XX)(YY)SX2SY2\hat{\rho}(X, Y) = \frac{\overline{(X - \overline{X})(Y - \overline{Y})}}{\sqrt{S^{*2}_X \cdot S^{*2}_Y}}

Это нормированная величина, принимающая значения от 1-1 до 11. Используется для оценки меры линейной зависимости.


Порядковые статистики и выборочные квантили

Вариационный ряд

Пусть X1,,XnX_1, \ldots, X_n — исходная выборка. Сортируем по возрастанию и получаем:

X(1)X(2)X(n)X_{(1)} \leq X_{(2)} \leq \ldots \leq X_{(n)}

Это и есть вариационный ряд. Элементы X(k)X_{(k)} называются порядковыми статистиками.

Замечание: некоторые авторы под вариационным рядом понимают статистический ряд — где сначала берётся unique, затем для каждого уникального значения считается количество вхождений νi\nu_i:

(x1,ν1),(x2,ν2),,(xm,νm)(x_1, \nu_1), (x_2, \nu_2), \ldots, (x_m, \nu_m)

после чего массив сортируется по xx. Здесь νi\nu_i — случайные величины (функции от выборки).

Теоретический квантиль (повторение)

Квантиль порядка α\alpha uαu_\alpha — это число, такое что:

P(Xuα)1αиP(Xuα)α\mathbb{P}(X \geq u_\alpha) \geq 1 - \alpha \quad \text{и} \quad \mathbb{P}(X \leq u_\alpha) \geq \alpha

В непрерывном случае квантиль определяется однозначно:

F(uα)=αF(u_\alpha) = \alpha

Геометрическая интерпретация: квантиль uαu_\alpha делит вероятностную массу под графиком плотности на части α\alpha (слева) и 1α1 - \alpha (справа).

Выборочные квантили

Обозначение: u^α\hat{u}_\alpha.

Граничные случаи:

  • u^0=X(1)=minXi\hat{u}_0 = X_{(1)} = \min X_i — минимум
  • u^1=X(n)=maxXi\hat{u}_1 = X_{(n)} = \max X_i — максимум

Содержательный случай α(0,1)\alpha \in (0, 1). Существует номер k{1,,n}k \in \{1, \ldots, n\}, такой что:

k1n<αkn\frac{k-1}{n} < \alpha \leq \frac{k}{n}

Тогда:

u^α=X(k)=X(nα)\hat{u}_\alpha = X_{(k)} = X_{(\lceil n\alpha \rceil)}

(элемент вариационного ряда с номером nα\lceil n\alpha \rceil).

Связанные термины

Квартили (от лат. quartus — четвёртый): делят выборку на четыре равные (в смысле эмпирической вероятностной массы) части.

  • Нулевой квартиль = min\min
  • Первый квартиль (нижний) = u^1/4\hat{u}_{1/4}
  • Второй квартиль = медиана = u^1/2\hat{u}_{1/2}
  • Третий квартиль (верхний) = u^3/4\hat{u}_{3/4}
  • Четвёртый квартиль = max\max

Перцентили: например, 74-й перцентиль = u^0.74\hat{u}_{0.74}.

Дециль: разбиение на десять частей.

Выборочная медиана

Часто определяется специальным образом в зависимости от чётности nn:

  • Если n=2m+1n = 2m+1 (нечётно): med^=X(m+1)\widehat{\mathrm{med}} = X_{(m+1)} — центральный элемент.
  • Если n=2mn = 2m (чётно): med^=X(m)+X(m+1)2\widehat{\mathrm{med}} = \dfrac{X_{(m)} + X_{(m+1)}}{2} — среднее арифметическое двух центральных элементов вариационного ряда.

При программировании необходимо смотреть, какое именно определение используется в конкретной библиотеке.


Средства визуализации выборки

Box plot («ящик с усами»)

Также неформально: «японские свечи» (хотя это другой объект на самом деле).

Структура (вертикальная ориентация):

  • Прямоугольник (ящик):
    • Нижняя граница = первый (нижний) квартиль u^1/4\hat{u}_{1/4}
    • Средняя линия = медиана u^1/2\hat{u}_{1/2}
    • Верхняя граница = третий (верхний) квартиль u^3/4\hat{u}_{3/4}
  • Межквартильный размах IQR=u^3/4u^1/4\mathrm{IQR} = \hat{u}_{3/4} - \hat{u}_{1/4} — аналог стандартного отклонения.
  • «Усики»: длиной обычно 1.5IQR1.5 \cdot \mathrm{IQR} от границ ящика.
  • Точки за пределами «усов» отмечаются отдельно и трактуются как выбросы.

Внутри ящика сосредоточено 50% эмпирической вероятностной массы.

Применение: на одной картинке можно нарисовать несколько box plot для разных категорий — это позволяет визуально сравнивать распределения.

Violin plot («скрипка»)

Неформально — это box plot + гистограмма на одной картинке. Точнее — аппроксимация плотности с двух сторон (KDE с очень узкими bin’ами), а внутри что-то вроде box plot.


Асимптотические результаты для порядковых статистик

Теорема об асимптотике среднего члена вариационного ряда

Условия: X1,,XnX_1, \ldots, X_n — выборка из непрерывного закона с теоретической плотностью ff. Пусть p(0,1)p \in (0, 1) — фиксированное число.

Утверждение:

nf(up)X(np)upp(1p)dN(0,1)\sqrt{n} \cdot f(u_p) \cdot \frac{X_{(\lceil np \rceil)} - u_p}{\sqrt{p(1-p)}} \xrightarrow{d} \mathcal{N}(0, 1)

при nn \to \infty.

Замечания:

  • upu_p — теоретический квантиль порядка pp.
  • Выборочный квантиль порядка ppасимптотически нормальная оценка теоретического квантиля.
  • Структура напоминает дисперсию распределения Бернулли p(1p)p(1-p).
  • При p=1/2p = 1/2 получаем результат для выборочной медианы.
  • На русском языке эта теорема плохо гуглится — на английском лучше.

Теорема об асимптотике крайних членов вариационного ряда (более экзотическая)

Условия: те же — выборка из непрерывного закона.

Утверждение: Для фиксированных ,s\ell, s:

  • nF(X())n \cdot F(X_{(\ell)}) сходится по распределению к Γ\Gamma-распределению с параметрами (,1)(\ell, 1).
  • n(1F(X(ns+1)))n \cdot (1 - F(X_{(n - s + 1)})) сходится по распределению к Γ\Gamma-распределению с параметрами (s,1)(s, 1).

При этом эти предельные распределения независимы.


Заключительные замечания

Что обсудили в курсе

  • Описательные статистики: эмпирическая функция распределения, гистограмма, выборочные характеристики.
  • Хорошие свойства выборочных характеристик: состоятельность, несмещённость (для исправленных версий), асимптотическая нормальность.

Важная оговорка: модель простейшей выборки

Все эти результаты получены в рамках модели простейшей выборки (i.i.d.), а это сильное предположение.

Проблема робастности

Если ослабить предположения модели (например, отказаться от полной независимости/одинаковой распределённости, допустить выбросы), оценки могут вести себя по-разному:

  • Выборочное среднеенеробастная оценка: при наличии выбросов оно сильно искажается.
  • Медиана — более устойчивая оценка к выбросам.

Это нетривиальная тема, на эту тему написано немалое количество нетонких книг. Конкретные подходы к борьбе с нарушением условий зависят от конкретной задачи и предметной области.

Где почитать про распределение порядковых статистик

Ивченко, Медведев — «Введение в математическую статистику» (упоминалась в списке литературы курса).