§2. Порядковые статистики и смеси: кто какой по счёту
В главе 4 мы уже сортировали выборку в вариационный ряд. Теперь спросим: как распределена -я по величине точка? И заодно научимся моделировать смеси — когда величина берётся то из одного закона, то из другого.
Закон -й порядковой статистики
Пусть равномерны на , а — -я по возрастанию.
Утверждение 3.
Доказательство — красивая подмена. Назовём «успехом» то, что точка упала левее . Шанс успеха , точки независимы — получилась схема Бернулли. А «-я по возрастанию не больше » — то же самое, что «хотя бы точек левее ». Это сумма биномиальных вероятностей от до из §1.
Продифференцировав и сократив (почти все слагаемые взаимно уничтожаются), получаем плотность:
Смысл по кирпичикам: — шанс, что точек левее ; — что правее; ещё одна точка сидит прямо в , а множитель считает, сколькими способами выбрать, кто где.
Бета-распределение
Определение. Величина имеет бета-распределение с параметрами , , если
Здесь — бета-функция Эйлера из главы 3, она просто нормирует площадь до единицы. Значит, -я порядковая статистика равномерной выборки имеет бета-распределение .
Форма зависит от параметров: при это равномерное; при — горб; при — «ванна», задранная к краям. Моменты считаются в одну строку:
Покрути виджет: двигай и . При это минимум, жмущийся к нулю, при — максимум у единицы, в середине — горб около .
Арксинус-закон: кто ведёт в игре
Особый случай — арксинус-распределение с функцией распределения . Его плотность — та самая «ванна»: высокая у краёв и низкая в середине.
Где он вылезает. Два равных по силе игрока бросают монетку: орёл — рубль первому, решка — второму. Какую долю времени первый будет в плюсе? Интуиция говорит: около половины, ведь силы равны. А на деле доля времени лидерства подчиняется арксинус-закону и чаще всего близка к 0 или 1.
Конкретно: , поэтому в каждом пятом случае один из игроков лидирует не менее 97,6 % всей игры. Проигрывающий почти всю партию сидит в минусе и думает «сейчас отыграюсь» — а закон говорит, что так и просидит.
Сравни: «почти всю игру впереди кто-то один» случается чаще, чем «поровну, около половины». Вот такая кривая справедливость у честной монетки.
Смеси и метод суперпозиции
Определение. Пусть , , а — функции распределения. Тогда называется смесью распределений с весами .
Например, смесь с весами закона «всегда 1» и равномерного на : монеткой решаешь, выдать ровно единицу или случайное число.
Моделируется смесь методом суперпозиции, в два хода (это формула полной вероятности):
- Разыгрываем номер с вероятностями — дискретным датчиком из §1.
- Берём число из закона любым подходящим способом.
По-дворовому: сначала жребием решаешь, к какой бригаде идти, потом бригада выдаёт своё.
Пример. Плотность с на . Перепишем её как с . А — это плотность максимума из равномерных чисел (бета ). Итак: разыграй с вероятностями , потом возьми максимум из равномерных. Работает, только пока все .
Многочлены Бернштейна
А если плотность любая непрерывная, не степенной ряд? Её можно приблизить многочленами Бернштейна:
Теорема Вейерштрасса. Если непрерывна на , то равномерно по при .
Доказательство опять на вероятностях. Пусть — число успехов в испытаниях с вероятностью успеха . Тогда — просто среднее значение в точке «доля успехов». А доля успехов по неравенству Чебышёва жмётся к :
Почти вся масса сидит рядом с , а там почти равна по непрерывности. Остаток весит не больше и уходит в ноль. Итог: равномерно по .
Для моделирования многочлен нормируют, чтобы площадь была 1, и раскладывают как смесь бета-плотностей — тех самых плотностей порядковых статистик. Веса пропорциональны . При больших это почти то же, что дискретная величина со значениями и вероятностями, пропорциональными .
Покрути виджет: двигай степень и смотри, как многочлен подползает к функции. На ступеньке убедишься, зачем теореме нужна непрерывность: в точках скачка многочлен застревает посередине и не дотягивается.