Глава 2. Математическое ожидание и дисперсия: центр и разброс
В прошлой главе мы описывали случайную величину целиком — функцией распределения . Это полная инфа, но её часто слишком много. На практике хочется двух коротких цифр: где центр (вокруг чего крутятся значения) и насколько сильно их колбасит вокруг этого центра. Первую цифру даёт математическое ожидание, вторую — дисперсия. Разберём обе, не спеша и с подробным разбором каждой формулы — тут важно не проскочить.
Матожидание — это точка равновесия
Заходим через физику, так нагляднее. Представь тонкий невесомый стержень (это наша числовая прямая), а на нём в точках насажены грузики массы — чем вероятнее значение, тем тяжелее грузик. Вопрос: в какой точке стержень подпереть пальцем, чтобы он не перевесил ни влево, ни вправо, а замер в равновесии?
Эта точка равновесия называется центром масс, и для случайной величины она и есть математическое ожидание. Тяжёлые грузики (частые значения) тянут точку к себе, лёгкие (редкие) — почти нет. Поиграй сам: двигай грузики и их веса, смотри, куда уезжает точка равновесия.
Прочувствовал? Теперь то же самое — формулой.
Формула матожидания: разбираем по кирпичикам
Определение (для дискретной величины). Если принимает значения с вероятностями , то математическое ожидание — это
Не пугайся, сейчас разложим каждый значок:
- (сигма) — это просто «сложи всё, что дальше, перебрав все варианты ». Значок суммы, не более.
- — само значение (например, сколько телефонов отжал: 0, 1, 2, …).
- — вероятность именно этого значения.
- — значение, взвешенное на свой шанс. Редкое значение входит слабо, частое — сильно.
Итог: складываем все значения, но не абы как, а с весом их вероятностей. Это не простое среднее по значениям — это взвешенное среднее, где вес каждого значения = его вероятность. Ровно та же точка равновесия, что и в виджете: тяжёлые (вероятные) значения перетягивают центр к себе.
Разберём на живом примере — обычный кубик. Значения , у каждого вероятность :
Обрати внимание на прикол: среднее вышло , хотя такой грани на кубике нет. Матожидание — это не «самое частое» и не «обязательно возможное» значение, это центр тяжести. Проверь на коде — накидаем кубик много раз и усредним:
Среднее по реальным броскам липнет к — как и обещала формула.
Пример: Бернулли
Для бернуллиевской величины (выгорело/спалился) значения всего два — с вероятностью и с вероятностью . Подставляем в формулу (1):
Разбор: ноль (спалился) с весом даёт ноль, единица (выгорело) с весом даёт . Сумма — . По-житейски: если из сотни дел в среднем выгорает доля , то средний «улов» за одну попытку и есть . Логично до безобразия.
Матожидание для непрерывных: сумма превращается в интеграл
Когда у величины есть плотность (значения размазаны сплошняком, а не сидят в отдельных точках), формула та же по духу, но сумма становится интегралом:
Разбор по кирпичикам — и ты увидишь, что это буквально формула (1), только «размазанная»:
- — это «непрерывная сумма» по всем значениям сразу (интеграл = предел суммы, когда кусочки бесконечно мелкие).
- — значение (как раньше).
- — вероятность попасть в крошечный кусочек шириной около точки (аналог веса ).
- — значение, взвешенное на вероятность оказаться рядом с ним.
Складываем (интегрируем) по всей прямой — снова получаем взвешенное среднее, ту же точку равновесия. Дискретный и непрерывный случай — это одна и та же идея, просто в одном сумма, в другом интеграл.
Пример: показательное
Для показательной величины (время до события) интеграл даёт красивый ответ:
Интуиция важнее выкладки: параметр — насколько часто случается событие. Чем больше, тем событие происходит чаще, тем меньше в среднем ждёшь. При среднее ожидание . Помнишь, в прошлой главе мы сэмплили показательное и среднее выходило около ? Вот теперь ты знаешь, откуда бралась эта цифра.
Дисперсия — насколько всё колбасит
Матожидание сказало нам, где центр. Но два расклада могут иметь один центр и вести себя совершенно по-разному: у одного значения жмутся вплотную к среднему, у другого — разлетаются широко. Нужна вторая цифра — мера разброса. Это дисперсия.
Определение.
Это, пожалуй, самая важная для понимания формула главы, поэтому разжуём её медленно, изнутри наружу:
- — отклонение значения от центра: на сколько конкретный исход промахнулся мимо среднего.
- — возводим отклонение в квадрат. Зачем? По двум причинам сразу. Первая: чтобы минусы не гасили плюсы. Значения ниже среднего дают отрицательные отклонения, выше — положительные; если их просто усреднить, они взаимно сократятся в ноль (центр же посередине). Квадрат делает всё положительным — теперь не сокращается. Вторая: квадрат сильнее наказывает большие промахи — отклонение в 2 раза даёт вклад в 4 раза. Крупные выбросы весят больше.
- — усредняем эти квадраты отклонений по всем значениям (тем же матожиданием, формула 1 или 2).
Итог человеческим языком: дисперсия — это средний квадрат отклонения от центра. Большая дисперсия — значения гуляют далеко от среднего, движуха непредсказуемая. Маленькая — всё жмётся к центру, расклад стабильный.
Один нюанс: из-за квадрата единицы измерения раздуваются (если в телефонах, то в «телефонах в квадрате» — бессмыслица). Поэтому часто берут стандартное отклонение — корень из дисперсии : он возвращает разброс в нормальные единицы и читается как «типичный промах мимо среднего».
Покрути в виджете распределений — это и есть стандартное отклонение: чем оно больше, тем шире расползается колокол вокруг центра.
Формула для счёта дисперсии
Считать дисперсию прямо по определению (3) муторно. Есть равенство попроще, которое даёт то же самое:
Читается так: «средний квадрат минус квадрат среднего». То есть: возьми среднее от (сначала возводишь в квадрат, потом усредняешь) и вычти из него квадрат среднего (сначала усредняешь, потом возводишь в квадрат). Порядок действий разный — и разница между ними и есть разброс. Считать по (4) обычно быстрее, чем по (3), а результат тот же.
Пример: дисперсия Бернулли
Красивый трюк. У Бернулли принимает только и , а для них (ведь и ). Значит . Подставляем в (4):
А теперь самое интересное — вдумайся в результат :
- при разброс максимален () — полная неопределённость, 50 на 50, гадать бесполезно;
- при или разброс равен нулю — исход предрешён, колебаться нечему.
Это глубокая мысль: неопределённость (а значит, и разброс) максимальна, когда шансы равны, и исчезает, когда всё решено заранее.
Занимательный парадокс: среднего может не быть вообще
И напоследок — вынос мозга в стиле «а так вообще бывает?». Есть распределение Коши с плотностью . Оно симметрично относительно нуля — то есть на глаз центр очевидно в нуле. Но если честно посчитать интеграл (2) для матожидания, он разбегается в бесконечность — и слева, и справа. Получается неопределённость «бесконечность минус бесконечность», и математическое ожидание Коши не существует.
Мораль: не у всякой случайной величины есть среднее. Иногда центр вроде бы виден глазом, а формула его взять не может — значения слишком часто улетают в дикую даль, и «точка равновесия» ускользает. Держи в голове: матожидание — штука мощная, но не всесильная.
Проверь себя
Реши в уме и впиши ответ: