1. Постановка задачи
Имеется выборка из независимых одинаково распределённых случайных величин. Распределение известно с точностью до конечного числа неизвестных параметров , принадлежащих параметрическому множеству . Требуется построить оценки этих параметров.
Один из общих подходов - метод максимального правдоподобия. Он основан на выборе таких значений параметров, при которых наблюдаемая выборка наиболее вероятна. Этот метод часто даёт более точные оценки, чем альтернативные подходы, и при выполнении определённых условий обладает оптимальными свойствами.
2. Интуиция
Пусть дана выборка. Разумно предположить, что истинные параметры - это те, при которых вероятность получить именно такую выборку максимальна. Если при одном наборе параметров данные очень правдоподобны, а при другом - почти невозможны, то следует предпочесть первый набор.
Для дискретных распределений это буквально вероятность наблюдать данные. Для непрерывных - плотность вероятности в точках выборки, которая также характеризует правдоподобие. Функция, связывающая параметры с этой вероятностью или плотностью, называется функцией правдоподобия. Максимизация этой функции даёт оценку максимального правдоподобия.
В отличие от метода моментов, где в конструкцию закладываются выборочные моменты, здесь не требуется никаких дополнительных догадок. Идея опирается только на само понятие вероятности или плотности.
3. Формальная конструкция
Пусть - выборка из распределения с плотностью или вероятностной массой . Для краткости вектор параметров обозначается через . Функция в дискретном случае задаёт вероятность , а в абсолютно непрерывном - плотность распределения. В обоих случаях она зависит от параметров.
Так как элементы выборки независимы и одинаково распределены, совместная вероятность или плотность равна произведению:
Функция называется функцией правдоподобия. Поскольку логарифм монотонен, точка максимума совпадает с точкой максимума логарифмической функции правдоподобия:
Оценкой максимального правдоподобия называется вектор , максимизирующий (или ):
Если функция дифференцируема, оценки ищутся из системы уравнений правдоподобия:
После нахождения стационарных точек необходимо проверить, что это действительно максимум, а не минимум или седловая точка. Однако на практике для большинства стандартных моделей проверка не требуется, так как выполняются условия регулярности, гарантирующие, что решение системы является оценкой максимального правдоподобия.
Важно: не всегда функция правдоподобия дифференцируема. Например, в равномерном распределении с неизвестной границей производная не существует, и оценку приходится искать из других соображений.
4. Свойства оценок максимального правдоподобия
При выполнении условий регулярности оценки максимального правдоподобия обладают сильными асимптотическими свойствами.
Состоятельность:
где - истинное значение параметра.
Асимптотическая нормальность:
где - информационная матрица Фишера:
Это означает, что при больших объёмах выборки оценка максимального правдоподобия приближённо нормальна с дисперсией, обратной количеству информации Фишера. Данное свойство делает метод асимптотически эффективным: среди всех состоятельных оценок оценка максимального правдоподобия имеет наименьшую возможную асимптотическую дисперсию.
Инвариантность: если - оценка максимального правдоподобия для , а - взаимно однозначная функция, то является оценкой максимального правдоподобия для . Это следует из независимости максимизации от параметризации.
Следует помнить, что свойства выполняются не всегда. Например, для равномерного распределения с неизвестной границей условия регулярности нарушаются, и оценка максимального правдоподобия не является асимптотически нормальной в стандартном смысле.
5. Примеры
5.1. Биномиальное распределение
Пусть , где известно, неизвестен. Вероятность получить успехов в испытаниях:
Функция совпадает с этой вероятностью. Функция правдоподобия для выборки :
Логарифмическая функция правдоподобия:
Производная по :
Приравниваем к нулю:
Отсюда получаем оценку:
Результат совпадает с оценкой, которую даёт метод моментов.
5.2. Нормальное распределение
Пусть , где - математическое ожидание, - дисперсия. Плотность:
Логарифмическая функция правдоподобия:
Частные производные:
Приравниваем производные к нулю и получаем систему:
Из первого уравнения:
Подставляем во второе уравнение и находим:
Это выборочная дисперсия со смещением. Оценка максимального правдоподобия для дисперсии смещена, в отличие от несмещённой оценки с делением на . Однако при больших разница мала.
5.3. Равномерное распределение
Пусть , . Плотность:
Эту плотность удобно записать с индикатором:
Функция правдоподобия:
Здесь производная по не существует из-за индикатора. Поэтому максимизируем из общих соображений. Чтобы не была нулём, необходимо . При выполнении этого условия , и чем меньше , тем больше значение. Следовательно, максимум достигается при
Эта оценка отличается от оценки метода моментов (). Она состоятельна, но смещена. Для устранения смещения можно использовать нормировку. Пусть - -я порядковая статистика выборки из . Можно показать, что
Тогда для выборки из справедливо
Следовательно, несмещённая оценка имеет вид
Этот пример показывает, что оценка максимального правдоподобия не обязана быть несмещённой, но часто легко корректируется.
6. Заключение
Метод максимального правдоподобия основан на выборе параметров, при которых вероятность наблюдения выборки максимальна. Он даёт универсальный способ построения оценок и при выполнении условий регулярности обладает оптимальными асимптотическими свойствами: состоятельностью, асимптотической нормальностью и эффективностью. Оценка максимального правдоподобия инвариантна относительно взаимно однозначных преобразований параметра.
Метод требует решения оптимизационной задачи, что может быть сложнее, чем другие подходы, но в большинстве практических ситуаций это не является серьёзным препятствием. На практике часто используют логарифмирование для упрощения вычислений.
В стандартных моделях, таких как биномиальное и нормальное распределения, оценки максимального правдоподобия совпадают с оценками метода моментов. Однако в более сложных ситуациях, например для равномерного распределения, результаты могут различаться, и метод максимального правдоподобия часто оказывается предпочтительнее.