Выборка и её происхождение
Математическая статистика занимается восстановлением вероятностных распределений по эмпирическим данным. Исходный объект - это выборка, то есть набор действительных чисел , полученных в результате наблюдения за некоторым процессом. Примеры процессов: количество заболевших за день, средняя температура воздуха, число бракованных деталей на производстве. Каждый раз фиксируется одно число, характеризующее процесс, и после наблюдений образуется выборка.
Сами по себе числа не несут вероятностной структуры. Чтобы появилась теория вероятностей и можно было строить статистические выводы, делается ключевое допущение: каждое число считается реализацией некоторой случайной величины . Предполагается, что существует вероятностное пространство , на котором определены случайные величины , и наблюдаемые значения есть для некоторого элементарного исхода .
Дополнительно принимаются два важных условия:
- Независимость случайных величин в совокупности.
- Одинаковая распределённость: все имеют одно и то же распределение.
Эти условия позволяют применять результаты теории вероятностей, прежде всего законы больших чисел и центральную предельную теорему. Без них аппарат прошлого семестра не работает. В реальных задачах, например при анализе эпидемии, независимость может нарушаться, и тогда нужны другие модели, но в базовом курсе мы ограничиваемся случаем независимых одинаково распределённых величин.
Параметрическая модель
Распределение случайных величин , как правило, известно с точностью до конечного набора неизвестных параметров. Формально: функция распределения принадлежит классу , где - вектор параметров, а - параметрическое множество. Часто , то есть параметр может быть многомерным.
Пример: если известно, что выборка порождена нормальным распределением, но неизвестны среднее и дисперсия, то , где - математическое ожидание, а - дисперсия. Тогда . Параметр может быть и скалярным, например, у биномиального распределения с неизвестной вероятностью успеха или у распределения Пуассона с неизвестным средним.
Таким образом, задача сводится к оцениванию неизвестных параметров по имеющейся выборке. Мы знаем семейство распределений, но не знаем конкретное значение .
Основная задача статистики
Имея выборку , требуется как можно точнее оценить распределение, из которого она порождена, или, в рамках параметрической модели, оценить вектор параметров . Если распределение восстановлено достаточно хорошо, можно предсказывать поведение процесса и лучше понимать природу явления.
В течение курса выделяются три класса задач, связанных с оцениванием:
- точечные оценки параметров,
- интервальные оценки,
- проверка гипотез.
В первую очередь рассматриваются точечные оценки, то есть построение функции от выборки, которая даёт приближение неизвестного параметра. Этому посвящены следующие заметки.