Выборка и её происхождение

Математическая статистика занимается восстановлением вероятностных распределений по эмпирическим данным. Исходный объект - это выборка, то есть набор действительных чисел , полученных в результате наблюдения за некоторым процессом. Примеры процессов: количество заболевших за день, средняя температура воздуха, число бракованных деталей на производстве. Каждый раз фиксируется одно число, характеризующее процесс, и после наблюдений образуется выборка.

Сами по себе числа не несут вероятностной структуры. Чтобы появилась теория вероятностей и можно было строить статистические выводы, делается ключевое допущение: каждое число считается реализацией некоторой случайной величины . Предполагается, что существует вероятностное пространство , на котором определены случайные величины , и наблюдаемые значения есть для некоторого элементарного исхода .

Дополнительно принимаются два важных условия:

  • Независимость случайных величин в совокупности.
  • Одинаковая распределённость: все имеют одно и то же распределение.

Эти условия позволяют применять результаты теории вероятностей, прежде всего законы больших чисел и центральную предельную теорему. Без них аппарат прошлого семестра не работает. В реальных задачах, например при анализе эпидемии, независимость может нарушаться, и тогда нужны другие модели, но в базовом курсе мы ограничиваемся случаем независимых одинаково распределённых величин.


Параметрическая модель

Распределение случайных величин , как правило, известно с точностью до конечного набора неизвестных параметров. Формально: функция распределения принадлежит классу , где - вектор параметров, а - параметрическое множество. Часто , то есть параметр может быть многомерным.

Пример: если известно, что выборка порождена нормальным распределением, но неизвестны среднее и дисперсия, то , где - математическое ожидание, а - дисперсия. Тогда . Параметр может быть и скалярным, например, у биномиального распределения с неизвестной вероятностью успеха или у распределения Пуассона с неизвестным средним.

Таким образом, задача сводится к оцениванию неизвестных параметров по имеющейся выборке. Мы знаем семейство распределений, но не знаем конкретное значение .


Основная задача статистики

Имея выборку , требуется как можно точнее оценить распределение, из которого она порождена, или, в рамках параметрической модели, оценить вектор параметров . Если распределение восстановлено достаточно хорошо, можно предсказывать поведение процесса и лучше понимать природу явления.

В течение курса выделяются три класса задач, связанных с оцениванием:

  • точечные оценки параметров,
  • интервальные оценки,
  • проверка гипотез.

В первую очередь рассматриваются точечные оценки, то есть построение функции от выборки, которая даёт приближение неизвестного параметра. Этому посвящены следующие заметки.


Ссылки