ком xi равна N1 . С этой же вероятностью может быть извлечен и
любой другой объект. Будем рассматривать величину признака X как случайную величину, возможные значения которой имеют со-
ответственно величины x ,..., x |
и одинаковые вероятности |
1 |
. То- |
||||||||
|
|||||||||||
1 |
n |
|
|
|
|
|
|
|
N |
||
гда математическое ожидание этой величины X есть |
|||||||||||
|
|
||||||||||
|
|
|
|
|
|
|
N |
|
|
||
N |
|
|
1 |
|
1 |
|
xi |
|
|
||
M[X ] = xi pi = x1 |
+ ...xN |
= |
i=1 |
. |
(11.2) |
||||||
|
N |
|
|||||||||
i=1 |
|
|
N |
|
N |
|
|
||||
|
|
|
|
|
|
|
|
|
|
||
Из сравнения выражений (11.1) и (11.2) видно, что генеральная средняя совпадает с математическим ожиданием M[X ] = xг . Это
справедливо и в том случае, если в генеральной выборке есть объекты с совпадающими значениями признака.
Выборочной средней называется величина
|
n |
xi |
|
|
x = |
i=1 |
. |
(11.3) |
|
|
||||
в |
n |
|
|
|
|
|
|
|
|
Заметим, что выборочные значения x1,..., xn |
– признака X, полу- |
|||
ченные в итоге независимых наблюдений, можно рассматривать как реализацию случайных величин X1,..., Xn , имеющих то же распре-
деление и те же числовые характеристики, что и сама случайная величина X. Выборочная средняя является случайной величиной, обладающей соответствующим законом распределения и его числовыми характеристиками. Действительно, поскольку выбор объектов случаен, то при следующем эксперименте можем получить другие
значения x1,..., xn , а следовательно, и другое среднее.
Генеральная и выборочная дисперсии
Под генеральной дисперсией понимается величина
|
1 |
N |
|
|
Dг = |
(xi − xг)2. |
(11.4) |
||
|
||||
|
N |
|
||
|
|
i=1 |
|
|
Соответственно, среднее квадратическое отклонение σг = |
Dг . |
|||
96
Аналогично для выборочной дисперсии:
Dв = |
1 |
n |
(xi − xв)2. |
(11.5) |
|
n |
i=1 |
|
|
|
|
|
|
|
И среднее квадратическое отклонение есть σв = |
Dв . |
|||
Приведем полезную формулу для определения дисперсии, свя-
зывающую квадрат средней величины (x)2 |
и средний квадрат слу- |
||||||||||
чайной величины x 2. |
|
|
|
|
|
|
|
|
|
||
Формула для вычисления дисперсии: |
|
|
|
||||||||
|
|
n |
|
|
|
|
n |
|
|
|
|
|
|
(xi − x)2 |
(xi2 − 2xi x + x 2 ) |
|
|||||||
D = |
i=1 |
|
|
= |
i=1 |
|
= |
|
|||
|
n |
|
|
n |
|
|
|||||
|
|
|
|
|
|
|
|
|
|||
|
|
n |
|
n |
|
|
|
|
|
|
|
|
xi2 |
|
xi |
|
|
|
|||||
= |
i=1 |
− 2x |
i=1 |
|
+ (x)2 = |
x2 |
− (x)2. |
(11.6) |
|||
|
|
|
|||||||||
|
|
n |
|
|
n |
|
|
|
|
|
|
Статистические оценки параметров распределения
Пусть требуется определить числовые характеристики случайной величины из некоторой генеральной совокупности. Например, рассматриваемой генеральной совокупностью является контингент
студентов МИФИ, а рассматриваемой случайной величиной − рост студента. Требуется определить средний рост студента. Понятно, что можно было бы использовать формулу (11.1), но для этого пришлось бы измерить рост всех N студентов. (Задача непростая, даже если всех удастся найти в институте.) Проще, конечно снять с занятий какую-нибудь группу в количестве n студентов, отвести в
медпункт и определить xв по формуле (11.3). При этом, конечно,
полученное значение может отличаться от истинного. Иными словами, мы нашли некоторую оценку случайной величины. Отметим сразу, что под термином «оценка» понимается не только само полученное численное значение, но и формула, которая использовалась для ее получения. Например, значение среднего роста студентов
можно получить также из выражения |
Xmax + Xmin |
, |
где Xmax , |
|
2 |
||||
|
|
|
97
Xmin – соответственно максимальное и минимальное значение ро-
ста в выбранной совокупности. Возникает вопрос о наилучшем выборе формулы для получения оценки интересующего нас параметра по выборке. В общем плане задача ставится следующим образом. Пусть X – случайная величина, имеющая плотность распределения
f (x, θ) , где θ – вектор параметров, значения и статистические свойства которых неизвестны. Исследовать все элементы генераль-
ной совокупности для определения θ не представляется возмож-
ным, поэтому о векторе параметров θ судят по выборке из генеральной совокупности. Функцию результатов наблюдений, с помо-
щью которой судят о значении вектора параметров θ, называют
статистической оценкой вектора параметров θ . Для простоты в дальнейшем будем говорить об оценке одного параметра θ . Рассмотрим некоторое множество выборок объемом n каждая. Выбо-
рочную оценку параметра θ по i-й выборке будем обозначать θ*i .
Так как состав каждой выборки заранее неизвестен, то θ*i − случай-
ная величина. Таким образом, оценка параметра является случайной величиной.
Свойства оценок
Состоятельность. Оценка θ* ( X1,..., Xn ) называется состоятельной, если по мере роста объема выборки n она сходится по ве-
роятности |
|
к |
истинному |
значению |
параметра: |
|
* |
,..., X |
|
|
n→∞ |
|
|
θ (X |
n |
) → θ . |
|
|
||
1 |
|
по вероятности |
|
|
||
Требование состоятельности отражает здравый смысл. Действительно, увеличение объема выборки есть не что иное, как увеличение информации о генеральной совокупности, поэтому оценка по выборке должна приближаться к истинному значению параметра. Это свойство оценки необходимо проверять в первую очередь. С другой стороны, свойство состоятельности – это асимптотическое свойство, т.е. оно может проявляться лишь при больших объемах выборки. Вместе с тем, как правило, можно предложить несколько состоятельных оценок одной и той же величины, которые при ко-
98
нечном объеме выборки будут давать различные результаты. Следовательно, только требования состоятельности недостаточно. Например, если в качестве оценки среднего роста взять формулу
n
Xв = i=1 Xi + 10 , то оценка будет состоятельной, но при малых объ- n n
емах выборки, мы будем получать завышенное значение среднего роста.
Несмещенность. Оценка θ*(X1,..., Xn ) называется несмещен-
ной, если при любом объеме выборки n результат ее усреднения по всем возможным выборкам данного объема приводит к истинному
значению оцениваемого параметра, т.е. M[θ*] = θ. В отличие от со-
стоятельности несмещенность оценки характеризует ее доасимптотические свойства, т.е. хорошие или плохие свойства при конечном объеме выборки. Удовлетворение требованию несмещенности устраняет систематическую погрешность оценивания, которая зависит от объема выборки. Оценка может быть состоятельной, но смещенной, т.е. хорошей при n → ∞, но плохой при конечном n.
Эффективность. Оценка θ*( X1,..., Xn ) называется эффективной,
если она при заданном объеме выборки имеет минимальную дисперсию. На рис. 11.1 показана такая ситуация.
Рис. 11.1. Эффективность оценки
В заключение отметим, что на практике стремятся, чтобы выбранная оценка удовлетворяла всем вышеперечисленным свойствам: состоятельности, несмещенности и эффективности.
Пример. Предположим, некто работает менеджером по торговле недвижимостью (жильем). Как и всякий земельный спекулянт, он желает купить жилье подешевле, а продать подороже. Для этого он должен изучить цены на жилую площадь. Допустим,
99
его пока интересует средняя цена за одну «сотку» (100 квадратных метров), например в Москве и Московской области. Понятно, что для того, чтобы знать среднюю цену по московскому региону (по всей генеральной совокупности), следовало бы опросить всех собственников продающих жилье, просуммировать стоимость и разделить на число собственников. Сделать это практически невозможно, и менеджер поставлен перед необходимостью сделать оценку средней цены по выборке из генеральной совокупности. Если
|
|
|
|
n |
Xi |
|
|
он будет вычислять среднюю цену по формуле |
|
|
в = |
i=1 |
|
, то за- |
|
X |
|
||||||
n |
|||||||
|
|
|
|
|
|||
висимость средней цены от объема выборки будет похожа на ту, что изображена на рис. 11.2. Из рисунка видно, что с увеличением объема выборки оценка средней цены стремится к некоторой постоянной. Этот факт отражает свойство состоятельности оценки. На рис. 11.3 показано поведение оценки средней цены в том случае, когда объем выборки не меняется, но увеличивается число выборок, по которым проводится усреднение. Этот рисунок иллюстрирует факт несмещённости оценки.
Рис. 11.2. Зависимость оценки средней цены от объема выборки
100