Материал: Камартина Н. М. Теория вероятностей и математическая статистика. Часть 2. Статистика

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Наличие положительного эксцесса означает присутствие слабоварьирующего «ядра» и сильно рассеянного вокруг него окружения в генеральной совокупности. Отрицательный эксцесс означает отсутствие такого ядра.

По значениям асимметрии и эксцесса можно судить о близости распределения к нормальному. Для такой оценки используют неравенства:

 

 

 

 

 

 

 

 

24n n 1 2

 

 

2

6n n 1

 

2

As

 

;

Ex

 

.

n 2 n 1 n 3

n 3 n 2 n 3 n 5

 

 

 

 

 

 

 

 

Свойства нормального закона распределения изучаются в теории вероятностей [1]. При использовании статистических методов весьма полезны визуально определяемые свойства графика стандартного нормального распределения – кривой Гаусса [4].

ИНТЕРВАЛЬНЫЕ ОЦЕНКИ ПАРАМЕТРОВ РАСПРЕДЕЛЕНИЯ

Точечные оценки, найденные по выборке объемом n, не позволяют непосредственно ответить на вопрос, какую ошибку мы допускаем, принимая вместо точного значения неизвестного параметра его приближенное значение.

Поэтому во многих случаях выгоднее пользоваться интервальной оценкой, основанной на определении некоторого интервала, внутри которого с определенной вероятностью находится неизвестное значение параметра.

Пусть найденная по результатам выборки объема n статистическая ха-

рактеристика x1, x2 ,..., xn является точечной оценкой неизвестного

параметра . Чем меньше разность , тем лучше качество оценки, тем

она точнее. Таким образом, положительное число характеризует точность

оценки .

Однако статистический метод не позволяет категорически утверждать, что оценка удовлетворяет данному неравенству в смысле математического анализа. Можно говорить только о вероятности (1 – ), с которой это неравенство выполняется. Такую вероятность называют доверительной.

Доверительной вероятностью оценки называют вероятность γ = 1 –

выполнения неравенства . Обычное значение задается заранее.

Наиболее часто полагают γ = 1 – равной одному из чисел: 0,95; 0,99; 0,9975.

11

Неизвестный параметр заключен внутри интервала

 

 

 

 

 

, .

 

 

 

 

 

Этот интервал называется доверительным интервалом. Границы интервала определяются по выборочным данным, они являются статистиками. Поэтому доверительный интервал случаен. Он может накрывать параметр или нет.

В практических приложениях важную роль играет длина доверитель-

ного интервала. Чем меньше длина доверительного интервала

 

 

 

 

,

 

,

 

 

 

 

 

 

тем, очевидно, точнее оценка. Длина доверительного интервала равна 2 . Величины , (1 – ) и n тесно взаимосвязаны, и, задавая определенные значения двум из них, можно определить величину третьей.

В решении практических задач для оценки генерального математического ожидания используют различные подходы. Если есть основания считать распределение приближенно нормальным, используется формула

 

 

 

 

s

 

 

 

 

s

 

 

 

 

 

 

 

 

 

 

 

 

 

 

P x t1

 

 

 

m x t1

 

 

 

 

,

(11)

 

 

 

 

 

 

 

 

n 1

 

 

n 1

 

 

 

 

 

 

 

 

 

 

 

2

2

 

 

 

 

 

 

 

 

 

 

 

 

где γ – доверительная вероятность оценивания;

s – исправленное среднее квадратическое отклонение;

t1 n 1 – квантиль распределения Стьюдента с n – 1 степенями сво-

2

боды порядка 1 . 2

Таблица квантилей распределения Стьюдента приведена в приложении (табл. П3).

Если предположение о нормальном распределении генеральной совокупности не подтвердилось, то при большом объеме выборки (n > 30) можно использовать формулу

 

 

 

s

 

 

 

 

s

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

P x u1

 

 

 

 

m x u1

 

 

 

 

 

,

(12)

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

n

 

 

 

 

 

n

 

 

2

2

 

 

 

 

 

 

 

 

 

 

 

 

 

где u1 – квантиль стандартного нормального распределения (табл. П2

2

в приложении);

s – исправленное выборочное среднее квадратическое отклонение; γ – доверительная вероятность.

Анализируя формулу доверительного интервала, можно заметить, что: а) увеличение объема выборки n приводит к уменьшению длины дове-

рительного интервала;

12

б) увеличение доверительной вероятности (1 – ) приводит к увеличению длины доверительного интервала, т. е. к уменьшению точности;

в) если задать точность и доверительную вероятность (1 – ), то можно найти минимальный объем выборки, который обеспечивает заданную точность.

ПРОВЕРКА СТАТИСТИЧЕСКИХ ГИПОТЕЗ

При проведении статистического исследования возникают вопросы о свойствах генерального распределения и выборки. Для ответов на эти вопросы выдвигаются гипотезы, требующие статистической проверки на основе полученной выборки. Гипотеза о виде распределения строится на основе графических данных. График эмпирической функции распределения должен быть похож на график функции распределения гипотетического закона, а гистограмма – на график плотности гипотетического распределения. Для часто встречающихся на практике законов распределения эти графики имеют известный вид.

Статистической гипотезой H называется предположение относительно параметров или вида распределения случайной величины Х. Проверяемая гипотеза называется нулевой гипотезой и обозначается H0 . Наряду

с гипотезой H0 рассматривают одну из альтернативных (конкурирующих) гипотез H1.

Термин «конкурирующая» означает, что являются взаимоисключающими два события:

по выборке принимается решение о справедливости для генеральной совокупности гипотезы H0 ;

по выборке принимается решение о справедливости для генеральной совокупности гипотезы H1.

Выдвинутую гипотезу проверяют на основе выборки. Для этого формируется функция выборочных элементов (статистика), по значениям которой судят о справедливости гипотезы. Эта статистика называется критерием значимости Z. Требования здесь такие:

–ее значения зависят от выборочных данных;

–будучи величиной случайной (в силу случайности элементов выбор-

ки), величина Z при выполнении гипотезы Н0 подчиняется некоторому известному закону распределения;

– ее значения позволяют судить о расхождении гипотезы Н0 с выборочными данными.

В основе большинства критериев значимости лежит простой принцип: если есть гипотеза о том, что событие имеет очень малую вероятность, но в результате всего лишь одного испытания это событие произошло, то следует

13

подвергнуть сомнению справедливость выдвинутой гипотезы. События, имеющие большую вероятность, считаются достоверными. Этот принцип реализуется следующим образом. Перед анализом выборки устанавливается

некоторая малая вероятность , называемая уровнем значимости. Она выбирается исходя из конкретики задачи. Пусть V – множество значений статистики Z. Указывается область маловероятных значений Z: Vk V, попадание в которую статистики Z позволит принять или отвергнуть гипотезу H0.

Критической областью критерия значимости называется подобласть значений статистики Z, вероятность попадания в которую для этой статистики при условии истинности проверяемой гипотезы равна уровню значимости:

P Z Vk / H0 .

Очевидно, попадание значения статистики в дополнительную область V \ Vk , называемую допустимой, будет означать принятие проверяемой ги-

потезы. Уровень значимости α определяет «размер» критической области. Критическая область выбирается исходя из требований задачи. Она может представлять собой полуось или объединение двух полубесконечных интервалов. В зависимости от вида критической области критерии подразделяют на правосторонние, левосторонние и двусторонние. По выбранному уровню значимости и по выборочным значениям признака определяется величина статистики критерия. Если эта величина попала в критическую область, то гипотеза отвергается. Но она может оказаться справедливой, просто случайно произошло событие, которое имеет очень малую вероятность α. Таким образом, α представляет собой вероятность отвержения правильной гипотезы. С уменьшением уровня значимости α расширяется критическая область и тем самым увеличивается вероятность принятия проверяемой гипотезы, когда она неверна.

Ошибкой первого рода называется ошибка отвержения правильной гипотезы. Ошибкой второго рода называется ошибка принятия неверной гипотезы.

Вероятность ошибки первого рода:

P Z Vk / H0 .

Вероятность ошибки второго рода:

P Z V \ Vk / H1 .

Число 1 – β называют мощностью критерия. Его выбор осуществляют таким образом, чтобы мощность была максимальной.

Общая схема проверки статистических гипотез:

1)выдвигаются проверяемая и альтернативная гипотезы H0 , H1 ;

2)выбирается уровень значимости α. Обычно это 0,001; 0,01; 0,05; 0,1;

14

3)выбираются статистика Z критерия значимости и критическая область, соответствующая ей, уровню значимости и проверяемым гипотезам;

4)вычисляется выборочное значение статистики Z;

5)если найденное по выборке значение статистики попало в критическую область, то гипотеза отвергается, если нет – принимается.

Критериев существует много. Мы ограничимся рассмотрением наиболее распространенного критерия значимости.

ПРИМЕНЕНИЕ КРИТЕРИЯ СОГЛАСИЯ 2 (ПИРСОНА)

Пусть по виду гистограммы выборки выдвинуто предположение о том, что распределение генеральной совокупности X можно считать нормальным. Разобьем множество значений исследуемого признака на непересекающиеся промежутки i, считая, что это множество занимало всю вещественную ось. Крайние промежутки при этом будут полубесконечными. Обозначим pi P X i вероятность попадания случайной величины Х

в соответствующий промежуток.

Для выборки, по которой мы изучаем нашу генеральную совокупность, обозначим n1, ..., nk частоты попадания вариант в соответствующие

промежутки. Очевидно, в случае справедливости выдвинутой гипотезы от-

носительные частоты

nk

при большом объеме выборки должны быть

n

 

 

 

 

 

 

 

близки к вероятностям pi. Статистика критерия Пирсона имеет вид

 

 

 

2

k

n np

2

(13)

 

 

 

i

i

.

 

 

 

i 1

 

npi

 

 

Со свойствами ее распределения можно ознакомиться в [1]. Применение критерия Пирсона основано на проверке согласованности

частот (отсюда название «критерий согласия») эмпирического распределения с теоретическими частотами нормального распределения.

Практические действия по проверке выдвинутой гипотезы начинаются с разбиения числовой оси. Как правило, используют те же промежутки, которые были найдены при построении гистограммы выборки. Если для ка- ких-либо промежутков частота индивидуальных значений признака оказывается мала (меньше 5), то соседние промежутки нужно объединить.

Определяют число степеней свободы (число независимых аргументов) статистики 2 . Аргументами являются частоты выборки, они связаны одним

равенством (их сумма равна объему выборки). В остальном частоты будут независимыми в силу независимости элементов выборки. Поэтому функция

2 имеет k – 1 независимых аргументов (число частот минус одна связь).

15

Источник: https://studfile.net/preview/15049155/