Величина 1 PД – доверительная вероятность. При этой дове-
рительной вероятности доверительный интервал для математического
ожидания m задается пределами |
x |
t |
|
|
; |
x |
t |
|
|
. |
||||||||||
|
|
|
|
|
|
|||||||||||||||
|
|
|||||||||||||||||||
1 |
|
|
|
|
|
|
|
|
|
n |
|
n |
||||||||
|
|
|
|
|
|
|
|
|
||||||||||||
Величина |
x |
t |
|
t S |
x |
представляет случайную ошибку на- |
||||||||||||||
|
n |
|
||||||||||||||||||
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
блюдения.
3.4. Проверка статистических гипотез
Статистической гипотезой H называется предположение о свойстве генеральной совокупности, которое можно проверить, опираясь на данные выборки. Гипотезы о параметрах генеральной совокупности называются параметрическими, о распределениях – непараметрическими.
Любая гипотеза формулируется до опыта и проверяется на основе последующего эксперимента. Основная гипотеза H0 обычно высказывается в форме, отрицающей наличие каких-либо видимых отличий, поэтому гипотеза H0 называется нулевой. Одновременно формулируется альтернативная гипотеза H1.
Проверка гипотезы осуществляется на основе выявления согласованности эмпирических (экспериментальных) данных с гипотетическими (теоретическими). Если расхождение между сравниваемыми величинами не выходит за пределы случайных ошибок, гипотезу принимают. При этом не делается никаких заключений о правильности самой гипотезы, речь идет лишь о согласованности сравниваемых данных. Нулевая гипотеза отвергается тогда, когда по выборке получается результат, который при истинности выдвинутой нулевой гипотезы маловероятен. Границей невозможного или маловероятного обычно считают 0,05, или 0,01, или 0,001 и называют уровнем значимости.
Процедура проверки гипотезы производится при помощи статистического критерия – правила, определяющего условия, при котором проверяемую нулевую гипотезу следует либо принять, либо отклонить. Критерий представляет собой случайную функцию результатов наблюдения с известным законом распределения (t-, F-, 2 - критерий). В соответствии с характером распределения одни значения
43
критерия являются более вероятными, другие – менее. Таким образом, область возможных значений делится на две части. Одна называется областью принятия гипотезы, другая (где гипотеза должна быть отвергнута) – критической областью. Чтобы проверить гипотезу, необходимо вычислить критерий и посмотреть, в какую область попадает вычисленное значение.
Проверка статистических гипотез складывается из следующих этапов:
формулируется в виде статистической гипотезы задача исследования;
выбирается статистическая характеристика гипотезы;
выбираются нулевая H0и альтернативная H1гипотезы на осно-
ве анализа возможных ошибочных решений и их последствий;
выбирается приемлемый уровень значимости ;
выбирается критерий проверки гипотезы H0;
вычисляется фактическое значение статистического критерия;
определяется критическое значение статистического критерия по соответствующей таблице;
проверяется нулевая гипотеза на основе сравнения фактического и критического значений критерия, в зависимости от результатов проверки гипотеза либо отклоняется, либо не отклоняется.
При проверке гипотез по одному из критериев возможны два ошибочных решения:
неправильное отклонение нулевой гипотезы – ошибка первого
рода;
неправильное принятие нулевой гипотезы – ошибка второго
рода.
Возможные решения приведены в табл. 3.1. Вероятность ошибки первого рода равна уровню значимости . Вероятность не совершить ошибку второго рода 1 называют мощностью критерия. Обычно
задают и пытаются сделать возможно малым.
|
|
|
Таблица 3.1 |
|
Возможные выводы при проверке гипотез |
||
|
|
|
|
Решение по критерию |
Фактически |
||
|
|
H0 верна |
H0 не верна |
H0 |
отклоняется |
Ошибка первого рода |
Правильное решение |
H0 |
не отклоняется |
Правильное решение |
Ошибка второго рода |
44
3.4.1. Проверка гипотезы о законе распределения
Гипотезы о распределениях заключаются в том, что выдвигается предположение о том, что распределение в генеральной совокупности подчиняется какому-то определенному закону. При планировании эксперимента важно, чтобы наблюдаемые значения физических величин подчинялись нормальному закону распределения. Поэтому нулевая гипотеза H0: результаты наблюдений подчиняются нормальному
закону распределения; альтернативная H1: результаты наблюдений не подчиняются нормальному закону распределения.
В качестве статистических характеристик гипотезы о законе распределения принимаются оценки параметров распределения. Предположим, что при выполнении n наблюдений одной и той же величины постоянная систематическая погрешность полностью исключена. Тогда результат i-го наблюдения xi xист i находится с некоторой
абсолютной случайной погрешностью i xi xист.
При нормальном законе распределения случайной погрешностиi за истинную величину xист m1 принимают ее оптимальную оцен-
ку, равную оценке математического ожидания (3.15).
Затем вычисляют абсолютную погрешность каждого из n наблюдений
i |
xi |
x |
. |
(3.20) |
Далее находят оценку СКО наблюдений S , характеризующую точность метода измерений:
|
1 |
n |
2 |
|
S |
|
i 1 i . |
(3.21) |
|
n 1 |
||||
Если число наблюдений n 20, строится интервальный вариационный ряд. При его построении в первой графе отдельные значения признака указываются в интервалах «от – до», во второй графе – численность единиц, входящих в интервал. Величина интервала определяется по формуле
i R m, |
(3.22) |
где R –размах варьирования признака, R xmax xmin ; m – число групп, которое приближенно определяется по формуле Стерджесса
m 1 3,32lgn. |
(3.23) |
45
Полученную по этой формуле величину округляют до целого большего числа. Нижнюю границу первого интервала определяют, вычитая из xmin половину последнего разряда.
Оценка математического ожидания в этом случае определяется по формуле
m
xj f j*
x |
|
j 1 |
|
, |
(3.24) |
m |
|
||||
|
|
f |
j* |
|
|
|
|
j |
|
|
|
где xj – середина интервала; f j* – частота попадания результатов на-
блюдения xi в заданный интервал; j – номер интервала. Оценка СКО
|
m |
|
|
|
|
|
|
xj |
x |
2 f j* |
|
||
S |
j 1 |
|
|
. |
(3.25) |
|
|
m |
* |
||||
|
|
f j |
|
|
||
|
|
j 1 |
|
|
|
|
Выбирается приемлемый уровень значимости, обычно 0,05. Проверка гипотезы состоит в том, чтобы на основании сравнения
эмпирических (фактических) частот с предполагаемыми (теоретическими) сделать вывод о соответствии эмпирического распределения гипотетическому. Для проверки близости теоретического и эмпирического распределений используются специальные показатели, называемые критериями согласия. Наиболее распространенным является критерий Пирсона 2 , вычисляемый по формуле
2 |
|
f |
j* f j |
2 |
|
|
|
|
|
|
, |
(3.26) |
|
|
f j |
|
||||
|
j |
|
|
|
||
где f j* – эмпирические частоты в интервале; f j – теоретические час-
тоты в интервале.
Если все эмпирические частоты равны соответствующим теоретическим частотам, то 2 равно нулю. Очевидно, что чем больше от-
личаются эмпирические и теоретические частоты, тем 2 больше; если расхождение несущественно, то 2 должно быть малым.
Теоретическая частота в данной группе вычисляется как произведение объема совокупности (числа наблюдений) на вероятность попадания в данный интервал. Теоретические частоты нормального распределения определяются по формуле
46
f j |
|
|
n i |
|
exp t2j |
2 , |
(3.27) |
|
S |
|
|
|
|||||
|
2 |
|||||||
|
|
|
|
|
|
|
||
где tj – нормированное отклонение
tj |
|
xj |
x |
. |
(3.28) |
|
|
||||
|
|
S |
|
||
Величина p t 
2 1exp t2 /2 – табличное значение (прил. 1), поэтому формулу (3.27) можно переписать в виде
f |
j |
|
n i |
pt |
j |
. |
(3.29) |
|
S |
||||||||
|
|
|
|
|
При расчете критерия Пирсона необходимо соблюдать условия:
число наблюдений должно быть достаточно велико n 50 ;
теоретические частоты в интервале должны быть больше 5. Если теоретические частоты в некоторых интервалах меньше 5, то соседние интервалы объединяют.
Критическое значение Т2 определяется по таблице распределения Пирсона (прил. 2) в соответствии с числом степеней свободыd.f. и уровнем значимости .
Число степеней свободы рассчитывается так: если эмпирический ряд распределения имеет k категорий (число интервалов с учетом объединения), то k эмпирических частот f1*, f2*, , fk* должны быть
k
связаны следующим соотношением: fj* n. Если параметры теоре-
j 1
тического распределения известны, то только (k 1) частот могут принимать произвольные значения, а последняя частота может быть найдена из указанного соотношения. Поэтому говорят, что система из k частот благодаря наличию одной связи теряет одну степень свободы и имеет только (k 1) степеней свободы. Кроме того, если при нахождении теоретических частот p параметров теоретического распределения неизвестны, то они должны быть найдены по данным эмпирического ряда. Это накладывает на эмпирические частоты еще p связей, благодаря чему система теряет еще p степеней свободы. Таким образом, число свободно варьируемых частот (а значит, и число степеней свободы) становится равным
d.f. k p 1 . |
(3.30) |
Если 2 T2, то гипотеза H0 о нормальном законе распределения эмпирических данных принимается.
47