Если t≥t при заданном уровне значимости α, то нулевая
α;n-2
*
гипотеза отклоняется, а альтернативная гипотеза H1: rxy ≠ 0, о
том, что коэффициент корреляции существенен, принимается.
Определение |
доверительного |
интервала |
коэффициента |
корреляции. При |
малых объемах |
выборки |
(n<20) можно |
|
|
|
* |
рекомендовать построение доверительного интервала для r ,
xy
которое основано на преобразовании Р. Фишера. Он
предложил такое нелинейное преобразование величины r ,
xy
при котором закон распределения этой оценки, вообще говоря, довольно сложный, практически приближается к нормальному. Это преобразование производится по формуле
Z*= |
|
ln |
|
|
. |
(5.22) |
||
|
|
|
||||||
Среднеквадратичное отклонение случайной величины z* |
||||||||
зависит от числа опытов z*= |
√ |
|
|
|
|
(5.23), а математическое |
||
|
|
|
|
|||||
ожидание очень близко к числу, получающемуся после
подстановки в формулу (5.22) вместо r истинного значения
xy
*
коэффициента корреляции r . Эти свойства величины Z*
xy
позволяют просто оценить, в каких пределах может находиться истинное значение коэффициента корреляции, если по n опытам получены некоторые значения его
выборочного значения (оценки) r . Если граничное значение
xy
r имеет тот же знак, что и r *, то можно считать в первом
xy |
xy |
приближении, что корреляционная связь между переменными достоверна.
120
Пример 5.1. При обработке n=17 пар данных x и y
выборочный коэффициент корреляции составил r = – 0,94, т.е.
xy
величина y связана с x достаточно сильной причинной связью, близкой к функциональной зависимости. Требуется определить значимость и найти доверительный интервал выборочного коэффициента корреляции.
Определение значимости коэффициента rxy ,
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
t=|rxy| |
√( |
)² |
=0,94 |
√ ( , |
)² |
=10,6. |
(5.23) |
||||||||
Критерий Стьюдента t |
=2,13 (0,05;15)=2,13145). |
|||||||||||||||
|
|
|
|
0,05;15 |
|
|
|
|
|
|
|
|
|
|
||
Поскольку |
t>t , |
|
то |
коэффициент |
корреляции |
|||||||||||
|
α;n-2 |
|
|
|
|
|
|
|
|
|
|
|
|
|
||
существенен. |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Определение доверительного интервала. По формулам |
||||||||||||||||
(4.22) и (4.23) определим величину Z*: Z*= |
|
ln |
, |
=-1,738 и ее |
||||||||||||
|
||||||||||||||||
среднеквадратичное отклонение: |
= |
|
|
|
|
=0,267., |
|
|||||||||
|
|
|
|
|
||||||||||||
|
|
|
|
|
|
|
√ |
|
|
|
|
|
|
|
||
Зададимся вероятностью того, что истинное значение Z отличается от вычисленного на основании оценки
коэффициента корреляции Z* не более чем на δ . Учитывая
Z
нормальный закон распределения Z, имеем при вероятности:
90%: δ =1,64 S =1,67 0,267=0,438;
Z Z
95%: δ =1,96 0,267=0,523;
Z
99,7%: δ =3,00 0,267=0,801.
Z
Таким образом, истинное значение Z лежит в пределах Z ≤Z ≤ Z , где с вероятностью, например, 90%, Z = -1,738-
1 |
2 |
1 |
121
0,438= -2,176 и |
Z = -1,738+0,438= -1,300. Для заданных |
|
|
2 |
|
значений вероятностей значения Z и Z составят: |
||
|
1 |
2 |
90%: Z = – 2,176, Z = –1,300;
1 2
95%: Z = – 2,261, Z = –1,215;
1 2
99,7%: Z = – 2,539, Z = –0,937.
1 2
Этим значениям Z и Z соответствуют коэффициенты
1 2
корреляции, полученные из формулы (5.22). Чтобы определить численные значения коэффициентов корреляции из формулы
(5.22), можно воспользоваться инструментом «Подбор параметра» из электронных таблиц Microsoft Excel (меню
«Сервис/Подбор параметра…»). В результате получим следующее решение:
90%: r = -0,97, r = -0,86, т.е. -0,97≤r ≤-0,86; 95%: r = -0,98, r = -0,84, т.е. -0,98≤r ≤-0,84; 99,7%: r = -0,99, r = -0,73, т.е. -0,99≤r ≤-0,73.
1 |
2 |
xy |
Следовательно, доверительные интервалы подтверждают достаточно сильную причинную связь между анализируемыми параметрами.
Таким образом, корреляционный анализ устанавливает связь между исследуемыми случайными переменными и оценивает тесноту этой связи.
122
5.5. Регрессионный анализ
Ниже излагаются основные положения регрессионного анализа, применение которого для обработки результатов наблюдений связано с меньшим числом ограничений, чем при корреляционном анализе. Как и корреляционный анализ, регрессионный анализ включает в себя построение уравнения регрессии, например, методом наименьших квадратов и статистическую оценку результатов. Если в регрессионном анализе расчет коэффициентов ведется теми же методами, например наименьших квадратов, то его теоретические предпосылки требуют других способов статистической оценки результатов.
При проведении регрессионного анализа примем следующие допущения:
1) входной параметр x измеряется с пренебрежимо малой ошибкой. Появление ошибки в определении y объясняется наличием в процессе не выявленных переменных и случайных воздействий, не вошедших в уравнение регрессии;
2) результаты наблюдений y , y ,..., y,..., y над выходной
1 2 i n
величиной представляют собой независимые нормально распределенные случайные величины;
3) при проведении эксперимента с объемом выборки n при условии, что каждый опыт повторен m* раз, выборочные
2 |
2 |
2 |
дисперсии S |
,..., S ,..., S |
должны быть однородны. При |
1 |
i |
n |
выполнении измерений в различных условиях возникает задача сравнения точности измерений. При этом следует подчеркнуть, что экспериментальные данные можно сравнивать только тогда, когда их дисперсии однородны. Это означает, как уже отмечалось, принадлежность
123
экспериментальных данных к одной и той же генеральной совокупности. Напомним: однородность дисперсий свидетельствует о том, что среди сравниваемых дисперсий нет таких, которые с заданной надежностью превышали бы все остальные, т.е. была бы большая ошибка. При одинаковом числе параллельных опытов однородность дисперсии, как мы уже показали, можно оценить по критерию Кохрена, а для сравнения двух дисперсий целесообразно воспользоваться F-критерием Фишера. После того как уравнение регрессии найдено, необходимо провести статистический анализ результатов. Этот анализ состоит в следующем: проверяется значимость всех коэффициентов и устанавливается адекватность уравнения. При моделировании приходится формализовать связи исследуемого явления (процесса), из-за чего возможна потеря некоторой информации об объекте. Иногда некоторые связи не учитываются. В то же время основное требование к математической модели заключается в ее пригодности для решения поставленной задачи и адекватности процессу. Регрессионную модель называют адекватной, если предсказанные по ней значения у согласуются с результатами наблюдений. Так, построив модель в виде линейного уравнения регрессии, мы хотим, в частности, убедиться, что никакие другие модели не дадут значительного улучшения в описании предсказания значений у. В основе процедуры проверки адекватности модели лежат предположения, что случайные ошибки наблюдений являются независимыми, нормально распределенными случайными величинами с нулевыми средними значениями и одинаковыми дисперсиями.
Сформулируем нуль-гипотезу H0: "Уравнение регрессии адекватно".
124