начала координат до точки пересечения линии регрессии с
осью ординат, а коэффициент b характеризует тангенс угла
1
наклона линии регрессии к оси OX.
Если же определяют уравнение регрессии в виде
ỹ= b0+b1x+ b11 x² , то система уравнений для нахождения b0, b1, b11 будет иметь следующий вид:
|
= |
+ |
+ |
; |
|
|
= |
+ |
+ |
; |
(5.16б) |
|
|||||
|
= |
+ |
+ |
. |
|
|
|
Из уравнений (5.15) и (5.16 б) вытекает правило записи любых систем нормальных уравнений: необходимо записать столько уравнений в системе,
сколько неизвестных коэффициентов содержится в искомом уравнении, всякий раз суммируя произведения членов исходного уравнения на переменную при искомом коэффициенте.
Оценку силы линейной связи осуществляют по выборочному (эмпирическому) коэффициенту парной
корреляции r . Выборочный коэффициент корреляции может
xy
быть вычислен двумя способами.
1. Как частный случай корреляционного отношения для линейного уравнения регрессии.
С учетом того, что y = b0+ b1x,
115
S*2y= |
|
|
|
|
0 + b1 xi - b0 – b1x]² = b1² Sx² , |
(5.17) |
|||
|
|
|
|
||||||
величина |
отношения S* /S |
y |
будет равна |
|
|||||
|
∑ |
[ |
y |
|
|
|
|||
|
|
|
|
|
rxy= b1Sx/Sy |
, |
(5.18) |
||
где Sx |
и |
Sy |
– выборочные |
средние |
квадратичные |
||||
отклонения.
2. Как среднее значение произведения центрированных случайных величин, отнесенное к произведению их среднеквадратичных отклонений:
|
|
|
|
∑ |
=1( |
|
− |
|
( |
− |
) |
|
|
|
|
|
|
|
|
|||||
|
|
= |
|
|
) |
|
|
|
= |
|
|
|
|
|
|
|
||||||||
|
|
|
|
|
( |
−1) |
− |
) |
|
|
|
|
|
|
|
|
||||||||
|
|
|
∑ =1( |
|
− |
( |
|
|
|
|
|
|
|
|
|
|
|
|||||||
= |
|
|
|
) |
|
|
|
|
|
|
. |
|
(5.19) |
|||||||||||
|
∑ =1 |
− |
) |
2 ∑ =1 |
( |
− |
) |
2 |
|
|||||||||||||||
|
|
( |
|
|
|
|
|
|
|
|
|
|
|
|
|
|||||||||
Покажем, что две последние формулы эквивалентны. Для |
||||||||||||||||||||||||
этого преобразуем выражение (5.19) к виду |
∑ |
( i |
-x)(y- |
|
|
= |
||||||||||||||||||
y) |
||||||||||||||||||||||||
rxy(n-1) SxSy. |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
i |
|
||||||
Подставляя последнее выражение в формулу (5.16а), |
||||||||||||||||||||||||
имеем |
( −1) |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
||||
= |
|
) |
2 |
= |
|
|
|
,откуда = |
|
|
. |
|
|
|
||||||||||
|
|
|
|
|
|
|
|
|
||||||||||||||||
|
∑ |
|
( − |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
|
=1 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|||
Как правило, по результатам экспериментов находят Sx, Sy, y ,x и рассчитывают rxy по формуле (5.19), а затем, используя эти величины, определяют коэффициенты уравнения регрессии:
b1=rxy Sx/Sy ; b0= y - b1x . |
(5.20) |
116
Коэффициент корреляции r изменяется в пределах
xy
-1≤ r ≤+1.
xy
Положительная корреляция между случайными величинами характеризует такую стохастическую зависимость между величинами, когда с возрастанием одной из них другая в среднем также будет возрастать. При отрицательной корреляции с возрастанием одной случайной величины другая
в среднем будет уменьшаться. Чем ближе значение r к
xy
единице, тем теснее статистическая связь.
Отметим еще раз область применимости выборочного коэффициента корреляции для оценки тесноты связи.
1. Коэффициент парной корреляции значений y и x применительно к однофакторной зависимости характеризует тесноту группирования данных лишь относительно прямой (например, линия A на рис. 5.8, a). При более сложной
зависимости (рис. 5.8, б) коэффициент корреляции r будет
xy
оценивать тесноту экспериментальных точек относительно некоторой прямой, обозначенной буквой А, что, естественно, несет мало сведений о тесноте их группирования относительно искомой кривой ỹ=f(x).
2. Коэффициент парной выборочной корреляции имеет четкий физический смысл только в случае двумерного нормального распределения параметров, т.е. когда для
каждого значения Х, например х , |
х , |
х , существует |
1 |
2 |
3 |
совокупность нормального распределения у и наоборот, а дисперсия зависимой переменной при изменении значения аргумента остается постоянной (рис. 5.9).
117
Рис. 5.8. К понятию коэффициента парной корреляции
Даже при выполнении этих, вообще говоря, достаточно жестких условий, не всякое значение выборочного коэффициента корреляции является достаточным для статистического обоснования выводов о наличии действительно надежной корреляционной связи между фактором и откликом. Надежность статистических характеристик ослабевает с уменьшением объема выборки (n). Так, при n=2 через две экспериментальные точки можно провести только одну прямую и зависимость будет функциональной, при этом выборочный коэффициент
корреляции равен единице (r =1). Однако это не означает
xy
надежность полученных статистических характеристик в силу весьма и весьма ограниченного объема выборки. Значит, вычислять коэффициент корреляции по результатам двух наблюдений бессмысленно, так как он заведомо будет равен единице, и это будет обусловлено не свойствами переменных и их взаимным отношением, а только числом наблюдений.
В связи с этим требуется проверка того, насколько значимо
отличается выборочный коэффициент корреляции r от его
xy
118
*
действительного значения r . При достаточно большом
xy
*
объеме выборки n→∞ r =r . Таким образом, требуется
xy xy
проверка значимости выборочного коэффициента парной корреляции и оценка его доверительного интервала.
Рис. 5.9. К понятию коэффициента парной корреляции в случае двумерного нормального распределения параметров
Для определения значимости r сформулируем нуль-
xy
*
гипотезу H0: rxy =0, т.е. корреляция отсутствует. Для этого
рассчитывается экспериментальное значение t-критерия Стьюдента и сравнивается с теоретическим при числе степеней свободы n-2.
|
|
|
|
|
|
t=|rxy| |
√ ( )² |
. |
(5.21) |
||
119