XIX века. Связь между ковариацией и линейным коэффициентом корреляции простейшая: необходимо значение ковариации разделить на произведение среднеквадратических отклонений (квадратных корней из дисперсий) случайных величин.
Особо обратить внимание на этапы построения парной корреляционной модели и тот факт, что, как правило, исследование начинают в предположении, что изучаемая зависимость будет описываться линейным законом изменения. При этом необходимо иметь в виду, что очень важный этап, который часто пропускают – это верификация модели, то есть проверка построенной модели на адекватность. Если модель окажется неадекватной, то ее дальнейшее использование невозможно.
Следует уяснить, что верификация модели проходит в три этапа:
•проверка существенности или значимости линейного коэффициента корреляции; осуществляется с помощью t-критерия Стьюдента;
•проверка существенности или значимости параметров уравнения регрессии; также осуществляется с помощью t-критерия Стьюдента;
•проверка значимости или предсказательной силы уравнения регрессии; осуществляется с помощью критерия Фишера (F-критерий); в основу проверки положена простейшая идея: сравнение предсказательной силы полученного уравнения регрессии с предсказательной силой среднего значения, то есть проверяется в каком случае ошибка прогноза будет меньше.
Термин «существенность» или «значимость» означает, что проверяе-
мый параметр будет отличен от нуля с заданной вероятность.
Естественно всегда возникает вопрос о том: правильно ли было сделано предположение о линейной зависимости изучаемых величин. Ответ на этот вопрос может дать следующее правило: если эмпирическое корреляционное отношение будет больше, чем абсолютное значение линейного коэффициента корреляции), то это означает, что нелинейная зависимость будет лучше представлять исследуемое явление, чем рассмотренная линейная.
Вопросы для самоконтроля
1.Существующие виды связи между переменными.
2.Что такое поле корреляции.
3.Как визуально установить наличие связи между изучаемыми переменными?
4.Как количественно определяется теснота связи между изучаемыми переменными?
5.Выбор вида уравнения регрессии.
6.Определение параметров уравнения регрессии.
7.Сущность метода наименьших квадратов.
8.Этапы проверки построенной модели на адекватность.
9.Как проверить существенность коэффициента корреляции?
6
9. Как проверить существенность коэффициентов уравнения регрес-
сии?
10.Как проверить значимость уравнения регрессии?
11.Что такое значимость или существенность параметров, определяемых в ходе эконометрического исследования?
12.Каковы предпосылки метода наименьших квадратов?
13.Свойства оценок, получаемых по МНК если выполнены условия Гаусса-Маркова.
14.Что означает свойство несмещенности?
15.Что означает свойство состоятельности?
16.Что означает свойство эффективности?
Тема №3 «Множественная регрессия и корреляция. Метод Брандона»
Большинство закономерностей, изучаемых управлением, имеет достаточно сложный характер и зависит от нескольких факторов, степень влияния каждого на изучаемую величину неизвестна. Поэтому построение парных корреляционных моделей может являться только первым этапом в исследовании таких зависимостей между изучаемой величиной и факторным признаком.
Для построения множественной корреляционной модели необходимо определить, какая величина будет являться зависимой, т.е. результирующим показателем, а какие величины будут являться независимыми, иначе называемые факторными признаками (факторами). Задача моделирования состоит в выявлении количественной связи между факторами и результирующим показателем.
Фактор, включаемый в модель, должен соответствовать следующим требованиям:
•иметь количественное выражение;
•между фактором и результирующим показателем должна быть логи- че-ская, причинная связь;
•между фактором и результирующим показателем должна быть статистическая связь;
•факторы не должны быть тесно связаны между собой, т.е. между факторами не должно быть мультиколлинеарности.
При изучении данной темы следует обратить внимание на схожесть с процессом построения парных корреляционных моделей: при построении моделей множественной корреляции выполняют те же этапы, но объем вычислений существенно больше. Достаточно сказать, что при построении парной корреляционной модели необходимо вычислить один линейный коэффициент корреляции, а при построении множественной модели необходимо вычислять уже матрицу линейных коэффициентов корреляции размерностью (m+1)•(m+1), где m – число независимых величин-факторов, включенных в модель.
7
Именно поэтому очень актуальным является разработка методов, снижающих вычислительную сложность решаемых задач. В качестве одного из таких методов рассматривается метод Брандона, когда уравнение регрессии задается в виде произведения, каждый сомножитель которого представлен функцией только одного факторного признака. Таким образом, уравнение регрессии принимает вид
~ |
n |
|
|
y = c∏ fi (xi ), |
|
|
i=1 |
где y=fi(xi) может иметь любой вид; с - постоянная величина, равная среднему значению y .
Таким образом одну достаточно сложную задачи для уравнения регрессии с m переменными заменили на m задач парной корреляции, каждая из которых уже гораздо проще.
При линейной форме связи множественный коэффициент корреляции является оценкой точности аппроксимации и равен корреляционному отношению η; при нелинейных формах связи для оценки точности аппроксимации (оценки адекватности модели) применяются корреляционное отношение η и ошибка аппроксимации ε. Эти оценки определяются так же, как и при парной корреляции.
Для оценки влияния отдельных факторов на результативный признак используются коэффициенты эластичности, показывающие уровень изменения результативного показателя в случае изменения факторного признака на 1% при неизменных значениях других факторов. Коэффициенты эластичности определяются по формуле
|
xi |
|
~ |
|
Эi = |
× |
∂ y |
, |
|
y |
∂ xi |
где y – теоретическое уравнение регрессии.
Вопросы для самоконтроля
1.Каким условиям должны удовлетворять факторы, включаемые в эконометрическую модель?
2.Выбор вида уравнения регрессии.
3.Что такое явление мультиколлениарности?
4.Как исключить явление мультиколлениарности?
5.Этапы проверки построенной модели на адекватность.
6.Что позволяет сделать метод Брандона?
7.Что означает незначимость полученного уравнения регрессии?
8.Каким условиям должны удовлетворять исходные данные для применения метода Брандона?
9.Как определить, будут ли нелинейные модели лучше описывать изучаемое явление по сравнению с линейными?
10.Как определяется влияние отдельных факторов модели на результа-
8
тивный признак?
11. Что означает отрицательность линейного коэффициента корреля-
ции?
Тема №4 «Гетероскедастичность»
При изучении этой темы необходимо обратить внимание на ее связь с МНК, то есть при нарушении второй предпосылки Гаусса-Маркова, когда дисперсия случайных отклонений не является постоянной, возникает явление гетероскедастичности. Это означает, что параметры уравнения регрессии, определенные по МНК при наличии гетероскедастичности не будут эффективными (т.е. они не будут иметь наим еньшую дисперсию по сравнению с другими оценками данного параметра). Это приводит к признанию статистически значимыми параметров уравнения регрессии и линейных коэффициентов корреляции, таковыми на самом деле не являющихся, а, следовательно, и к неверным выводам относительно адекватности построенной модели.
В ходе изучения этой темы следует обратить внимание на тот факт о дисперсии каких величин в данном случае идет речь. При изучении гетероскедастичности речь идет о дисперсии случайных отклонений, то есть значения статистических данных yi (а это величины, как правило, являющиеся исходны-
ми данными) отличаются от значений полученных по уравнению регрессии ~yi
при тех же значениях независимой переменной xi. Эти отклонения обозначаются как εi, но истинные значения этих отклонений исследователь, как правило, не знает, но может их оценить. Эти оценки обозначаются, как ei. На практике гетероскедастичность проявляется в виде зависимости случайных отклонений εi и их оценок ei от номера наблюдения, то есть i или же от величины xi.
К сожалению, не существует какого-либо однозначного метода определения гетероскедастичности. В ходе изучения предмета рассматривались наиболее популярные и наглядные:
•графический анализ отклонений;
•тест ранговой корреляции Спирмена;
•тест Парка;
•тест Глейзера;
•тест Голдфелда—Квандта.
В материалах лекций все эти методы достаточно хорошо описаны. Вместе с тем возникает закономерный вопрос о методах, которые могли
бы исключить гетероскедастичность из анализируемой статистической совокупности, что дало бы возможность использовать традиционный метод наименьших квадартов.
Наиболее распространенным методом в этом случае является метод взвешенных наименьших квадратов (ВНК). В основу метода положена простейшая идея, заключающаяся в том, что для исключения влияния какой-то составляющей в статистической совокупности, необходимо каждое данное в этой совокупности разделить или вычесть некую величину, характеризующую это
9
влияние. Так как в данном случае необходимо исключить влияние дисперсии случайных отклонений на совокупность, то простейшим методом будет являться деление всех элементов совокупности на величину дисперсии случайных отклонений. Естественно, данный метод применим при известных для каждого наблюдения значениях дисперсии случайных отклонений. Деление наблюдаемых значений на соответствующее ему значение среднего квадратического отклонения (СКО) даст совокупность, к которой уже можно применить традиционный МНК, то есть в новой полученной совокупности явление гетероскедастичности уже будет отсутствовать. Следует обратить внимание, что деление осуществляется не на дисперсию, а на СКО. Связано это с тем, что дисперсия имеет единицы измерения, отличные от единиц измерения исходной величины, а вот СКО имеет такие же единицы измерения. Именно поэтому ее и используют. В этом и заключается суть метода взвешенных наименьших квадратов.
На практике, как правило, дисперсии случайных отклонений, а значит и СКО, исследователю не известны. Поэтому делается некоторое предположение о том, как же будут зависеть дисперсии случайных отклонений, а вмести с ними и СКО, от xi. В лекциях рассматривается два возможных варианта такой зависимости: пропорционально xi и пропорционально xi2.
Но данные ухищрения помогают далеко не всегда. Во многих случаях дисперсии случайных отклонений зависят не от включенных в уравнение регрессии объясняющих переменных, а от тех, которые не включены в модель, но играют существенную роль в исследуемой зависимости. В этом случае они должны быть включены в модель, а для этого необходимо изменить спецификацию модели.
Вопросы для самоконтроля
1.Что такое гетероскедастичность?
2.Что такое гомоскедастичность?
3.Какие свойства оценок, получаемых по МНК, будут нарушаться если имеет место гетероскедастичность.
4.Методы обнаружения гетероскедастичности.
5.Какие методы исключения гетероскедастичности Вы знаете?
6.В чем сущность метода взвешенных наименьших квадратов
7.Как поступают в том случае, когда дисперсии случайных отклонений неизвестны?
8.Почему уравнение регрессии для исключения гетероскедастичности делят на СКО, а не на дисперсию?
9.Приведите графический пример гетероскедастичности.
Тема №5 «Автокорреляция»
Под автокорреляцией понимается корреляция между наблюдаемыми показателями, упорядоченными определенным образом. Автокорреляция
10