Таблица 6 – Главные компоненты
4
Component
Row
1 ------
------------
1
-2,983
2
-2,107
3
-0,107
4
-0,502
5
-0,073
6
-0,089
7
0,183
8
0,880
9
2,247
10
2,552
Multiple Regression Analysis
-----------------------------------------------------------------------
Dependent variable: Col_4
-----------------------------------------------------------------------------
Standard T
Parameter Estimate Error Statistic P-Value
-----------------------------------------------------------------------------
CONSTANT 32,22 0,394 81,782 0,00
PCOMP_1 2,000 0,244 8,187 0,00
-----------------------------------------------------------------------------
Analysis of Variance
-----------------------------------------------------------------------------
Source Sum of Squares Df Mean Square F-Ratio P-Value
-----------------------------------------------------------------------------
Model 104,039 1 104,039 67,03 0,00
Residual 12,417 8 1,552
-----------------------------------------------------------------------------
Total (Corr.) 116,456 9
R-squared = 89,34 percent
R-squared (adjusted for d.f.) = 88,00 percent
Standard Error of Est. = 1,246
Mean absolute error = 0,914
Durbin-Watson statistic = 1,585
Полученное уравнение регрессии имеет вид:
y
=
32,22
+ 2,00
z1.
Первая главная компонента z1 адекватно описывает зависимую переменную y. Подставляя, в полученное уравнение выражение для первой главной компоненты, переходим к исходным переменным x1 – x3:
y
= 16,542
+ 2,822
x1
+ 2,808
x2
+ 2,755
x3.
Полученное уравнение более точно описывает зависимость результирующей переменной от влияющих факторов по сравнению с уравнением множественной регрессии.
1) Получить задание от преподавателя на выполнение лабораторной работы.
2) Ввести исходные данные в ППП Statgraphics Plus или в другой пакет, например STATISTICA.
3) Оценить мультиколлениарность факторных переменных и сделать вывод о целесообразности построения модели на главных компонентах.
4) Рассчитать главные компоненты.
5) Построить уравнение в главных компонентах и оценить его адекватность.
6) Построить уравнение регрессии в исходных факторных переменных.
7) Сравнить точность регрессионной модели с моделью на главных компонентах. Сделать выводы по результатам исследований.
1) Подготовить данные для расчетов в ППП Statgraphics Plus либо в другой программе.
2) Проверить независимость (немультиколлениарность) факторных переменных.
3) Выделить главные компоненты, построить уравнения главных компонент.
4) Построить уравнение регрессии на выделенных главных компонентах методом множественной регрессии.
5) Оценить значимость уравнения регрессии в целом и коэффициентов регрессии при главных компонентах.
6) Сделать выводы по результатам исследований.
1) Исходные данные для исследования.
2) Матрица парных коэффициентов корреляции.
3) Таблица главных компонент.
4) Уравнения главных компонент.
5) Таблица со значениями главных компонент.
6) Результаты расчета уравнения регрессии на главных компонентах.
7) Уравнение регрессии с исходными факторными переменными.
8) Выводы по результатам выполненной лабораторной работе.
1. С какими целями проводится компонентный анализ?
2. Как косвенно можно подтвердить, или опровергнуть предположение о том, что исследуемые данные подчиняются многомерному нормальному закону распределения вероятностей.
3. В чем заключается идея метода главных компонент. Как подбираются главные компоненты?
4. Для чего проводится анализ независимости исходных факторных переменных?
5. Какую информацию содержат коэффициенты матрицы корреляций?
6. Как определяется целесообразность проведения компонентного анализа?
7. К чему приводит мультиколлениарность данных при регрессионном анализе?
8. Как оценивается точность модели на главных компонентах?
1. Введение в эконометрику: учебное пособие/ Л.П. Яновский, А.Г. Буховец; под. ред. Л.П. Яновского. -2-е изд. доп. – М.: КОНКУРС, 2007.-256 с.-ISBN 5-85971-270-0.
2. Дубров А.М., Мхитарян В.С., Трошин Л.И. Многомерные статистические методы.– М.: Финансы и статистика, 2003.-352 с.- ISBN – 5-279-019450-3.
Использовать данные из лабораторной работы №6 с целью сравнения точности разработанных моделей на главных компонентах с регрессионными моделями.
Освоение методов построения моделей временных рядов на основе структурирования процессов.
Модели, построенные по данным, характеризующим экономическую систему или процесс за ряд последовательных равноотстоящих моментов времени, называются моделями временных рядов, в дальнейшем - временными рядами. Простейшей является модель аддитивного случайного процесса, имеющая вид [1, 2]:
Yt = Ut + Vt + et , (1)
где Ut - трендовая компонента; Vt – сезонная компонента; et – случайная компонента; t – уровни наблюдения, t =1, 2, 3,….
Для построения модели (1) необходимо получить оценки каждой компоненты. Для выделения составляющих компонент пользуются процедурами фильтрации, регрессионного и корреляционного анализов.
Относительно трендовой составляющей Ut предполагают, что она должна представлять некоторую гладкую функцию, описываемую полиномом минимальной степени. Для этого чаще всего используются следующие функции времени t:
- линейная Ut = a+b t;
- парабола второго и, реже, более высокого порядков
Ut = a+b1 t +b2 t 2 +b3 t 3 +…+bn t n;
- экспонента Ut = e a+bt и др.
Параметры тренда определяются методом наименьших квадратов, в качестве независимой переменной выступает время t =1, 2, 3, .. , а в качестве зависимой переменной – уровни временного ряда Yt. Критерием отбора наилучшей формы тренда является значение скорректированного коэффициента детерминации R2.
Пример
Имеются данные о выработке продукции за 18 месяцев работы производственного участка (таблица 1). Требуется построить график динамики выработки продукции, подобрать наилучшую форму тренда, выделить сезонную компоненту и построить аддитивную модель.
Таблица 1- Выработка продукции
Месяцы |
1 |
2 |
3 |
4 |
5 |
6 |
Выработка продукции |
596488 |
615925 |
612846 |
634217 |
659835 |
615392 |
Месяцы |
7 |
8 |
9 |
10 |
11 |
12 |
Выработка продукции |
708291 |
580846 |
509008 |
ё |
568649 |
420148 |
Месяцы |
13 |
14 |
15 |
16 |
17 |
18 |
Выработка продукции |
452529 |
447319 |
456579 |
505584 |
484261 |
453356 |
Решение проводим с использованием ППП MS EXCEL. С использованием Мастера диаграмм строим график динамики выработки продукции (рисунок 1). График (рис.1) характеризует убывающую тенденцию выработки продукции с периодическими колебаниями. Проведем подбор тренда путем добавления линий тренда. Одновременно установим режим отображения уравнения регрессии, описывающего тренд и коэффициента детерминации. В таблице 2 приведены характеристики подбираемых линий тренда. Все три вида тренда адекватно описывают характер изменения выработки продукции во времени. Коэффициенты детерминации статистически значимы при уровне значимости 0,05, расчетные значения критерия Фишера превышают табличные данные.
Рисунок 1- График выработки продукции по месяцам
Таблица 2 – Подбор вида тренда
Вид тренда |
Коэффициент детерминации |
Уравнение тренда |
Линейный |
61% |
Ut = 665390 -12707 t |
Парабола |
61,5% |
Ut = -50,31t 2 – 11751 t + 662203 |
Экспонента |
62,4% |
Ut = 672830e - 0,0235 t |
Для математического описания тренда выбираем более простое линейное уравнение.
Для выделения сезонной компоненты совместно со случайной (Vt + et), из исходного ряда Yt вычитаем трендовую компоненту Ut. При этом получаем центрированный временной ряд:
(Vt + et) = Yt - Ut . (2)
График центрированного временного ряда отображен на рисунке 2.
Для определения периода циклической компоненты Vt вычисляем автокорреляционную функцию центрированного временного ряда (рисунок 3). На графике просматривается периодическая составляющая с периодом (13-1)=12 месяцев и временным сдвигом (12-3)=9 месяцев.
Рисунок 2 - График компонент (Vt + et) в динамическом ряду выработки продукции
Амплитуда гармоники может быть приближенно оценена с помощью дисперсию центроированного временного ряда, т.к. из условия аддитивности модели вытекает баланс дисперсий центрированного ряда:
S2 (Vt +et) = S2 (Vt) + S2(et) , (3)
где S2 (Vt +et) – оценка дисперсии центрированного временного ряда; S2 (Vt) - оценка дисперсии сезонной (гармонической) компоненты, равная квадрату амплитуды гармоники; S2(et) – оценка дисперсии случайной компоненты.
Если пренебречь дисперсией случайной компоненты, то за амплитуду гармонической составляющей можно принять (оценка сверху) стандартное отклонение центрированного ряда. В рассматриваемом примере это будет:
AVt = S(Vt) = 53660.
Амплитуда гармоники может быть уточнена по критерию минимума случайной компоненты временного ряда. На графике (рисунок 4) приведены совмещенные компоненты (Vt+et) и гармоническая компонента Vt с уточненной амплитудой, равной 50000:
Vt = 50000*Sin((2π/12)*t + 2π*2,85/4). (4)
Рисунок 3 - Автокорреляционная функция центрированного временного ряда
Для выделения случайной компоненты et из центрированного временного ряда (Vt+et) вычитаем гармоническую компоненту Vt . График случайной компоненты приведен на рисунке 5. Случайная компонента et имеет следующие параметры:
- среднее значение равно -226,3 (шт./месяц), что статистически незначимо при уровне значимости 0,05;
- оценка дисперсии равна 13,7 108 (шт./месяц)2.
После подстановки в исходное уравнение (1) всех компонент, временной ряд выработки продукции, уровни которых представлены в таблице 1, описывается следующей аддитивной моделью:
Yt = -12707*t + 665390 + 50000*Sin((2π/12)*t + 2π*2,85/4) + et . (5)
Рисунок 4 - График центрированного ряда (Vt + et) с наложением гармонической компоненты Vt = 50000*Sin((2π/12)*t + 2π*2,85/4)
Рисунок 5 - График случайной компоненты временного ряда выработки продукции
Адекватность модели (5) оцениваем по результатам анализа случайной компоненты et,. Проверяем выполнение предпосылок м.н.к.[1]:
- случайностьь остатков модели определяем по числу точек перегиба:
p = 11 > pк =9;
- соответствие распределения нормальному закону, определяем по R/S критерию:
расчетное значение R/S равно 3,69, находится в области критических границ для уровня значимости 0,05, равной R/S = 3,3 – 4,21;
- равенство нулю математического ожидания остатка определяем с помощью t–критерия Стьюдента:
tр = 0,48 ≤ tкр = 2,1 (для уровня значимости 0,05);
- независимость значений уровней случайной компоненты определяем по d-критерию Дарбина – Уотсона:
dw = 1,4 > d2 = 1,39 (для уровня значимости 0,05 имеем d1=1,16; d2=1,39).
Все предпоссылки м.н.к. выполняются, что подтверждает адекватность разработанной модели (5).
Оценим точность разработанной модели. Для этого вычисляем среднюю абсолютную и среднюю относительную ошибку. Расчеты показали следующие результаты: