1) Теоретическое уравнение регрессии: Уi=б+вxi+еi, где б - свободный член; в - коэффициент регрессии, показывающий, на сколько изменится Уi при изменении хi на единицу; еi, - случайное отклонение, возникающее в следствие не учтенных в модели факторов и случайных ошибок;
2) Эмпирическое уравнение регрессии: Уi=Ь+вxi+ei, где где Ь - эмпирическая оценка свободного члена регрессии; в - оценка коэффициента регрессии, показывающий, на сколько изменится Уi при изменении хi на единицу; еi, - остаток регрессии;
В регрессии, построенной по методу наименьших квадратов (МНК), сумма квадратов отклонений фактических значений зависимой переменной У от расчетных Ух минимальна Ух:
Для того, чтобы оценки модели были:
1)
несмещенными, то есть мат ожидание оценки параметра было равно значению параметра: , где М - математическое ожи-дание;
2)
Состоятельны, то есть дисперсия оценки параметра стремится к нулю при большом количестве наблюдений: , где D - дисперсия;
3) Эффективны, то есть их дисперсия наименьшая в сравнении с другими оценками в классе линейных функций;
необходимо выполнение условий теоремы Гаусса-Маркова:
1) Математическое ожидание случайного отклонения еi равно нулю для всех наблюдений
2) Дисперсия случайных отклонений еi постоянна. Выполнение предпосылки называется гомоскедатичностью, нарушение - гетероскедастичностью
3) Случайные отклонения еi и еj являются независимыми друг от друга для i ? j. Выполнение данной предпосылки говорит об отсутствии автокорреляции, нарушение - о присутствии автокорреляции:
4) Случайное отклонение должно быть независимо от объясняющих переменных:
5) Модель линейна относительно параметров.
В настоящее время все значения коэффициентов модели, дисперсии., мат ожидания считаются автоматически а программе Eviews. Для того, чтобы использовать эконометрическую модель, необходимо, чтобы она и коэффициенты перед регрессорами были значимы, а также, чтобы она удовлетворяла условиям отсутствия мультиколлинеарности (высокой корреляции между регрессорами), автокорреляции (зависимость случайного члена в любом наблюдении от его значений во всех других наблюдениях), гетероскедастичности (непостоянство дисперсии остатков). Для этого проводят статистические тесты, статистики которых также можно автоматически посчитать в программе, и методы визуального анализа, которые приведены в таблице 2.
Таблица 2
Тесты и визуальный анализ, применяемые при составлении эконометрической модели
|
Название |
Нулевая гипотеза Н0 для тестов, черты для визуального анализа |
Для чего |
|
|
Визуальный анализ графика значений планируемого регрессанта и регрессоров. |
_ |
Увидеть визуально тренд, если он есть. Взять логарифмы переменных или приращения для устранения проблемы. |
|
|
Визуальный анализ гистограммы переменных |
Гистограмма должна визуально напоминать нормальное распределение. |
Увидеть выбросы, чтобы затем задать условие не попадания в них для лучше |
|
|
Тест Жака-Бера, визуальный анализ гистограммы остатков. |
S=0 и К=0, где S-коэффициент асимметрии; К-коэффициент эксцесса; Распределение нормальное |
Судить о нормальности ошибок наблюдения. |
|
|
LM-тест на наличие автокорреляции |
Автокорреляции нет. |
Данный тест может проводиться, если ошибки распределены нормально. |
|
|
Анализ попарных корреляций между регрессорами, VIF, R2 |
1) Корреляция между регрессорами не должна быть выше 0,6-0,8 (насколько это возможно) 2) VIF (коэффициент увеличения дисперсии) не должен превышать 5 3) Высокое значение R2 может говорить о хорошей подгонке, однако при его значении свыше 0,9 может свидетельствовать о мультиколлинеарности |
Выявить мультиколлинеарность. Для решения проблемы можно убрать регрессор, значения которого сильно коррелируют с другими., либо задать вспомогательную переменную, равную единице при слишком большом или слишком маленьком значении регрессора или регрессанта и включить в модель. |
|
|
Тест на гетероскедастичность (Тест Вайта) |
Гетероскедастичности нет |
Позволяет выявить непостоянство дисперсии. Возможно внести корректировки Вайта для преодоления проблемы гетероскедастичности |
Для того, чтобы спрогнозировать зависимую переменную на шаг вперед, необходимо задать значения регрессоров. Один из способов - взять их медианные значения и построить модель с ними. Для этого в Eviews генерируется еще одно наблюдение с медианными значениями.
Таким образом, множественная регрессия позволяет спрогнозировать спрос на нефтепродукты, исходя из зависимости от определенных факторов. Таковыми может выступать ВВП (для всех видов нефтепродуктов), количество машин, автобусов, грузовиков (для оценки спроса на бензин), количество поездов, использующих дизель и их удельный вес в общем количества поездов в РЖД (для дизеля) и т.д. В данном пункте работы была приведена теоретическая основа работы с данными для составления модели множественной регрессии.
1.4 Теоретические аспекты прогнозирования методиками анализа временных рядов
Анализ временных рядов посвящен эконометрическим моделям, в которых применяются переменные с лагом, то есть сдвинутые во времени на предыдущий шаг. В то время как в обычных эконометрических моделях (рассмотренных в предыдущем пункте) регрессант зависит от значений переменных, то есть экономической системы в текущий момент времени, и определяется ей, в модели, включающей переменную с лагом, поведение системы объясняется также траекторией, по которой система пришла в данное состояние. Такая модель представляет собой функцию зависимости не от переменных, а от траектории. Для этих моделей требуются особые приемы анализа.
Связано это с тем, что некоторые типы траекторий не описываются регрессией по методу наименьших квадратов. При значимых коэффициентах и проверках стандартными тестами, на самом деле зависимости между экономическими показателями нет. Нельсон и Канг назвали такие регрессии кажущимися (spurious). В 1987 году Нельсон и Плоссер показали, что большее число исторических макроэкономических рядов США являются таковыми.
Итак, временной ряд - это совокупность наблюдений экономического показателя в разные моменты времени. Причем показатель может быть как типа запаса (в один момент времени), как цена нефтепродукта, так и типа потока, как потребление нефтепродуктов в определенный промежуток времени. Временной ряд рассматривается как выборка из последовательных случайных величин, совокупность которых называется стохастическим процессом или дискретным случайным
Реализация случайного процесса - это последовательность значений случайной величины, зависящая только от времени при фиксированном случае. То есть, временной ряд есть реализация стохастического процесса.
Наиболее полной характеристикой стохастического процесса является совместная функция распределения или функция плотности распределения, если она существует. Так как число случайных величин во временном ряде велико, для определения его свойств необходимо рассматривать совокупность функций распределения: одномерная f1(xt1), двумерная f2(xt1,xt2) и т.д.
Однако, рассматривать все функции распределения, как правило, не приходится, потому что у временного ряда обычно рассматривается только одна реализация. Кроме того, если статистические характеристики ряда постоянно меняются, о нем ничего нельзя сказать. Поэтому при анализе временных рядов рассматривают стационарные случайные процессы: у такого процесса свойства с течением времени не меняются. Существует два типа стационарности.
1) Строгая стационарность (стационарность в узком смысле)
Процесс называется строго стационарным, если сдвиг во времени не приводит к изменению функции плотности (распределения, если функции плотности не существует). Из этого следует, что при существовании математического ожидания и дисперсии (когда соответствующие интегралы сходятся), они не зависят от времени. Действительно:
(2)
гдеE{Xt} - матожидание случайной величины Xt,
z - значение случайной величины,
f1(z) - функция плотности распределения при данном значении;
(3)
гдеCov - ковариация случайной величины Xt1 и Xt2.
Из формул видно, что при одинаковых функциях распределения, вне зависимости от времени, математическое ожидание и дисперсия также останутся неизменными. Кроме того, произведя замену переменной можно увидеть, что ковариация зависит не от t1 и t2, а от разности (t1-t2). Совокупность всех ковариаций при различных расстояниях между моментами времени называется автоковариационной функцией. Следовательно, она также зависит не от моментов t1, t2 и других, а от их попарных разностей.
Используя значение автоковариационной функции, можно найти коэффициент корреляции между разделенными на тау значениями временного ряда:
(4)
Где с(ф) - коэффициент корреляции;
г(ф) - автоковариации, где ф ? (-?;+?);
г(0) - автоковариационная функция для 0; дисперсия.
Этим выражением определяется автокорреляционная функция временного ряда
2) Слабая стационарность, или стационарность в широком смысле
Если у случайного процесса дисперсия и матожидание не зависят от времени, а автокорреляционная функция зависит только от разности (t1-t2), то такой процесс называется слабо стационарным. Всякий строго стационарный процесс является слабо стационарным, однако обратное утверждение выполняется не всегда.
Самые частые случайные процессы во временных рядах - это, во-первых, белый шум еt: процесс, который удовлетворяет условиям теоремы Гауса-Маркова (матожидание равно нулю, дисперсия постоянна и шумы не коррелируют). Такой процесс является стационарным в широком смысле, а также в узком, если случайные величины еi распределены по нормальному закону. Во-вторых - процесс случайного блуждания, который можно представить в виде Xt=Xt-1+ еt. Он не является стационарным, так как его дисперсия зависит от времени, однако при взятии первой разности получается новый временной ряд: Xt - Xt-1= еt., который является стационарным. Взятие первой разности является одним из способов приведения нестационарного ряда к стационарному (однако, не всегда).
В 1938 г. Вольд доказал, что всякий недетерминированный стационарный в широком смысле процесс (который нельзя точно предсказать) можно представить в виде линейной комбинации белых шумов с разными коэффициентами:
(5)
гдемt - матожидание процесса
е - белый шум.
Иногда это выражение называют линейным фильтром. Для его выполнения необходимо условие сходимости по вероятности, т. е. У|ш| < ?.
При составлении модели временного ряда используют МА, либо AR-процессы. Дискретный случайный процесс называется процессом скользящего среднего (МА - moving average) порядка q, если в разложении Вольда только q слагаемых.: , где . Его текущее значение объясняется q предыдущими значениями белого шума. Часто такую модель составляют тогда, когда данные сильно колеблются. Любой МА-процесс стационарен.
Случайный процесс называется процессом авторегрессии (AR - autoregression) порядка p, если он определяется линейной комбинацией p предыдущих значений и белым шумом: Xt=б1Xt-1+б2Xt-2+еt. AR стационарен, когда корни характеристического уравнения лежат внутри единичной окружности: |бi| < 1 при любом i.
Далее в таблице приведены основные тесты, используемые при анализе временных рядов:
Таблица 3
Тесты и визуальный анализ, применяемые при составлении модели с временным рядом
|
Название |
Нулевая гипотеза Н0 для тестов, черты для визуального анализа |
Для чего |
|
|
Визуальный анализ графика значений ряда |
_ |
Увидеть визуально тренд, если он присутствует в начале анализа |
|
|
Визуальный анализ коррелограммы |
У стационарного AR ряда автокорреляционная функция (ACF) медленно убывает, а частная автокорреляционная функция (PACF) имеет всплеск, а затем значительно убывает. Значимые p лежат справа на коррелограмме частной автокорреляционной функции. Коррелограмма разностей не харакетризуется автокорреляцией. У MA процесса коррелограмма остатков резкий обрыв ACF и постепенное спадание PACF. Также, может встречаться ARMA процесс с особенностями и AR и MA процессов. |
Определить вид процесса. |
|
|
Тест Дикки-Фуллера |
Ряд нестационарный |
По наличию единичного корня определяет нестационарность ряда |
|
|
Критерии Акайка и Шварца |
Не должны увеличиваться при добавлении значимых членов авторегрессии, видные из коррелограммы |
||
|
Тест на гетероскедастичность (Тест Вайта/ARCH) |
Гетероскедастичности нет |
При разной волатильности ряда на отдельных промежутках дисперсия может быть не постоянной - это проблема гетероскедастичности. |