9. Сглаживание временных рядов
С формальной точки зрения временные ряды являются частным случаем моделей с детерминированной независимой переменной, в качестве которой рассматривается время t. При этом для зависимой переменной X(t) часто рассматривают аддитивную модель
X(t) = T(t) + P(t) + R(t),(3)
где T(t) - тренд, задающий центральную тенденцию, P(t) - периодическая составляющая, R(t) - случайная составляющая. Иногда рассматривают мультипликативную модель X(t) = T(t) P(t) R(t), однако она не имеет самостоятельного значения, поскольку после логарифмирования переходит в модель (3) для логарифмов включенных в модель составляющих.
Для модели (3) рассматривают различные варианты непараметрики. Например, тренд T(t) может задаваться линейной функцией, а периодическая составляющая P(t) быть произвольной. Методы непараметрического оценивания периодической составляющей для такой модели разработаны в [21].
От независимости отклонений приходится отказаться при движении от дискретного времени к непрерывному. В пределе отклонения моделируются случайным процессом с непрерывными траекториями. Так поступают при моделировании динамики курсов акций и валют. Математическая теория оценивания в случае непрерывных случайных процессов существенно отличается от таковой в случае выборок погрешностей.
10. Методы восстановления зависимостей в пространствах общей природы
Обсудим модели регрессионного анализа в общем виде. Сначала рассмотрим параметрические постановки задач регрессионного анализа (восстановления зависимостей) в пространствах произвольной природы, затем -- непараметрические, после чего перейдем к оцениванию нечисловых параметров в классической ситуации, когда отклик и факторы принимают числовые значения.
Задача аппроксимации зависимости (параметрической регрессии). Пусть X и Y -- некоторые пространства. Пусть имеются статистические данные -- n пар (xk, yk), где xk X, yk Y, k = 1, 2, …, n. Задано параметрическое пространство произвольной природы и семейство функций g(x,и): XИ > Y. Требуется подобрать параметр так. чтобы g(xk, ) наилучшим образом приближали yk, k = 1, 2, …, n. Пусть fk -- последовательность показателей различия в У. При сделанных предположениях параметр естественно оценивать путем решения экстремальной задачи:
.(4)
Часто, но не всегда, все fk совпадают. В классической постановке, когда Х = Rk, У = R1, функции fk различны при неравноточных наблюдениях, например, когда число опытов меняется от одной точки х проведения опытов к другой.
Если fk(y1, y2) = f(y1, y2) = (y1 - y2)2, то получаем общую постановку метода наименьших квадратов:
.
В рамках детерминированного анализа данных остается единственный теоретический вопрос -- о существовании n. Если все участвующие в формулировке задачи (4) функции непрерывны, а минимум берется по бикомпакту, то n существует. Есть и иные условия существования n [10].
При появлении нового наблюдения х в соответствии с методологией восстановления зависимости рекомендуется выбирать оценку соответствующего у по правилу
у* = g(x, n).
Обосновать такую рекомендацию в рамках детерминированного анализа данных невозможно. Это можно сделать только в вероятностной теории, равно как и изучить асимптотическое поведение n, доказать состоятельность этой оценки.
Как и в классическом случае, вероятностную теорию целесообразно строить для трех различных постановок.
1. Переменная х -- детерминированная (например, время), переменная у -- случайная, ее распределение зависит от х.
2. Совокупность (xk, yk), k = 1, 2, …, n, -- выборка из распределения случайного элемента со значениями в Х У.
3. Имеется детерминированный набор пар (xk0, yk0), k = 1, 2, …, n, результат наблюдения (xk, yk) является случайным элементом, распределение которого зависит от (xk0, yk0). Это -- постановка т.н. конфлюэнтного анализа.
Во всех трех случаях
,
однако случайность входит в правую часть по-разному в зависимости от постановки, от которой зависит и определение предельной функции f().
Проще всего выглядит f() в случае второй постановки при fk ? f:
f() = Mf(g(x1, ), y).
В случае первой постановки
в предположении существования указанного предела. Ситуация усложняется для третьей постановки:
.
Во всех трех случаях на основе общих результатов о поведении решений экстремальных статистических задач можно изучить асимптотику оценок n методами нечисловой статистики [10]. При выполнении соответствующих внутриматематических условий регулярности оценки оказываются состоятельными, т.е. удается восстановить зависимость.
Аппроксимация и регрессия. Соотношение (4) дает решение задачи аппроксимации. Поясним, как эта задача соотносится с нахождением регрессии. Согласно [10] для случайной величины (, ) со значениями в Х У регрессией на относительно меры близости f естественно назвать решение задачи
Mf(g(), ) > (5)
где f: YY > R1, g: X > Y, минимум берется по множеству всех измеримых функций.
Можно исходить и из формально другого определения. Для каждого х Х рассмотрим случайную величину (х), распределение которой является условным распределением при условии = х. В соответствии с определением математического ожидания в пространстве общей природы назовем условным математическим ожиданием решение экстремальной задачи
Оказывается, при обычных предположениях измеримости решение задачи (5) совпадает с (Внутриматематические уточнения типа «равенство имеет место почти всюду» здесь опущены.)
Если заранее известно, что условное математическое ожидание принадлежит некоторому параметрическому семейству g(x, ), то задача нахождения регрессии сводится к оцениванию параметра в соответствии с рассмотренной выше второй постановкой вероятностной теории параметрической регрессии.
Если же нет оснований считать, что регрессия принадлежит некоторому параметрическому семейству, можно использовать непараметрические оценки регрессии. Они строятся с помощью непараметрических оценок плотности [1, 20].
Непараметрические методы восстановления зависимости. Пусть 1 -- мера в Х, 2 -- мера в У, а их прямое произведение = 1 2 -- мера в Х У. Пусть g(x, y) -- плотность случайного элемента (, ) по мере . Тогда условная плотность g(y|x) распределения при условии = х имеет вид
(6)
(в предположении, что интеграл в знаменателе отличен от 0). Следовательно,
а потому
Заменяя g(x,y) в (6) непараметрической оценкой плотности gn(x,y), получаем оценку условной плотности
.(7)
Если gn(x,y) -- состоятельная оценка g(x,y), то числитель (7) сходится к числителю (6). Сходимость знаменателя (7) к знаменателю (6) обосновывается с помощью предельной теории статистик интегрального типа [12]. В итоге получаем утверждение о состоятельности непараметрической оценки (7) условной плотности (6).
Непараметрическая оценка регрессии ищется как
Состоятельность этой оценки следует из приведенных выше общих результатов об асимптотическом поведении решений экстремальных статистических задач.
11. Оценивание объектов нечисловой природы в классических постановках регрессионного анализа
Нечисловая статистика тесно связана с классическими областями прикладной статистики. Ряд трудностей в классических постановках удается понять и разрешить лишь с помощью общих результатов прикладной статистики. В частности, это касается оценивания параметров, когда параметр имеет нечисловую природу.
Рассмотрим типовую прикладную постановку задачи восстановления регрессионной зависимости, линейной по параметрам. Исходные данные имеют вид . Цель состоит в том, чтобы с достаточной точностью описать y как многочлен (полином) от x, т.е. модель имеет вид
(8)
где m -- неизвестная степень полинома; a0, a1, a2, …, am -- неизвестные коэффициенты многочлена; , -- погрешности, которые для простоты примем независимыми и имеющими одно и то же нормальное распределение с нулевым математическим ожиданием и дисперсией 2.
В прикладной статистике часто используют следующую технологию анализа данных. Сначала пытаются применить модель (8) для линейной функции (m = 1), при неудаче (неадекватности модели) переходят к многочлену второго порядка (m = 2), если снова неудача, то берут модель (8) с m = 3 и т.д. Адекватность модели обычно проверяют по F-критерию Фишера, основанному на предположении нормальности погрешностей.
Обсудим свойства этой процедуры. Если степень полинома задана (m = m0), то его коэффициенты оценивают методом наименьших квадратов, свойства этих оценок хорошо известны. Однако в рассматриваемой постановке m тоже является неизвестным параметром и подлежит оценке. Таким образом, требуется оценить объект (m, a0, a1, a2, …, am), множество значений которого можно описать как . Это -- объект нечисловой природы, обычные методы оценивания для него неприменимы. Разработанные к настоящему времени методы оценивания степени полинома носят в основном эвристический характер (см., например, гл. 12 монографии [22]). Рассмотрим некоторые из них.
Замечание. Здесь наглядно проявляется одна из причин живучести вероятностно-статистических моделей на основе нормального распределения. Такие модели, как правило, не адекватны реальной ситуации, о чем сказано выше. Однако с математической точки зрения они позволяют глубже проникнуть в суть изучаемого явления. Поэтому такие модели полезны для первоначального анализа ситуации. В ходе дальнейших исследований необходимо снять нереалистическое предположение нормальности и перейти к непараметрическим моделям.
Оценивание степени полинома. Полезно рассмотреть основной показатель качества регрессионной модели (8). Одни и те же данные можно обрабатывать различными способами. На первый взгляд, показателем отклонений данных от модели может служить остаточная сумма квадратов SS. Чем этот показатель меньше, тем приближение лучше, значит, и модель лучше описывает реальные данные. Однако это рассуждение годится только для моделей с одинаковым числом параметров. Ведь если добавляется новый параметр, по которому можно минимизировать, то и минимум, как правило, оказывается меньше.
В качестве основного показателя качества регрессионной модели используют следующую оценку остаточной дисперсии
.
Таким образом, вводят корректировку на число параметров, оцениваемых по наблюдаемым данным. Корректировка состоит в уменьшении знаменателя на указанное число. В модели (8) это число равно (m + 1). В случае задачи восстановления линейной функции одной переменной оценка остаточной дисперсии имеет вид
поскольку число оцениваемых параметров m + 1 = 2.
Еще раз -- почему при подборе вида модели знаменатель дроби, оценивающей остаточную дисперсию, приходится корректировать на число параметров? Если этого не делать, то придется заключить, что всегда многочлен второй степени лучше соответствует данным, чем линейная функция, многочлен третьей степени лучше приближает исходные данные, чем многочлен второй степени, и т.д. В конце концов доходим до многочлена степени (n - 1) с n коэффициентами, который проходит через все заданные точки. Но его прогностические возможности, скорее всего, существенно меньше, чем даже у линейной функции. Излишнее усложнение статистических моделей вредно.
Типовое поведение скорректированной оценки остаточной дисперсии в случае расширяющейся системы моделей (т.е. при возрастании натурального параметра m) выглядит так. Сначала наблюдаем заметное убывание. Затем оценка остаточной дисперсии колеблется около некоторой константы (дисперсии погрешности). Поясним ситуацию на примере модели восстановления зависимости, выраженной многочленом:
Пусть эта модель справедлива при При в скорректированной оценке остаточной дисперсии учитываются не только погрешности измерений, но и соответствующие (старшие) члены многочлена (предполагаем, что коэффициенты при них отличны от 0). При имеем
Следовательно, скорректированная оценка остаточной дисперсии будет колебаться около указанного предела. Поэтому представляется естественным, что в качестве оценки неизвестной статистику степени многочлена (полинома) можно использовать первый локальный минимум скорректированной оценки остаточной дисперсии, т.е.
В работе [23] найдено предельное распределение этой оценки параметра, принимающего целые значения - степени многочлена.
Теорема. При справедливости некоторых условий регулярности
Таким образом, предельное распределение оценки m* степени многочлена (полинома) является геометрическим. Это означает, в частности, что оценка не является состоятельной. При этом вероятность получить меньшее значение, чем истинное, исчезающе мала. Далее имеем:
Разработаны и иные методы оценивания неизвестной степени многочлена, например, путем многократного применения процедуры проверки адекватности регрессионной зависимости с помощью критерия Фишера. Предельное поведение таких оценок -- таково же, как в приведенной выше теореме, только значение параметра иное. Для степени многочлена давно предложены состоятельные оценки [24]. Для этого достаточно уровень значимости (при проверке адекватности регрессионной зависимости с помощью критерия Фишера) сделать убывающим при росте объема выборки.