Контрольная работа: Метод аддитивной аппроксимации данных выборки ограниченного объема

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Статистический эксперимент. Для опытной оценки степени расхождения суммы независимых случайных величин от нормального закона при невыполнении условий центральной предельной теоремы, был проведен эксперимент, заключающийся в генерации двух массивов нормальных чисел по формуле:

, (30)

где Ri - равномерно распределенное число.

Как видно из (30), данный метод генерации основан на центральной предельной теореме.

Первый массив чисел генерировался стандартным способом по формуле (30). В качестве Ri были взяты равномерно распределенные числа с математическим ожиданием Mx=0,5 и s2=1/12. Второй ряд чисел генерировался также по (30), но математическое ожидание равномерных чисел варьировалось по различным законам, что нарушает условия центральной предельной теоремы. Степень нормальности этих массивов проверялась критериями Шапиро-Уилкса, Смирнова-Мизеса-Крамера. Графики зависимости величины критерия нормальности от объема выборки для некоторых распределений, полученные с помощью разработанного пакета программ, приведены в Приложении А. По оси ординат отложены значения статистики критерия Мизеса-Смирнова-Крамера, по оси абсцисс - количество чисел в выборке. Из графиков видно, что при невыполнении условий центральной предельной теоремы нормальность полученного распределения нарушается, и степень расхождения растет с ростом числа чисел в массиве, что подтверждает возможность аппроксимации статистических данных различными законами распределений.

. Разработка методов аппроксимирующих вкладов значений выборки

Метод вкладов основан на:

а) использовании дополнительной, кроме самой выборки, априорной информации о случайной величине Х;

б) индивидуальном подходе к каждой реализации выборки;

в) "распределении" информации, полученной от отдельной реализации выборки, на конечном интервале d.

Априорной информацией может быть предположение относительно истинной плотности распределения f(x) случайной величины Х. Пусть функция f(x) удовлетворяет следующим условиям:

) f(x) 0 при a x b;

f(x) 0 при x<a и x>b, (31)

где [a, b] - интервал возможных значений Х.

) f(x) - непрерывная функция и внутри [a, b] не имеет очень крутых подъемов и спадов.

В зависимости от того, какой конкретный вид f(x) будет выбран, различают метод прямоугольных вкладов, метод треугольных вкладов, метод гауссовых вкладов и т.д.

Метод прямоугольных вкладов Наличие априорной информации вида (31), даже при отсутствии реализаций Х, позволяет построить оценку плотности f*(x). На имеющемся уровне знаний ни одной из возможных реализаций внутри интервала [a, b] нельзя отдать предпочтение.

Такой особенностью обладает равномерное распределение:

 (32)

Индивидуальный подход к каждой отдельной реализации хi выборки заключается в том, что каждой реализации приписывается элементарная плотность, то есть имеет место прямоугольная форма ядра или функция вклада будет иметь следующий вид:

 (33)

где d - ширина функции вклада.

Функция вклада задается симметрично относительно xi на конечном интервале длиной d (рисунок 5).

Рисунок 5 - График функции вклада Yxi(x)

Линейное суммирование с заданными весами априорной плотности (32) и вкладов (33) для всех n элементов выборки приводит в итоге к искомой оценке плотности:

 (34)

В выражении (34) с помощью весового коэффициента 1/(n+1) осуществляется нормирование оценки плотности f*(x).

Для построения оценки f*(x) необходимо установить интервал изменения случайной величины. Общее правило, справедливое для всех исследуемых законов распределения и для всех методов, состоит в вычислении границ интервалов из соотношения P{a<x<b}=0.997¸0.999. Формула (26) еще не дает приемлемой эмпирической функции плотности по n значениям случайной величины Х, так как что для некоторых значений xi функции вклада Yxi(x) будут выходить за пределы области [a, b] и, значит, функция fn(x) будет отлична от нуля и вне этой области. Последнее же противоречит априорному условию. Поэтому выходящую за пределы [a, b] часть площади данного вклада Yxi(x) будем отбрасывать, а над оставшимся основанием прямоугольника, лежащим внутри [a, b], равномерно надстраивать площадь, равную отброшенной. На рисунке 6 изображены диаграммы построения эмпирической функции плотности вероятности для пяти значений выборки.

В методе прямоугольных вкладов в качестве функции вклада используется равномерное распределение. Использование этого вклада упрощает построение эмпирической функции распределения, но данный вклад не является единственно возможным и оптимальным.

Рисунок 6 - Диаграммы построения эмпирической функции распределения f*(x) методом прямоугольных вкладов

Метод треугольных вкладов. В качестве функции вклада не обязательно использовать прямоугольник, тем более, что при применении прямоугольного вклада не выделяется точка xi, которая зафиксирована при конкретном измерении величины Х. Действительно, нет необходимости приписывать точке xi абсолютное значение, но считать в этой точке плотность вклада максимальной по сравнению с другими в интервале d вполне целесообразно. Этому больше всего будет отвечать функция вклада в виде элементарного распределения Симпсона (треугольника). Распределение Симпсона симметрично, а элементарное распределение берется шириной d и высотой h. Метод треугольных вкладов отличается от метода прямоугольных вкладов только формой функции вклада:

 (35)

На рисунке 7 изображен график функции вклада Симпсона Yxi(x).

Рисунок 7 - График функции вклада Симпсона Yxi(x)

Когда нет ни одной реализации случайной величины, учитывая предварительные условия, можно записать плотность распределения в виде, не противоречащем имеющейся информации о Х:

 (36)

где c=(b+a)/2.

Аналогично методу прямоугольных вкладов линейное суммирование с заданными весами априорной плотности (3.48) и вкладов (35) для всех n элементов выборки приводит в итоге к искомой оценке плотности (34). При алгоритмической реализации для построения (34) все обрабатываемые значения упорядочивают по возрастанию, и как таковое, суммирование осуществляется только в точке пересечения вкладов - результатов предыдущего суммирования и нового вклада. Таким образом, построение происходит "внахлест" - меньшая площадь вклада накладывается на большую - результат предыдущего суммирования. Затем проводится сглаживающая ломаная, соединяющая вершины вклада, так как это делается при построении полигональной оценки.

На рисунке 8 изображены диаграммы построения эмпирической функции плотности вероятности методом треугольных вкладов для тех же пяти значений выборки, что и для прямоугольных вкладов на рисунке 6. Аналогично выходящую за пределы [a, b] часть площади данного вклада Yxi(x) отбрасывают и равномерно надстраивают площадь, равную отброшенной, над оставшимся основанием прямоугольника, лежащим внутри [a, b].

Метод гауссовых вкладов. В качестве функции вклада можно использовать нормальное распределение, которое является симметричным. Поскольку дисперсия вклада d должна быть конечной, то, строго говоря, в качестве функции вклада необходимо использовать усеченное нормальное распределение, то есть функция вклада имеет вид:

Рисунок 8 - Диаграммы построения эмпирической функции распределения f*(x) методом треугольных вкладов

, (37)

где с=[F(3)-F(-3)]-1»1.0028,  - функция нормального распределения.

На рисунке 9 изображен график функции гауссова вклада Yxi(x).

Априорная функция вклада:

, (38)

где  c=(b+a)/2.

Линейное суммирование с заданными весами априорной плотности (38) и гауссовых вкладов (37) для всех n элементов выборки приводит в итоге к искомой оценке плотности (36).

На рисунке 10 изображены диаграммы построения эмпирической функции плотности вероятности для тех же пяти значений выборки, что и для прямоугольных и треугольных вкладов на рисунках 6, 8. Аналогично выходящую за пределы [a, b] часть площади данного вклада Yxi(x) отбрасывают и равномерно надстраивают площадь, равную отброшенной, над оставшимся основанием прямоугольника, лежащим внутри [a, b].

Рисунок 9 - График функции гауссова вклада xi(x)

Рисунок 10 - Диаграммы построения эмпирической функции распределения f*(x) методом гауссовых вкладов

Таким образом, независимо от вида функции вклада в результате геометрических построений получают эмпирическую функцию плотности вероятности (26), которую теперь необходимо отнести к какой-либо теоретической функции распределения. Для этого интервал [a, b] разбивается на k равных интервалов, и вычисляются частные площади Si, то есть площади секторов, ограниченные пределами i-го интервала, i = 1,2, ... , k (см. рисунок 6). Следующий шаг - это получение значений оценки функции плотности вероятности по формуле:

 (39)

Для того чтобы отнести полученную функцию распределения к одному из теоретических законов распределения надо для каждой теоретической функции распределения получить значения pi(x) и, используя одним из критериев согласия, определить меру расхождения между теоретическим и эмпирическим распределением.

Следует отметить, что нельзя применять общераспространенные критерии согласия (критерий 2, критерий Колмогорова), так как для их использования необходимо знать объем выборки n, а в процессе работы метода происходит равномерное "размазывание" случайной реализации по сектору, значит использовать конкретное значение объема выборки нельзя. Тогда целесообразно воспользоваться методом наименьших квадратов для того, чтобы отнести полученную оценку (26) к одной из теоретических функций распределения:

, (40)

где  - эмпирическое и теоретическое значения вероятностей i-го () разряда соответственно.

Статистику (40) вычисляют для набора наиболее распространенных на практике законов распределений. Полученные значения критерия согласия в результате одновременной идентификации эмпирического распределения одним из набора  теоретических распределений задают отношение порядка вероятностей соответствия статистических моделей в виде неубывающего упорядоченного ряда:

. (41)

Основываясь на сравнительном анализе членов ранжированного ряда (41) и выделяя максимальный (первый) элемент, делают вывод о соответствии эмпирического закона распределения  тому или иному, например, j-му стандартному распределению с вероятностью Pj(V).

Укрупненный алгоритм аддитивной аппроксимации эмпирического распределения методом вкладов приведен на рисунке 11.

Рисунок 11 - Укрупненный алгоритм аддитивной аппроксимации эмпирического распределения методом вкладов

. Разработка метода имитационного моделирования для идентификации вероятностных моделей параметров на основе статистик малых выборок

Рассмотренные выше алгоритмы и методы аддитивной аппроксимации малой выборки являются графическими методами. Альтернативным решением при обработке статистических массивов малой выборки является использование метода имитационного моделирования.

Идея алгоритма состоит в следующем: как и в методе вкладов используется некоторая дополнительная информация относительно неизвестного истинного распределения и при построении эмпирической функции распределения учитывается флуктуационный характер реализующихся в опыте значений случайной величины Х и поэтому не придается осуществившимся событиям некоторая абсолютная значимость.

Метод имитационного моделирования основан:

·        на использовании дополнительной, кроме самой выборки, априорной информации о случайной величине Х;

·        на индивидуальном подходе к каждой реализации выборки;

·        на "распределении" информации, полученной от отдельной реализации выборки, на конечном интервале d.

Если априорно ни одной из возможных реализаций внутри интервала [a, b] не придается предпочтение, то в качестве функции вклада можно использовать равномерное распределение (32). Поэтому индивидуальный подход к каждому случайному значению xi случайного процесса Х состоит в генерации равновероятно распределенных псевдослучайных чисел в d-окрестностях значений xiХ,  (рисунок 12).

Рисунок 12 - Представление элемента хi совокупностью значений

Если границы d-окрестностей выходят за пределы отрезка [a, b], то получаемые при генерации числа равномерно распределяются в диапазоне [a, xi+d/2] или [xi-d/2, b]. Количество генерируемых при поступлении очередного значения хi чисел определяется из условия требуемой достоверности. Использование генерации равномерно распределенных чисел не является единственно возможной (например, аналогично методу треугольных вкладов нет необходимости случайному значению хi придавать абсолютного значения, но считать в этой точке плотность максимальной по сравнению с другими в интервале d вполне целесообразно, поэтому можно генерировать числа с плотностью возрастающей к xi и убывающей к xi-d/2, и xi+d/2).

Таким образом, осуществляется переход от малой выборки (n=510) к выборке стандартного объема данных, представляющей собой аддитивную суперпозицию (n+1) псевдореализаций, причем основная из них ограничена диапазоном [a,b] с математическим ожиданием 0.5[b+a]. Такая модель выборки позволяет строить эмпирическую гистограмму с применением известных классических методов и приемов, определять оценки среднеквадратичного отклонения и среднего значения процесса Х, коэффициенты асимметрии и эксцесса, другие моменты. Для полной характеристики эмпирического распределения производится его идентификация одним из стандартных законов распределения в дифференциальной и интегральной формах.

Источник: https://www.bibliofond.ru/detail.aspx?id=864548