Контрольная работа: Метод аддитивной аппроксимации данных выборки ограниченного объема

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

где  - распределение Стьюдента для доверительной вероятности b с n-1 степенями свободы.

График зависимости (17) приведен на рисунке

Рисунок 3 - График зависимости n=F(Dср) для экспоненциального закона распределения

Рисунок 4 - График зависимости объема выборки n от коэффициента вариации V, погрешности оценки Dср и доверительной вероятности b для нормального закона

Можно выделить несколько недостатков методов обработки статистического материала, если объемы выборок значительны. Статистическая обусловленность, или достоверность эмпирического распределения неодинакова в различных зонах (в зависимости от степени нарушения предпосылок закона больших чисел):

·        наибольшей статистической обусловленностью обладает зона больших частот;

·        "хвосты" эмпирического распределения обусловлены хуже (так как приходящееся на них общее число событий относительно мало);

·        зоны усечения эмпирического распределения (соответствующие отсутствующим наблюдениям) имеют нулевую обусловленность.

Анализ соотношений (14)÷(17) и рисунков 2÷4 свидетельствует, что традиционные методы оказываются неприемлемыми для обработки данных о выбросах, представленных, как правило, крайне немногочисленными статистическими данными (не более 10 выбросов), и необходимо привлечение специального математического аппарата по обработке статистик малых выборок.

Патентный поиск в области устройств по идентификации законов распределения по малому числу данных класса G 06 F за последние 15 лет позволяет сделать следующие выводы: известные алгоритмы является узкоспециализированными на идентификацию только одного вида закона распределения, не делается вывод о виде закона распределения измеряемой случайной величины.

Таким образом, для получения приемлемых по достоверности результатов обработки статистических данных традиционные методы требуют объемов выборок в сотни значений, при этом классические методы неизбежно приводят к потере части информации, имеющейся в выборке. При малом числе данных эти методы несостоятельны, что зачастую приводит к отказу от обработки статистического материала, который может нести важнейшую информацию о ТО. Поэтому традиционные методы и разработанные на их основе ИВК и статистические анализаторы не могут отвечать требованиям функционального диагностирования сложных ТО в нештатных режимах, для которых характерны быстрое изменение состояния и недопустимость длительного пребывания в предаварийном режиме. Очевидно, что для обработки эмпирических данных о выбросах случайных процессов контролируемых параметров необходимо использование математического аппарата статистик малых выборок.

. Принципы обработки статистических данных в базисе аддитивной аппроксимации стандартными распределениями

Выборку следует считать малой, если при ее обработке методами, основанными на группировке наблюдений, нельзя достичь заданных точности и достоверности. Выборку можно считать большой, если при ее обработке имеется возможность перейти к группировке наблюдений без ощутимой потери информации. При этом должны достигаться заданные точность и достоверность. Но самым существенным, что следует из определения малой выборки, является необходимость при обработке малой выборки индивидуального подхода к каждой отдельной реализации.

Получение оценки функции плотности. При решении задачи оценивания плотности или функции распределения по малой выборке используются некоторые приемы как гистограммного и метода полигональных оценок, так и вообще традиционного подхода: приписывание некоторой функции каждой реализации случайной величины, так и "распределение" некоторой элементарной вероятности по всему интервалу существования функции.

Именно эти приемы использовались для получения оценки плотности распределения f*(x) непосредственно по выборке. В работе данная оценка называется эмпирической компонентой полной оценки.

Поскольку информация, заложенная в малой выборке, ограничена, то очевидно, для повышения эффективности оценивания, как отмечалось выше, необходимо привлекать дополнительную информацию, которая содержится в априорных данных. По априорным данным также можно отыскать оценку плотности f0(x).

В целом, получение полной оценки плотности распределения будет состоять из следующих этапов:

·        анализ и формализация априорного массива в виде оценки f0(x);

·        накопление и формализация в виде оценки fn(x) эмпирического массива;

·        объединение априорной и эмпирической информации, получение полной оценки f*(x).

Априорная компонента. Выбранная f0(x) должна полностью соответствовать уровню знаний о случайной величине X. Для этого при выборе f0(x) надо потребовать, чтобы она имела максимально возможную энтропию при заданных условиях в виде конкретных априорных данных. При заданных условиях f0(x) должна быть выбрана такой, чтобы обеспечивался максимум функционала

. (18)

Задача сводится к отысканию f0(x) как функции от x, обеспечивающей экстремум интеграла

, (19)

где G - функционал.

При этом могут накладываться ограничивающие условия вида:

; (20)

где О1, О2,..., Оn - заданные ограничения, g1, g2,..., gn - некоторые функции.

Известно, что f0(x), обеспечивающая экстремум интеграла (19), может быть найдена из уравнения

 (21)

где  - неопределенные множители, которые вычисляются с помощью подстановки f0(x), удовлетворяющей уравнению (21) в равенствах (20).

Допустим, что известен интервал изменения случайной величины  и существует единственное условие

.

Тогда, учитывая, что ,  вычислим для составления уравнения (21) частные производные функций G(x,f0) и g1(x,f0) и, подставив их в уравнение (21), получим:

, (22)

то есть максимум энтропии Н0 обеспечивается при . Подставив f0(x) в (22), получим

 (23)

Таким образом, априорным данным в виде интервала изменения случайной величины (a,b) адекватна априорная компонента f0(x) оценки плотности распределения f*(x) в форме плотности равномерного распределения (23).

Эмпирическая компонента. Пусть f(x) - неизвестная плотность распределения вероятностей случайной величины X, заданная на действительной оси R. Задана конечная совокупность реализаций ,  случайной величины X, то есть имеется эмпирический массив данных. Необходимо по заданному массиву построить fn(x) - эмпирическую компоненту оценки плотности f(x). Оценка должна быть состоятельной, несмещенной и эффективной. Априорно полагается, плотность f(x) - непрерывная или хотя бы кусочно-непрерывная функция и удовлетворяет условию f(x)>0 на интервале .

Эмпирическая компонента fn(x) строится путем графического суммирования упорядоченных значений выборки x1,...,xn с построением вокруг каждого значения выборки некоторого элементарного распределения, называемого вкладом или ядром.

Выражение для эмпирической оценки в этом случае примет вид:

статистический аддитивный аппроксимация выборка

 (24)

где d - полуинтервал диапазона изменения величины X, C(d) - амплитуда или высота вклада.

Высота вклада C(d) может быть вычислена следующим образом:

, (25)

где Y(d,x) - ядро вклада при xi=0.

Полная оценка функции плотности распределения определяется с учетом (24) и (25) следующим выражением:

 (26)

где a - вероятность полного получения оценки по априорным данным;  - коэффициент нормировки i-ой реализации.

Использование методов, основанных на аддитивной композиции, наталкивается на достаточно серьезные теоретические затруднения. Эмпирическая функция распределения (26) - аддитивная конструкция из стандартных (симметричных) распределений, а на основании центральной предельной теоремы в различных формах в доказательстве А.М. Ляпунова предрешена быть описанной нормальным законом. Следовательно, возможность идентификации статистических массивов малых выборок законами распределений, отличных от нормального, является весьма сомнительной. Докажем, что при невыполнении условий центральной предельной теоремы, возможна идентификация не только нормальным законом, а семейством бесконечно делимых предельных распределений.

Теоретические предпосылки аппроксимации вероятностных функций распределений аддитивной композицией стандартных распределений. Различные формы закона больших чисел утверждают одно: факт сходимости по вероятности тех или иных случайных величин (с.в.) к определенным постоянным. Все формы центральной предельной теоремы посвящены установлению условий, при которых возникает нормальный закон распределения. Так как эти условия на практике весьма часто выполняются, нормальный закон является самым распространенным из законов распределения, наиболее часто встречающимся в случайных явлениях природы. Он возникает во всех случаях, когда исследуемая случайная величина может быть представлена в виде суммы достаточно большого числа независимых (или слабо зависимых) элементарных слагаемых, каждое из которых в отдельности сравнительно мало влияет на сумму.

Долгое время нормальный закон считался единственным и универсальным законом ошибок. В настоящее время взгляд на нормальный закон как на единственный и универсальный должен быть пересмотрен. Опыт показывает, что в ряде процессов измерения и производства наблюдаются законы распределения, отличные от нормального. Это утверждение чисто опытного характера, однако существуют и теоретические обоснования анормальности многих наблюдаемых явлений.

Кажущаяся незыблемость предельных теорем зачастую заставляет многих авторов обходить молчанием явления, утверждения и даже математически доказанные теоремы, опровергающие их абсолютность. Тем не менее, работы в данной области ведутся давно и требуют на данном этапе развития техники тщательного изучения. Стоит обратить внимание на следующие математические факты.

Предельные теоремы отличаются той особенностью, что доставляемая ими аппроксимация оказывается тем менее действенной, чем меньше вероятность р. Оказалось, что в случае малых р для приближений надо привлекать не нормальное, а другое распределение (теорема Пуассона):

 (27)

где  распределение Пуассона. Чебышевым была доказана теорема - закон больших чисел и тогда же поставлен вопрос об уточнении предельных аппроксимаций распределений Yn и предложено это делать за счет добавления к нормальному распределению конечной части некоторого зависящего от n ряда. Тот ряд, который использовал Чебышев, впоследствии действительно оказался хорошей основой для построения уточненных аппроксимаций (ряд Чебышева-Крамера или разложение Эджворта-Крамера).

Леви дал описание всех функций распределения G(x), появляющихся в качестве предельных в соотношении:

 (28)

где выбором положительных постоянных Вm можно распоряжаться по своему усмотрению (символ  означает слабую сходимость распределений). Описание осуществляется в терминах характеристических функций, соответствующих распределениям G(x). G(x) называется классом устойчивых законов (сейчас называют строго устойчивых).

Колмогоровым и Гнеденко показано, множество U всех распределений, которые могут появиться в качестве предельных для распределений сумм Snm, совпадает с множеством всевозможных распределений на вещественной оси. Чтобы убедиться в том, что любая функция распределения U(x) может выступать в качестве предельной, достаточно рассмотреть последовательность серий случайных величин {Xnj}, n=1,2,..., в которых Xn1 подчинены распределению U(x), при любых n, а Xnj=0 с вероятностью 1 для всех j 2, n 1. Кроме того, следует ввести в постановку задачи разумные общие ограничения: специфические свойства предельных функций распределения должны определяться тем, что они являются предельными для сумм возрастающего числа независимых случайных величин, причем роль каждого отдельного слагаемого должна быть при n исчезающе малой.

Обширность класса предельных законов при такой постановке вызывает сомнение до настоящего времени. Однако еще де Финетти ввел понятие безгранично делимых распределений и дал описание в терминах характеристических функций небольшой части класса этих распределений, а Колмогоров описал все распределения из с конечной дисперсией. Полное описание класса дали Леви и Хинчин, Хинчин доказал, что U совпадает с. Обобщающие теоремы Ляпунова и Линдеберга содержат некоторые достаточные условия сходимости распределений сумм Sn к предельному закону без условия предельной пренебрегаемости.

В работах Кароблиса, посвященных проблеме асимптотических приближений распределений сумм независимых случайных величин, развивается постановка вопроса, в которой аппроксимирующим является не одно распределение, а параметрическое семейство распределений.

Помимо (27), (28) и других теоретических заключений, на возможность аппроксимации не только нормальным распределением указывает и неравенство Берри - Эссеена, которое оценивает расхождение суммы независимых с.в.: для некоторого А>0 и независимых с.в. X1,...,Xn с нулевым математическим ожиданием, конечной дисперсией справедливо:

 (29)

где  Ф(X) - функция нормального распределения.

Причем порядок оценки (29) нельзя улучшить, не вводя дополнительных предположений о распределениях рассматриваемых случайных величин. До сих пор нет единого мнения по выбору величины А, в некоторых работах указывается А=0.82, при которой выполняется неравенство. Однако очевидна зависимость величины расхождения суммы с.в. от числа слагаемых. При малом числе слагаемых, например, величина  оказывается существенной 0,259, то есть расхождение с нормальным законом велико, и целесообразно в качестве предельного использовать другое распределение. Как было показано выше, при аппроксимации эмпирических распределений в качестве предельных необходимо использовать целый класс безгранично делимых распределений.

Итак, современная теория суммирования случайных величин предполагает коррекцию результатов классических предельных теорем и вводит свой специфичный аппарат для доказательства того факта, что в качестве предельных необходимо рассматривать не одно (нормальное) распределение, а целый класс распределений, при этом неравенство Берри - Эссеена позволяет получить количественную оценку расхождения аддитивной аппроксимации с нормальным распределением.

Источник: https://www.bibliofond.ru/detail.aspx?id=864548