Данные - это зарегистрированные факты, описания явлений реального мира или идей
Основные методы анализа данных и их реализация в программном обеспечении Excel, Statistica и R
Диаграммы размаха («ящик с усами») (Box and Whisker Plot или Box Plot) – это удобный способ визуального представления групп числовых данных через квартили.
Прямые линии, исходящие из ящика, называются «усами» и используются для обозначения степени разброса (дисперсии) за пределами верхнего и нижнего квартилей. Выбросы иногда отображаются в виде отдельных точек, находящихся на одной линии с усами. Диаграммы размаха могут располагаться как горизонтально, так и вертикально.
Диаграммы размаха, как правило, используются в описательной статистике и позволяют быстро исследовать один или более наборов данных в графическом виде. Несмотря на то, что в сравнении с гистограммой или графиком плотности, этот график может показаться примитивным, его преимущество – в экономии пространства, что особенно удобно при сравнении распределений между большим количеством групп или наборов данных.
Есть различные способы построения подобных диаграмм. Наиболее распространённые требуют вычисления медианы, верхнего и нижнего квартилей и минимальное и максимальное значение выборки; или среднее, стандартные отклонения и максимум и минимум (нужно уточнить)
График на нормальной вероятностной бумаге предназначен для визуальной оценки близости распределения к нормальному. Если наблюдаемые значения распределены нормально, то все значения на графике должны попасть на прямую линию
Если значения не являются нормально распределенными, они будут отклоняться от линии. На этом графике можно легко обнаружить выбросы
нормальная - специальным образом разграфленная бумага, построенная так, что график функции нормального распределения изображается на ней прямой линией. Это достигается изменением шкалы на вертикальной оси (см. рис.). На свойстве "выпрямления" основан простой способ проверки гипотезы о принадлежности дайной выборки к нормальной совокупности: если построенная на В. б. эмпирия, функция распределения хорошо приближается прямой линией, то можно с основанием полагать, что совокупность, из к-рой взята выборка, является приближенно нормальной.

Достоинство этого метода состоит в том, что вывод о принадлежности к нормальной совокупности можно сделать без знания численных значений параметров гипотетич. распределения.
Квартили - это квантили (он же персентиль), делящие ранжированную совокупность на 4 равные части. Нижний квантиль отсекает 25% наименьших значений в ранжированной совокупности, а верхний квантиль, соответственно, - 75%. Квантиль, делящий ранжированную совокупность на две равные по числу половины, называется медианой. Медиана совпадает с 5-тым децилем и вторым квартилем. Все квантили измеряются в тех же единицах, что и случайная величина. Децели - 0,1 и 0,9
Квантили используют для свертки информации. Представление о распределении случайной величины можно получить по 7 точкам. Обычно вычисляют нижний и верхний децили (0,1 и 0,9), нижний и верхний квартили (0,25 и 0,75) и медиану. Наряду с вычисленными значениями квантилей приводят минимальное и максимальное значения и объем выборки. Результаты свертки информации представляют обычно в виде таблицы, где указаны все эти характеристики или в виде графика. На графике по оси абсцисс откладывают значения минимума, квантилей и максимума, а по оси ординат - соответствующие им значения γ *100%
Кванти́ль в математической статистике (α-квантиль) — значение xα, которое заданная случайная величина не превышает с фиксированной вероятностью (1-α), т.е. P(X≤xα)=α. Если вероятность задана в процентах, то квантиль называется процентилем или перцентилем.
Например, фраза «90-й процентиль массы тела у новорожденных мальчиков составляет 4 кг» означает, что 90 % мальчиков рождаются с весом, меньшим либо равным 4 кг, а 10 % мальчиков рождаются с весом, большим 4 кг.

0,25-квантиль называется первым (или нижним) кварти́лем (от лат. quarta — четверть);
0,5-квантиль называется медианой (от лат. mediāna — середина) или вторым кварти́лем;
0,75-квантиль называется третьим (или верхним) кварти́лем.
Интеркварти́льным размахом (англ. Interquartile range) называется разность между третьим и первым квартилями, то есть x0,75-x0,25. Интерквартильный размах является характеристикой разброса распределения величины и является робастным аналогом дисперсии. Вместе, медиана и интерквартильный размах могут быть использованы вместо математического ожидания и дисперсии в случае распределений с большими выбросами, либо при невозможности вычисления последних.
Также разновидносться квантилей являются децили. Деци́ль характеризует распределение величин совокупности, при котором девять значений дециля делят её на десять равных частей. Любая из этих десяти частей составляет 1/10 всей совокупности. Так, первый дециль отделяет 10 % наименьших величин, лежащих ниже дециля, от 90 % наибольших величин, лежащих выше дециля.
Так же, как в случае моды и медианы, у интервального вариационного ряда распределения каждый дециль (и квартиль) принадлежит определённому интервалу и имеет вполне определённое значение.
В настоящей заметке χ2-распределение используется для проверки согласованности набора данных с фиксированным распределением вероятностей. В критерии согласия частоты, принадлежащие определенной категории, сравниваются с частотами, которые являются теоретически ожидаемыми, если бы данные действительно имели указанное распределение. [1]
Проверка с помощью критерия согласия χ2 выполняется в несколько этапов. Во-первых, определяется конкретное распределение вероятностей, которое сравнивается с исходными данными. Во-вторых, выдвигается гипотеза о параметрах выбранного распределения вероятностей (например, о ее математическом ожидании) или проводится их оценка. В-третьих, на основе теоретического распределения определяется теоретическая вероятность, соответствующая каждой категории. В заключение, для проверки согласованности данных и распределения применяется тестовая χ2-статистика:

где f0 — наблюдаемая частота, fе — теоретическая, или ожидаемая частота, k — количество категорий, оставшихся после объединения, р — количество оцениваемых параметров.
Классический критерий Колмогорова (иногда говорят Колмогорова-Смирнова) предназначен для проверки простых гипотез о принадлежности анализируемой выборки некоторому полностью известному закону распределения.
В данном случае критерий Колмогорова используется для проверки гипотезы о принадлежности наблюдаемой выборки нормальному закону, параметры которого оцениваются по этой самой выборке методом максимального правдоподобия. То есть, проверяется сложная гипотеза и в качестве оценок параметров нормального закона используются выборочные оценки среднего и дисперсии.
В этом случае (Lilliefors) использовались модифицированные статистики вида:
.
Критические
значения для статистики
приведены
в следующей таблице (Lilliefors):
|
|
0,15 |
0,10 |
0,05 |
0,03 |
0,01 |
|
|
0,775 |
0,819 |
0,895 |
0,955 |
1,035 |
До конца XIX века нормальное распределение считалась всеобщим законом вариации данных. Однако К. Пирсон заметил, что эмпирические частоты могут сильно отличаться от нормального распределения. Встал вопрос, как это доказать. Требовалось не только графическое сопоставление, которое имеет субъективный характер, но и строгое количественное обоснование.
Так был изобретен критерий χ2 (хи квадрат), который проверяет значимость расхождения эмпирических (наблюдаемых) и теоретических (ожидаемых) частот. Это произошло в далеком 1900 году, однако критерий и сегодня на ходу. Более того, его приспособили для решения широкого круга задач. Прежде всего, это анализ категориальных данных, т.е. таких, которые выражаются не количеством, а принадлежностью к какой-то категории. Например, класс автомобиля, пол участника эксперимента, вид растения и т.д. К таким данным нельзя применять математические операции вроде сложения и умножения, для них можно только подсчитать частоты.
Наблюдаемые частоты обозначим О (Observed), ожидаемые – E (Expected). В качестве примера возьмем результат 60-кратного бросания игральной кости. Если она симметрична и однородна, вероятность выпадения любой стороны равна 1/6 и, следовательно, ожидаемое количество выпадения каждой из сторон равна 10 (1/6∙60). Наблюдаемые и ожидаемые частоты запишем в таблицу и нарисуем гистограмму.

Нулевая гипотеза заключается в том, что частоты согласованы, то есть фактические данные не противоречат ожидаемым. Альтернативная гипотеза – отклонения в частотах выходят за рамки случайных колебаний, расхождения статистически значимы. Чтобы сделать строгий вывод, нам потребуется.
Обобщающая мера расхождения между наблюдаемыми и ожидаемыми частотами.
Распределение этой меры при справедливости гипотезы о том, что различий нет.
Начнем с расстояния между частотами. Если взять просто разницу О — E, то такая мера будет зависеть от масштаба данных (частот). Например, 20 — 5 =15 и 1020 – 1005 = 15. В обоих случаях разница составляет 15. Но в первом случае ожидаемые частоты в 3 раза меньше наблюдаемых, а во втором случае – лишь на 1,5%. Нужна относительная мера, не зависящая от масштаба.
Обратим внимание на следующие факты. В общем случае количество категорий, по которым измеряются частоты, может быть гораздо больше, поэтому вероятность того, что отдельно взятое наблюдение попадет в ту или иную категорию, довольно мала. Раз так, то, распределение такой случайной величины будет подчинятся закону редких событий, известному под названием закон Пуассона. В законе Пуассона, как известно, значение математического ожидания и дисперсии совпадают (параметр λ). Значит, ожидаемая частота для некоторой категории номинальной переменной Ei будет являться одновременное и ее дисперсией. Далее, закон Пуассона при большом количестве наблюдений стремится к нормальному. Соединяя эти два факта, получаем, что, если гипотеза о согласии наблюдаемых и ожидаемых частот верна, то, при большом количестве наблюдений, выражение
![]()
имеет стандартное нормальное распределение.
Важно помнить, что нормальность будет проявляться только при достаточно больших частотах. В статистике принято считать, что общее количество наблюдений (сумма частот) должна быть не менее 50 и ожидаемая частота в каждой группе должна быть не менее 5. Только в этом случае величина, показанная выше, имеет стандартное нормальное распределение. Предположим, что это условие выполнено.
У стандартного нормального распределения почти все значение находятся в пределах ±3 (правило трех сигм). Таким образом, мы получили относительную разность в частотах для одной группы. Нам нужна обобщающая мера. Просто сложить все отклонения нельзя – получим 0 (догадайтесь почему). Пирсон предложил сложить квадраты этих отклонений.
![]()
Это и есть знамений критерий Хи-квадрат Пирсона. Если частоты действительно соответствуют ожидаемым, то значение критерия будет относительно не большим (т.к. большинство отклонений находится около нуля). Но если критерий оказывается большим, то это свидетельствует в пользу существенных различий между частотами.
«Большим» критерий Пирсона становится тогда, когда появление такого или еще большего значения становится маловероятным. И чтобы рассчитать такую вероятность, необходимо знать распределение критерия при многократном повторении эксперимента, когда гипотеза о согласии частот верна.
λ - критерий Колмогорова-Смирнова Назначение критерия Критерий λ предназначен для сопоставления двух распределений: а) эмпирического с теоретическим, например, равномерным или нормальным; б) одного эмпирического распределения с другим эмпирическим распределением. Критерий позволяет найти точку, в которой сумма накопленных расхождений между двумя распределениями является наибольшей, и оценить достоверность этого расхождения. Описание критерия Если в методе χ2 мы сопоставляли частоты двух распределений отдельно по каждому разряду, то здесь мы сопоставляем сначала частоты по первому разряду, потом по сумме первого и второго разрядов, потом по сумме первого, второго и третьего разрядов и т. д. Таким образом, мы сопоставляем всякий раз накопленные к данному разряду частоты. Если различия между двумя распределениями существенны, то в какой-то момент разность накопленных частот достигнет критического значения, и мы сможем признать различия статистически достоверными. В формулу критерия λ включается эта разность. Чем больше эмпирическое значение λ, тем более существенны различия. Гипотезы - Н0: Различия между двумя распределениями недостоверны (судя по точке максимального накопленного расхождения между ними). H1: Различия между двумя распределениями достоверны (судя по точке максимального накопленного расхождения между ними). Графическое представление критерия Рассмотрим для иллюстрации распределение желтого (№4) цвета в 8-цветном тесте М. Люшера. Если бы испытуемые случайным образом выбирали цвета, то желтый цвет, так же, как и все остальные, равновероятно мог бы занимать любую из 8-и позиции выбора. На практике, однако, большинство испытуемых помещают этот цвет, "цвет ожидания и надежды" на одну из первых позиций ряда. На Рис. 4.9 столбиками представлены относительные частоты8 попадания желтого цвета сначала на 1-ю позицию (первый левый столбик), затем на 1-ю и 2-ю позицию (второй столбик), затем на 1-ю, 2-ю и 3-ю позиции и т. д. Мы видим, что высота столбиков постоянно возрастает, так как они отражают относительные частоты, накопленные к данной позиции. Например, столбик на 3-й позиции имеет высоту 0,51. Это означает, что на первые три позиции желтый цвет помещают 51% испытуемых. 8 Относительная частота, или частость, - это частота, отнесенная к общему количеству наблюдении; в данном случае это частота попадания желтого цвета на данную позицию, отнесенная к количеству испытуемых. Например, частота попадания желтого цвета на 1-ю позицию ƒ=24; количество испытуемых n=102; относительная частота ƒ*=ƒ/n=О,235. Прерывистой линией на Рис. 4.9 соединены точки, отражающие накопленные частоты, которые наблюдались бы, если бы желтый цвет с равной вероятностью попадал на каждую из 8-и позиций. Сплошными линиями обозначены расхождения между эмпирическими и теоретическими относительными частотами. Эти расхождения обозначаются как d. Рис 4.9. Сопоставления в критерии λ: стрелками отмечены расхождения между эмпирическими и теоретическими накоплениями относительными частотами по каждому разряду Максимальное расхождение на Рис. 4.9 обозначено как dmax Именно эта, третья позиция цвета, и является переломной точкой, определяющей, достоверно ли отличается данное эмпирическое распределение от равномерного. Мы проверим это при рассмотрении Примера 1. Ограничения критерия λ 1. Критерии требует, чтобы выборка была достаточно большой. При сопоставлении двух эмпирических распределений необходимо, чтобы n1,2 >50. Сопоставление эмпирического распределения с теоретическим иногда допускается при n>5 (Ван дер Варден Б.Л., 1960; Гублер Е.В., 1978). 2. Разряды должны быть упорядочены по нарастанию или убыванию какого-либо признака. Они обязательно должны отражать какое-то однонаправленное его изменение. Например, мы можем за разряды принять дни недели, 1-й, 2-й, 3-й месяцы после прохождения курса терапии, повышение температуры тела, усиление чувства недостаточности и т. д. В то же время, если мы возьмем разряды, которые случайно оказались выстроенными в данную последовательность, то и накопление частот будет отражать лишь этот элемент случайного соседства разрядов. Например, если шесть стимульных картин в методике Хекхаузена разным испытуемым предъявляются в разном порядке, мы не вправе говорить о накоплении реакций при переходе от картины №1 стандартного набора к картине №2 и т. д. Мы не можем говорить об однонаправленном изменении признака при сопоставлении категорий "очередность рождения", "национальность", "специфика полученного образования" и т.п. Эти данные представляют собой номинативные шкалы: в них нет никакого однозначного однонаправленного изменения признака. Итак, мы не можем накапливать частоты по разрядам, которые отличаются лишь качественно и не представляют собой шкалы порядка. Во всех тех случаях, когда разряды представляют собой не упорядоченные по возрастанию или убыванию какого-либо признака категории, нам следует применять метод χ2 .
Критерий Стьюдента t относится к одному из наиболее давно разработанных и широко используемых методов статистики. Чаще всего он применяется для проверки нулевой гипотезы о равенстве средних значений двух совокупностей, хотя существует также и одновыборочная модификация этого метода. В данном сообщении я продемонстрирую, как статистические тесты, основанные на критерии Стьюдента, можно реализовать в R.
Начать, пожалуй, стоит с математических допущений, на которых основан критерий Стьюдента. Основных таких допущений, как известно, два:
Сравниваемые выборки должны происходить из нормально распределенных совокупностей;
Дисперсии сравниваемых генеральных совокупностей должны быть равны.
Кроме того, в своей исходной форме, t-критерий предполагает независимость сравниваемых выборок.
Проверка указанных требований к данным должна всегда предшествовать формальному статистическому анализу, в котором задействован критерий Стьюдента (к сожалению, многие исследователи забывают об этом). Способы проверки этих требований я рассмотрю в будущих сообщениях. Сейчас же пока отметим, что условие нормальности распределения данных становится не таким жестким при "больших" объемах выборок, а для выборок с разными дисперсиями существует особая модификация t-критерия (критерий Уэлча; см. также ниже).
Одновыборочный t-критерий
Этот вариант критерия Стьюдента служит для проверки нулевой гипотезы о равенстве среднего значения (mu1mu1) генеральной совокупности, из которой была взята выборка, некоторому известному значению (mu0mu0):
H0:μ1=μ0H0:μ1=μ0
В общем виде проверка (= тест) этой гипотезы выполняется при помощи t-критерия, который рассчитывается как отношение разницы между выборочным средним и известным значением к стандартной ошибке выборочного среднего:
t=¯x−μ0S¯xt=x¯−μ0Sx¯
Рассчитанное значение критерия мы можем далее интерпретировать следующим образом, исходя из свойств t-распределения: если это значение попадает в т.н. область отклонения нулевой гипотезы (см. рисунок ниже), то мы вправе отклонить проверяемую нулевую гипотезу. Область отклонения нулевой гипотезы для критерия Стьюдента определяется заранее принятым уровнем значимости (например, α=0.05α=0.05) и числом степеней свободы.
Эквивалентным подходом к интерпретации результатов теста будет следующий: допустив, что нулевая гипотеза верна, мы можем рассчитать, насколько велика вероятность получить t-критерий, равный или превышающий то реальное значение, которое мы рассчитали по имеющимся выборочным данным. Если эта вероятность оказывается меньше, чем заранее принятый уровень значимости (например, P<0.05P<0.05), мы вправе отклонить проверяемую нулевую гипотезу. Именно такой подход сегодня используется чаще всего: исследователи приводят в своих работах P-значение, которое легко рассчитывается при помощи статистических программ.
Сравнение двух независимых выборок
При сравнении двух выборок проверяемая нулевая гипотеза состоит в том, что обе эти выборки происходят из нормально распределенных генеральных совокупностей с одинаковыми средними значениями:
H0:μ1=μ1H0:μ1=μ1
Поскольку эти генеральные средние мы оцениваем при помощи выборочных средних значений, формула t-критерия приобретает вид
t=¯x1−¯x1S¯x1−¯x2t=x1¯−x1¯Sx1¯−x2¯
В знаменателе приведенной формулы находится стандартная ошибка разницы между выборочными средними, которая в общем виде рассчитывается как
S¯x1−¯x2=√s21n1+s22n2,Sx¯1−x¯2=s12n1+s22n2,
где s21s12 и s22s22 - выборочные оценки дисперсии. При соблюдении условия о равенстве групповых дисперсий приведенная формула приобретает более простой вид (подробнее см. здесь). Интерпретация t-критерия, рассчитанного для двух выборок, выполняется точно так же, как и в случае с одной выборкой (см. выше).