Перечень наблюденных значений случайной величины Х (или интервалов наблюденных значений) и соответствующих им частот называется
статистическим законом распределения случайной величины.
Для выполнения статистических процедур интервальный ряд как правило подвергают дальнейшим преобразованиям. Длину частичного интервала следует выбирать так, чтобы ряд не был слишком громоздким, но при этом позволял выявлять характерные изменения признака X. Величину R xmax xmin называют размахом выборки. Количество интервалов k вы-
бирают по формуле Стерджесса: k 1 3,322 lg n . Очевидно, это число округляется до целого. Далее определяется длина интервалов разбиения. Для
случая равных интервалов ее называют «шагом»: h Rk .
Формируется таблица, в которой интервалы статистического ряда идут в столбце. В каждом из них выбирается середина, и ей «приписывается» частота, относящаяся к данному интервалу. В литературе принят термин «вес».
Статистические законы позволяют визуально произвести оценку закона распределения исследуемой случайной величины. Это очень важная часть этапа описательной статистики. Одним из наиболее распространенных приемов визуализации данных является гистограмма.
Гистограммой называется ступенчатая фигура, состоящая из прямоугольников, в основании которых лежат интервалы разбиения, а высоты определяются формулой
mi n mi*.
Такая гистограмма является ненормированной и подходит для простой визуализации данных. Площадь такой ступенчатой фигуры очевидно равна h.
С математической точки зрения целесообразнее использовать нормированную гистограмму, в которой на оси ординат откладываются не сами частоты, а плотности распределения наблюдений. Для такой гистограммы по оси ординат откладывают значения
mi hn m* . h
Тогда характер изображения не будет меняться в зависимости от изменения шага разбиения массива данных на интервалы. Нормированная гистограмма обладает важным свойством: сумма площадей всех прямо-
угольников равна 1.
Если строить нормированную гистограмму по частотам, то такая площадь будет равна объему выборки.
Полигоном частот называется ломаная, соединяющая точки с координатами xi , xi 1 . Этот способ изображения используют для случая дискретной вариации.
6
Выводы о вариации признака на всей генеральной совокупности делают по выборке. Состав выборки случаен, поэтому выводы о параметрах распределения генеральной совокупности не могут быть точными. С ростом объема выборки вероятность правильного вывода должна увеличиваться. Поэтому любому решению, принимаемому по выборке, сопоставляют вероятность, отражающую степень достоверности принятого результата. Задача оценки параметров в общем виде формулируется так.
Пусть X – случайная величина с законом распределения F(X, θ). Здесь θ – параметр распределения, числовое значение которого неизвестно. Судят о нем по выборке. Всякую однозначно определенную функцию выборочных наблюдений, с помощью которой судят о значении параметра θ, называют оценкой (статистикой) параметра θ. Для нас интерес представляют выборочные оценки для параметров генеральной совокупности. Оценка должна быть «хорошей», а значит, отвечать некоторым свойствам. Очевидно, нужно обеспечить отсутствие систематических ошибок при оценке параметров. Оценку, обладающую таким свойством, называют несмещенной. Ее математическое ожидание должно быть равно оцениваемому параметру.
Поскольку оценка – это статистика, ее значение меняется от выборки к выборке. Меру ее рассеивания около математического ожидания, как известно из теории вероятностей, характеризует дисперсия. Очевидно, из двух оценок лучшей будет та, рассеивание которой около оцениваемого параметра будет меньше. Несмещенную оценку, которая имеет наименьшую дисперсию среди всех несмещенных оценок параметра θ, вычисленных по выборке одного и того же объема, называют эффективной оценкой.
Оценку называют состоятельной, если при достаточно большом числе независимых наблюдений с вероятностью, близкой к 1, можно утверждать, что разность между выборочной оценкой и неизвестным параметром по абсолютной величине окажется меньше сколь угодно малого положительного числа δ: 
Здесь ε – положительное число, близкое к нулю.
Смысл приведенного соотношения в том, что чем больше число наблюдений, тем больше уверенность (вероятность) в незначительном отклонении оценки от неизвестного параметра. Очевидно, что «хорошая» оценка должна быть состоятельной, иначе она не имеет практического смысла, так как увеличение объема полученной информации не будет приближать нас к «истинному» значению параметра.
Наиболее важными числовыми характеристиками случайной величины являются математическое ожидание и дисперсия. Для их точечного (одним числом) оценивания используют числовые характеристики выборки.
7
«Вариация» – это изменчивость, изменение. Наиболее распространенной оценкой вариации признака является выборочное среднее. Это обобщающий показатель совокупности, характеризующий уровень изучаемого явления или процесса. Средняя величина обобщает количественное выражение признака и погашает индивидуальные различия статистических величин совокупности, вызванные случайными обстоятельствами.
Выборочной средней называется среднее арифметическое всех наблюдаемых в выборке значений:
|
|
x1m1 x2m2 ...xk mk |
k |
|
|
|
|
xk mk . |
(1) |
||
x |
|||||
n |
|||||
|
|
i 1 |
|
||
|
|
|
|
Для интервального статистического ряда эта формула приобретает вид
|
k |
|
|
|
|
xi mi |
n |
|
|
x |
i 1 |
ximi*. |
(2) |
|
n |
||||
|
i 1 |
|
||
|
|
|
Здесь используются середины интервалов и относительные частоты. Выборочное среднее – это несмещенная оценка генерального матема-
тического ожидания и состоятельная оценка генеральной средней. С доказательством этого факта можно ознакомиться в [1].
Для решения вопроса о количественной характеристике степени рассеивания наблюдаемых значений относительно их среднего используют выборочную дисперсию. Это среднее арифметическое квадратов отклонений наблюдений относительно их средней.
Выборочной дисперсией называется значение случайной величины
|
n |
x |
x 2 |
|
|
|
Dв |
|
i |
. |
(3) |
|
i 1 |
|
|
n |
|
|
|
|
|
|
|
Для ее вычисления используют известные из теории вероятностей |
|||||
свойства: |
|
|
|
|
|
для дискретного вариационного ряда |
|
||||
|
n |
|
|
|
|
|
xi x 2 mi |
|
n |
|
|
Dв |
i 1 |
|
xi x 2 mi*; |
|
|
n |
|
|
|||
|
|
|
i 1 |
|
|
|
|
|
|
|
|
для интервального вариационного ряда
8
|
k |
|
|
|
|
xi x 2 mi |
k |
|
|
Dв |
i 1 |
xi x 2 mi*, |
(4) |
|
n |
||||
|
i 1 |
|
||
|
|
|
где xi – середина i-го интервала.
Свойством несмещенности эта оценка НЕ обладает [1]. Для того чтобы «исправить» этот недостаток, нужно умножить выборочную дисперсию
на число |
n |
. Тогда получится величина |
|
|
|
||||
|
|
|
|
|
|||||
n 1 |
|
|
|
||||||
|
|
|
s2 |
n |
D , |
|
|
(5) |
|
|
|
|
|
|
|
|
|||
|
|
|
n 1 |
|
|
||||
|
|
|
|
в |
|
|
|
||
называемая исправленной выборочной дисперсией. Коэффициент |
n |
на- |
|||||||
|
|
||||||||
n 1 |
|||||||||
зывается поправкой Бесселя. Дисперсия уже описывает разброс значений относительного среднего. Вот только ее размерность отличается от размерности самого признака. Поэтому более удобной мерой рассеивания являет-
ся среднее квадратическое отклонение s.
Величины x, s2 являются несмещенными, состоятельными и эффективными точечными оценками математического ожидания и дисперсии генеральной совокупности.
Медианой называется такое значение признака, которое делит весь ряд значений пополам. Медиана не зависит от величины крайних вариантов. Поэтому ее часто используют как более надежный, чем выборочное среднее, показатель типичного значения признака. Особенно это важно, если ряд значений неоднороден, в нем встречаются резкие отклонения от среднего. В интервальном ряду распределения для нахождения медианы применяется формула:
|
|
|
|
|
|
|
Ме X |
0 |
h |
0,5n mМе 1 |
, |
(6) |
|
mМе |
||||||
|
|
|
|
|||
|
|
|
|
|
где Ме – медиана;
X0 – нижняя граница интервала, в котором находится медиана; h – величина (размах) интервала;
m – накопленная частота в интервале, предшествующем медианному;
Ме 1
mМе – частота в медианном интервале.
Важное значение имеет такая величина признака, которая встречается в изучаемом ряду распределения чаще всего. Такую величину принято называть модой. В дискретном ряду мода определяется без вычисления, как значение признака с наибольшей частотой. Обычно встречаются ряды с одним модальным значением признака. Если в ряду распределения встречаются два или несколько равных значений признака, то он считается соответственно бимодальным или мультимодальным. Это свидетельствует о неоднородности выборки.
9
В интервальном ряду распределения интервал с наибольшей частотой называется модальным. Внутри этого интервала находят условное значение признака, вблизи которого плотность распределения достигает максимума. Это условное значение и считается точечной модой. Такая точечная мода располагается ближе к той из границ интервала, за которой частота в соседнем интервале больше частоты в интервале за другой границей модального интервала. Отсюда получаем формулу
Мо X 0 |
h |
mМо |
mМо 1 |
, |
(7) |
|
mМо mМо 1 |
mМо mМо 1 |
|||||
|
|
|
|
где Мо – мода; Х0 – нижнее значение модального интервала;
mМо – частота в модальном интервале; mМо 1 – частота в предыдущем интервале;
mМо 1 – частота в следующем интервале за модальным; h – длина интервала.
Для дальнейшего изучения характера вариации используют такие характеристики, как асимметрия и эксцесс.
Коэффициент асимметрии вычисляется двумя разными способами. Один вариант, называемый «третий центральный момент» [1], –
As |
3 |
, |
(8) |
|
s3 |
||||
|
|
|
|
|
|
k |
x 3 mi |
|
|
|
|
xi |
||
где |
3 |
|
i 1 |
|
. |
|
|
||||
|
|
|
n |
||
|
|
|
|
||
Английским статистиком К. Пирсоном на основе разности между средней арифметической величиной и модой был предложен другой показатель асимметрии:
|
|
|
Мо |
|
|
As |
X |
. |
(9) |
||
П s
Он зависит от степени асимметричности в средней части ряда распределения, а показатель асимметрии As – от крайних значений признака.
Показатель эксцесса распределения рассчитывается по формуле
Ex 4 |
3, |
(10) |
s4 |
|
|
k
xi x 4
где |
4 |
|
i 1 |
|
. |
|
|
||||
|
|
|
n |
||
|
|
|
|
||
10