Статья: Вероятностно-статистические модели корреляции и регрессии

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

1

Научный журнал КубГАУ, №160(06), 2020 год

Статья по теме:

Вероятностно-статистические модели корреляции и регрессии

Орлов Александр Иванович, д.э.н., д.т.н., к.ф.-м.н., профессор Московский государственный технический университет им. Н.Э. Баумана

Коэффициенты корреляции и детерминации широко используются при статистическом анализе данных. Согласно теории измерений линейный парный коэффициент корреляции Пирсона применим к переменным, измеренным в шкале интервалов. Его нельзя использовать при анализе порядковых данных. Непараметрические ранговые коэффициенты Спирмена и Кендалла оценивают связь порядковых переменных. Критическое значение при проверке значимости отличия коэффициента корреляции от 0 зависит от объема выборки. Поэтому использование "шкалы Чеддока" некорректно. При применении пассивного эксперимента коэффициенты корреляции обоснованно использовать для прогнозирования, но не для управления. Для получения предназначенных для управления вероятностно-статистических моделей необходим активный эксперимент. Влияние выбросов на коэффициент корреляции Пирсона весьма велико. При увеличении числа проанализированных наборов предикторов заметно растет максимальный из соответствующих коэффициентов корреляции - показателей качества приближения (эффект «вздувания» коэффициента корреляции). Рассмотрены четыре основные модели регрессионного анализа. Выделены модели метода наименьших квадратов с детерминированной независимой переменной. Распределение отклонений произвольно, однако для получения предельных распределений оценок параметров и регрессионной зависимости предполагаем выполнение условий центральной предельной теоремы. Второй тип моделей основан на выборке случайных векторов. Зависимость является непараметрической, распределение двумерного вектора - произвольным. Об оценке дисперсии независимой переменной можно говорить только в модели на основе выборки случайных векторов, равно как и о коэффициенте детерминации как критерии качества модели. Обсуждается сглаживание временных рядов. Рассмотрены методы восстановления зависимостей в пространствах общей природы. Показано, что предельное распределение естественной оценки размерности модели является геометрическим, а построение информативного подмножества признаков наталкивается на эффект "вздувания коэффициентов корреляции". Обсуждаются различные подходы к регрессионному анализ интервальных данных. Анализ многообразия моделей регрессионного анализа приводит к выводу, что не существует единой "стандартной модели"

Ключевые слова: МАТЕМАТИЧЕСКАЯ СТАТИСТИКА, НОВАЯ ПАРАДИГМА ПРИКЛАДНОЙ СТАТИСТИКИ, КОЭФФИЦИЕНТ КОРРЕЛЯЦИИ ПИРСОНА, НЕПАРАМЕТРИЧЕСКИЕ РАНГОВЫЕ КОЭФФИЦИЕНТЫ КОРРЕЛЯЦИИ, ВЫБРОСЫ, КОЭФФИЦИЕНТ ДЕТЕРМИНАЦИИ, РЕГРЕССИОННЫЙ АНАЛИЗ, МЕТОД НАИМЕНЬШИХ КВАДРАТОВ, НЕПАРАМЕТРИЧЕСКАЯ СТАТИСТИКА, НЕЧИСЛОВАЯ СТАТИСТИКА, ОЦЕНКА РАЗМЕРНОСТИ МОДЕЛИ, СТАТИСТИКА ИНТЕРВАЛЬНЫХ ДАННЫХ, РАСПРОСТРАНЕННЫЕ ОШИБОЧНЫЕ ВЫВОДЫ

The correlation and determination coefficients are widely used in statistical data analysis. According to measurement theory, Pearson's linear paired correlation coefficient is applicable to variables measured on an interval scale. It cannot be used in the analysis of ordinal data. The nonparametric Spearman and Kendall rank coefficients estimate the relationship of ordinal variables. The critical value when testing the significance of the difference of the correlation coefficient from 0 depends on the sample size. Therefore, using the Chaddock Scale is incorrect. When using a passive experiment, the correlation coefficients are reasonably used for prediction, but not for control. To obtain probabilistic-statistical models intended for control, an active experiment is required. The effect of outliers on the Pearson correlation coefficient is very large. With an increase in the number of analyzed sets of predictors, the maximum of the corresponding correlation coefficients -- indicators of approximation quality noticeably increases (the effect of “inflation” of the correlation coefficient). Four main regression analysis models are considered. Models of the least squares method with a determinate independent variable are distinguished. The distribution of deviations is arbitrary, however, to obtain the limit distributions of parameter estimates and regression dependences, we assume that the conditions of the central limit theorem are satisfied. The second type of model is based on a sample of random vectors. The dependence is nonparametric, the distribution of the two-dimensional vector is arbitrary. The estimation of the variance of an independent variable can be discussed only in the model based on a sample of random vectors, as well as the determination coefficient as a quality criterion for the model. Time series smoothing is discussed. Methods of restoring dependencies in spaces of a general nature are considered.

It is shown that the limiting distribution of the natural estimate of the dimensionality of the model is geometric, and the construction of an informative subset of features encounters the effect of "inflation coefficient correlation". Various approaches to the regression analysis of interval data are discussed. Analysis of the variety of regression analysis models leads to the conclusion that there is no single “standard model”

Keywords: MATHEMATICAL STATISTICS, A NEW PARADIGM OF APPLIED STATISTICS, PEARSON CORRELATION COEFFICIENT, NONPARAMETRIC RANK CORRELATION COEFFICIENTS, OUTLIERS, DETERMINATION COEFFICIENT, REGRESSION ANALYSIS, LEAST-SQUARES METHODS, NONPARAMETRIC STATISTICS, NONNUMERIV STATISTICS, ESTIMATION OF THE DIMENSION OF THE MODEL, STATISTICS OF INTERVAL DATA, COMMON ERRONEOUS CONCLUSIONS

Введение

Коэффициенты корреляции и детерминации широко используются при статистическом анализе данных. При этом достаточно часто допускаются те или иные ошибки. Некоторые из них рассмотрены ниже.

Ограничимся случаем двух переменных. Пусть (X, Y) - двумерный случайный вектор. Наиболее часто используют линейный парный коэффициент корреляции Пирсона и непараметрические ранговые коэффициенты Спирмена и Кендалла.

Согласно теории измерений [1] коэффициент корреляции Пирсона можно применять к переменным, измеренным в шкале интервалов (и в шкалах с более узкой группой допустимых преобразований, например, в шкале отношений). Его нельзя применять при анализе порядковых данных (например, для анализа связи успеваемости по двум учебным предметам). Непараметрические ранговые коэффициенты Спирмена и Кендалла предназначены для оценки связи порядковых переменных. Их можно использовать и в шкалах с более узкой группой допустимых преобразований, например, в шкалах интервалов или отношений. Исходя из теории устойчивости [2], одни и те же данные целесообразно обработать разными способами и сравнить результаты. В частности, целесообразно рассчитать все упомянутые выше коэффициенты корреляции.

Если X и Y - независимые случайные величины, то коэффициенты корреляции равны 0. Обратное неверно - из равенства 0 коэффициента корреляции не следует, что случайные величины X и Y - независимы.

1. Значимость отличия от 0 и "шкала Чеддока"

Выборочные коэффициенты корреляции - случайные величины. Их распределения являются асимптотически нормальными.

Часто проверяют нулевую гипотезу о том, что тот или иной теоретический коэффициент корреляции равен 0. Если эта гипотеза отклоняется, то можно утверждать, что случайные величины X и Y зависимы. Гипотеза отклоняется на уровне значимости , если выборочный коэффициент корреляции по абсолютной величине больше граничного значения , где n - объем выборки, C и f - некоторые функции, причем

.

Для коэффициента корреляции Пирсона функция f зависит от распределения случайного вектора (X, Y). Распространенные таблицы рассчитаны для случая двумерного нормального распределения (X, Y). Хорошо известно, что распределения подавляющего большинства реальных данных не являются нормальными. Следовательно, применение правил, сформированных для двумерного нормального распределения, как правило, не является обоснованным.

Для непараметрических коэффициентов ранговой корреляции Спирмена и Кендалла свойства правил проверки гипотезы о том, что теоретический коэффициент корреляции равен 0, не зависят от распределения данных.

Иногда показателям тесноты связи (модулям коэффициентов корреляции) пытаются дать качественную оценку (т.н. шкала Чеддока, см. табл.1):

Таблица 1 - Шкала Чеддока

Количественная мера тесноты связи

Качественная характеристика силы связи

0,1 - 0,3

Слабая

0,3 - 0,5

Умеренная

0,5 - 0,7

Заметная

0,7 - 0,9

Высокая

0,9 - 0,99

Весьма высокая

Такая рекомендация не вполне адекватна. При малых объемах выборки значение коэффициента корреляции 0,5 или 0,7 вполне совместимо со справедливостью гипотезы о том, что теоретический коэффициент корреляции равен 0. А при достаточно большом объеме выборки коэффициент 0,1 может свидетельствовать о необходимости отклонения такой гипотезы.

2. Активный и пассивный эксперименты

переменная спирмен кендалл дисперсия

Вопреки часто встречающимся мнениям и предложениям, коэффициенты корреляции можно обоснованно использовать лишь для прогнозирования, но не для управления.

Рассмотрим упрощенный пример. Пусть X - число телевизоров в городе, Y - число преступлений в этом городе, Z - число психических заболеваний в нем. Были собраны данные по нескольким сотням городов (англосаксонских стран). Выборочный коэффициент корреляции между X и Y оказался равным практически 1. Весьма мало отличался от 1 и выборочный коэффициент корреляции между X и Z. С высокой степенью точности справедливы зависимости Y = aX и Z = bX. С помощью этих зависимостей можно надежно прогнозировать число преступлений и число психических заболеваний по число телевизоров в городе.

В подобных ситуациях часто возникает желание использовать зависимости Y = aX и Z = bX для управления. Однако очевидно, что прекращение телевещания (переход к X = 0) не приведет к резкому снижению число преступлений и число психических заболеваний. В чем причина неудачи, казалось бы, естественного подхода к управлению? Дело в том, что значения всех трех рассматриваемых переменных определяются значениями четвертой переменной (латентной, скрытой) - числа жителей города W. А именно, с высокой точностью X = cW, Y = dW, Z = eW, откуда Y = (d/c)X, Z = (e/c)X.

Проблема в том, что при анализе реальных данных не всегда ясно наличие или отсутствие латентных переменных, определяющих успех управления по регрессионным зависимостям. Полезны понятия "пассивный эксперимент" и "активный эксперимент". При пассивном эксперименте данные накапливаются путем пассивного наблюдения, другими словами, информацию получают в условиях обычного функционирования изучаемых объектов. Активный эксперимент проводится с применением искусственного воздействия на изучаемые объекты по специальной программе.

При пассивном эксперименте существуют только факторы в виде входных контролируемых, но неуправляемых переменных, и экспериментатор находится в положении пассивного наблюдателя. Задача планирования в этом случае сводится к оптимальной организации сбора информации и решению таких вопросов, как выбор количества и частоты измерений, выбор метода обработки результатов измерений.

Наиболее часто целью пассивного эксперимента является построение математической модели объекта. Хорошим примером пассивного эксперимента являются измерения метеорологических параметров (температуры, скорости ветра и т.д.).

Активный эксперимент основан на задании экспериментатором значений факторов. Такой эксперимент позволяет быстрее и эффективнее решать задачи исследования, но более сложен, требует больших материальных затрат и может помешать нормальному ходу технологического процесса. Иногда отсутствует возможность проведения активного эксперимента (например, при исследовании явлений природы). Тем не менее, учитывая преимущества активного эксперимента, тогда, когда это возможно, предпочтение отдают ему. Теория планирования экспериментов [3, 4] посвящена прежде всего активным экспериментам.

3. Влияние выбросов на коэффициент корреляции

Акад. АН СССР С.Н. Бернштейн еще в 1932 г. рассмотрел [5] следующую проблему: "Определить наименьшее возможное значение коэффициента корреляции Пирсона R между величинами X и Y, если известно, что математические ожидания их равны 0 и что существуют две константы L и такие, что всегда

. "

Пусть . В [5] показано, что минимум коэффициента корреляции R достигается при и равен

.

Для достижения минимума необходимо и достаточно, чтобы постоянно выполнялось одно из равенств .

Таким образом, минимум R достигается, когда Y есть функция X, которую можно даже предполагать монотонной, если имеем, например,

Рассмотрев численный пример, С.Н. Бернштейн заканчивает статью [5] так: "... достаточно, чтобы только один из 701 индивида не подчинился господствующему закону пропорциональности Y = 0,1X, чтобы коэффициент корреляции понизился до значения 0,198".

Таким образом, влияние выбросов на коэффициент корреляции может быть весьма велико. Следовательно, перед расчетом коэффициента корреляции необходимо исключить выбросы из выборки. Хорошо известно [1], что обоснованное исключение выбросов может быть проведено только на основе соображений предметной области, поскольку математико-статистические алгоритмы являются крайне неустойчивыми по отношению к отклонениям от функции распределения, принятой в вероятностно-статистической модели.

4. Вздувание коэффициентов корреляции

Это явление обнаружил А.Н. Колмогоров в работе 1933 г. «К вопросу о пригодности найденных статистическим путем формул прогноза» [6]. Предположим, что имеется много наборов предикторов (факторов, признаков). Для каждого из них строится наилучшее приближение отклика с помощью линейной функции от предикторов. Показателем качества приближения служит коэффициент корреляции между откликом и наилучшей линейной функцией от предикторов (в настоящее время чаще используют его квадрат, называемый коэффициентом детерминации). Эффект «вздувания» коэффициента корреляции состоит в том, что при увеличении числа проанализированных наборов предикторов заметно растет максимальный из соответствующих коэффициентов корреляции - показателей качества приближения. Создается впечатление, что тот набор предикторов, на котором достигается рассматриваемый максимум, дает хорошее приближение для отклика. Однако это впечатление развеивается при попытке использовать соответствующую зависимость для прогноза - по новым данным коэффициент корреляции между откликом и ранее найденной линейной функцией от предикторов оказывается значительно меньшим.

Источник: https://otherreferats.allbest.ru/download/1219794/