МИНИСТЕРСТВО ОБРАЗОВАНИЯ И НАУКИ РОССИЙСКОЙ ФЕДЕРАЦИИ
ФГБОУ ВО «Воронежский государственный технический университет»
Ю.В. Минаева
МЕТОДЫ СТАТИСТИЧЕСКОГО И ИНТЕЛЛЕКТУАЛЬНОГО АНАЛИЗА ДАННЫХ
Утверждено учебно–методическим советом университета в качестве учебного пособия
Воронеж 2017
УДК 681.3.(075.8)
ББК 22.172 я 7 М613
Минаева Ю.В. Методы статистического и интеллектуального анализа данных: учеб. пособие / Ю.В. Минаева. – Воронеж: ФГБОУ ВО «Воронежский государственный технический университет», 2017. 90 с.
В учебном пособии рассматриваются теоретические сведения о классических статистических методах анализа данных (корреляционный, регрессионный, дисперсионный и др. виды анализа) и о современных методах интеллектуальной обработки накопленной информации, используемых для получения новых полезных знаний (OLAP–анализ и Data Mining).
Издание соответствует требованиям Федерального государственного образовательного стандарта высшего образования по направлению 09.03.01 «Информатика и вычислительная техника» (направленность «Системы автоматизированного проектирования»), дисциплине «Методы обработки данных».
Ил. 18. Табл. 12. Библиогр.: 11 назв.
Рецензенты: кафедра программирования и информационных технологий
Воронежского государственного университета (зав. кафедрой, канд. физ.–мат. наук, доц. Н.А. Тюкачев); канд. техн. наук, доц. Ю.В. Литвиненко
©Минаева Ю.В., 2017
©ФГБОУ ВО «Воронежский государственный технический университет», 2017
ВВЕДЕНИЕ
С развитием науки и техники все более актуальной становится задача обработки накопленной информации с целью получения новых знаний. Для решения этой задачи к настоящему времени разработано большое количество методов, относящихся как к классической теории статистики, так и к современному популярному направлению интеллектуальной обработки многомерных данных.
Методы математической статистики (корреляционный, регрессионный, дисперсионный и др. виды анализа) позволяют специалистам–аналитикам выявлять закономерности и делать обоснованные выводы и прогнозы и оценивать вероятности их выполнения. Развивающиеся в настоящее время методы обработки многомерных данных, такие как OLAP–анализ и Data Mining, предполагают активное использование средств искусственного интеллекта для получения новых полезных знаний, скрытых в больших объемах накопленной информации.
В современных условиях функционирование практически любого предприятия немыслимо без процессов сбора и хранения данных, поэтому методы анализа информации являются общеупотребительным инструментом, используемым в плановых, аналитических и маркетинговых отделах производственных и торговых предприятий, банков и страховых компаний, правительственных и медицинских учреждений.
Учебное пособие содержит теоретические сведения о типовых задачах анализа информации и методах их решения. Для удобства изучения все рассматриваемых методы обработки данных объединены в следующие группы: методы описательной статистики, методы анализа статистических связей, методы классификации и редукции данных, технологии многомерного анализа данных.
3
1. ОБРАБОТКА ДАННЫХ С ПОМОЩЬЮ МЕТОДОВ ОПИСАТЕЛЬНОЙ СТАТИСТИКИ
1.1. Основные понятия и задачи математической статистики
При исследовании различных технических и экономических процессов часто приходится сталкиваться с событиями, имеющими случайную природу. Как известно, для описания случайных величин с заданными вероятностными характеристиками (например, законом распределения, математическим ожиданием и дисперсией) эффективно используется аппарат теории вероятности, однако, если статистические характеристики исследуемого объекта неизвестны, а есть только результаты наблюдений над ним, то для их обработки используются методы математической статистики.
Математическая статистика – наука, изучающая методы исследования закономерностей в массовых случайных явлениях и процессах по данным, полученным из конечного числа наблюдений за ними.
Основными задачами математической статистики являются:
–оценка неизвестных характеристик случайной
величины;
–проверка статистических гипотез, т.е. предположений
ораспределении вероятностей наблюдаемой случайной величины;
–установление формы и степени связи между случайными величинами.
Приведем основные определения, необходимые для дальнейшего изучения методов обработки данных наблюдений за исследуемым объектом.
В зависимости от характера принимаемых значений случайная величина может быть дискретной, т.е. принимать
4
только значения из определенного набора, или непрерывной, т.е. принимать любые значения.
Генеральная совокупность – все множество возможных значений исследуемой случайной величины X.
Случайная выборка из генеральной совокупности X
– совокупность случайных величин x1, x2 ,..., xn , полученных
в результате n наблюдений за случайной величиной X, при этом число n – объем случайной выборки.
Целью изучения любой выборки является получение информации о генеральной совокупности, поэтому выборка должна быть репрезентативной (представительной), т.е.
правильно отражать пропорции генеральной совокупности. Это достигается с помощью выполнения следующих требований:
–каждый элемент xi , i 1,...,n , выбирается случайно и независимо от других;
–все элементы xi имеют одинаковую вероятность
попасть в случайную выборку;
– объем выборки n должен быть настолько велик, чтобы позволять решать задачу с требуемой точностью.
Характеристики случайных величин, полученные по генеральной совокупности, называются теоретическими (генеральными); характеристики, полученные по выборке из генеральной совокупности – эмпирическими (выборочными)
Статистические показатели, характеризующие случайную выборку, могут быть абсолютными и относительными.
Абсолютные показатели представляют собой суммарные значения тех или иных признаков, вычисленных по выборке (или генеральной совокупности) в целом или по ее части.
Относительные показатели определяются как отношение одного абсолютного показателя к другому.
Исследование случайных величин с помощью методов математической статистики проводится в три этапа:
5