Минобрнауки России
Филиал федерального государственного бюджетного
образовательного учреждения
высшего профессионального образования
"Российский государственный гуманитарный университет" в г. Георгиевске Ставропольского края
Направление
подготовки "Прикладная информатика"
Контрольная работа
Статистический
пакет Statistica for Windows
Немченко Лариса Олеговна
студентка 3-го курса
заочного отделения
Проверил: Горохова И.Ю.
Георгиевск
2015
Оглавление
Введение
Глава 1. Программный пакет Statistica
Глава 2. Описательные статистики и графики
Глава 3. Группировка
Глава 4. Корреляции
Глава 5. Методы множественной регрессии
Глава 6. Непараметрические статистики
Глава 7. Дисперсионный анализ (ANOVA/MANOVA)
Заключение
Список
используемой литературы и источников
Введение
Окружающий нас мир насыщен информацией - разнообразные потоки данных окружают нас, захватывая в поле своего действия, лишая правильного восприятия действительности. Не будет преувеличением сказать, что информация становится частью действительности и нашего сознания.
Без адекватных технологий анализа данных человек оказывается беспомощным в жестокой информационной среде и скорее напоминает броуновскую частицу, испытывающую жестокие удары со стороны и не имеющую возможности рационально принять решение.
Статистика позволяет компактно описать данные, понять их структуру, провести классификацию, увидеть закономерности в хаосе случайных явлений. Удивительно, что даже простейшие методы визуального и разведочного анализа данных позволяют существенно прояснить сложную ситуацию, первоначально поражающую нагромождением цифр.
Идея состоит в том, чтобы вывалить из мешка различные методы, написав
своего рода популярную энциклопедию всевозможных методов анализа данных, и
позволить пользователю, применяя систему STATISTICA, свободно
экспериментировать с этими методами.
Глава 1. Программный пакет Statistica
Statistica - программный пакет для статистического анализа, разработанный компанией StatSoft, реализующий функции анализа данных, управления данных, добычи данных, визуализации данных с привлечением статистических методов.
Существуют различные варианты пакета в зависимости от целей и задач пользователя:
· однопользовательская версия (single-user);
· сетевая версия (concurrent network) - для использования в локальных вычислительных сетях;
· enterprise-версия - для использования в крупных организациях;
· веб-версия - для использования в крупных сетях через веб-браузер.
Также существуют различные комплекты поставки в зависимости от включённых функций:
· Base - набор основных статистик и методов для разведочного анализа.
· Advanced - включает все возможности продукта Base, а также модули углубленных линейных и нелинейных моделей, многомерных технологий анализа данных, анализа мощности и интервального оценивания.
· Quality Control (контроль качества) - включает методы управления качеством данных, а также контрольные карты презентационного качества.
· Automated Neural Networks - включает методы для нейросетевых исследований.
· Data Miner - включает методы добычи данных.
· Text Miner - дополнительная возможность для добычи данных над текстами.
· Process Optimization - возможности проводить мониторинг процессов, идентифицировать и предотвращать проблемы, относящиеся к контролю качества на производстве.
· Monitoring and Alerting Server (MAS) (сервер мониторинга и предупреждений) - средства для централизованного автоматизированного мониторинга различных процессов и параметров продуктов
Пакет обладает широкими графическими возможностями, позволяет выводить информацию в виде различных типов графиков (включая научные, деловые, трёхмерные и двухмерные графики в различных системах координат, специализированные статистические графики - гистограммы, матричные, категорированные графики и др.), все компоненты графиков настраиваются.
Программа вычисляет практически все используемые описательные статистики общего характера: медиану, моду, квартили, заданные пользователем процентили, среднее значение и стандартное отклонение, квартильный размах, доверительные интервалы для среднего, асимметрию и эксцесс (и их стандартные ошибки), гармоническое и геометрическое среднее, а также многие специальные описательные статистики.
Как и во всех других модулях системы STATISTICA, в разведочном анализе данных доступны разнообразные графики и диаграммы, в т.ч. различные виды диаграмм размаха и гистограмм, гистограммы двумерных распределений (трехмерные и категоризованные), двух- и трехмерные диаграммы рассеяния с помеченными подмножествами данных, нормальные и полунормальные вероятностные графики и графики с исключенным трендом, графики квантиль-квантиль, вероятность-вероятность и т.д.
Имеется набор критериев для подгонки нормального распределения к данным (критерии Колмогорова-Смирнова, Лилиефорса и Шапиро-Уилкса).
Практически все описательные статистики и графики могут быть построены для данных, категоризованных (сгруппированных) по значениям одной или нескольких группирующих переменных.
Например, с помощью нескольких щелчков мыши можно сгруппировать имеющиеся данные о людях по полу и возрасту, а затем просмотреть категоризованные гистограммы, диаграммы размаха, нормальные вероятностные графики, диаграммы рассеяния и т.д. В случае, если было выбрано более двух категоризованных переменных, автоматически будет построен каскад соответствующих графиков.
Имеется возможность производить категоризацию по числовым (непрерывным) переменным, например, можно потребовать, чтобы значения переменной были разбиты на заданное число интервалов; с помощью инструмента перекодировки можно в реальном времени задать специальный способ перекодировки переменной (возможна категоризация практически любой сложности, заданная через соотношения между любыми переменными файла данных).
В дополнение к этому, в системе имеется специализированная процедура иерархической группировки, позволяющая осуществлять категоризацию данных по многим (до шести) переменным и строить различные категоризованные графики, описательные статистики и корреляционные матрицы для подгрупп (пользователь может в интерактивном режиме игнорировать некоторые факторы в полной таблице группировок и исследовать статистики по маргинальным таблицам).
Многочисленные возможности форматирования и расстановки меток позволяют получать таблицы и отчеты презентационного качества, содержащие длинные метки и описания переменных. При этом важно отметить, что процедура группировки выполняется для чрезвычайно больших объемов данных (например, по одной категоризующей переменной можно построить до 300 групп), а ее результаты содержат все соответствующие статистики дисперсионного анализа (включая полные таблицы ANOVA, критерии проверки гипотез типа критерия Левена однородности дисперсии, семь различных апостериорных (post-hoc) критериев и т.д.).
Как и во всех других модулях системы STATISTICA, для достижения высокой - не имеющей аналогов в сравнении с другими пакетами - точности результатов здесь можно производить вычисления с повышенной точностью (если нужно - с четырехкратной).
В дополнение к большому числу готовых статистических графиков пользователь может самостоятельно задавать различные типы визуализации исходных данных, описательных статистик, взаимосвязей между статистиками, группировок и категоризаций с помощью средств прямого доступа (point-and-click), что позволяет существенно упростить задачу. Средства графического разведочного анализа объединены с собственно статистическими процедурами, что существенно облегчает визуальный анализ данных (например, в интерактивном режиме можно удалять выбросы, выделять подмножества данных, осуществлять сглаживание и подгонку функций, а богатые средства работы с кистью позволяют легко выявлять и/или выделять нужные данные).
В системе имеется большой набор методов для исследования корреляций между переменными. Прежде всего, могут быть вычислены все основные характеристики связи между переменными, в том числе: коэффициент корреляции Пирсона r, коэффициент ранговой корреляции Спирмена R, тау (b, c) Кендалла, Гамма, тетрахорический r, Фи, V Крамера, коэффициент сопряженности C, D Соммера, коэффициенты неопределенности, частные и получастные корреляции, автокорреляции, различные меры расхождения и т.д.
Нелинейные корреляции, регрессия для цензурированных данных и другие более специализированные меры корреляции реализованы в модулях STATISTICA Advanced Linear/Non-Linear Models: Нелинейное оценивание и Анализ выживаемости.
Корреляционные матрицы могут быть вычислены с построчным, попарным удалением пропусков или с подстановкой среднего вместо пропущенных значений. Как и во всех других модулях системы STATISTICA, для достижения высокой - не имеющей аналогов среди других пакетов - точности результатов здесь можно производить вычисления с повышенной точностью (если нужно - с четырехкратной). Как и все численные результаты, корреляционные матрицы в системе STATISTICA выводятся в виде таблиц, имеющих богатые возможности форматирования данных (см. ниже) и визуализации численных результатов; так, можно "указать" на конкретный корреляционный коэффициент и вызвать для него контекстное меню всевозможных "описательных диаграмм" (диаграммы рассеяния с доверительными интервалами, различные объемные гистограммы двумерных распределений, вероятностные графики и т.д.).
Богатые средства закрашивания позволяют выделять (или, наоборот, затенять) отдельные точки на диаграмме рассеяния и таким образом оценивать их влияние на положение линии регрессии (и других подогнанных кривых).
Таким образом исследуются, например, выбросы или резко выделяющиеся наблюдения.
Поддерживаются разнообразные форматы глобального вывода корреляций; значимые коэффициенты корреляции могут автоматически выделяться цветом, каждую ячейку таблицы результатов можно расширить и посмотреть число n наблюдений, по которым вычислен коэффициент и уровень значимости p, можно запросить подробные результаты, включающие все описательные статистики (попарные средние и стандартные отклонения, B-веса, пересечения, и т.д.).
Как и все численные результаты, корреляционные матрицы выводятся в виде
таблиц, поддерживающих операцию масштабирования и интерактивно управляемый
формат вывода значащих цифр (например, от +0.4 до +0.41358927645193); таким
образом, матрицы больших размеров можно сжимать (с помощью операции уменьшения,
либо изменением формата вывода, что делается перетягиванием границ столбцов с
помощью мыши). Это облегчает зрительное восприятие и, в частности, помогает
быстро находить коэффициенты, превосходящие заданную величину или имеющие
определенный уровень значимости (соответствующие ячейки в таблице результатов
будут помечены красным цветом).
Глава 5. Методы множественной регрессии
В модуле Множественная регрессия реализован полный набор методов линейной регрессии. Эти методы включают простую, множественную, пошаговую регрессию (с пошаговым/блоковым включением или исключением предикторов), иерархическую, нелинейную (полиномиальную, экспоненциальную, логарифмическую и т.д.) и гребневую (ридж) регрессию, с включением или без включения константы (свободного члена), модели взвешенных наименьших квадратов.
Программа вычисляет полный набор статистик и дополнительных анализов, включая полную таблицу регрессии (со значениями стандартной ошибки для B, Beta и свободного члена, коэффициента детерминации R2 и скорректированного R2 для моделей с константой и без нее и таблицей дисперсионного анализа), матрицы частных и получастных корреляций, корреляции и ковариации коэффициентов регрессии, матрицу выметания (обратную матрицу), статистику Дарбина-Уотсона d, расстояния Махаланобиса и Кука, удаленные остатки, доверительные интервалы для предсказанных значений и многие другие статистики.
Значения зависимой переменной для отдельных наблюдений можно просмотреть визуально с помощью разведочных пиктографиков и других многомерных графиков, доступных непосредственно из меню таблицы результатов. Остаточные и предсказанные значения можно автоматически добавлять к текущему файлу данных. Процедура прогнозирования позволяет проводить анализ типа "что-если" и интерактивно вычислять предсказанные значения по задаваемым с клавиатуры значениям предикторов.
В системе STATISTICA можно проанализировать чрезвычайно большие планы (более 500 переменных). Кроме того, имеются дополнительные средства (специальный аппарат) для сверхбольших задач регрессии (с тысячами переменных), двуступенчатый метод наименьших квадратов, преобразования Бокса-Кокса и Бокса-Тидвелла.
Система STATISTICA имеет также специальные модули общего нелинейного
оценивания с помощью которых, можно оценить практически любую определенную
пользователем нелинейную модель и где имеется целый ряд предопределенных
моделей, включая логит-, пробит- модели и др. В системеSTATISTICA также имеется
дополнительный модуль SEPATH - Моделирование структурными уравнениями, который
позволяет анализировать чрезвычайно большие матрицы корреляций, ковариаций и
моментов (для моделей со свободным членом).
Модуль Непараметрическая статистика содержит полный набор непараметрических статистик, включая все стандартные тесты и некоторые специальные прикладные статистики, в частности, критерий Вальда-Вольфовица, U тест Манна-Уитни (с точными вероятностями вместо нормальных аппроксимаций для малых выборок), критерии Колмогорова-Смирнова, критерий Вилкоксона парных сравнений, ранговый дисперсионный анализ Краскела-Уоллиса, медианный тест, критерий знаков, ранговый дисперсионный анализ Фридмана, Q- критерий Кохрена, критерий МакНемара, коэффициент конкордации Кендалла, тау (b, c) Кендалла, ранговая корреляция Спирмена R, точный критерий Фишера, критерии хи-квадрат, статистики V-квадрат, Фи, Гамма, d Соммера, коэффициенты сопряженности и другие (специальные непараметрические критерии и статистики входят также в состав некоторых других модулей, см., например, Анализ выживаемости, Анализ процессов STATISTICA и др.)
Все (ранговые) критерии могут работать с совпадающими рангами и вносят
поправку на малый объем выборки и совпадающие ранги. Как и во всех других
модулях системы STATISTICA, процедуры всех критериев снабжены разнообразными
графическими инструментами (здесь доступны различные типы диаграмм рассеяния,
специальные диаграммы размаха, линейные графики, гистограммы и много других
двух- и трехмерных графиков).