4. ТЕХНОЛОГИИ МНОГОМЕРНОГО АНАЛИЗА ДАННЫХ
4.1. Основы организации обработки больших объемов данных
Большие объемы информации, используемой, например, на крупном предприятии, требуют применения специальных программных средств, предназначенных для ввода, хранения и анализа данных – систем поддержки принятия решений
(СППР, в английской терминологии DSS – Decision support system).
Основная задача СППР – предоставить специалистам – аналитикам инструмент для выполнения анализа данных. СППР не генерируют правильные решения сами, а только предоставляет аналитику данные в соответствующем виде (отчеты, графики, таблицы и т.д.) для изучения и анализа.
Задачи, решаемые с помощью СППР, в зависимости от их интеллектуальности можно разделить на три класса:
–информационно–поисковый анализ – СППР осуществляет поиск необходимых данных; характерной чертой такого анализа является выполнение заранее определенных запросов;
–оперативно–аналитический анализ – СППР производит группирование и обобщение данных в любом виде, необходимом аналитику; заранее предсказать необходимые запросы невозможно;
–интеллектуальный анализ – СППР осуществляет поиск фундаментальных логических закономерностей в накопленных данных, построение моделей и правил, которые объясняют найденные закономерности и/или прогнозируют развитие некоторых процессов.
Таким образом, обобщенно архитектура СППР включает следующие подсистемы:
1) подсистема ввода данных – выполняет операционную (транзакционную) обработку данных (Online transaction
56
processing, OLTP); для реализации этих подсистем используются обычные СУБД;
2)подсистема хранения – реализуется, как правило, с помощью современных СУБД и хранилищ данных;
3)подсистема анализа – включает следующие подсистемы:
– подсистему информационно–поискового анализа на базе реляционных СУБД и статических запросов с использованием языка структурных запросов SQL;
– подсистему оперативного анализа реализуется с помощью OLAP – технологии, использующей концепцию многомерного представления данных;
– подсистему интеллектуального анализа, реализующие методы и алгоритмы Data Mining.
OLTP–системы оперативной обработки транзакций достаточно успешно решают задачи сбора, хранения и поиска информации, однако их применение для полноценного анализа данных не является эффективным. Основной причиной этого является различие в требованиях, предъявляемых к OLTP– системам и системе анализа (табл. 9).
Противоречивость требований к OLTP–системам и системам, ориентированным на глубокий анализ информации, усложняет задачу их интеграции как подсистем единой СППР.
Внастоящее время наиболее популярным решением этой проблемы является подход, ориентированный на использовании концепции хранилищ данных. Общая идея хранилищ данных заключается в разделении базы данных для OLTP–систем и базы данных для выполнения анализа и последующем их проектировании с учетом соответствующих требований.
Хранилище данных (ХД) – интегрированный, неизменчивый, поддерживающий хронологию набор данных, организованный для целей поддержки принятия решений.
Интеграция данных в ХД заключается в приведении данных, извлеченных из разных систем, к единому формату.
57
|
|
Таблица 9 |
|
|
|
|
|
Характеристика |
Требования к OLTP– |
Требования к системе |
|
системе |
анализа |
|
|
|
|
||
|
Доступ к данным |
Запросы к данным |
|
Характер запросов |
пользователя |
могут быть |
|
осуществляется по |
произвольными и |
|
|
к данным |
|
||
заранее составленным |
заранее не |
|
|
|
|
||
|
запросам |
определены |
|
|
Должна быть |
Должна быть |
|
|
возможность в любое |
|
|
Управление |
возможность |
|
|
время добавлять, |
|
||
данными |
периодически |
|
|
изменять и удалять |
|
||
|
обновлять данные |
|
|
|
данные |
|
|
|
|
|
|
|
Допускаются неверные |
Не допускаются |
|
Качество данных |
данные из–за ошибок |
|
|
ошибки в данных |
|
||
|
ввода |
|
|
|
|
|
|
Время обработки |
|
Время отклика |
|
Время отклика системы |
системы может |
|
|
обращений к |
|
||
измеряется в секундах |
составлять несколько |
|
|
данным |
|
||
|
минут |
|
|
|
|
|
|
Характер |
|
Загрузка процессора |
|
вычислительной |
Постоянная средняя |
только при |
|
нагрузки на |
загрузка процессора |
выполнении запроса, |
|
систему |
|
но на 100% |
|
|
Основными |
Приоритетными |
|
|
являются |
|
|
Приоритетность |
приоритетами |
|
|
обеспечение гибкости |
|
||
характеристик |
являются высокая |
|
|
системы и |
|
||
системы |
производительность и |
|
|
независимости |
|
||
|
доступность |
|
|
|
работы пользователей |
|
|
|
|
|
|
Поддержка хронологии заключается в том, что для проведения анализа все данные, хранящиеся в ХВ, привязываются ко времени.
Неизменяемость – данные после загрузки в ХД только читаются. Это позволяет существенно повысить скорость доступа к данным за счет исключения операций модификации.
Все данные в ХД делятся на три основных категории:
1. Детальные данные – данные, переносимые непосредственно из OLTP–систем (например, продажи,
58
результаты наблюдений и т.д.). Принято делить все данные делятся на измерения и факты. Измерения – наборы данных, необходимые для описания событий, например, товары, города, люди. Факты – данные, отражающие сущность событий (сведения о продажах, результаты измерений…).
2.Агрегированные данные формируются на основании детальных данных путем суммирования числовых фактических данных по отдельным измерениям.
3.Метаданные – информация о содержащихся в ХД
данных:
– описание объектов предметной области, информация о которых хранится в ХД (возможные значения атрибутов объектов, источники информации об объектах и др.);
– описание категорий пользователей, использующих данные (сведения о пользователях и их категории доступа);
– места хранения данных (местоположение источников данных – серверов и рабочих станций, установленное на них программное обеспечение и др.);
– описание действий, выполненных над данными (исправление ошибок, расщепление / слияние полей и т.д.);
– время выполнения разных операций над данными (загрузка, агрегирование, извлечение…);
– причины, повлекшие выполнение над данными тех или иных операций (требования пользователей, статистика обращений к данным и т.д.).
В зависимости от способа организации ХД можно разделить следующим образом:
1. Виртуальные ХД – данные не копируются из источников информации в единое хранилище, а извлекаются, преобразуются и интегрируются непосредственно при выполнении аналитических запросов в оперативной памяти компьютера. Достоинством виртуальных ХД является минимизация объема памяти, занимаемой на носителе информации, но при этом они обладают следующими недостатками:
– большое время обработки запросов;
59
–временная недоступность хотя бы одного источника информации может привести либо к невыполнению аналитического запроса, либо к ошибочным результатам;
–требуются значительные ресурсы компьютеров, что приводит к снижению производительности OLTP–систем, что является недопустимым, т.к. время выполнения операций в таких системах часто бывает критичным;
–сложность формирования единого непротиворечивого взгляда на объект исследования из–за различий в форматах данных, несинхронностью моментов обновления данных в разных источниках информации и т.д.;
–практическая невозможность получения данных за долгий период времени, т.к. доступны только те данные, которые на момент запроса есть в источнике; устаревшие данные могут быть уже удалены или выгружены в архив.
2. Физические ХД – отформатированные данные физически размещаются на носителе, что связано с решением следующих проблем:
–потребность в эффективном хранении и обработке очень больших объемов информации;
–повышенные требования к безопасности данных. Снижения затрат на создания ХД можно добиться,
используя витрину данных (ВД) – упрощенный вариант ХД, содержащий только тематически объединенные данные.
ВД максимально приближена к конечному пользователю и содержит данные, тематически на него ориентированной (например, данные только по конкретному отделу или городу). ВД существенно меньше по объему, чем ХД, и для ее реализации не требуется больших затрат. Они могут быть реализованы как самостоятельно, так и вместе с ХД.
Самостоятельные (автономные) ВД часто встречаются в организациях с большим количеством независимых подразделений, решающих собственные аналитические задачи. Достоинствами такого подхода являются:
60