Материал: Методы статистического и интеллектуального анализа данных. Минаева Ю.В

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

–проектирование ВД для ответов на определенный круг вопросов;

–быстрое внедрение ВД и получение отдачи;

–упрощение процедур заполнения ВД и повышения их производительности за счет учета потребностей определенного круга пользователей.

Недостатком автономных ВД является многократное хранение данных в разных ВД, что приводит к увеличению расходов на их хранение.

ВД могут использоваться и совместно с ХД. В этом случае ХД представляет собой единый централизованный источник информации для всей предметной области, а ВД являются подмножествами данных, организованными для представления информации по тематическим разделам данной области. При этом конечные пользователи имеют возможность доступа к детальным данным хранилища, если данных в витрине недостаточно. Достоинствами такого подхода являются:

–простота создания и наполнения ВД, поскольку наполнение происходит из единого стандартизованного источника очищенных данных – хранилища;

–простота расширения СППР за счет добавления новых

ВД;

–снижение нагрузки на основное ХД.

К недостаткам можно отнести:

–избыточность (данные хранятся как в ХД, так и в ВД);

–дополнительные затраты на разработку СППР с ХД и

ВД.

4.2. OLAP–технология

комплексного

анализа

многомерных данных

 

 

В процессе анализа данных и поиска решений часто возникает необходимость в построении зависимостей между различными параметрами, число которых может варьироваться в широких пределах. Традиционные средства анализа,

61

оперирующие данными, представленными в виде таблиц реляционной база данных, не могут в полной мере удовлетворять таким требованиям, в первую очередь, из–за невозможности объединять, просматривать и анализировать данные с точки зрения множественности измерений.

Измерение – это последовательность значений одного из анализируемых параметров (например, для параметра «время» это могут быть дни или месяцы). Каждое измерение может быть представлено в виде иерархической структуры (например, год – квартал – месяц – неделя – день).

Множественность измерений предполагает представление данных в виде многомерной модели, в которой по измерениям откладываются параметры, относящиеся к анализируемой предметной области (например, время, города, должности и т.д.).

Представление данных, включающее несколько независимых измерений, вдоль которых могут быть проанализированы определенные совокупности данных, называется многомерным. Одновременный анализ по нескольким измерениям – многомерный анализ.

Многомерная модель данных может быть представлена в виде гиперкуба (рис. 13), ребра которого являются измерениями, а ячейками – меры – данные, количественно характеризующие анализируемые факты (объемы продаж).

62

Рис. 13. Представление многомерных данных в виде гиперкуба

OLAP (On–Line Analytical Processing) – технология оперативной аналитической обработки данных, использующая методы и средства для сбора, хранения и анализа многомерных данных в целях поддержки процессов принятия решений.

Основное назначение OLAP–систем – поддержка аналитической деятельности, произвольных запросов пользователе–аналитиков. Цель OLAP–анализа – проверка возникающих гипотез.

OLAP–система включает в себя два основных компонента:

–OLAP–сервер – обеспечивает хранение данных, выполнение над ними необходимых операций и формирование многомерной модели на концептуальном уровне. В настоящее время OLAP–серверы объединяют с ХД или ВД;

–OLAP–клиент – представляет пользователю интерфейс к многомерной модели данных, обеспечивая его возможностью удобно манипулировать данными для выполнения задач анализа.

OLAP–серверы скрывают от конечного пользователя способ реализации многомерной модели. Они формируют гиперкуб, с которым пользователи посредством OLAP–клиента выполняют все необходимые манипуляции, анализируя

63

данные. Между тем способ реализации очень важен, т. к. от него зависят такие характеристики, как производительность и занимаемые ресурсы.

Выделяют три основных способа реализации модели данных: многомерная, реляционная и смешанная.

Многомерные модели (MOLAP – многомерный

(multivariate) OLAP) – для реализации многомерной модели используют многомерные БД, при этом ри этом куб представляется в виде одной плоской таблицы, в которую построчно вписываются все комбинации членов всех измерений с соответствующими им значениями мер (табл. 10).

 

 

 

 

 

 

Таблица 10

 

 

 

 

 

 

 

 

 

Измерения

 

 

Меры

 

 

 

 

 

 

 

 

 

Товар

 

№

Дата

Кол–во

 

Стоимость

 

 

магазина

 

 

 

 

 

 

 

 

 

Карандаши

 

1

25.11.17

150

 

450

 

 

 

 

 

 

 

 

 

Карандаши

 

1

26.11.17

220

 

660

 

 

 

 

 

 

 

 

 

Карандаши

 

2

25.11.17

240

 

700

 

 

 

 

 

 

 

 

 

Ручки

 

1

25.11.17

110

 

810

 

 

 

 

 

 

 

 

 

Ручки

 

2

26.11.17

150

 

1020

 

 

 

 

 

 

 

 

 

Ластики

 

1

25.11.17

160

 

1050

 

 

 

 

 

 

 

 

 

Ластики

 

2

25.11.17

120

 

950

 

 

 

 

 

 

 

 

 

Ластики

 

2

26.11.17

110

 

870

 

 

 

 

 

 

 

 

 

К преимуществам использования многомерных БД в OLAP–системах относятся:

– быстрый поиск и выборка данных, т. к. многомерная база данных денормализована и содержит заранее агрегированные показатели, обеспечивая оптимизированный доступ к запрашиваемым ячейкам и не требуя дополнительных преобразований при переходе от множества связанных таблиц к многомерной модели;

64

–многомерные БД легко справляются с задачами включения в информационную модель разнообразных встроенных функций, тогда как объективно существующие ограничения языка SQL делают выполнение этих задач на основе реляционных БД достаточно сложным, а иногда и невозможным.

С другой стороны, имеются также существенные недостатки многомерных БД:

–за счет денормализации и предварительно выполненной агрегации многомерная таблица требует большего объема памяти по сравнению с реляционной БД;

–многомерные БД чувствительны к изменениям в многомерной модели. Так при добавлении нового измерения приходится изменять структуру всей БД, что влечет за собой большие затраты времени.

На основании анализа достоинств и недостатков многомерных БД можно выделить следующие условия, при которых их использование является эффективным:

–объем исходных данных для анализа не слишком велик (не более нескольких гигабайт), т. е. уровень агрегации данных достаточно высок;

–набор информационных измерений стабилен;

–время ответа системы на нерегламентированные запросы является наиболее критичным параметром;

–требуется широкое использование сложных встроенных функций для выполнения кроссмерных вычислений над ячейками гиперкуба, в том числе необходима возможность написания пользовательских функций.

Реляционная модель (ROLAP – реляционный

(relational) OLAP) – для реализации многомерной модели используют реляционные БД. В настоящее время распространены две основные схемы реализации многомерного представления данных с помощью реляционных таблиц: схема «звезда» (рис. 14) и схема «снежинка» (рис. 15).

65

Источник: https://studfile.net/preview/16563531/