Материал: Методы статистического и интеллектуального анализа данных. Минаева Ю.В

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Таблица_измерений_1 Таблица_измерений_2

id_изм_1

 

 

id_изм_2

…

 

 

…

 

 

 

 

 

 

Таблица_фактов

 

 

 

 

 

 

id_изм_1

 

 

id_изм_2

 

 

…

 

 

id_изм_n

 

 

…

 

 

 

 

 

 

 

Таблица_измерений_n

 

 

 

 

id_изм_n

 

…

 

 

 

 

 

…

 

 

 

 

 

 

Рис. 14. Схема представления многомерной модели «звезда»

Основными составляющими схемы "звезда" являются денормализованная таблица фактов и множество таблиц измерений.

Таблица фактов, как правило, содержит сведения об объектах или событиях, совокупность которых будет в дальнейшем анализироваться. Обычно говорят о четырех наиболее часто встречающихся типах фактов. К ним относятся:

–факты, связанные с транзакциями; они основаны на отдельных событиях (типичными примерами которых является телефонный звонок или снятие денег со счета с помощью банкомата);

–факты, связанные с "моментальными снимками"; они основаны на состоянии объекта (например, банковского счета)

66

в определенные моменты времени (например, на конец дня или месяца). Типичными примерами таких фактов является объем продаж за день или дневная выручка;

–факты, связанные с элементами документа – основаны на том или ином документе (например, счете за товар или услуги) и содержат подробную информацию об элементах этого документа (например, о количестве, цене, проценте скидки);

–факты, связанные с событиями или состоянием объекта – представляют возникновение события без подробностей о нем (например, просто факт продажи или факт отсутствия таковой без иных подробностей).

Таблица_измерений_11 id_изм_11

…

Таблица_измерений_1 id_изм_1

id_изм_11

…

…

Таблица_фактов

id_изм_1

…

id_изм_n

…

Таблица_измерений_n

id_изм_n

…

Рис. 15. Схема представления многомерной модели «снежинка»

67

Таблица фактов, как правило, содержит уникальный составной ключ, объединяющий первичные ключи таблиц измерений. При этом как ключевые, так и некоторые не ключевые поля должны соответствовать измерениям гиперкуба. Помимо этого таблица фактов содержит одно или несколько числовых полей, на основании которых в дальнейшем будут получены агрегатные данные.

Таблицы измерений содержат неизменяемые или редко изменяемые данные. В подавляющем большинстве случаев эти данные представляют собой по одной записи для каждого элемента нижнего уровня иерархии в измерении. Таблицы измерений также содержат как минимум одно описательное поле (обычно с именем члена измерения) и, как правило, целочисленное ключевое поле для однозначной идентификации члена измерения. Каждая таблица измерений должна находиться в отношении «один–ко–многим» с таблицей фактов.

Скорость роста таблиц измерений должна быть незначительной по сравнению со скоростью роста таблицы фактов. Например, новая запись в таблицу измерений, характеризующую товары, добавляется только при появлении нового товара, не продававшегося ранее.

Схема «снежинка» используется в более сложных задачах с иерархическими измерениями. Например, если в таблице измерений используется ссылка на категории товаров, названия которых содержатся в отдельной таблице.

Использование реляционных БД в OLAP–системах имеет следующие достоинства:

–в большинстве случаев корпоративные хранилища данных реализуются средствами реляционных СУБД, и инструменты ROLAP позволяют производить анализ непосредственно над ними. При этом размер хранилища не является таким критичным параметром, как в случае MOLAP;

–в случае переменной размерности задачи, когда изменения в структуру измерений приходится вносить

достаточно часто, ROLAP–системы с динамическим

68

представлением размерности являются оптимальным решением, т. к. в них такие модификации не требуют физической реорганизации БД;

– реляционные СУБД обеспечивают значительно более высокий уровень защиты данных и хорошие возможности разграничения прав доступа.

Главный недостаток ROLAP по сравнению с многомерными СУБД – меньшая производительность. Для обеспечения производительности, сравнимой с MOLAP, реляционные системы требуют тщательной проработки схемы базы данных и настройки индексов, т. е. больших усилий со стороны администраторов БД.

Смешанная модель (HOLAP – гибридный (hybrid)

OLAP) – для реализации модели данных используют и многомерные, и реляционные БД.

4.3. Интеллектуальный анализ данных (Data Mining)

OLAP–системы предоставляют аналитику средства проверки гипотез при анализе данных. При этом основной задачей аналитика является генерация гипотез. Он решает ее, основываясь на своих знаниях и опыте. Однако знания есть не только у человека, но и в накопленных данных, которые подвергаются анализу. Такие знания часто называют "скрытыми", т. к. они содержатся в гигабайтах и терабайтах информации, которые человек не в состоянии исследовать самостоятельно. В связи с этим существует высокая вероятность пропустить гипотезы, которые могут принести значительную выгоду.

Очевидно, что для обнаружения скрытых знаний необходимо применять специальные методы автоматического анализа, при помощи которых приходится практически добывать знания из "завалов" информации. За этим направлением закрепился термин добыча данных или Data

Mining.

69

Data Mining – исследование и обнаружение средствами искусственного интеллекта в сырых данных скрытых знаний, которые ранее не были известны, нетривиальны, практически полезны, доступны для интерпретации человеком.

Рассмотрим свойства обнаруживаемых знаний, данные в определении, более подробно.

–знания должны быть новые, ранее неизвестные;

затраченные усилия на открытие знаний, которые уже известны пользователю, не окупаются, поэтому ценность представляют именно новые, ранее неизвестные знания;

–знания должны быть нетривиальны; результаты анализа должны отражать неочевидные, неожиданные закономерности в данных, составляющие так называемые скрытые знания; результаты, которые могли бы быть получены более простыми способами (например, визуальным просмотром), не оправдывают привлечение мощных методов

Data Mining;

–знания должны быть практически полезны и

приносить определенную выгоду при их применении;

–знания должны быть доступны для понимания

человеку; найденные закономерности должны быть логически объяснимы, в противном случае существует вероятность, что они являются случайными; кроме того, обнаруженные знания должны быть представлены в понятном для человека виде.

Основными задачами, решаемыми с помощью методов

Data Mining, являются:

–задача классификации – определение класса объекта по его характеристикам, при этом множество классов, к которым может быть отнесен объект, известно заранее;

–задача регрессии – определение по известным характеристикам объекта значение некоторого его параметра;

–поиск ассоциативных правил – нахождение частых зависимостей (ассоциаций) между объектами или событиями; найденные зависимости представляются в виде правил и могут быть использованы как для лучшего понимания природы

70

Источник: https://studfile.net/preview/16563531/