Контрольная работа: Функции принадлежности. Нечеткие деревья решений

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Графическая иллюстрация дерева решений


Область применения деревья решений в настоящее время широка, но все задачи, решаемые этим аппаратом могут быть объединены в следующие три класса:

Описание данных: Деревья решений позволяют хранить информацию о данных в компактной форме, вместо них мы можем хранить дерево решений, которое содержит точное описание объектов.

Классификация: Деревья решений отлично справляются с задачами классификации, т.е. отнесения объектов к одному из заранее известных классов.

Целевая переменная должна иметь дискретные значения.

Регрессия: Если целевая переменная имеет непрерывные значения, деревья решений позволяют установить зависимость целевой переменной от независимых(входных) переменных. Например, к этому классу относятся задачи численного прогнозирования(предсказания значений целевой переменной).

. Алгоритм построения нечеткого дерева решений

Главной идеей в таком подходе является сочетание возможностей деревьев решений и нечеткой логики,. Отличительной чертой деревьев решений является то, что каждый пример определенно принадлежит конкретному узлу. В нечетком случае это не так. Для каждого атрибута необходимо выделить несколько его лингвистических значений и определить степени принадлежности примеров к ним. Вместо количества примеров конкретного узла нечеткое дерево решений группирует их степень принадлежности. Коэффициент - это соотношение примеров узла N для целевого значения i, вычисляемый как:, где μN(Dj) - степень принадлежности примера Dj к узлу N, μi(Dj) - степень принадлежности примера относительно целевого значения i, S N - множество всех примеров узла N. Затем находим коэффициент, обозначающий общие характеристики примеров узла N. В стандартном алгоритме дерева решений определяется отношение числа примеров, принадлежащих конкретному атрибуту, к общему числу примеров. Для нечетких деревьев используется отношение, для расчета которого учитывается степень принадлежности.

Выражение даѐт оценку среднего количества информации для определения класса объекта из множества P N. На следующем шаге построения нечеткого дерева решений алгоритм вычисляет энтропию для разбиения по атрибуту A со значениями aj: , где узел N|j - дочерний для узла N. Алгоритм выбирает атрибут с максимальным приростом информации.

Узел N разбивается на несколько подузлов N|j. Степень принадлежности примера Dk узла N|j вычисляется пошагово из узла N как, где μi(Dk,aj) показывает степень принадлежности Dk к атрибуту aj. Подузел N|j удаляется, если все примеры в нем имеют степень принадлежности, равную нулю. Алгоритм повторяется до тех пор, пока все примеры узла не будут классифицированы либо пока не будут использованы для разбиения все атрибуты.

Принадлежность к целевому классу для новой записи находится по формуле, где - коэффициент соотношения примеров листа дерева l для значения целевого класса k, μl(Dj) - степень принадлежности примера к узлу l, χk - принадлежность значения целевого класса k к положительному значению исхода классификации.

. Пример: построение дерева решений о выдаче кредита

В таблице 1 представлены данные о семи клиентах банка: проживание в регионе (в годах), доход (в денежных единицах) и рейтинг выдачи ему кредита. Необходимо построить нечеткое дерево решений, с помощью которого определить рейтинг выдачи кредита для клиента, который проживает в регионе 25 лет, и доход его составляет 32 000 (будет решаться задача регрессии).

Таблица - Обучающие примеры для построения нечеткого дерева решений

Проживание в регионе

Доход

Рейтинг

D1

0

10 000

0.0

D2

10

15 000

0.0

D3

15

20 000

0.1

D4

20

30 000

0.3

D5

30

25 000

0.7

D6

40

35 000

0.9

D7

40

50 000

1.0


Предположим, что атрибут "проживание в регионе" может принимать значения "временно", "продолжительно", "постоянно", а атрибут "доход" - "малый", "средний" и "высокий". Степень принадлежности каждого примера к значениям атрибутов представлена в таблице ниже. Общий вид функции для атрибутов показан на графики функций принадлежности


Степень принадлежности примеров к атрибутам

Проживание в регионе

Доход


Временно

Продолжительно

Постоянно

Малый

Средний

Высокий

D1

1

0

1

0

0

D2

0,8

0,2

0

0,6

0,4

0

D3

0,5

0,5

0

0,1

0,9

0

D4

0,2

0,8

0

0

1

0

D5

0

0,5

0,5

0

1

0

D6

0

0

1

0

0,6

0,4

D7

0

0

1

0

0

1


В начале необходимо найти значение - общая энтропия.да = 0 + 0 + 0,1 + 0,3 + 0,7 + 0,9 + 1,0 = 3, Pнет = 1 + 1 + 0,9 + 0,7 + 0,3 + 0,1 + 0 = 4,

= Pда + Pнет = 3 + 4 = 7, бит.

Теперь рассчитаем E(SN, проживание в регионе). P да временно = min(0;1) + min(0;0,8) + min(0,1;0,5) + min (0,3;0,2) + min(0,7;0) + min(0,9;0) + min(1;0) = 0 + 0 + 0,1 + 0,2 + 0 + 0 + 0 = 0,3P нет временно = min(1;1) + min(1;0,8) + min(0,9;0,5) + min (0,7;0,2) + min(0,3;0) +min(0,1;0) + min(0;0) = 1 + 0,8 + 0,5 + 0,2 + 0 + 0 + 0 = 2,5 P временно = 0,3 + 2,5 = 2,8 E(проживание в регионе, временно)= бит. Для продолжительного и постоянного проживания в регионе проводятся аналогичные вычисления. Результат сведем в итог расчетов для атрибута "проживание в регионе"


Временно

Продолжительно

Постоянно

Рда

0,3

0,9

2,4

Рнет

2,5

1,7

0,4

Е в битах

0,491

0,931

0,592


Отсюда находим энтропию: E(SN, проживание в регионе) = бит. Рассчитаем прирост информации для данного атрибута. G(SN, проживание в регионе) = 0,985 - 0,653 = 0,332 бит. Проводя подобные вычисления для атрибута "доход", получаем E(SN, доход) = 0,691 бит, G(SN, доход) = 0,294 бит. Максимальный прирост информации обеспечивает атрибут "проживание в регионе", следовательно, разбиение начнется с него. На следующем шаге алгоритма необходимо для каждой записи рассчитать степень принадлежности к каждому новому узлу по формуле. Пример в таблице ниже.

К узлам [проживание в регионе = временно и доход = высокий] и [проживание врегионе = продолжительно и доход = высокий] не принадлежит ни одна запись, поэтому они удаляются из дерева. Для каждого узла находятся коэффициенты PNi. Полученное дерево представленона рисунке ниже после таблицы.

Принадлежность записей новым узлам дерева

Проживание в регионе

Временно

продолжительно

Постоянно

Малый

Средний

Высокий

Малый

Средний

Высокий

Малый

Средний

Высокий

D1

1

0

0

0

0

0

0

0

0

D2

0.6

0.4

0

0.2

0.2

0

0

0

0

D3

0.1

0.5

0

0.1

0.5

0

0

0

0

D4

0

0.2

0

0

0.8

0

0

0

0

D5

0

0

0

0

0.5

0

0

0.5

0

D6

0

0

0

0

0

0

0

0.6

0.4

D7

0

0

0

0

0

0

0

1


Графическая иллюстрация  полученного нечеткого дерева решений


Теперь определим кредитный рейтинг для клиента, проживающего в регионе 25 лет, и с доходом 30 000.За положительный исход в данной задаче принято одобрение в выдаче кредита, поэтому χ да = 1,0, χнет = 0,0. Новый клиент принадлежит к двум узлам: [проживание в регионе = продолжительно и доход = средний] и [проживание в регионе = постоянно и доход = средний], со степенями 0,8 и 0,2 соответственно. Подставляя полученные значения в формулу, рассчитываем кредитный рейтинг

.

В итоге мы получили кредитный рейтинг, равный 0,395. Он означает, что степень принадлежности записи к тому, что кредит клиенту будет выдан, равна 0,395, а к невыдаче - 0,605. Следовательно, этому клиенту банком будет отказано.

Решая задачу классификации, выбирается тот класс i, для которого значение Pi максимально.

Применение и основные выводы.

Нечеткие деревья решений применяются в Data Mining как для решения задач классификации, так и для решения задачи регрессии, когда необходимо знать степени принадлежности к тому или иному исходу. Они могут быть использованы в различных областях: в банковском деле для решения задачи скоринга, в медицине для диагностики различных заболеваний, в промышленности для контроля качества продукции и так далее.

Безусловным достоинством данного подхода является высокая точность классификации, достигаемая за счет сочетания достоинств нечеткой логики и деревьев решений. Процесс обучения происходит быстро, а результат прост для интерпретации. Так как алгоритм способен выдавать для нового объекта не только класс, но и степень принадлежности к нему, это позволяет управлять порогом для классификации.

Однако для этого необходим репрезентативный набор обучающих примеров, в противном случае сгенерированное алгоритмом дерево решений будет слабо отражать действительность и, как следствие, выдавать ошибочные результаты.

ЧАСТЬ 3

Описать cовременное практическое применение механизмов анализа нечеткой информации

Различные типы интеллектуальных систем имеет свои особенности, например, по возможностям обучения, обобщения и выработки результатов, что делает их наиболее пригодными для решения одних классов задач и менее пригодными - для других.

Различные нейропакеты помогают успешно решать такие задачи, как оценка рейтинга ценных бумаг (нейропакет S&PCBRS); контроль валютных операций в двадцати трех странах мира (Inspector); анализ займов, кредитное планирование и прогноз экономической активности (Nexpert Object); формирование портфеля ценных бумаг (Open Interface); оценка кредитных займов, прогноз курсов валют, анализ биржевой и рыночной активности, прогноз экономических и биржевых индексов (BrainMaker); биржевые прогнозы, проверка подлинности кредитных карт (HNC). Помимо анализа финансовой деятельности нейросети успешно справляются с идентификацией непривычных для людей образов, распознаванием речи (Avalanche), синтезом речи и текста (Back propagation), управлением роботом (Cerebellatron), идентификация написанных от руки символов (Неокогнитрон, Япония) нечеткий решение функция принадлежность

Нечеткие деревья решений применяются в Data Mining <http://www.basegroup.ru/glossary_ajax/definitions/data_mining> как для решения задач классификации, так и для решения задачи регрессии, когда необходимо знать степени принадлежности к тому или иному исходу. Они могут быть использованы в различных областях: в банковском деле для решения задачи скоринга <http://www.basegroup.ru/glossary_ajax/definitions/scoring>, в медицине для диагностики различных заболеваний, в промышленности для контроля качества продукции и так далее.

Безусловным достоинством данного подхода является высокая точность <http://www.basegroup.ru/glossary_ajax/definitions/precision> классификации, достигаемая за счет сочетания достоинств нечеткой логики и деревьев решений. Процесс обучения происходит быстро, а результат прост для интерпретации. Так как алгоритм способен выдавать для нового объекта не только класс, но и степень принадлежности к нему, это позволяет управлять порогом для классификации.

Однако для этого необходим репрезентативный набор обучающих примеров, в противном случае сгенерированное алгоритмом дерево решений будет слабо отражать действительность и, как следствие, выдавать ошибочные результаты.


СПИСОК ИСПОЛЬЗУЕМОЙ ЛИТЕРАТУРЫ

http://www.stgau.ru/company/personal/user/8068/files/lib.pdf://stu.scask.ru/book_ins.php?id=26://www.pcweek.ru/themes/detail.php?ID=43833

Обработка нечеткой информации в системах принятия решений А.Н.Борисов, 1989

Лекции по принятию решений в условиях нечеткой информации Губко М.В. 2004

Источник: https://www.bibliofond.ru/detail.aspx?id=827248