В случае, когда функция активации одна и та же для всех нейронов сети, сеть называют однородной (гомогенной).
Одной из наиболее распространенных является нелинейная функция с насыщением, так называемая логистическая функция или сигмоид (т.е. функция S-образного вида):
f (x) |
1 |
[6.1] |
1 e ax |
При уменьшении сигмоид становится более пологим, в пределе при=0 вырождаясь в горизонтальную линию на уровне 0.5. При увеличении сигмоид приближается по внешнему виду к функции единичного скачка с порогом Т в точке х=0. Из выражения для сигмоида очевидно, что выходное значение нейрона лежит в диапазоне [0,1]. Одно из ценных свойств сигмоидной функции – простое выражение для ее производной:
[6.2]
Следует отметить, что сигмоидная функция дифференцируема на всей оси абсцисс, что широко используется во многих алгоритмах обучения. Кроме того, она обладает свойством усиливать слабые сигналы лучше, чем сильные, и предотвращает насыщение от сильных сигналов, так как они соответствуют областям аргументов, где сигмоид имеет пологий наклон.
Многослойные сети прямого распространения
Класс нейронных сетей прямого распространения характеризуется наличием одного или нескольких скрытых слоев, узлы которых называются скрытыми нейронами, или скрытыми элементами. Функция последних заключается в посредничестве между внешним входным сигналом и выходом нейронной сети. Узлы источника входного слоя сети формируют соответствующие элементы шаблона активации (входной вектор), которые составляют входной сигнал, поступающий на нейроны (вычислительные элементы) второго слоя (т.е. первого скрытого слоя). Выходные сигналы второго слоя используются в качестве входных для третьего слоя и т.д. Обычно нейроны каждого из слоев сети используют в качестве входных сигналов выходные сигналы нейронов только предыдущего слоя. Набор выходных сигналов нейронов выходного (последнего)
слоя сети определяет общий отклик сети на данный входной образ, сформирован-
26
ный узлами источника входного (первого) слоя.
Рис.6.3. Многослойные сети прямого распространения.
Алгоритм обратного распространения
Согласно метода наименьших квадратов, минимизируемой целевой фун-
кцией ошибки НС является величина E(w) |
1 |
( y(j ,Np) d j , p )2 , где y(j ,Np) – ре- |
|
||
|
2 j , p |
|
альное выходное состояние нейрона j выходного слоя N нейронной сети при подаче на ее входы p-го образа; djp – идеальное (желаемое) выходное состояние этого нейрона.
Суммирование ведется по всем нейронам выходного слоя и по всем обрабатываемым сетью образам. Минимизация ведется методом градиентно-
го спуска, что означает подстройку весовых коэффициентов w( n) |
E |
, |
|
||
ij |
wij |
|
|
|
где wij – весовой коэффициент синаптической связи, соединяющей i-ый нейрон слоя n-1 с j-ым нейроном слоя n, – коэффициент скорости обучения,
0< <1. А производная определяется |
E |
|
E |
|
dy j |
|
s j |
, где под yj, подра- |
|||
|
|
|
|
|
|
||||||
w |
y |
j |
ds |
j |
w |
||||||
|
|
|
|
|
|||||||
|
ij |
|
|
|
|
|
ij |
|
|||
зумевается выход нейрона j, а под sj – взвешенная сумма его входных сигналов, то есть аргумент активационной функции. Так как множитель dyj/dsj является производной этой функции по ее аргументу, из этого следует, что производная активационной функция должна быть определена на всей оси абсцисс. В связи с этим функция единичного скачка и прочие активационные функции с неоднородностями не подходят для рассматриваемых НС. В них применяются такие гладкие функции, как гиперболический тангенс или классический сигмоид с экспонентой.
Третий множитель sj/ wij, очевидно, равен выходу нейрона предыдущего слоя yi(n-1).
Что касается первого множителя, он легко раскладывается следующим образом:
E |
|
E |
|
dyk |
|
sk |
|
E |
|
dyk |
w(jkn 1) |
|
|
|
y j |
|
|
||||||
y j k |
yk dsk |
k |
yk dsk |
||||||||
Здесь суммирование по k выполняется среди нейронов слоя n+1.
Введя новую переменную |
( n) |
|
E |
|
dy j |
мы получим рекурсивную фор- |
|
j |
y j |
ds j |
|||||
|
|
|
|
||||
|
|
|
|
|
27
мулу для расчетов величин j(n) слоя n из величин k(n+1) более старшего слоя n+1.
|
( n) |
|
|
( n 1) |
|
( n 1) |
|
dy j |
|
|||||
j |
|
k |
|
wjk |
|
|
|
|
[6.3] |
|||||
|
ds j |
|||||||||||||
|
|
|
|
k |
|
|
|
|
|
|
|
|||
|
|
|
Для выходного же слоя |
|
||||||||||
|
( N ) ( y( N ) |
d |
) |
dyl |
|
|
|
|
|
[6.4] |
||||
|
|
|
|
|
|
|||||||||
|
l |
|
|
l |
|
l |
|
dsl |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
В данном случае производная dyl вычисляется по формуле [6.2] dsl
Теперь мы можем записать в раскрытом виде:
w( n) ( n) y( n 1) |
[6.5] |
||
ij |
j |
i |
|
Иногда для придания процессу коррекции весов некоторой инерционности, сглаживающей резкие скачки при перемещении по поверхности целевой функции, дополняется значением изменения веса на предыдущей итерации:
w( n) (t) ( w(n) (t 1) (1 ) (n) y( n 1) |
) |
[6.6] |
||
ij |
ij |
j i |
|
|
где – коэффициент инерционности, t – номер текущей итерации.
Полный алгоритм обучения НС с помощью процедуры обратного распространения строится так:
Шаг 1.Подать на входы сети один из возможных образов и рассчитать результат. (Каждый нейрон вычисляет значение по формуле [6.1], в качестве функции активации использовать сигмоид.)
Шаг 2. Рассчитать (N) для выходного слоя по формуле [6.4]. Рассчитать по формуле [6.5] или [6.6] изменения весов w(N) слоя N.
Шаг 3. Рассчитать по формулам [6.3] и [6.5] (или [6.3] и [6.6]) соответственно (n) и w(n) для всех остальных слоев, n=N-1,...1.
Шаг 4. Скорректировать все веса в НС
w( n) (t) w( n) (t 1) w( n) (t) |
[6.7] |
||
ij |
ij |
ij |
|
где t – номер текущей итерации.
Шаг 5. Если ошибка сети существенна, перейти на Шаг 1. В противном случае – конец.
Принять:
– коэффициент инерционности принять равным 0.5,– коэффициент скорости обучения принять равным 0.5,– принять равным 0.3.
28
СПИСОК РЕКОМЕНДУЕМОЙ ЛИТЕРАТУРЫ
1.Андрейчиков А.В., Андрейчикова О.Н. Интеллектуальные информационные системы: Учебник. – М.: Финансы и статистика, 2004. – 424 с.
2.Гаврилова Т.А., Червинская К.Р. Извлечение и структурирование знаний для экспертных систем. – М.: Радио и связь, 1992 – 198 с.
3.Змитрович А.И. Интеллектуальные информационные системы. – Мн.: НТООО «ТетраСистемс», 1997 – 368 с.
4.Кофман А. Введение в теорию нечетких множеств. – М.: Радио и связь, 1982
– 432 с.
5.Лорьер Ж.-Л. Системы искусственного интеллекта. – М.: Мир, 1991 – 586 с.
6.Обработка знаний / Под ред. Осуга С. – М.: Мир, 1989 – 293 с.
7.Представление и использование знаний / Под ред. Уэно Т., Исидзука М. – М.:
Мир, 1989 – 220 с.
8.Яйлеткан А.А. Логика BFSN или порождающие схемы логики. – Тюмень:
ТОГИРРО, 2002 – 35 с.
9.Яйлеткан А.А. Обобщение и систематизация основ математической логики. – Тюмень: ТОГИРРО, 2002 – 373 с.
10.Яйлеткан А.А. Интеллектуальные информационные системы. – Тюмень:
ТюмТГНГУ, 2007 – 128 с.
8.ДОПОЛНИТЕЛЬНАЯ ЛИТЕРАТУРА
1.Амамия М., Танака Ю. Архитектура ЭВМ и ИИ. – М.: Мир, 1993.
2.Андрейчиков А.В., Андрейчикова О.Н. Компьютерная поддержка изобретательства (методы, системы, примеры, применения). – М.: Машиностроение,
1998.
3.Андриенко Г.Л., Андриенко Н.В. Игровые процедуры сопоставления в инженерии знаний // Сб. тр. III конференции по искусственному интеллекту. –
Тверь, 1992.
4.Батищев Д.И. Генетические алгоритмы решения экстремальных задач: Учеб. пособие. – Воронеж: Изд-во ВГТУ, 1995.
5.Борисов А.Н., Крумберг О.А., Федоров И.П. Принятие решений на основе нечетких моделей. – Рига: Зинатне, 1990.
6.Букатова И.Л. Эволюционное моделирование и его приложения. – М.: Наука,
1979.
7.Гаврилова Т.А., Хорошевский В.Ф. Базы знаний интеллектуальных систем. – СПб.: Питер, 2000.
29
8.Искусственный интеллект: В 3 кн. Кн. 1. Системы общения и экспертные системы: Справочник / Под ред. Э.В. Попова. – М.: Радио и связь, 1990.
9.Искусственный интеллект: В 3 кн. Кн. 2. Модели и методы: Справочник / Под ред. Д.А. Поспелова. – М.: Радио и связь, 1990.
10.Искусственный интеллект: В 3 кн. Кн. 3. Программные и аппаратные средства: Справочник / Под ред. В.Ф. Хорошевского. – М.: Радио и связь, 1990.
11.Корнеев В.В. и др. Базы данных. Интеллектуальная обработка информации.
–М.: Нолидж, 2000.
12.Логический подход к искусственному интеллекту: от классической логики к логическому программированию: Пер. с фр. / А. Тейз, П. Грибомон, Ж. Луи и др. – М.: Мир, 1990.
13.Нильсон Н.Дж. Искусственный интеллект. Метод поиска решений. – М.:
Мир, 1973.
14.Осипов Г.С. Приобретение знаний интеллектуальными системами. – М.:
Наука, 1997.
15.Половинкин А.И. Основы инженерного творчества. – М.: Машиностроение,
1988.
16.Хант Э. Искусственный интеллект: Пер. с англ. / Под ред. В.Л. Стефанюка.
–М.: Мир, 1978.
17.Экспертные системы. Принципы работы и примеры: Пер. с англ. / Под ред. Р. Форсайта. – М.: Радио и связь, 1987.
18.Элти Дж., Кумбс М. Экспертные системы: концепции и примеры: Пер. с англ. – М.: Финансы и статистика, 1987.
30