Материал: Модели и алгоритмы проектирования и разработки систем поддержки принятия инвестиционных решений. Морозов В.П., Баркалов С.А

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

данного терминологического портрета представляется следующим образом: Экономический кризис (0,1): финансовый кризис (0,3) производственный кризис (0,3) внешний долг (0,3).

Определение 3.3.2. Подсистемой весовой обработки информации на задан-

ном терминологическом портрете будем называть четверку:

 

(Z,D,M, ),

(3.40)

где Z – терминологический портрет Z0 T ; D – коллекция

документов;

М-множество запросов; – отображение, :M [0,1] 2D [0,1] сопоставляет каж-

дойпаре(запрос,точностьподобия) множествопар(документ,меракорреляции). Остальные определения 3-6 и рассуждения, приведенные в [112], приемлемы для данного случая. Отличие заключается в механизме распределения запросов по подсистемам поиска. Применительно к тезаурусу [112] нагрузка на информационные подсистемы поиска равномерная. Применительно к терминологическому портрету нагрузка на информационные подсистемы поиска избирательная, зависящая от весов терминов. В данном случае ответ подсистемы

обработки информацииQ на запрос m = zi gi с точностью c будет определяться в соответствии с выражением

Q n

i (zi gi,c)

 

 

i 1

 

, (3.41)

n

( (d, ):d D zi gi ct(d) (zi gi,t(d)) ) D [0,1]

i 1

где c – отношение правдоподобия. При определении ответа N (m,c) отношение подобия c осуществляет выбор документов, точность подобия которых не менее с. Мера корреляции (m,t(d)) показывает, какая часть информации в документе соответствует ответу на вопрос. Если документ d Dс мерой корреляции включен в ответ, т.е. (d, ) (m,c), то верно неравенство c.

Один из возможных алгоритмов реализации механизма обработки терминологического портрета заключается в следующем. На начальном этапе информационные подсистемы отыскивают и обобщают информацию до определенного порогового значения c для термина с максимальным весом. Затем для более меньшего веса, и т. д вплоть до термина с наименьшим весом.

Разработанная математическая модель подсистемы весовой обработки информации на заданном терминологическом портрете (3.41) позволяет составлять ответы на запросы более гибко, с учетом неопределенности описания как документов, так и запросов, по сравнению с простой распределенной информационной подсистемой, а также перераспределять нагрузку на локальные информационные подсистемы в зависимости от значимости обслуживаемых терминов.

Рассмотрим синтез структуры распределенной информационной системы.

176

3.4. Синтез структуры распределенной информационной системы

Пусть Sj = (Tj, Dj, Mj, j ), j 1, – локальные информационные систе-

мы, предназначенные для обеспечения функционирования сложной управляющей системы, состоящей из совокупности К = {1, …, } объектов. Информация

с каждой локальной информационной системы поступает в центр сбора информации для дальнейшей передачи ее управляющему органу. Одна локальная информационная система может обслуживать несколько объектов.

Распределенная информационная система S = (T, D, M, ) определяется

через локальные составляющие:

 

 

1)

T UTj ; Rj R (Tj Tj ); K j K (T0 j T0 j );

(3.42)

 

j

 

 

 

2)

D U Dj ;

 

 

(3.43)

 

j

 

 

 

3)

(K U Kj ) (

(M j M j ));

(3.44)

 

j

~ j

~ j

 

4)

m M j

(m) d :d D m t(d) .

(3.45)

 

 

 

~

 

Распределенная информационная система выступает в роли центра сбора и обработкиинформации,т.е.обработкиответовна запросы управляющихорганов.

Для формализации задачи введем обозначения: cjl – стоимость сбора информации о l-м объекте j-й локальной информационной системой; bjl – стои-

мость передачи единицы информации об 1-м объекте в центр из j-й информационной локальной системы; xjl – булева переменная, равна 1, если l-й объект

обслуживается j-й локальной информационной системой, и равна 0 – в противном случае.

Описание состояния каждого объекта представляется в виде своей информационной модели:

Slj (Tjl ,Dlj ,M lj , lj ), l K, j {1, , },

(3.46)

где Tjl – тезаурус с дескрипторным множеством T0lj , описывающий состояние l-го объекта; Dlj – коллекция возможных документов, которые требуются органам управления для принятия решения; M lj – множество допустимых за-

просов со стороны органов управления; jl :M lj 2Dlj отображение, сопостав-

ляющее каждому вопросу множество документов.

Индекс j указывает, что информационная модель 1-го объекта сформирована в j -й локальной информационной системе.

Если локальная система обслуживает несколько объектов, то она формально является распределенной системой "точечного" типа.

Информация об объектах представляется независимыми информационными моделями и, вместе с тем, она сосредоточена в одном месте, в одной "точке". Таким образом, информационные модели объектов являются подсис-

177

темами глобальной информационной модели. Это дает возможность формулироватьответы на запросы в виде

 

 

 

(3.47)

j(m) d:d Dj m

t(d) ,

 

~ j

 

 

где m M j .

Правильность ответа гарантируется свойствами распределенной системы, представленной в п. 3.3.

Для запросов сложного типа, включающих в себя несколько дескрипторов, выражение (3.47) имеет вид

k p

l

 

k p

 

l

l

 

,

(3.48)

 

j (m) j (m)

d : d D j m j

j

t(d)

i 1 l 1

 

 

i 1 l 1

 

~

 

 

 

где m {m1, mk}, mi {mi} –числообъектов,обслуживаемыхлюбойсистемой.

Объем передаваемой информации на запрос m из j-й локальной информационной системы равен

 

 

 

F ( j (

m

)) ,

(3.49)

m

где F – оператор преобразования информации к виду, предназначенному для передачи в каналы связи.

Сформулируем задачу распределения объектов по локальным информационным подсистемам при множестве допустимых запросов в распределенной системе M {m1, mr}, на которые ответы формируются последовательно без

повторения запросов. Для удобства положим, что каждый запрос описывается однимдескриптором.

Требуется найти

min cjl xjl bjlF(lj (mi ))xjl

(3.50)

{xjl }

j

l

i j l

 

 

 

при ограничениях:

 

xjl 1, l K ;

(3.51)

 

 

 

 

j

 

 

xjl

( )Nj, j {1, }.

(3.52)

l

 

 

 

 

Ограничение (3.51) требует обслуживания каждого объекта только одной информационной системой. Условие (3.52) ограничивает количество объектов, подлежащих обслуживанию локальными подсистемами, либо, напротив, требует, чтобы их было не меньше заданного числа.

Усложним требования к распределенной системе. Потребуем, чтобы органы управления получали ответы на запросы даже в случае, если любая локальная информационная система перестанет функционировать.

Иначеговоря,возникаетпотребностьвдублированииинформацииобобъектах. Постановка задачи меняется только в части, касающейся изменения огра-

ничения (3.51). Оно принимает вид

178

xjl 2, l K.

(3.53)

j

 

Модифицируем еще раз постановку задачи. Будем считать, что после закрепления объектов за локальными информационными системами в задаче (3.50)-(3.51) перераспределения объектов не происходит.

Однако органам управления необходимо иметь информацию о предыдущих состояниях объектов даже после прекращения функционирования любой из локальных подсистем. Это означает, что происходит дублирование информационных моделей об объектах постоянно в процессе их функционирования и информациялокальныхинформационныхсистемперераспределяетсямеждуними.

Упростим ситуацию, полагая, что перераспределение информации осуществляется один раз. Хотя в реальной ситуации информация о состоянии объектов передается по мере ее поступления на всем интервале времени функционирования локальных информационных систем, указанное ограничение не снижает общих рассуждений, так как полная постановка задачи потребует просто дополнительного суммирования по дискретным моментам времени.

Введем следующие обозначения: ajs – стоимость передачи единицы информации из j-й локальной информационной системы в s-ю; yjsl – булева пере-

менная, равна 1, если информация об l-м объекте перераспределяется из j-й локальной информационной системы в s-ю.

Окончательно задача синтеза структуры распределенной информационной системы формулируется так:

необходимо найти

min

}

cjl xjl bjlF(lj (mi ))xjl ajs[F(Tjl ,Dlj ,Mlj ,lj )xjl ]yjsl

(3.54)

{x

,y

j l

i j s

j s l

 

jl

isl

 

 

при ограничениях

xjl 1, l K ;

(3.55)

 

 

 

 

 

 

 

 

 

 

j

 

 

 

 

 

xjl ( )N j , j{1, };

(3.56)

 

 

 

 

l

 

 

 

 

 

 

yjsl

1, l Kj {l:xjl 1}, j {1, }.

(3.57)

 

 

 

 

s

 

 

Ограничение (3.57) требует перераспределения информации об l-м объекте из j-й локальной информационной системы.

На основе задачи (3.54)-(3.57) можно сформулировать ряд задач, учитывающих те или иные требования относительно структуры распределенной системы. Для этого необходимо сформулировать требования в виде ограничений и ввести их в описание задачи.

Разработанная модель учитывает распределение информации по дескрипторам, описывающим документ. Это позволяет органам управления оценивать

179

неопределенность ответов на запросы.

Пусть документы в локальных информационных системах представляются в виде

t(dlj ) { t1lj ,w1 , t2lj ,w2 , , tklj ,wk },

(3.58)

dlj Dlj ,

Slj (Tjl ,Dlj ,M lj , lj ).

 

В реальных ситуациях при описании состояния объектов, разные локальные информационные системы, обеспеченные различными техническими средствами измерения и наблюдения за состоянием объектов, представляют не совпадающие между собой описания одних и тех же объектов. В формализованном виде это оз-

начает, что при запросе m органов управления о состоянии некоторого объекта l локальные информационныесистемыдадутответыс точностьюподобия :

lj (

 

, ) (dlj , lj ):dlj Dj

 

t(dlj ) lj (

 

,t(dlj )) , l K,

j

 

. (3.59)

m

m

m

1,

Очевидно, что показатели lj - могут быть использованы для уточнения

структуры распределенной системы, т. е. выбора такой структуры, которая бы обеспечивала получение ответов с максимальной мерой корреляции или с мерой корреляции не менее заданной. Последнее требование эквивалентно условию передачи информации с отвечающей запросу содержательной частью не менее заданной. Формализация этого условия применительно к постановке задачи (3.54)-(3.57) состоитво введении дополнительных ограничений:

lj (

 

,t(dlj )) j , l K,

j:xjl 1.

(3.60)

m

В интересах практической реализации терминологического поиска на основе разработанных моделей и синтезированной структуры распределенной информационной системы необходимо рассмотреть технологические аспекты решаемой задачи. Первый из них состоит в разработке алгоритма идентификации текстовой информации заданному терминологическому портрету.

3.5. Алгоритм идентификации текстов

Терминологический портрет может быть построен как для отдельного текста (терминологический портрет текста (ТПТ) так и для некоторой предметной области. Владельцем терминологического портрета предметной области может быть как пользователь, так и СППИР. Считая пользователя и СППИР единым целым, будем называть последний терминологическим портретом информационной системы (ТПИС). Пример ТПИС в виде иерархической структуры предметной области формирования и управления портфелем ЦБ приведен на рис.1. п. 1.5. Он содержится в специальном разделе витрины данных и является своеобразным фильтром, через который «пропускается» множество тематических текстов, поступающих из различных источников информации. Блок-схема алгоритма идентификации некоторого текста приведена на рис. 3.3.

180

Источник: https://studfile.net/preview/16563833/