Материал: Модели и алгоритмы проектирования и разработки систем поддержки принятия инвестиционных решений. Морозов В.П., Баркалов С.А

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

случае принадлежности исследуемого текста данной рубрике последний поступает на вход алгоритма извлечения дополнительных данных.

Алгоритм извлечения дополнительных данных реализует сравнение содержания аннотированного текста с содержанием текущей информации и, в случае новизны, её вывод. Содержание текущей информации выделяется из терминологического портрета рубрики.

Входе дальнейшего развития системы моделей и алгоритмов формализации и анализа текста ее ядро, содержащее пять первых алгоритмов обработки текста, практически не изменялось, а модифицировались модель семантического анализа текста и алгоритмы формирования терминологического портрета текста и извлечения дополнительных данных. Так, в интересах аннотирования текстов [110] в алгоритме формирования терминологического портрета текста основной упор был сделан на определение частот встречаемости слов [140] и применение шинглов [124].

Вданной работе модификация модели семантического анализа текста заключалась в следующем.

3.7. Семантическая матрично-лексическая модель анализа текста

Целевое назначение данной модели заключается в выделении терминов заданного текста на основании смысла. Ее основу составляютлексемы.

Под лексемой (лексической единицей) будем понимать элементарную семантичеcки значимую единицу языка, представляющую собой слово, устойчивое словосочетание или другую языковую конструкцию, способную обозначать предметы, явления, их признаки и др [217].

Лексемы имеют ряд свойств.

Свойство 3.7.1. Две лексемы равны в том случае, если равно число составляющих их символов и символы в одинаковых позициях совпадают.

Свойство 3.7.2. Частота лексемы есть число ее повторений в различных фразах. Лексемы с единичной частотой встречаемости называются уникальными.

Свойство 3.7.3. Повторяющиеся лексемы составляют лексическое множество связей текста.

Свойство 3.7.3 показывает, что для каждого текста может быть построена своя матрица лексических связей (МЛС). Данная матрица строится следующим образом.

Пусть имеется текст, в котором присутствует множество лексем {L} {l1,…,li,…,lNk}. Они упорядочены последовательностью появления в тексте. Общее число лексем связи в тексте составляет Nk. Выявлены частоты встречаемости лексем F f1, , fi , , fNk . При этом fi 1 при любом i Nk, по-

скольку уникальные лексемы удалены.

Предложениям текста Pn , n {1,…,Jp} соответствует множество входящих в них лексем li M.

Введемдвоичныйпараметр qin ,определяемыйвсоответствиисвыражением

186

 

1, если l

 

 

Пn

 

 

qn

 

i

 

 

(3.67)

 

Пn

 

i

0,если l

i

 

 

 

 

 

 

 

 

Тогда Pn соответствуетвектор pn (qn, ,qn, ,qn

), а тексту МЛС –

 

1

 

 

i

Jm

 

q11

(qin) q1n

N

q1

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

q1

q1

 

 

 

 

 

 

 

 

 

 

 

 

 

i

 

N

i

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

.

(3.68)

qn

 

qn

 

 

 

 

 

 

 

 

i

 

 

Ni

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

N

 

 

 

 

 

 

 

 

 

 

N

 

 

 

p

 

 

p

 

 

p

 

 

 

q

 

q

 

 

 

 

i

 

N

 

 

 

 

 

 

 

i

 

 

 

 

 

 

 

 

 

 

 

МЛС является одним из инструментов представления текста в виде ориентированного графа, позволяющего проводить его дальнейший анализ. Он строится следующим образом.

Имеется текст TK(R,D), представленный в виде множества вершинпредложений R и множества дуг, порождаемых лексическим множеством связей – D.

 

Пусть лексема mi

с частотой fi представляет число дуг Df2 , гдеDba – чис-

ло сочетаний из b по a.

 

i

 

 

 

Вершины rm и rb

лексемы mi из M связаны семантической (смысловой)

дугой

Dm,b , если

m b 1.

 

i

i

i

 

Кроме того, вершины Rm&Rb смежны, т.е. дугаDim,b инцидентна верши-

нам (rm ), (rb ). Она исходитиз rm и заходитвrb .

Число дуг, инцидентных i-й вершине, представляет собой сумму элементов i-й строки МЛС.

Построим матрицы инцидентности и смежности для текста TK(R,D). Матрица P(G) размером a b (a – число вершин, b – число ребер (дуг)

графа T), (i,j)-й элемент которой равен 1, если вершина oi инцидентна ребру lj в графе T, или если oi есть начало дугиlj , равен -1, если вершина oi есть конец дуги lj (только для орграфов), и равен 0 в остальных случаях, соответствует матрице инцидентности (0,1).

Матрица C(T) размером a a (a - число вершин в T), (i,j)-й элемент cij которой равен 1, если вершины oi и oj смежны, т.е. соединены дугой (или реб-

187

ром) (oi , o j ) , и равен 0 в противном случае, соответствует матрице смежности

- (0,1).

Процедура формирования данных матриц из МЛС заключается в следующем. Построим следующую матрицу:

Am

(3.69)

c(m,b) im * ib ,

i 1

 

где c(m,b) – элемент матрицы смежности размерности

Ar Dg , равный числу

дуг, идущих из вершины rm в вершинуrb .

Введем следующие обозначения: j – номер дуги, j+(1,…,Dg); m и b – номера вершин. Смысл записи Dim,b заключается в утверждении существования

mi-й лексемы, порождающей j-ю дугу, инцидентную rm , rb вершинам. При этом элемент p(m,b) матрицы инцидентности размерности Ar Dg будет иметь

вид

где D

 

 

Аm

i

!

g

 

 

2*(fь 2)

 

 

i 1

1, если Dm,j b,

p(m, j) 1,если Db,j m, , (3.70)

0 вдругих случаях,

.

В том случае, если последовательность вершин от rm до rb частично упорядочена таким образом, что последующая вершина смежна с предыдущей,

то имеет место путь изrm вrb , представляющий собой совокупность соответствующих дуг. При этом длина пути есть число дуг в последовательности. Длина

L между множествами лексем, входящих в rm и rb предложения, есть путь между двумя вершинами. Путь от предложения, порождающего аксиоматическую лексему, до предложения, порождающего произвольную терминальную лексему, есть полная ассоциация mi-й аксиоматической лексемы. Фактически локализованная тема mi, есть объединение всех ее полных ассоциаций без повторов.

Семантическое расстояние между двумя лексемами в пределах заданного текста (графа TK) определяется как минимум из длин всех путей, соединяющих предложения областей существования этих двух лексем.

Важной характеристикой ориентированного графа текста является ассоциативная мощность. Она позволяет определить нагрузку дуги (ее длину) и, что очень важно, оценить важность ассоциации.

Ассоциативное графовое представление текста заключается в виде последовательности предложений-вершин, а фактически лексем, связанных между собой смыслом. В процессе определения наиболее важных понятий, содер-

188

жащихся в тексте, необходимо соответствующее ассоциативное множество слов привести к нормальной форме. Для определения ассоциативного множества слов целесообразно использовать меры связности графа с аксиоматическими лексемами [111].

На практике наряду с представлением текста в виде графа используют семантическую сеть. Она позволяет представлять смысл текста в более естественной форме – в виде совокупности связанных между собой понятий (слов и словосочетаний), несущих основную смысловую нагрузку и наиболее часто, встречающихся в тексте. Она, как и граф, состоит из вершин и рёбер.

Имена, приписываемые вершинам и рёбрам семантической сети, совпадают с именами соответствующих сущностей и отношений, используемыми в естественном языке. Ребро и связанные им вершины образуют подграф семантической сети, несущий минимальную информацию - факт наличия связи определённого типа между соответствующими объектами.

Пример фрагмента семантической сети, описывающей кризисные состояния (предкризисное состояние, кризис, рецессия) внешней среды в сфере экономики, представлен на рис. 3.5.

 

Предкризисное

 

Кризис

 

Рецессия

 

 

состояние

 

 

 

 

 

 

 

 

 

 

 

 

имеет

 

 

 

 

 

 

 

 

Экономика

 

 

 

 

 

 

 

 

 

имеет

 

 

 

 

Безработица

Капитал

 

Внешний

 

ВВП

Бюджет

 

долг

 

 

имеет

 

 

 

имеет

 

 

 

имеет

Р

С

О

П

Р

С

Р

С

Д

Пф

 

Р - рост С - снижение

О-отток П-приток

Д-дефицит

Пф-профицит

 

 

 

Рис. 3.5. Фрагмент семантической сети

 

 

Пример, представленный на рис. 3.5, может быть проработан на любую глубину. При этом слова, используемые при обозначении объектов в семантической сети, могут быть продублированы в других названиях сколь угодно раз.

Воспользовавшись фрагментом вышеприведенной семантической сети, можно построить структуру «экономические показатели».

189

СОЗДАТЬ-СТРУКТУРУ(ИМЯСТРУКТУРЫ=ЭКОНОМИЧЕСКИЕПОКАЗАТЕЛИ ЧИСЛО АТРИБУТОВ = 5 АТРИБУТ = БЕЗРАБОТИЦА АТРИБУТ = КАПИТАЛ АТРИБУТ = ВНЕШНИЙ ДОЛГ АТРИБУТ = ВВП АТРИБУТ = БЮДЖЕТ).

Для реализации данной структуры целесообразно использовать аппарат фреймов [187]. Известно, что наибольшее распространение находят три типа фреймов: фреймы-структуры, фреймы-роли, фреймы-сценарии [187]. В [66] для построения модели семантического анализа русскоязычных текстов использовались фреймы-сценарии. В данной работе более перспективным является использование фреймов-структур в силу трех причин. Во-первых, они в максимальной степени соответствуют представлению информации по своему принципу построения. При заполнении их элементов-слотов определёнными значениями фрейм-структуры превращаются в описания конкретных фактов, событий, процессов [74, 221]. Во-вторых, фрейм-структуры обладают объектноориентированными свойствами инкапсуляции, наследования и полиморфизмом объектов [187], что гармонично сочетается с общей технологией разработки СППИР, в частности, использованием объектно-ориентированной среды разработки Delphi 7.0. В-третьих, табличная форма представления фрейм-структур оптимально вписывается в общую концепцию построения БД СППИР (как в рамках хранилища данных, так и в рамках витрины данных).

Недостатками фреймового подхода к проведению семантического анализа текста являются более жёсткое, чем при подходе, основанном на семантической сети, выделение объектов, ситуаций и их свойств, а также возрастание сложности фреймовой модели (появление разнотипных вложенных фреймов) при увеличении в тексте числа иерархически взаимосвязанных разноплановых понятий, терминов, фактов, событий, процессов и др. [194]. Данные недостатки приводят к существенным трудностям формирования терминологических портретов.

Для парирования данных недостатков использовалась гибридная модель семантического анализа, содержащая как семантическую сеть, так и фреймыструктуры. При этом составляющие данной модели использовались избирательно. Так, в интересах семантического анализа газетных статей приоритет в использовании отдавался фреймам.

Поскольку газетные статьи являются одним из источников снижения неопределенности внешней среды для ЛПР, исследование последних актуально. Проведенные исследования показали, что для их семантического анализа целеесообразно применять фреймы. Поскольку первейшей заботой журналиста является быстрая и не загружающая мозг передача информации, то, как правило, все характеристики, требующие применения медленных индуктивных или дедуктивных процессов, для семантического анализа которых необходимы се-

190

Источник: https://studfile.net/preview/16563833/