случае принадлежности исследуемого текста данной рубрике последний поступает на вход алгоритма извлечения дополнительных данных.
Алгоритм извлечения дополнительных данных реализует сравнение содержания аннотированного текста с содержанием текущей информации и, в случае новизны, её вывод. Содержание текущей информации выделяется из терминологического портрета рубрики.
Входе дальнейшего развития системы моделей и алгоритмов формализации и анализа текста ее ядро, содержащее пять первых алгоритмов обработки текста, практически не изменялось, а модифицировались модель семантического анализа текста и алгоритмы формирования терминологического портрета текста и извлечения дополнительных данных. Так, в интересах аннотирования текстов [110] в алгоритме формирования терминологического портрета текста основной упор был сделан на определение частот встречаемости слов [140] и применение шинглов [124].
Вданной работе модификация модели семантического анализа текста заключалась в следующем.
3.7. Семантическая матрично-лексическая модель анализа текста
Целевое назначение данной модели заключается в выделении терминов заданного текста на основании смысла. Ее основу составляютлексемы.
Под лексемой (лексической единицей) будем понимать элементарную семантичеcки значимую единицу языка, представляющую собой слово, устойчивое словосочетание или другую языковую конструкцию, способную обозначать предметы, явления, их признаки и др [217].
Лексемы имеют ряд свойств.
Свойство 3.7.1. Две лексемы равны в том случае, если равно число составляющих их символов и символы в одинаковых позициях совпадают.
Свойство 3.7.2. Частота лексемы есть число ее повторений в различных фразах. Лексемы с единичной частотой встречаемости называются уникальными.
Свойство 3.7.3. Повторяющиеся лексемы составляют лексическое множество связей текста.
Свойство 3.7.3 показывает, что для каждого текста может быть построена своя матрица лексических связей (МЛС). Данная матрица строится следующим образом.
Пусть имеется текст, в котором присутствует множество лексем {L} {l1,…,li,…,lNk}. Они упорядочены последовательностью появления в тексте. Общее число лексем связи в тексте составляет Nk. Выявлены частоты встречаемости лексем F f1, , fi , , fNk . При этом fi 1 при любом i Nk, по-
скольку уникальные лексемы удалены.
Предложениям текста Pn , n {1,…,Jp} соответствует множество входящих в них лексем li M.
Введемдвоичныйпараметр qin ,определяемыйвсоответствиисвыражением