Дипломная (вкр): Методы и алгоритмы семантического поиска информации в системах поддержки пользователей

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

1.4 Постановка задач научно-квалификационной работы

Целью научно-квалификационной работы является улучшение методов и алгоритмов семантического поиска на запросы, полученные от пользователей, и повышение качества возвращаемых ответов относительно конкретной предметной области в системах поддержки пользователей.

Для достижения поставленной цели в работе были поставлены и решены следующие задачи:

.        Исследование принципов работы с запросами в существующих системах поддержки пользователей.


.        Разработка методов и алгоритмов поиска по естественно-языковым запросам использующем логико-семантический подход. Адаптация методов и алгоритмов для русского языка в системах поддержки пользователей.

.        Разработка моделей и сценариев работы системы поддержки пользователей

.        Разработка экспериментального прототипа системы поддержки пользователей

.        Исследование эффективности полученных методов и алгоритмов на примере разработанного прототипа системы поддержки пользователей для веб-сервисов

В результате анализа инструментов, занимающихся анализом естественно-языковых текстов, были сделаны следующие выводы:

)        Основная часть инструментов работает на англоязычном рынке и готовых решений для русского языка немного.

)        Существующие системы анализа текстов недостаточно адаптированы для задачи поиска ответов на вопросы.

)        Большая часть существующих поисковых машин все еще отталкивается от ключевых слов, что недостаточно для более точного поиска результата.

Чрезвычайно мало комплексных решений по анализу естественного русского языка. Основные инструменты в первую очередь работают с английским языком. Большая часть существующих инструментов с поддержкой русского языка основывается на анализе морфологии и не предоставляют возможности извлекать смысл из текста. Инструмента, подходящего для решения задачи консультанта, или программы, помогающей найти ответ на вопрос для конкретной предметной области не было найдено. Таким образом, существующие системы не удовлетворяют поставленным задачам.

Учитывая вышеизложенные выводы, было принято решение разработать систему, которая будет способна анализировать естественно-языковую фразу на русском языке и помогать пользователю быстрее находить ответ на вопрос по заданной предметной области (на конкретном сайте). Такая система будет полезна для больших информационных порталов, где информация плохо структурирована, и посетитель, приходящий на сайт, часто не может найти нужную информацию и вынужден обращаться к службе поддержки, либо просто перейти на решение конкурента.

Было принято решение на начальном этапе сделать систему в форме бота, который в живой форме может общаться с клиентом и предлагать ему ответы на вопросы. Боты в последнее время становятся популярны, так как более привычны человеку в обращении, чем простые каталоги с ответами на вопросы. В качестве примера все возрастающей популярности ботов можно привести пример кроссплатформенного мессенджера Telegram и магазин ботов для Telegram - storebot.me.

2. Расширение метода семантической обработки информации на основе интенсиональной логики в предметной области систем поддержки пользователей

.1 Формально-математические основания метода анализа предложений на естественном языке

Изначально были попытки описать семантику естественного языка с помощью исчисления предикатов. Но в ходе попыток преобразования фраз на естественном языке в логические формулы, Монтегю столкнулся с рядом трудностей. Возникли сложности с представлением союзов, имен прилагательных, глагольных времен и т.д. Для преодоления такого рода трудностей Монтегю предложил использовать язык интенсиональной логики. Основные отличия языка интенсиональной логики от исчисления предикатов:

)        Богатая структура типов выражений и частей моделей. Такие типы есть и в исчислении предиактов, но в интенсиональной логике, они многообразнее. Базовые типы интенсиональной логики будут рассмотрены ниже.

)        Все выражения в языке интенсиональной логики представлены как функции. Т.е. все типы, кроме основных e и t, являются типами функций. Все выражения, кроме основных обозначают функции. Также функции могут выступать в качестве аргументов или значений других функций.

)        Добавлена операция functional application (функциональное применение) - применение функции к ее аргументу

)        Активно используются лямбда-выражения.

)        Включение множества возможных миров

)        Для интерпретации временных операторов используется структура времени

В интенсиональной логике выделяется 2 базовых типа выражений: e-сущности и t-истинностные значения. Сам TYPE тип выражения определяется следующим образом [4]:

1)     

2)     

)        Если  и , то

)        Если , то

)        Ничто другое, кроме перечисленного в п. 1-4, не относится к множеству TYPE.

Таблица 1 - Типы и названия выражений интенсиональной логики

Тип выражения

Название

Множество семантических значений

e

Индивид

D

<s, e>

Индивидный

t

Истинностное значение

<e, t>

Множества индивидов

<s,<e, t>>

Свойства индивидов

<<s, e>, t>

Множества индивидных концептов

<<s,<e, t>>, t>

Множества свойств индивидов

<s,t>

Пропозиции

<<s, t>, t>

Множества пропозиций

<e, <e, t>>

Отношения между индивидами

<s,<e,<e,t>>>

Отношения-в-интенсионале между индивидами


Для того, чтобы установить соответствие между синтаксическими категориями и категориями интенсиональной логики, Монтегю ввел множество синтаксических категорий формальной семантики (табл.2).

Таблица 2 - Основные категории формальной семантики

Категория

Определение

Грамматический эквивалент

Примеры

e

-

нет

-

t

-

Утвердительные предложения

Выводы сделаны верно. Ветер усиливается.

IV (Intransitive Verb phrase)

t/e

Глагольные фразы и непереходные глаголы

Увеличиваться Помогать

T (Term phrase)

t/IV

Существительные фразы и собственные имена

Леонид Вологда, Oн1, он2

TV (Transitive Verb)

IV/T

Переходные глаголы

Определять Заимствовать

CN (Common Noun)

t//e

Нарицательные существительные

Двигатель Семантика

IAV (Intransitive adverb)

IV/IV

Наречия

Быстро Медленно

t/t (Sentence Adverb)


Модальные определители предложения

Необходимо-чтобы Непременно

IAV/T


Предлоги

В, на

DET

T/CN

Определители

Каждый, любой, всякий.

IV// IV


Глаголы, образующие инфинитивы

Пытаться Учиться


.2 Модернизация метода интенсиональной логики для русскоязычных систем поддержки пользователей

.2.1 Построение дерева предложения для последующего семантического анализа и выделения сущностей

Проанализировав данное предложение с помощью pymorphy2, получим следующие характеристики слов:

)        “Каждый” ('ADJF,Apro inan,masc,sing,accs') - Имя прилагательное (полное), местоименное неодушевленное, мужской род, единственное число, винительный падеж.

Принадлежит к категории DET.

)        “охотник” ('NOUN,anim,masc sing,nomn') - Имя существительное, одушевлённое, мужской род единственное число, именительный падеж.

Принадлежит к категории CN.

)        “желает” ('VERB,impf,tran sing,3per,pres,indc') - Глагол (личная форма), несовершенный вид, переходный, единственное число, 3 лицо, настоящее время, изъявительное наклонение.

Принадлежит к категории TV.

)        “знать” ('INFN,impf,tran') - Глагол (инфинитив), несовершенный вид, переходный.

Принадлежит к категории TV.

)        “где” ('ADVB,Ques') - Наречие, вопросительное.

Принадлежит к категории IAV.

)        “сидит” ('VERB,impf,intr sing,3per,pres,indc') - Глагол (личная форма), несовершенный вид, непереходный, единственное число, 3 лицо, настоящее время, изъявительное наклонение.

Принадлежит к категории IV.

)        “фазан” ('NOUN,anim,masc sing,nomn') - Имя существительное, одушевлённое, мужской род единственное число, именительный падеж.

Принадлежит к категории CN.

Рисунок 7 - Древовидная структура предложения

Таким образом, можно сделать вывод, что с помощью формальной семантики Монтегю возможно формализовать тексты на естественном русском языке. Формализация текстов на русском языке будет отличаться от формализации текстов на английском языке из-за их структурных различий. Для формализации текстов на русском языке важное значение имеют как морфологический, так и синтаксический анализ, в то время как в английском языке большую роль играет синтаксический анализ текста. Имея достаточно большой корпус языка, такой как OpenCorpora, можно проводить качественный морфологический анализ, который позволит с помощью категорий интенсиональной логики формализовать естественно-языковой текст на русском языке.

.2.2 Перевод вопроса на естественном языке в формулу формальной семантики

Монтегю вводит понятие Правил трансформации, которые используются для перевода фразы в формулу формальной семантики. Выделяется множество основных выражений категории A - обозначенное как ВА, а также множество фраз категории А, обозначенное как РА. В множество РА входят все выражения и фразы, которые могут быть составлены с помощью синтаксических правил. Приведем пример правила трансформации для фрагмента естественного языка[5]:

1)      Если  в области g, то .

2)      Если , то .

)        Онn, онаn, ониn переводятся в .

)        Если , , то «любой (любая, любые) ».

Правила применения функций

5)      Если ,  и ,  переводятся соответственно в , , то  переводится в .

6)      Если ,  и ,  переводятся соответственно в , , то  переводится в .

)        Если ,  и ,  переводятся соответственно в , , то  переводится в .

)        Если ,  и ,  переводятся соответственно в , , то  переводится в .

)        Если ,  и ,  переводятся соответственно в , , то  переводится в .

)        Если ,  и ,  переводятся соответственно в , , то  переводится в .

)        Если ,  и ,  переводятся соответственно в , , то  переводится в .

Источник: https://www.bibliofond.ru/detail.aspx?id=896626