Использование онтологий в работе с полнотекстовыми базами данных
Н.С. Бажанов1
1 Новосибирская государственная консерватория им. М.И. Глинки, Новосибирск, Российская Федерация
Аннотация
онтология поиск база данных текстовый документ
В статье рассматривается поиск и работа с полнотекстовыми неструктурированными базами данных, заранее не подготовленными для поиска, которые представляют собой коллекцию текстовых документов в одной научной области. Наибольший объем содержания статьи раскрывает технологический контекст полнотекстового поиска, рассматриваются и анализируются те взаимосвязанные в системе поиска структуры, которые влияют на результат поиска информации. В качестве инструмента, организующего такой поиск, избраны онтологические описания. Понятие онтологии используется в прикладном, а не в философском значении, как спецификация сущности вещей. Важной стороной онтологий является «концептуализация» предметного знания, вне учета которого полнотекстовой поиск будет всегда ограничен. Фактически задача поиска в больших полнотекстовых базах данных создать такое взаимодействие компьютерных алгоритмов и интеллекта исследователя, которое перевело бы поиск из простых, разовых, законченных действий в непрерывное наполнение сложного, составного знания о научной проблеме. В статье анализируется соотношение смыслов поиска и языковых слов, используемых в запросе. Разделение понятий смысл и слово придает поиску более совершенную форму, выводя на первое и ведущее место смыслы поиска посредством ведомых вербальных форм. Также рассматриваются важные свойства поиска: концентрация найденных смыслов, новизна искомого знания, замкнутость и открытость результатов. На основании изучения особенностей работы и поиска в полнотекстовых базах данных автор приходит к следующим выводам. Возможности поиска и работы с полнотекстовыми базами данных никогда не используются полностью. Совершенствование информационно-поисковой системы всегда актуально. Чем более концентрированы в полнотекстовой базе данных научные смыслы и одна тематика дисциплины, тем больше возможностей ее функционирования в виде базы знаний и экспертной системы. Поиск в полнотекстовой базе данных представляет собой открытую систему: одновременно снимая одни вопросы, он добавляет новые, тем самым делая поиск непрерывным «интеллектуально-системным» познанием научной проблемы.
Ключевые слова: поиск в полнотекстовых базах данных, онтологии поиска, смысл и слово, экспертные системы, базы знаний.
Abstract
USING ONTOLOGIES WORKING WITH FULL-TEXT DATABASES
N.S. Bazhanov1
1 Glinka Novosibirsk State Conservatoire, Novosibirsk, Russian Federation
The article deals with searching and working with full-text unstructured databases that are not prepared in advance for search, which are a collection of text documents in a single scientific field. The largest volume of the article's content reveals the technological context of full-text search, and examines and analyzes those interrelated structures in the search system that affect the result of information search. Ontological descriptions are chosen as a tool for organizing such a search. The concept of ontology is used in an applied, rather than in a philosophical sense, as a specification of the essence of things. An important aspect of ontologies is the "conceptualization" of subject knowledge, without which full-text search will always be limited. In fact, the task of searching in large full-text databases is to create an interaction between computer algorithms and the investigator's intelligence that would translate the search from simple, one-time, legitimate actions into a continuous filling of complex, composite knowledge about a scientific problem. The article analyzes the relationship between search meanings and language words used in the query. The separation of the concepts of meaning and word gives the search a more perfect form, bringing the search meanings to the first and leading place through the guided verbal forms. Important properties of the search are also considered: the concentration of the found meanings, the novelty of the sought knowledge, the closeness and openness of the results. Based on the study of the features of work and search in full-text databases, the author comes to the following conclusions. Search and full- text database capabilities are never fully used. Improving the information retrieval system is always relevant. The more scientific meanings and one subject of a discipline are concentrated in a full-text database, the more opportunities it has for functioning as a knowledge base and expert system. Search in a full-text database is an open system: simultaneously removing some questions, it adds new ones, thereby making the search a continuous "intellectual-system" knowledge of a scientific problem.
Keywords: search in full-text databases, search ontologies, meaning and word, expert systems, knowledge bases.
Наиболее продуктивным направлением в компьютерных технологиях научной деятельности является использование различных баз данных и поисковых систем на их основе. На развитие систем текстового поиска оказали влияние разработки полнотекстовых (full-text system) баз данных и поисковых систем. В настоящее время перспективные разработки в рассматриваемой области концентрируются вокруг авторитетной международной конференции по текстовому поиску TREC (Техt Retrieval Со^егепсе https:// trec.nist.gov), учрежденной в 1992 г. в США Американским национальным институтом по стандартам и технологиям (NIST https://www. nist.gov).
Полнотекстовые базы данных (ПБД) - признанный во всем мире источник важной и актуальной информации (Шабурова Н., 2006; Сафина Г., 2005). ПБД включают в себя полные тексты электронных версий книг, журнальных статей, реферативных обзоров по конкретной научной проблематике и т.п. Такие тексты, как правило, отвечают критерию законченности и соответствуют атрибутам жанров, в которых существуют: статья, реферат, книга, доклад, цитаты, выписки.
Очень часто ПБД целиком состоят из так называемой неструктурированной информации. Неструктурированная база данных наполнена информацией, которая заранее не упорядочена, не имеет структуры, не разделена на стандартные части. В сравнении с дорогостоящими библиотечными системами и подготовленными базами данных здесь файлы даны «как есть», все вместе - имя автора, название, сам текст, литература, и возможные ключевые слова. Все компоненты могут быть в одном файле, а сами текстовые файлы могут быть разных форматов. Иногда такие базы данных называются «мешок текстов». Преимущество таких баз данных заключено в простоте их создания путем слияния небольших корпоративных архивов.
При наличии большой коллекции текстов в компьютерных форматах возникает заманчивая задача, при написании научной статьи использовать не 10-20 книг, а огромную библиотеку полнотекстовых источников численностью в сотни и тысячи книг, собранных в одной предметной области. Корпус текстов в предметной области мыслится как взаимосвязанное целое, организованное в логике предмета. Тогда можно найти новое знание, которое содержится в столь огромной библиотеке текстов, но не может быть обнаружено человеком без помощи компьютера. В обобщенном плане, в компьютерных технологиях работы с текстами основная проблема заключается в том, как сделать поиск наиболее полным, как с помощью слов найти наибольшее количество искомых смыслов.
Проблема. Научно-информационный потенциал большой коллекции полнотекстовых документов, собранных в одной тематике, настолько значителен, что никогда не используется полностью. В ПБД в явном или скрытом виде может содержаться новое знание. Новое знание образуют смысловые отношения из разных книг, документов. В известных научных источниках остаются не выявленными кросс-связи суждений, т.е. высказывания, разделенные между собой значительными фрагментами текста. Генеративный смысловой потенциал имеют кон- кордации внутри терминологического аппарата научной проблемы. В такой коллекции документов не может быть только нового знания, полученного экспериментальными методами и еще не опубликованного в научных изданиях. Исходя из подобного представления свойств ПБД, возникает актуальная задача совершенствования информационно-поисковой системы до функционального уровня решения перечисленных проблем.
Для того чтобы использование ПБД было эффективным, необходимо часть интеллектуальной обработки информации передать компьютеру, т.е. автоматизировать. Подобные задачи относятся к методологии использования машинной обработки текстов, а также являются специфическим продолжением идеологии больших данных (big data1).
Однако для передачи компьютеру части рутинной работы по анализу текста, действия необходимо было алгоритмизировать и создать специальные компьютерные программы2. Так, частотное распределение слов (встречаемость) в тексте и его структурах приобретало смысл только после того, как из текста были исключены предлоги (наиболее часто употребимые) и другие незначимые слова. Любой запрос на поиск ключевых слов должен был проходить морфологическую обработку, которая учитывала все встречающиеся в языке словоформы. Нужно было учитывать при поиске информации синонимические варианты существования одного и того же смысла. Местоимения необходимо было соотносить с предыдущими собственными именами (так называемое разрешение кореференций - coreference resolution) и т.п. Возникла компьютерная лингвистика - современная область технологического знания, призванная в поисках и работе со смыслами преодолеть особенности организации слов в языке и любом тексте.
Следующим препятствием при интеллектуальном анализе текстов оказалась сама предметная область знания. Для того чтобы формальные алгоритмы автоматизированной обработки начали работать с большими коллекциями текстов, необходимо было учесть «мыслимый за кадром», внетекстовой, смысловой и содержательный контексты. Оказалось необходимым выделить понятия из текста и представить их системные значения в терминологическом аппарате. Кроме того, что термины взаимосвязаны между собой, они еще имеют некоторую модификацию смыслов в зависимости от использования в различных научных дисциплинах. Так появились онтологии3- концептуализации
предметного знания4 (Кузнецов О., 2010; Мёдова А., 2016). В большинстве подобных работ концептуализация понимается как введение онтологических представлений в массив эмпирических данных, обеспечивающее теоретическую организацию материала и схематизацию связей понятий. Сегодня это направление считается дальнейшим продолжением и развитием системной методологии, столь популярной в науке второй половины XX в. (Bertalanffy L., 1968). Перспективным направлением совершенствования работы с ПБД оказалось применение в качестве инструмента поиска онтологий (Пальчунов Д., 2008).
Для формирования простейших онтологий в виде классификаций были построены графические редакторы, которые упрощают работу с такими онтологиями и делают их более наглядными. К ним относятся редакторы онтологий: PROTЙGЙ, Ontolingua, Chimaera.
Термин «онтология» стал использоваться в нескольких значениях. Работы в области философии продолжали обсуждать онтологию как учение «о бытии всего сущего, о его сущности и всеобщих принципах организации» (Яскевич Я., 2006). Второе направление называло онтологиями искусственные, наиболее полные описания значения элементов обобщенных систем. В отличие от методологии общей теории систем в «онтологиях» предполагалась возможность раскрытия спецификации сущности вещей.
В методологию науки понятие «онтологии» вел Томас Грубер (Thomas Robert «Tom» Gruber (род. 1959) американский компьютерный ученый). В прикладном значении понятие онтологии стало применяться как «точная спецификация некоторой предметной области» (Некипелов Н., 2010, с. 39). «Онтология предметной области рассматривается как пара - сигнатура из множества ключевых понятий предметной области и множество аналитических предложений, истинных в данной предметной области. Это множество аналитических предложений определяет смысл (значение) ключевых понятий предметной области» (Пальчунов Д., 2008, с. 3-4). Онтологии стали активно применяться в системах извлечения нового знания, получили новый импульс развития в больших полнотекстовых неструктурированных базах данных.
«В сфере искусственного интеллекта онтология - это дисциплина, связанная с построением специфической системы понятий, которая описывает определенную предметную область. Содержание понятий отражается с помощью концептов. Формально в онтологии концепт отождествляется с объектом (классом), имеющим связи с другими классами. Класс определяется как множество экземпляров с общими свойствами и содержит описание собственно экземпляров и их свойств» (Кузнецов О., 2010, с. 762).
В отличие от естественнонаучных дисциплин музыкознание еще только приступает к освоению технологий интеллектуальной обработки текстов и применению методологии онтологического подхода.
Онтология поиска в ПБД касается сущностей самого поиска. Ключевыми являются вопросы - каким образом человек находил раньше и находит теперь (вместе с компьютером) необходимые фрагменты текста с заданным смыслом? Можно ли назвать поиском некоторые сложные виды работы с ПБД, когда исследователь пытается обнаружить скрытые взаимосвязи, как проявление системного знания по предмету? Так мы подходим к ответу на вопрос: Чем отличается работа с ПБД, от поиска в ПБД? Такое отличие определяется содержанием пунктов 3-10 (см. перечисление ниже). Можно представить следующую классификацию общения исследователя с ПБД:
1. Поиск простого совпадения;
2. Поиск совпадения с учетом морфологии (возможных словоформ);
3. Поиск корреляций (от лат. еогге1аНо соотношение, взаимосвязь), например по удаленности слов друг от друга в тексте;
4. Поиск корреляций по частотному распределению слов;
5. Поиск терминов;
6. Поиск утверждений / отрицаний;
7. Поиск логических имен;
8. Поиск логических действий;
9. Поиск методологических установок и приемов;
10. Поиск выводов и заключений.
Следовательно, потребность в информации уже разделяется на различные функционально-логические единицы. Очевидны потребность в литературе по теме исследования, фактах, понятиях, терминах, категориях, суждениях, умозаключениях, взаимосвязях и выводах, и наконец, поиск неизвестных и непредполагаемых свойств текста, когда логические, статистические5 предметные закономерности о тексте предоставляет компьютерная программа.
В алгоритмах консультации и работы с элементами искусственного интеллекта каждый последующий цикл запросов зависит от результатов предыдущего совместного действия человека и компьютерной программы поиска. В этом случае задействованными в работе оказываются и научная гипотеза, и формирование концепции, и верификация суждений, утверждений и выводов. При такой постановке проблемы становится понятным, что поиск информации не разовая конечная функция, а непрерывная, постоянная технология интерактивной компьютерной работы с научными текстами (Бажанов Н.. 2016, с. 91).