Автореферат: Интеграция и поиск распределенных данных на основе semantic web технологий

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

· Каноническая схема данных описывается в модели RDF/RDFS, локальные схемы данных приводятся к той же модели.

· В системе может не быть явно выделенного медиатора: все узлы имеют доступ к метаинформации, описывающей структуру интегрированной информационной системы, и могут выполнять распределённый поиск основываясь на этой информации, общих протоколах, общей модели данных и предложенных алгоритмах. Это позволяет строить не только информационные системы, ориентированную на поиск данных, но также и на совместную работу с информацией (аналогично федеративным базам данных).

Раздел 2.1 посвящен описанию онтологии, характеризующей информационные источники, данные которых подлежат интегрированию. На рисунке 2 изображены основные классы этой онтологии в нотации UML.

Мы выделяем следующие типы источников, в зависимости от степени участия в распределённой среде:

· 0-й уровень: информационный источник не участвует в выполнении запросов, функция поиска не поддерживается. Данные источника периодически реплицируются на другой узел, на котором они индексируются, и становятся доступны для поиска. Данный уровень позволяет с наименьшими затратами подключать источники к распределённой среде, для этого достаточно реализовать программный компонент, который будет с определённой периодичностью выгружать новые данные в RDF формате

· 1-й уровень: информационный источник может участвовать в выполнении запросов, но не предоставляет возможностей записи информации. Данный уровень соответствует обычным информационным системам с поддержкой функции поиска. Требует реализации адаптера, который будет переводить поисковые запросы в формат, понятный данному источнику.

· 2-й уровень: информационный источник, в дополнении к операции поиска, поддерживает процессы репликации данных и метаинформации.

Полная информация обо всех информационных источниках, участвующих в распределённой среде, собирается централизованно, и реплицируется в соответствии с конфигурацией распределённой среды для обеспечения эффективного доступа. В частности, эта информация используется при выполнении поисковых запросов. Кроме того, фрагменты этой информации могут храниться в узлах в целях оптимизации (например, информация о “соседних” узлах).

Рисунок 2. Основные свойства и классы, описывающие информационные источники.

Раздел 2.2 описывает базовые понятия интегрированной схемы данных (mediated schema). Эти понятия используются для построения схем данных, соответствующих конкретным информационным источникам, и являются основой для семантической интеграции. Схема определяет:

· Ресурс (kernel:Resource). Ресурс можно охарактеризовать как единицу хранения: распределённый поиск рассматривает каждый источник как коллекцию ресурсов. Ресурс хранится в репозитории целиком: все его простые (rdfs:Literal) и составные (kernel:DependentObject) свойства определены в том же репозитории, что и сам ресурс. У ресурса определено текстовое свойство “URI” - глобально-уникальный идентификатор, имя ресурса в системе. Среди свойств ресурса выделяются свойства, доступные для использования в поисковых выражениях.

· Зависимый объект (kernel:DependentObject). Экземпляры данного класса являются составной частью ресурсов (отношение агрегации).

· Связь: свойство, значением которого является ресурс. Связанный ресурс не обязан храниться в том же информационном источнике, в котором определён основной.

Рисунок 3. Распределение ресурсов между информационными источниками.

Таким образом, требуется, чтобы RDF-тройки были распределены между репозиториями не произвольным образом: тройки, определяющие свойства ресурса или зависимых от него объектов расположены в рамках одного репозитория. Из этого требования следует, что у каждого репозитория достаточно информации, чтобы выполнять поиск ресурсов по значению их свойств (непосредственных или связанных с зависимыми объектами). Если данные представить в виде графа, то границы репозиториев будут проходить по связям типа ресурс-ресурс (рисунок 3).

В разделе 2.3 в рамках дополнительной онтологии описывается дополнительная метаинформация, применяемая для оптимизации поиска и управления процессами репликации в распределённой среде. Такого рода информацию удобно представлять в соответствии с традиционными базовыми понятиями, поскольку это позволяет применять стандартные механизмы для её распространения. Представлены следующие виды метаинформации:

1. Описатель коллекции - вспомогательная информация, позволяющая оценивать степень соответствия информационного источника поисковому запросу. Основу описателя коллекции составляет частотный словарь, в котором содержатся значения и статистические свойства атрибутов, относящихся к ресурсам информационного источника. Такая информация позволяет исключать из процесса совместного поиска узлы, про которые заведомо известно, что они не содержат искомую информацию.

2. Индекс - информация, на основе которой для заданного поискового запроса можно получить список идентификаторов, удовлетворяющих этому запросу ресурсов. При наличии индекса какого-либо узла операцию поиска можно выполнять локально, не производя обращений к этому узлу.

3. Управляющая информация - указания для процессов репликации ресурсов в распределённой среде.

Схема управляющей информации определяет следующие сущности:

· канал - направление обмена. Канал определяется узлом-источником и узлом-получателем. Такую сущность удобно выделять отчасти из-за её административной составляющей: канал устанавливает доверительные отношения между узлами.

· группа каналов - каналы с общим источником или получателем объединяются в именованные группы для удобства конфигурирования.

· задание - определяет репликацию. Задание характеризуется источником данных (может осуществляться как репликация собственных данных, так и полученных от других узлов), запросом, фильтрующим данные, предназначенные для репликации, и получателем. Здесь источник и получатель - канал или группа каналов.

На рисунке 4 изображен пример схемы репликации данных, в котором ресурсы реплицируются на все дочерние узлы, и все родительские (но не попадают на соседние). Для такого случая задания будут выглядеть следующим образом (при условии, что дочерние направления объединены в группу каналов “DOWN”, а родительский - в группу “UP”):

Таблица 1

Источник

Запрос

Назначение

UP

-

DOWN

DOWN

-

UP

(локальные данные)

-

UP, DOWN

Рисунок 4. Пример схемы репликации данных.

В разделе 2.4 рассмотрен набор следующих операций распределённой информационной системы:

· Локальный поиск - поиск данных в рамках одного информационного источника. Для операции локального поиска определена семантика языка запросов, соответствующая глобальной RDF модели данных, и предложены различные формы записи выражений этого языка, предназначенные для взаимодействия пользователей с системой и внутрисистемных взаимодействий. Определёна RDSF схема для представления результатов операции локального поиска.

· Совместный поиск - поиск информации в нескольких узлах одновременно с последующей интеграцией результатов. Для операции совместного поиска задаётся запрос такого же вида, как и для локального поиска, вместе с коллекцией узлов, на которые следует разослать данный запрос. Важной особенностью операции совместного поиска является возможность поиска данных с учётом атрибутов, связанных с ними объектов, притом, что связанные друг с другом ресурсы могут находиться на разных узлах. При этом допускаются как непосредственные связи, так и связи через произвольное количество промежуточных ресурсов.

· Выгрузка данных - операция, позволяющая получить информацию их узла по ряду заданных критериев. Операция предназначена для поддержки обмена данными между узлами. Информация приводится к универсальному формату, пригодному для пересылки. Одно из основных требований - возможность последовательного обновления данных, то есть получения коллекции данных, изменившихся с момента последнего сеанса выгрузки.

· Загрузка данных - операция загрузки данных из универсального формата в репозиторий узла распределённой системы. Применяется для обмена.

· Индексирование - построение индекса данных информационного источника с учётом их семантики.

· Создание описателя - формирование метаинформации, достаточной для определения степени соответствия информационного источника и поискового запроса.

· Оценка запроса по индексу - результат аналогичен локальному поиску, но операция может выполняться не в узле, в котором идёт поиск данных, а в узле, в котором хранится индекс.

· Оценка запроса по описателю - определение релевантности источника поисковому запросу.

Узлы не обязаны поддерживать все перечисленные операции. Например, для интеграции автономной информационной системы достаточно поддержки операции локального поиска, при этом её выполнение ложится на соответствующий адаптер. Часть операций неосуществима только с помощью адаптеров, и требует программной поддержки в информационной системе.

В разделе 2.5 описаны подходы к реализации вышеуказанных операций, предложены протоколы взаимодействия и соответствующие алгоритмы. Изложение ведётся для источника, данные которого хранятся в реляционной модели, поскольку именно на базе таких источников производилась практическая реализация этих методов.

Для операции совместного поиска предложен алгоритм его реализации и соответствующий протокол взаимодействия с возможностью сохранения состояния, состоящий из элементарных операций:

· элементарный поиск с сохранением результатов как именованной коллекции;

· теоретико-множественные операции над именованными коллекциями (объединение, пересечение, вычитание);

· специальная операция перехода по связям: на основе коллекции ресурсов строится новая коллекция, состоящая из связанных с ним ресурсов по заданному свойству

Особенностью этого протокола является то, что множество узлов, участвующих в поиске, может меняться в результате выполнения операции перехода по связям (уменьшаться или увеличиваться). Показано, что данный алгоритм эффективен в условиях, когда большинство связанных между собой объектов находятся в рамках одного источника (то есть число связей, пересекающих границы источников, относительно невелико).

Для операций выгрузки и загрузки данных представлено описание реализации журнала обмена, предназначенного для поддержки требования последовательного обновления.

Рассмотрена реализация операции индексирования данных:

· описан формат индекса с семантической информацией, основанный на онтологии источника данных, то есть индекса, позволяющего определить факт соотнесения терма с определённым свойством ресурса;

· приведено описание алгоритма поиска ресурсов, соответствующих заданному поисковому запросу;

· описаны применяемые методы ранжирования результатов поискового запроса и учёта словоформ в поиске;

· рассмотрено расширение формата индекса, позволяющее выполнять поиск с учётом ограничений на связанные ресурсы в рамках одного репозитория.

Рассмотрена реализация операций создания описателя и оценки соответствия запроса по описателю: метод построения описателей по индексу и алгоритм, оценивающий релевантность запроса.

Глава III. Применение разработанных моделей и технологий

В разделе 3 описано применение разработанных решений на практике, среди которых наиболее значительной является ЕНИП (Единое Научное Информационное Пространство) РАН. Инициатива по организации Единого Научного Информационного Пространства РАН (ЕНИП РАН) призвана помочь научным коллективам сделать ряд шагов в направлении интеграции разнородных научных информационных и программных ресурсов отдельных научных учреждений, предоставлении пользователям более эффективных средства интеграции и поиска информации, научной коммуникации, сотрудничества и совместной работы. Под единым пространством понимается ни формирование централизованной системы, ни навязывание всем одних и тех же решений, а стремление последовательностью практических шагов, совместными усилиями научных коллективов РАН:

· сформулировать взаимосогласованный набор соглашений, правил и открытых стандартов;

· приготовить совокупность макетов и типовых решений для реализации адаптеров прикладных систем, инфраструктурных служб, поддерживающих разные уровни интероперабельности распределенных гетерогенных данных и приложений;

· создать ряд информационных систем общего назначения, следующих этим соглашениям, использующих эти реализации, допускающих модульную организацию, наращивание функциональных возможностей;

· применить эти результаты для решения соответствующих задач учреждений РАН.

Источник: https://otherreferats.allbest.ru/download/1005740/