АВТОРЕФЕРАТ
диссертации на соискание ученой степени кандидата технических наук
Специальность 05.13.18 - математическое моделирование, численные методы и комплексы программ
ИНТЕГРАЦИЯ И ПОИСК РАСПРЕДЕЛЁННЫХ ДАННЫХ НА ОСНОВЕ SEMANTIC WEB ТЕХНОЛОГИЙ
Москва - 2007
Работа выполнена в отделе систем математического обеспечения вычислительного центра им. А. А. Дородницына РАН
Научный руководитель:
доктор физико-математических наук,
профессор
Серебряков Владимир Алексеевич
Официальные оппоненты:
член-корреспондент РАН,
доктор технических наук, профессор
Арлазаров Владимир Львович
кандидат физико-математических наук
Босов Алексей Вячеславович
Ведущая организация:
Институт прикладной математики им. М.В. Келдыша РАН
Защита состоится 25 мая 2007 года в 9.00 час. на заседании диссертационного совета К212.156.02 в Московском физико-техническом институте (государственном университете) по адресу: 141700, г. Долгопрудный Московской обл., Институтский пер., д. 9, ауд. 903 КПМ
С диссертацией можно ознакомиться в библиотеке МФТИ.
Автореферат разослан « 24» апреля 2007 г.
1. Общая характеристика работы
Актуальность темы
Вместе с повсеместным распространением сетевых технологий и Интернет значительно упростился доступ к данным, независимо от их физического местоположения. Это позволяет одновременно получить доступ к большому числу источников данных, связанных между собой каким-либо образом, и, с помощью объединения результатов запросов, получить полезную информацию, которая физически не хранится в одном источнике. Этот процесс автоматизируют системы интеграции данных, то есть такие информационные системы, которые предоставляют пользователю доступ к интегрированному представлению информации, содержащейся во множестве источников данных.
Задача интегрирования данных осложняется тем, что источники информации, как правило, являются автономными - они разрабатываются и поддерживаются независимо от приложений, которые могут их использовать. Архитектура таких источников, протоколы коммуникации и производительность определяются их владельцами. Информация в них может быть представлена в различных моделях данных: от реляционной или объектно-ориентированной до слабоструктурированных файлов (HTML/TXT). Источники работают на различных аппаратных платформах, используют различное программное обеспечение, имеют различные интерфейсы доступа (CGI,RMI,Corba,SOAP).
В последнее время на подходы к интеграции данных большое влияние оказывает инициатива Semantic Web. В частности, в рамках этой инициативы были предложены формат данных (XML), модель данных (RDF) и стандарты описания схем данных (RDFS,OWL), которые позиционируются как средства обмена информацией, данными, и знаниями с учётом их семантики.
Целью работы является разработка моделей и технологий создания информационных систем, предназначенных для поиска и интегрирования данных, содержащихся в распределённых неоднородных информационных источниках, с применением технологий Semantic Web. В работе исследованы и решены следующие задачи:
1. Исследование и сравнительный анализ существующих подходов и моделей поиска данных и интеграции данных распределённых неоднородных информационных систем.
2. Формализация основных операций в распределённой системе (поиск, совместный поиск, обмен).
3. Создание моделей выполнения операций и разработка алгоритмов их реализации.
4. Разработка технологии построения интегрирующей информационной системы на основе модели данных RDF/RDFS.
5. Реализация компонентов информационной системы, соответствующей выбранным моделям, методам и технологиям в виде комплекса программ.
Научная новизна
В диссертационной работе получены следующие новые результаты:
· Разработана схема данных для информации, описывающей и классифицирующей интегрируемые источники данных;
· Произведено формальное описание операций поиска и обмена данными в распределённой информационной системе
· Разработана модель и алгоритмы выполнения указанных операций
Практическая ценность
Практическая ценность данной работы состоит в том, что разработанные модели и алгоритмы позволяют создавать интегрирующие информационные системы, эффективно решающие поставленные перед ними задачи. Предложенные решения были применены на практике в нескольких информационных системах, наиболее масштабной из которой на текущий момент является Единое Научное Информационное Пространство (ЕНИП) - инициатива, направленная на предоставление унифицированного доступа к интегрированной научной информации институтов РАН.
Апробация работы
Основные результаты работы докладывались и обсуждались на следующих научных конференциях и семинарах:
· Научно-практический семинар "Новые технологии в информационном обеспечении науки", Москва, 2003.
· Всероссийская научная конференция "Электронные библиотеки: перспективные методы и технологии, электронные коллекции", Санкт-Петербург, 2003; Пущино 2004; Суздаль, 2006
· Всероссийская научная конференция "Научный сервис в сети Интернет", Новороссийск, 2004
· Международный коллоквиум Spring Young Researcher's Colloquium On Database and In-formation Systems - SYRCoDIS, St.-Petersburg, Russia, 2004.
· Международная конференция The 8th World Multi-Conference on Systemics, Cybernetics and Informatics - SCI 2004, Orlando, Florida, 2004.
· Научная конференция МФТИ, Долгопрудный, 2005; Долгопрудный, 2006.
· Международная конференция "Порядковый анализ и смежные вопросы математического моделирования", Владикавказ, 2006.
· Научные семинары систем математического обеспечения вычислительного центра им. А. А. Дородницына РАН, 2002-2006.
Публикации
По теме диссертации опубликовано 12 работ, в том числе одна - из списка изданий, рекомендованных ВАК.
Диссертация состоит из введения, трёх глав, заключения, списка использованных источников, включающего 85 работ, одного приложения. Работа изложена на 107 страницах.
2. Краткое содержание работы
Введение
Во введении обоснована актуальность темы исследования, описаны решаемые проблемы, рассматриваются общие подходы к интеграции информационных систем. Введение дает характеристику основных проблем и задач, возникающих при этом.
Глава I. Подходы к интеграции данных
В главе 1 приведен обзор существующих методик построения интегрирующих систем, то есть систем, которые предоставляют пользователям интегрированный доступ к данным, хранящимся в различных информационных источниках. Процесс интеграции данных ставит множество проблем, вызванных, в частности, автономностью и разнородностью источников, количественными и качественными требованиями к обработке запросов. информационный программа алгоритм
Архитектурно, интегрирующие системы можно разделить на системы с “виртуальной” интеграцией (virtual view), в которых данные для ответа на запросы пользователя берутся из информационных источников непосредственно в процессе выполнения запроса, и системы, в которых интегрированные данные собираются заранее и хранятся централизованно (materialized view). Второй подход обычно применяется в случаях, когда количество информационных источников невелико, и известен класс запросов, которые будет делать пользователь. Так же возможен и гибридный подход, который применяется в первую очередь для улучшения производительности систем с виртуальной интеграцией.
Системы с “виртуальной” интеграцией делятся на федеративные базы данных (federated databases) и системы, основанные на медиаторах (mediated systems). Федеративные базы данных состоят из нескольких полуавтономных баз данных, которые частично разделяют информацию между собой. В свою очередь, системы, основанные на медиаторах, интегрируют разнородные источники данных, среди которых могут быть как базы данных, так и веб-сайты, полуструктурированная информация в файловой системе и т.п. Источники в этом случае остаются полностью автономными. Как правило, такие системы обладают ограниченными возможностями языка запросов (по сравнению, например, с SQL), и интегрированные данные доступны только для чтения.
Исходя из этого, основной интерес для нас представляют системы с виртуальной и гибридной интеграцией с использованием медиаторов. Архитектура такой системы представлена на рисунке 1.
Рисунок 1. Схема медиаторной интегрирующей системы
Основными компонентами такой системы являются:
· Медиатор (mediator) - программный компонент, который, с одной стороны, взаимодействует с пользователем интегрирующей системы, и, с другой стороны, с информационными источниками. Медиатор предоставляет единую “точку входа” (программный интерфейс) для запросов пользователей. Он выполняет основные стадии обработки запроса: декомпозицию на запросы к источникам (на основе их описаний), оптимизацию плана выполнения, рассылку адаптерам и комбинирование результатов.
· Адаптер (wrapper) - посредник между медиатором и информационным источником. Задача адаптера - перевести запрос из интегрированной схемы в схему источника, и, затем, результаты запроса перевести обратно в интегрированную схему. Адаптер предназначен для скрытия деталей реализации источника от медиатора.
Одной из основных проблем построения систем с помощью медиаторов является интеграция схем источников: доступ к интегрированным данным должен осуществляться в терминах одной, канонической схемы. Создание такой канонической схемы, как правило, является сложным процессом, включающим в себя несколько стадий:
1. предварительная стадия: выбор схем, которые будут интегрированы, порядок интеграции, сбор дополнительной информации о схеме источников (метаинформации)
2. сравнение схем, с целью поиска конфликтов и корреляций;
3. разрешение конфликтов, которое потенциально может включать в себя изменение схем источников (если есть такая возможность);
4. непосредственно создание интегрированной схемы;
5. спецификация отображений между глобальной схемой и схемами источников.
Следует отметить, что для глобальной схемы разработан ряд метрик, которые позволяют оценить её качество, такие как: “доступность” (в источниках присутствуют все данные, необходимые для интегрированной информации), “информационная вместимость” (information capacity) - доступность в глобальной схеме всей информации, которую можно получить непосредственно в локальном источнике, избыточность (понимание идентичных сущностей), и т.д.
Основная задача интегрирующей системы - обработка пользовательских запросов. По сравнению с традиционным процессом обработки запросов, состоящим из разбора (parsing), оптимизации и выполнения, выполнение распределённых запросов усложняется по следующим причинам:
· для выполнения запроса следует подобрать релевантные источники, т.е. источники, данные которых могут быть использованы в результате;
· источники могут иметь ограниченные возможности в плане выполнения запросов;
· часть данных может дублироваться;
· часть источников по каким-либо причинам может быть недоступна в момент выполнения запроса.
В большой степени на обработку запросов влияет то, каким образом задано соответствие глобальной схемы и схем источников. Для этого применяются следующие подходы:
· GAV (Global as View): отношения (relations) глобальной схемы выражаются через отношения локальных схем - для реляционной модели;
· LAV (Local as View): отношения локальных схем выражаются через отношения глобальных схем - для реляционной модели;
· Подход на основе DL (Description Logic): понятия (concepts) локальных источников информации определяются через понятия глобальной модели. Данный подход похож на LAV, но вместо отношений глобальной схемы используются понятия проблемной области.
При применении GAV перевод запросов из глобальной модели в модели источников осуществляется достаточно просто, так же легко строятся иерархии медиаторов. Однако, при добавлении новых информационных источников возникают сложности: надо исследовать соотношение нового источника и всех имеющихся, и изменить в соответствии с этим отображение. Таких проблем с добавлением нет у LAV - новые правила добавляются к старым, не изменяя их - но перевод запросов из глобальной схемы в локальную является сложной, хотя и достаточно хорошо изученной задачей. LAV позволяет в тех случаях, когда несколько источников содержат дублирующую информацию, получить несколько вариантов исполнения запроса, среди которых затем можно выбрать наиболее подходящий с учётом таких факторов как доступность узлов, их загруженность и т.п. Подход с использованием DL облегчает отображение по сравнению с LAV (понятия локальной и глобальной схемы являются частью предметной области), но в общем случае не позволяет описать произвольные соединения отношений; кроме этого, иногда при добавлении новых источников возникает необходимость в расширении модели предметной области.
Глава II. Интеграция данных с помощью онтологий
В главе 2 представляется подход к интеграции данных информационных систем, основанный на использовании онтологий источников данных. Метод основан на классической модели систем, использующих медиаторы, со следующими особенностями:
· Интегрируемые информационные системы могут быть как автономными, так и разработанными специальным образом для участия в распределённом взаимодействии. Помимо поиска, такие системы поддерживают обмен информацией и метаинформацией, что позволяет осуществлять распределённый поиск более эффективно, по сравнению с классической моделью.