ОРДЕНА ЛЕНИНА ИНСТИТУТ ПРИКЛАДНОЙ МАТЕМАТИКИ
им. М.В. Келдыша
Российской Академии Наук
Проблемы технологического обеспечения многоцелевого режима эксплуатации каталогов метаданных Интернет
Е.Л. Китаев, Д.Л. Кузьмичев, М.И. Слепенков
Москва, 2002
Аннотация
В настоящей работе делается попытка представить обзор современной проблематики технологического обеспечения каталогов метаданных Интернет. На примере каталога веб-сайтов дается описание архитектуры системы, вводятся основные сущности и структуры данных, в которые они отображаются, а также рассматривается процесс ведения каталога, компоненты и рабочие места, участвующие в этом процессе. Приводятся основные функциональные требования к системе обслуживания подписчиков при эксплуатации каталога в многоцелевом режиме, а также предлагаются некоторые решения, направленные на удовлетворение этих требований.
Abstract
The paper attempts to give an overview of current technological problems for supporting Internet metadata catalogues. Based on the examples of a Web-site catalogue authors present the architecture, introduce underlying objects and data structures used for their representation in the database. The process of the catalogue content management is described along with the components and tools participating in the process. The set of functional requirements for catalogue subscriber service subsystem is discussed and some solutions are proposed.
Введение
Сегодня одной из самых распространенных задач, которую приходится решать пользователям глобальной сети, является поиск и оптимизация доступа к ресурсам Интернет. Для обеспечения этой потребности в сети создаются узлы-посредники, в основе организации которых лежат массивы метаданных - определенным образом структурированная информация, описывающая атрибуты ресурсов. Эффективность работы посредника напрямую зависит от качества метаданных, которыми он располагает. При этом важную роль играет не только формальный аспект (например, степень структурированности метаданных), но и достоверность самой информации о ресурсе, ее актуальность.
На сегодняшний день высокое качество описания ресурсов достигается в каталогах метаданных. Каталоги обычно специализируются на определенном типе ресурсов: описания сайтов, электронных документов, дистрибутивах программ, базах данных, вычислительных серверах сети и т.п. В каталогах, автоматизированные процедуры сбора информации (сканирование сети, организация приема заявок от владельцев ресурсов и т.п.) дополняются участием экспертов (референтов). В задачи экспертов входит оценка различных параметров ресурса, его классификация, составление описания ресурса и задание ряда атрибутов, которые невозможно определить автоматически.
Особенностью метаданных ресурсов Интернет, отличающих их от прочих информационных фондов (библиографических каталогов, музейных каталогов и т.п.), является высокая степень изменчивости предмета описания. Помимо изменения содержания самого ресурса (например, обновление контента сайта, изменения состояния загруженности вычислителя), объективно существует такой важный параметр - как доступность. Понятно, что для поддержки актуальности метаданных процесс экспертизы ресурса должен производиться итеративно и достаточно регулярно. Из вышесказанного следует, что организация каталога метаданных ресурсов Интернет является дорогостоящим и трудоемким предприятием.
Одним из перспективных путей обеспечения подписчиков качественной информацией при одновременном снижении ее себестоимости является переход от одно-целевого режима функционирования каталогов метаданных (т.е. когда каталог работает в качестве поставщика информации для одного потребителя), к много-целевому режиму, когда каталог обслуживает большую группу подписчиков - потребителей метаинформации -одновременно. Основной проблемой, возникающей при таком варианте использования каталога, является многообразие взглядов на метаданные со стороны подписчиков. Такая постановка объективно вытекает из того, что на практике подписчики специализируются не только по типам ресурсов, но и по целевым группам пользователей, запросы которых они обслуживают.
В настоящей работе делается попытка представить обзор современной проблематики технологического обеспечения каталогов метаданных Интернет. Содержание работы разделено на два раздела. В первом разделе будет описана архитектура каталога, введены основные сущности и структуры данных, в которые они отображаются, а также рассмотрен процесс ведения каталога и компоненты, участвующие в этом процессе.
Во втором разделе будут описаны основные функциональные требования к системе обслуживания подписчиков, возникающие при эксплуатации каталога в многоцелевом режиме, а также предложены некоторые решения, обеспечивающие выполнение этих требований. В заключительной части можно найти краткий обзор наиболее значимых инициатив в области организации инфраструктуры метаданных Интернет и месте настоящей работы в этой научно-практической области.
1. Архитектура каталога метаданных
Цель этого раздела - сформировать у читателя общее представление об архитектуре каталога метаданных, а также рассмотреть широкий круг технических деталей, связанных со структурами данных, в которые погружается информация; технологические операции по ведению контента; принципы организации редакционного процесса; связи с внешними системами и сервисами и т.д. Последующее изложение будет построено на примере каталога описаний Веб-сайтов. Авторы исходят из того, что подавляющее большинство читателей знакомо с каталогами этого класса, составляющих основу популярных порталов и поэтому нет необходимости раскрывать целевую функцию этого типа метаданных.
1.1 Основные сущности каталога
В основе любого каталога лежат три сущности: рубрикаторы, состоящие из рубрик (тематических разделов, категорий, географических понятий и т.п.) образующих иерархическую структуру; объекты рассматриваемой области - описания ресурсов, характеризующиеся определенным набором атрибутов; а также связи, которые устанавливаются между ресурсами и рубриками (позиционирование ресурсов в рубрикаторе).
Все обладающие общими свойствами объекты можно выделить в группу. Объекты внутри этой группы можно разделить на подгруппы, определяемые другими свойствами, еще более конкретизирующими объект. Таким образом, можно выделять подгруппы вплоть до полного исчерпания известных свойств объектов или до нужного уровня конкретизации (абстракции). Рубрика - это некий уровень абстракции, классифицирующий объект, а совокупность рубрик образует иерархическую систему и называется рубрикатором. На Рис. 1 приведена примеры простой иерархической структуры тематического и географического рубрикаторов Веб-сайтов.
Рис. 1 Фрагменты тематического и географического рубрикаторов
Как видно из рисунка, на самом верхнем уровне иерархии находится абстрактный раздел с названием рубрикатора. Он содержит, например, такие подрубрики, как "Бизнес и финансы", "Спорт", "Путешествия и Туризм". Те, в свою очередь, содержат другие подрубрики и т.д.
Некоторые рубрики могут быть по смыслу ассоциативно связаны с другими группами рубрик, находящимися на других ветвях иерархии. Пример подобных ассоциаций приведен на рис. 2. Как видно из рисунка, такими связями могут обладать подразделы "Бизнес" и "Спорт" раздела "СМИ", которые образуют смысловые связи с подразделами "Новости бизнеса" (раздел "Бизнес и финансы") и "Новости спорта" (раздел "Спорт"). На рис. 2 эти связи указаны в виде ссылок на соответствующие разделы "СМИ".
Рис 2. Пример ассоциативных связей между рубриками
Другими словами, все объекты, принадлежащие, например, разделу "СМИ/Бизнес", могут быть отнесены в виртуальный подраздел "Новости бизнеса" раздела "Бизнес и финансы".
Основные атрибуты, которыми должны обладать ассоциативные связи - это идентификатор раздела, содержащий объекты; идентификатор раздела, в котором будет создан виртуальный подраздел, и псевдоним (название) виртуального подраздела.
Переходя к атрибутному составу описания Веб-сайта, следует сразу отметить, что оно не такое простое, как может показаться посетителю страниц каталога. Данное описание отнюдь не исчерпывается URL сайта и его аннотацией. Ниже представлена форма - регистрационная карточка описания Веб-сайта, которая используется при ведении действующего.
Полный перечень реквизитов описания ресурса включает в себя:
· URL ресурса - адрес сайта.
· Заголовок содержит название и цель сайта, так, чтобы читая заголовок отдельно от аннотации, посетитель мог понять основную идею сайта.
· Аннотация сайта - краткое описание содержания сайта, не содержащее оценочной или рекламной информации.
Рис. 3 Карточка описания веб-сайта
· Аннотация от владельца сайта - дополнительная информация об изменениях и дополнениях к содержанию сайта.
· Ключевые слова - набор слов, по которым может быть осущёствлен поиск сайта, дополняющий слова из заголовка или аннотации.
· Язык сайта - множественный признак, определяющий на каких языках представлены публикации на сайте.
· Сервисы сайта - перечень признаков, отражающих наличие на сайте специализированных информационных разделов или функций (чата, конференций и форумов, подборок ссылок, интернет-магазина, службы рассылок, MP3 и др.).
· Источник информации (Коммерческая организация, Частное лицо, Пресса, Неизвестен и т.п.) - дополнительный признак, позволяющий посетителю точнее оценить уровень достоверности информации, представленной на сайте.
· Вид информации (Коммерческая, Развлекательная, Справочная, Общение и т.п.) - дополнительный признак, позволяющий посетителю оценить характер представленной на сайте информации.
· География - элементы специального географического рубрикатора, характеризующие региональную принадлежность содержимого сайта, могут отсутствовать у ресурсов, не имеющих по своей природе региональной принадлежности.
· Тематические рубрики - элементы тематического рубрикатора, отражающие тематическую направленность ресурса. Для каждой рубрики редактором дополнительно устанавливается коэффициент релевантности ресурса и темы. Этот коэффициент обычно используется, как один из параметров сортировки при показе списка ресурсов в рубрике на страницах каталога.
· Объем ресурса - атрибут принимает одно из следующих значений: Страница, Сайт, Раздел сайта, Не определено.
· Доступность ресурса - результат работы специальной утилиты, осуществляющей регулярную автоматическую проверку доступности ресурса по его URL.
· Служебные реквизиты - идентификатор ресурса в БД; реквизиты, характеризующие состояние обработки ресурса (зарегистрирован, в работе, в архиве, опубликован и т.п.), дату регистрации в каталоге, дату актуализации и т.п.
Как видно, структура описания ресурса является достаточно сложной с большим количеством множественных атрибутов, а также связями с рубрикаторами (при этом каждая связь обладает собственными атрибутами). Важно также отметить, что в описании ресурсов представлены атрибуты, которые имеют различный регламент ведения: автоматический (например, доступность); полуавтоматический (например, название и ключевые слова могут быть получены путем сканирования головной страницы сайта, а затем обработаны редактором); большая часть полей ведется вручную параллельно редакторским коллективом каталога и владельцами сайтов (в частности, атрибуты сайта, указанные его владельцем, могут быть проверены и скорректированы редактором).
1.2 Представление основных сущностей каталога в базе данных
Определив три основных сущности каталога и его атрибуты, мы тем самым определили несколько таблиц базы данных и отношения между ними. Типовая схема базы данных Веб-каталога будет иметь вид, представленный на Рис. 4.
В схеме представлено шесть таблиц:
· Resource- таблица, содержащая описания сайтов: Resource_ID - идентификатор сайта в БД; Resource _URL - адрес сайта в Интернет; Resource_Name - название сайта; Resource_Description - описание сайта, публикуемое на страницах каталога (смысл остальных полей мы не рассматриваем, поскольку он очевиден из их названий и соответствует тем атрибутам, которые представлены в карточке описания сайта см. Рис.3).
Рис. 4 Фрагмент схемы Базы Данных для представления основных сущностей каталога
· Rubric - таблица для представления иерархических рубрикаторов Веб-каталога: Rubric_ID - идентификатор рубрики - тематического раздела каталога; Rubric_Parent_ID - идентификатор родительского раздела; Rubric_Name - название раздела; Rubric_Description - описание раздела; Rubric_Keywords - список ключевых слов характеризующих рубрику; Rubric_Sort_Order - поле, значение которого используется для упорядочивания подрубрик на страницах Веб-каталога при показе тематического раздела и всех его подрубрик; Rubric_Is_Visible - поле типа bit, принимающее одно из двух значений: 1 - рубрика публикуется на страницах каталога, 0 - рубрика не публикуется (обычно «невидимые» рубрики используются в технологических целях для организации редакторского процесса, о котором речь пойдет ниже); Editor_ID - идентификатор редактора, отвечающего за ведение ресурсов в данном разделе каталога.
· Resource_Rubric - таблица для представления множественных связей между веб-реcурсами и рубриками классификатора: Resource_ID - идентификатор сайта в БД; Rubric_ID - идентификатор рубрики, к которому принадлежит сайт; Relation_Weight - весовой коэффициент, значение которого используется для сортировки описаний сайтов на страницах Веб-каталога при показе всех ресурсов, связанных с данной рубрикой.
· Rubric_Link - таблица, содержащая описание ассоциативных связей между рубриками: Rubric_ID - идентификатор рубрики; Rubric_Parent_ID - идентификатор дополнительного родительского узла; Rubric_Name - имя псевдонима рубрики, с которым она будет показана в контексте данного родительского узла.
· Resource_Attribute - таблица с нормативными данными для представления атрибутов сайта: Resource_Attribute_ID - идентификатор атрибута; Resource_Attribute_Name - имя атрибута; Resource_Attribute_Category - категория, к которой принадлежит данный атрибут (в каталоге выделяются следующие категории: Языки сайта, Сервисы сайта, Источник информации, Вид информации).