Статья: Разработка инструментов аналитики данных международных наукометрических сервисов

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Разработка инструментов аналитики данных международных наукометрических сервисов

М.А. Митрохин, Д.А. Данилин

Аннотация

наукометрический сервис интерфейс

Описаны базы знаний наукометрических сервисов Scopus, Web of Science, eLIBRARY.RU, Mendeley, SCImago Journal & Country Rank. Рассмотрены возможности пользовательских интерфейсов данных сервисов, частота обновления данных, особенности получения доступа к информации, принципы их работы. Описаны возможности существующих интерфейсов программного получения данных (API) рассматриваемых сервисов. Обоснована целесообразность разработки программных модулей получения данных о публикационной активности сотрудников наукоемких предприятий, преподавателей и обучающихся образовательных организаций с помощью описанных API. Представлены результаты разработки сервиса аналитического сопровождения публикационной активности сотрудников Пензенского государственного университета.

Ключевые слова: аналитика, наукометрия, обработка данных, API, публикации, наука, автоматизация.

Abstract

DEVELOPMENT OF DATA ANALYTICS TOOLS FOR INTERNATIONAL SCIENTOMETRIC SERVICES

M.A. Mitrokhin, D.A. Danilin

The knowledge base of scientometric services Scopus, Web of Science, eLIBRARY.RU, Mendeley, SCImago Journal & Country Rank are described. The possibilities of user interfaces of these services, the frequency of data updates, the features of accessing information, the principles of their work are considered. The capabilities of the existing software data acquisition interfaces (APIs) of the considered services are described. It is concluded that it is advisable to develop software modules for obtaining data on the publication activity of employees of high-tech enterprises, teachers and students of educational organizations using the described APIs. The experience of Penza State University in the development of analytical support services for the publication activity of employees is presented.

Keywords: analytics, scientometrics, data processing, API, publications, science, automation.

Введение

Одним из основных процессов управления научными и научно-образовательными организациями является управление знаниями (knowledge management) [1]. Частной задачей управления знаниями является аналитическое сопровождение публикационной активности сотрудников (обучающихся). Эта задача является одной из наиболее актуальных и значимых в организации научно-исследовательской деятельности. Эффективный сбор, анализ и представление наукометрических данных позволяют не только оперативно и точно оценивать текущее состояние научного сектора учебного заведения или НИИ, но и применять экономико-организационные решения с целью повышения как уровня публикационной активности, так и качества публикуемых материалов. Но информационно-аналитическое сопровождение публикационной активности сотрудников и обучающихся - трудоемкий процесс, связанный с обработкой большого объема данных. Одним из способов оптимизации этого процесса (уменьшения времени актуализации данных, повышения точности формируемых показателей, исключения дублирования данных и т.д.) является использование программных способов получения первичных данных о научных трудах. Такой подход позволяет не только снизить нагрузку на человеческие ресурсы (исключение необходимости ручного ввода), но и исключить необходимость модерации вводимых данных (ввиду их гарантированной достоверности, обеспечиваемой издательствами и наукометрическими сервисами), а также автоматизировать саму загрузку обрабатываемых данных в информационную систему организации, не выделяя ее в отдельный производственный процесс.

Материал и методика

В настоящее время наибольшей популярностью в Российской Федерации пользуются наукометрические сервисы: Scopus, Web of Science, Re- searcherlD, eLIBRARY.RU, Mendeley, SCImago Journal & Country Rank.

Scopus - крупнейшая международная база данных, содержащая аннотации и информацию о рецензируемой издательским домом Elsevier научной литературе, имеющая встроенные инструменты анализа, отслеживания и визуализации данных [2]. Данные Scopus используются для составления таких международных рейтингов университетов, как QS, THE, Shanghai University Rankings [3]. Метрики данного сервиса также активно используются министерствами и ведомствами, курирующими научную и инновационную деятельность (не только РФ, но и других государств), а также осуществляющими финансирование НИР фондами. Scopus отличается глубиной и широтой охвата содержимого, а также ежедневной актуализацией данных. В базе Scopus содержится более 23 700 изданий (из них 280 - специализированные, 4000 журналов в открытом доступе) более 5000 международных издателей в области гуманитарных, общественных, естественных наук, а также техники, медицины и искусства. Кроме того, данный сервис хранит более 167 000 книг, ежегодно добавляя более 20 000 книг и 560 книжных серий, более 8,3 млн докладов конференций на 100 000 международных конференциях. Отличительной особенностью Scopus является возможность хранения публикаций в стадии допечатной подготовки «Articles-in-Press» из 8000 журналов. Общее же число записей в базе знаний составляет 71 млн (из них 64 млн записей с 1969 г., остальные - до 1970 г., наиболее ранняя из которых датируется 1788 г.). Общее число патентных записей - более 39 млн от пяти мировых патентных ведомств. Scopus имеет собственный интерфейс программного предоставления данных - любой желающий может получить ключ API и использовать его бесплатно (при соблюдении политики использования API и данных). Вся информация, получаемая через API, имеет подробный вид, описанный в технической документации сервиса. Так, зная ID автора, можно получить все его публикации, а также расширенную информацию о публикациях: дата, издание, авторы, цитирование и т.д. При необходимости же получения большей информации (издание, аффиляция авторов и т.д.) возможно оформление подписки на платный сегмент API.

Web of Science представляет собой поисковый веб-сервис, объединяющий реферативные базы данных публикаций в научных журналах и патентов (в т.ч. базы, учитывающие взаимное цитирование публикаций) [4]. Web of Science охватывает материалы по общественным, техническим, естественным, гуманитарным наукам и искусству. Платформа обладает встроенным поисковиком с возможностью анализа и управления библиографической информацией. Данный наукометрический сервис также предоставляет бесплатный API и поддерживает расширенный поиск по всем материалам для получения метаданных на уровне элементов, включая цитируемость и аффиляцию авторов. Кроме того, возможно обнаружение связанных работ.

В число инструментов обработки данных Web of Science входит ResearcherlD - международная идентификационная система для глобального учета уникальных авторов научных статей [5]. После добавления публикаций в профиль ResearcherlD происходит автоматическая привязка соответствующих публикаций в Web of Science (создается прямая ссылка из Web of Science на профиль ResearcherlD). Использование данного сервиса позволяет сформировать полный список статей автора, которые есть в базе Web of Science, а также получать статистические данные, по которым можно формировать инфографику. Однако существенным минусом данного инструмента является отсутствие API.

Mendeley - веб-сервис и бесплатная программа для управления данными, позволяющая просматривать и хранить исследовательские работы в формате PDF и имеющая подключение к международной социальной сети научных сотрудников [6]. Объем хранимых сервисом документов составляет порядка 100 млн работ. Данные Mendeley позволяют оценить общее число публикаций в целевом научном направлении, динамику изменения этого числа в разные годы, выявить наиболее просматриваемые публикации и их аудиторию по странам. Сервис позволяет выбрать как бесплатный базовый пакет услуг, так и платный, предоставляющий увеличенные квоты на хранение материалов и создание групп. С помощью API Mendeley, предоставляемого на бесплатной основе, возможно получение информации об атрибутах, размещенных в базе документов: список ключевых слов, аннотацию, а также число просмотревших этот документ ученых, их места работы, страны проживания, должности и т.д.

eLIBRARY.RU является крупнейшей в России электронной библиотекой научных публикаций, обладающей обширными возможностями анализа и поиска научной информации [7]. Библиотека интегрирована с Российским индексом научного цитирования (РИНЦ) - бесплатным общедоступным инструментом измерения публикационной активности ученых и организаций, созданным по заказу Министерства науки и высшего образования РФ [8]. База данных eLIBRARY.RU содержит более 29 млн публикаций и научных статей, в т.ч. электронные версии более чем 5600 (4800 - в открытом доступе) российских научно-технических журналов. Платная подписка eLIBRARY.RU предоставляет пользователю доступ к полнотекстовой коллекции из более 1100 ведущих российских журналов. При этом идентификация пользователей с оформленной подпиской в библиотеке осуществляется на основе внешних IP-адресов компьютеров, с которых ведется работа (список IP-адресов, относящихся к организации-лицензиату, модерируется только официально утвержденным представителем организации в его административном интерфейсе). Личный кабинет пользователя (в т.ч. без подписки) позволяет осуществлять настройку извещений по электронной почте, настройку панели навигатора, истории поисковых запросов, вносить изменения в персональную карточку, формировать подборки статей и т.д. Несмотря на широкие возможности визуального интерфейса сервиса, долгое время у библиотеки не было интерфейса программного получения данных. Однако в 2019 г. был осуществлен релиз eLIBRARY.RU API, доступ к которому является платным (минимальная цена - 25 000 руб.) [9].

SCImago Journal & Country Rank (SJCR) - общедоступный аналитический портал, который предоставляет наукометрические показатели по журналам и странам, а также отображает статистику цитирования журналов и рейтинги публикационной активности [10]. Основными показателями, размещаемыми на ресурсе, являются SCImago Country Rank (SCR) и SCImago Journal Rank (SJR). SCR учитывает многие факторы: индекс Хирша, взвешенные показатели цитирований по годам, общее количество опубликованных цитирований, статей. SJR (показатель престижности или влияния журнала) отображает среднее число цитат, полученных в текущем году на статьи, опубликованные в журналах за три предыдущих года [11]. Данный сервис позволяет сравнивать рейтинги как отдельных журналов, так и стран в целом. Данные о журналах могут быть сгруппированы по тематическим областям (27 основных тематических областей), тематическим категориям (313 конкретных тематических категорий) или по странам. Объем обрабатываемых SJCR данных составляет порядка 34 100 изданий от более чем 5000 международных издателей из 239 стран. Обновление данных осуществляется 2 раза в год. Данный сервис не предоставляет API, однако позволяет отображать основные метрики журнала в веб-интерфейсе с помощью встраиваемого кликабельного виджета.

В условиях существования API крупных международных наукометрических сервисов (Scopus, Web of Science, eLIBRARY.RU), повсеместной циф- ровизации современной научно-образовательной отрасли, а также отсутствия готовых решений, ориентированных на интеграцию с информационными системами вуза или научной организации, становится актуальной разработка ПО автоматизированного получения и анализа соответствующих данных.

Разработка веб-сервиса аналитического сопровождения публикационной активности сотрудников Пензенского государственного университета

Одним из этапов разработки соответствующего программного обеспечения (ПО) является выбор архитектуры его построения. Среди наиболее распространенных архитектур можно выделить нативное приложение, независимый веб-сервис, решение на базе конфигурируемой системы или фреймворка, а также веб-модуль расширения функционала уже используемых систем. Сравнительная характеристика указанных подходов приведена в табл. 1.

Таблица 1 Сравнительная характеристика архитектур построения ПО

Подход

Плюсы

Минусы

Нативное приложение

- возможность буферного хранения обрабатываемой информации на стороне клиента и отложенной синхронизации данных;

- возможность использования аппаратных функций устройства;

- возможность работы при отсутствии сетевого соединения

- необходимость разработки ПО для каждой целевой платформы и операционной системы;

- необходимость доставки объемных обновлений

на устройства пользователей;

- сложность однообразного

и одновременного изменения бизнес-логики сервиса, реализуемой на стороне пользователя

Отдельный веб-сервис

- легкость доставки информационной услуги

до пользователя и обновления функционала сервиса;

- кроссплатформенность

- необходимость дублирования на стороне сервера информации, возможно, хранимой

в уже эксплуатируемых программно-вычислительных комплексах организации ;

- необходимость разработки не только целевого функционала, но и типовых модулей и подсистем (авторизация, взаимодействие с БД и т.д.);

- необходимость наличия постоянного сетевого соединения

Фреймворк

- наличие уже готовых служебных модулей ПО

- необходимость приобретения лицензии;

- ограниченный функционал, заложенный возможностями базового ядра системы;

- отсутствие гарантированной кроссплатформенности

Веб-модуль расширения функционала

- наличие уже готовых служебных модулей ПО;

- легкость доставки информационной услуги

до пользователя и обновления функционала сервиса;

- кроссплатформенность

- необходимость адаптации разработки к уже существующему ПО;

- необходимость наличия постоянного сетевого соединения

В условиях существования уже используемых на предприятии или в образовательной организации информационных систем наиболее рациональным подходом можно считать разработку веб-модуля расширения функционала. Его достоинства сочетают в себе гибкость адаптации существующих модулей к новой задаче с кросс-платформенностью и простотой использования конечным пользователем, а зависимость построенного таким образом ПО от наличия постоянного сетевого соединения может быть частична компенсирована кэшированием данных на стороне клиента.

Именно такой подход был выбран для разработки веб-сервиса аналитического сопровождения публикационной активности сотрудников Пензенского государственного университета - «Scopus PSU»Данный проект стал победителем конкурса «Ректорские гранты - 2019» (Договор на проведение НИР № 16,18,19/19 НИР) и сейчас находится на этапе внутреннего тестирования..

Проект «Scopus PSU» представляет собой комплекс программных средств, позволяющих интегрировать данные международного наукометрического сервиса Scopus в информационное пространство ПГУ. Данный сервис позволяет автоматизировать загрузку данных о публикациях, проиндексированных Scopus, в электронную библиотеку ПГУ, проводить аналитику показателей публикационной активности сотрудников и подразделений (количество публикаций, их цитируемость, индекс Хирша авторов научных работ и т.д.), а также осуществлять выгрузку соответствующих показателей в графическом (диаграммы) и табличном виде.

Работа веб-сервиса «Scopus PSU» основана на взаимодействии электронной библиотеки ПГУ из состава электронной информационной образовательной среды (ЭИОС) c программным интерфейсом Elsevier API, предоставляющим данные наукометрического сервиса Scopus [12]. Схема взаимодействия элементов сервиса представлена на рис. 1.

Рис. 1. Схема взаимодействия элементов веб-сервиса «Scopus PSU»

Результаты

Использование данного сервиса позволяет отказаться от процесса ручного ввода данных о научных работах и дальнейшей их верификации, и требует для своей работы лишь ввода сотрудником его уникального идентификатора Scopus в личном кабинете ЭИОС ПГУ. При этом привязка данных к иерархии подразделений университета, заложенной в ЭИОС, не требует создания дополнительных инструментов администрирования: при редактировании данных о месте работы или иной информации о сотруднике данные обновляются автоматически.

Пользовательский интерфейс страницы просмотра данных о подразделениях приведен на рис. 2, где область экрана № 1 - история перехода по иерархии подразделений вуза, область № 2 - панель быстрого поиска и перехода к подразделениям, область № 3 - данные о текущем подразделении, область № 4 - данные о подчиненных подразделениях, область № 5 - панель фильтрации данных по времени, типу публикации и т.д.

Источник: https://otherreferats.allbest.ru/download/1323577/