Слово и смысл. Информация и смысл. Один и тот же смысл может быть выражен множеством словесных сочетаний. Основная проблема полнотекстового поиска и анализа состоит в том, чтобы несколькими запросами «вытащить» из текста наиболее полный объем искомого смысла. Эта проблема владения словами, синонимами, т.е. задача лингвистическая и литературно-содержательная. Поскольку слово мыслится как символ несущий смысл, становится понятным выход технологий работы с ПБД на семантику текста. Так для компьютерных технологий поиска значимы лингвистика и семантика текста. Модель языка смысл <-> текст была разработана И.А. Мельчуком, советским, канадским лингвистом (1974).
Именно в философии компьютерных технологий обострились и были подчеркнуты еще раз конфликты между смыслом и словом. Поскольку в компьютерных технологиях происходило дальнейшее отчуждение слов от смыслов, (знака от значения), конфликт слово <-> смысл оказался выражен предельно ярко. Обнаружилось, что в большинстве ситуаций поиска пользователи ищут невербальные смыслы, которые выражены словами на разных языках и всегда неточно. «Символ говорит о том, что смысл одного мира лежит в другом мире, что из другого мира подается знак о смысле» (Бердяев Н., 1994, с. 50). Оказалось, что человек в компьютерных технологиях создал великую модель окружающего мира, в которой, в конечном виде, на мониторе электронные уровни единички и нолика выглядят для человека как смыслы. Для того чтобы это было так, работают сотни тысяч специалистов различных направлений культуры.
Следствием множественных отношений между словом и смыслом является использование в работе с БД и в поиске тезаурусов. Как правило, они связаны с терминологическим аппаратом предметной области и приводят хотя бы в приблизительное соответствие слова и смыслы. Все перечисленные выше соотношения слов и искомых смыслов необходимо учитывать при составлении запроса на поиск в ПБД.
Итак, в поиске информации в ПБД запрос осуществляется в словах, а ищем мы смыслы. По этой причине любой набор ключевых слов на поиск документа или цитат из него всегда неадекватен смысловому содержанию поиска. С этих позиций существует ущербность любого словесного выражения смысла. В научных текстах всегда актуальным остается семантический и лингвистический анализ терминологического аппарата.
Важным качеством ПБД является степень концентрации отраслевого знания в экспертной6 системе. Известный парадокс знания гласит, чем меньше область, в которой сконцентрировано знание, и чем больше массив такого знания, тем выше потребительская стоимость такой системы. Это современная модификация известного тезиса о векторе развития научного знания «все большее о все меньшем».
О форме смысла. При описании онтологий мы сталкиваемся с проблемами адекватности передачи смыслов посредством слов и в виде текста научного издания. Оказывается, что традиционные печатные, полиграфические формы фиксации и передачи некоторых системных смыслов не подходят для адекватно го представления их на бумаге. Хуже всего удается передать смыслы соотношений между частями целого. Передача смысла соотношения «каждый с каждым» приводит к фиксации в виде таблицы только бинарных соотношений. Многомерные описательные таблицы (матрицы) занимают гигантские печатные площади, таблицы вложений содержат большие пустующие места, даже простые многомерные графические схемы отношений и взаимосвязей становятся «нечитабельны» из-за плотности изображения элементов и связей между ними. В электронных изданиях возможны более адекватные формы передачи сложных смыслов, за счет гиперссылок и системы закладок.
Так, важнейшее последствие применения онтологий - вопрос о форме выражения смыслов. Наследование компьютерными технологиями «бумажной» двухмерной логики выражения приобретает существенное негативное ограничение для передачи многомерной природы смыслов.
Концентрация смыслов в ПБД. По концентрации знания в найденном документе результатом поиска могут быть:
1. Упоминание;
2. Суждение;
3. Обсуждение (несколько суждений в сопоставлении);
4. Тема части документа с анализом и выводами (гипотеза или концепция);
5. Документ, целиком посвященный одной научной проблеме;
6. Подборка документов об одной научной проблеме.
Из найденных упоминаний о том, что ищешь, научной концепции не «сошьешь». Должен быть расширенный результат со множеством детализированных смыслов, на тему поиска в виде ряда статей, а еще лучше монографий. Кроме того, в таком результате поиска должны быть полностью представлены атрибуты научного решения проблемы: постановка задачи, методология решения, исходная база научной литературы, основная аналитическая часть, выводы, описание ограничений и т.д. Именно в такой своей форме ПБД начинает работать как эксперт консультант по научной проблеме.
Научная новизна и поиск в ПБД.
Методологически интересным представляется соотношение новизны научной информации и технологии полнотекстового поиска. Естественно, человек ищет то, что знает, поскольку формулирует ключевые слова поиска. Однако тем самым априори снижается новизна искомого знания. Следовательно, самым продуктивным для новизны знания будет ситуация, когда пользователь, хотя бы частично, не предполагает результат поиска. Поиск смыслов в тексте должен быть организован так, чтобы результат поиска был значительно больше ожидания исследователя.
Внесение элемента неопределенности оказывается важным условием поиска информации с наибольшим уровнем новизны. Новизна информации возникает только на основе нового алгоритма поиска. Тем самым, казалось бы, простой вопрос об информационной потребности приобретает философско-методологический характер.
«Люди будут искать то, что они знают, обращаясь к документальным репозитариям. Однако они вообще не будут или просто не смогут выразить запросом то, чего они не знают, даже имея доступ к собранию документов» (Ландэ Д., 2003), заметил Джим Нисбет, вице-президент компании Яешю, которая является одним из ведущих производителей систем добычи данных. Утверждение Джима Нисбета представляется излишне категоричным и касается крайних проявлений соотношения информационной потребности и запроса на поиск. Информационная потребность для поиска в ПБД никогда не принимает состояние «полного знания» или «полного незнания», потребность всегда состоит из некоторого сочетания пропорций того и другого. Результат именно полнотекстового поиска, одновременно снимая одни вопросы, добавляет новые, тем самым делает поиск не прерывным«интеллектуально системным» познанием научной проблемы.
Научная новизна результата поиска может быть представлена новой критикой научной концепции, понятийного или логического каркаса знания. Это самая сложная часть добычи знания, зависящая от таланта исследователя, его изощренности в постановке проблемы, в искусстве вопрошания и технологии поиска.
«Вид эффективного анализа текста - Text Mining - используя вычислительные мощности, должен выявить отношения, которые могут приводить к добыче новых знаний пользователем» (Ландэ Д., 2003).
Речь идет об отношениях между понятиями и терминами.
Развитием работы с ПБД принято считать частоту употребления «слова-понятия» в тексте. Из гигантских текстовых массивов вытаскиваются фрагменты с наиболее частым употреблением заданного ключевого слова и увязанные, на основе частотного распределения, сопутствующие слова. Здесь конкордация смыслов основного и сопутствующих слов тем больше, чем чаще они встречаются во фрагменте текста.
Другой принцип выявления кон- кордации смыслов - позиционный. Считается, чем ближе слова расположены друг к другу, чем меньше слов между ними, тем конкордация смыслов выше. Близость позиций «слов-понятий» в тексте, в пределах предложения, фразы, абзаца, считается проявлением взаимосвязи между ними. Тем самым находится контекст понятия, его окружение, более полный список терминологического аппарата. Тогда исследователь может обнаружить и интерпретировать взаимосвязь сущностей, которую раньше не замечал. В этом случае интеллектуальные технологии поиска раскрывают новые взаимосвязи смыслов.
Выводы
Ресурсы и возможности поиска в ПБД никогда не используются в полной мере возможностей. Расширение и совершенствование информационно-поисковой системы всегда актуально.
Онтологии поиска представляют собой наиболее современные и развитые способы описания, систематизации и обобщения поисковых систем.
Из общей онтологии поиска можно выделить лингвистическую часть и часть поиска, учитывающую особенности предметной области.
Лингвистика поиска должна всегда принимать во внимание первичность искомых смыслов по отношению к их вербальному выражению в виде запроса.
Чем более концентрированы в ПБД научные смыслы и одна тематика дисциплины, тем больше возможностей ее функционирования в виде базы знаний и экспертной системы.
Поиск в ПБД представляет собой открытую систему, одновременно снимая одни вопросы, он добавляет новые, делая поиск непрерывным «интеллектуально-системным» познанием научной проблемы.
Примечания
1 Big data - огромные коллекции документов или базы данных, тематически сконцентрированные в одной области знания.
2 В качестве примера следует упомянуть мощные поисковые программы: Dtsearch(www.dtsearch.com); Searchinform Desktop (www.searchinform.com).
3 Относительно предметных онтологий всегда остается определенный скепсис. Насколько изоморфны сущности вещей, чтобы их разнообразие свести к ограниченному количеству онтологических схем.
4 Проблемы онтологии музыки: Коллектив. моногр. М.: ГИИ, 2018. 400 с.
5 Инструменты статистического анализа текста. ИКЬ: http://textanalysis.rU/2 (дата обращения: 26.07.2020).
6 Общепринято деление ПБД на фактографические (фактологические), документальные и экспертные системы. В фактографических ПБД хранятся однозначные сведения, отвечающие на вопрос где, когда, кто, как называется и т.д. В документальных ПБД содержатся неоднозначные сведения, - статьи, подборки, коллекции документов по теме. Экспертные системы на основе ПБД работают как научные консультанты по данной проблеме или дисциплине, так как содержат документы, написанные экспертами в данной области знания.
ЛИТЕРАТУРА
1. Бажанов Н.С. О системе поиска информации в текстах исторического музыкознания // Вестник Томского государственного университета. Культурология и искусствоведение. 2016. № 1. С. 83-93.
2. Бердяев Н.А. Философия свободного духа. М.: Республика, 1994. 479 с.
3. Кузнецов О.П., Суховеров В.С., Шипилина Л.Б. Онтология как систематизация научных знаний: структура, семантика, задачи // Труды конференции «Технические и программные средства систем управления, контроля и измерения». М., 2010. С. 762-773.
4. Ландэ Д. Глубинный анализ тестов. Технология эффективного анализа текстовых данных. 2003. иБЬ: http://dwl.kiev.ua/art/dz/ index.html (дата обращения: 26.07.2020).
5. Мёдова А.А. Онтология времен музыки: физическое и астрономическое время в музыкальном произведении // Философские науки. 2016. № 5. С. 110-123.
REFERENCES
1. Bazhanov, N.S. (2016), “About the system of information search in texts of historical musicology”, Vestnik Tomskogo gosudarstvennogo universiteta. Kul'turologiya i iskusstvovedenie [Bulletin of Tomsk State University. Cultural studies and art history], № 1, pp. 83-93. (in Russ.)
2. Berdyaev, N.A. (1994), Filosofiya svobodnogo dukha [Philosophy of the free spirit], Respublika, Moscow, 479 p. (in Russ.)
3. Bertalanffy, L. von. (1968), General System theory: Foundations, Development, Applications, 1st ed., George Braziller, lnc., N. Y., 289 p. (in Eng.)
4. Kuznetsov, O.P., Sukhoverov, V.S., Shipilina, L.B. (2010), “Ontology as a systematization of scientific knowledge: structure, semantics, tasks”, Trudy konferentsii “Tekhnicheskie i programmnye sredstva sistem upravleniya, kontrolya i izmereniya” [Works of the conference
5. Мельчук И.А. Опыт теории лингвистических моделей «Смысл ^ Текст». М., 1974. 370 с.
6. Некипелов Н., Шахиди А. Онтология анализа данных // Антология онтологии: Электронная подборка научных статей / сост. Н.М. Боргест. Самара, 2010.
7. Пальчунов Д.Е. Решение задачи поиска информации на основе онтологий // Бизнес-информатика. 2008. № 1. С. 3-13.
8. Сафина Г. Создание и использование полнотекстовых баз данных в учебном процессе вуза // Вестник Казанского государственного университета культуры и искусств. 2005. № 3. С. 214-215.
9. Шабурова Н.Н., Анализ использования полнотекстовых баз данных в информационно-библиотечном обслуживании научных исследований // Библиосфера. 2006. № 2. С. 7-12.
10. Яскевич Я.С., Лукашевич В.К. Философия и методология науки: Учеб. пособие для магистрантов и аспирантов. Минск: БГЭУ, 2006, С. 33.
11. Bertalanffy L. von. General System theory: Foundations, Development, Applications. 1st ed. N. Y.: George Braziller, lnc., 1968. 289 p.
12. “Technical and Software Tools for Control, Control and Measurement Systems”], Moscow, pp. 762-773. (in Russ.)
13. Lande, D. (2003), Glubinnyi analiz testov. Tekhnologiya effektivnogo analiza tekstovykh dannykh [Deep text analysis. Technology for effective text data analysis], available at: http:// dwl.kiev.ua/art/dz/index.html (accessed 26 July 2020). (in Russ.)
14. Melchuk, I.A. (1999), Opyt teorii lingvisticheskikh modelei “Smysl ^ Tekst” [Experience of the theory of linguistic models "Meaning ^ Text"], Moscow, 370 p. (in Russ.)
15. Myodova, A.A. (2016), “Ontology of the times of music: physical and astronomical time in a musical work”, Filosofskie nauki [Philosophical Sciences], no. 5, pp. 110-123. (in Russ.)
16. Nekipelov, N., Shahidi, A. (2010), “Ontology ofdata analysis”,Antologiya ontologii,
17. Ehlektronnaya podborka nauchnykh statei [Anthology of ontology, Electronic collection of scientific articles], Samara. (in Russ.)
18. Palchunov, D.E. (2008), “Solving the problem of searching for information based on ontology”, Biznes-informatika [Business informatics], no. 1, pp. 3-13. (in Russ.)
19. Safina, G. (2005), “Creation and use of full-text databases in the educational process oftheuniversity”, Vestnik Kazanskogo
20. gosudarstvennogo universiteta kul'tury i iskusstv [Bulletin of the Kazan State University of Culture and Arts], no. 3, pp. 214-215. (in Russ.)