Материал: 2047

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

понденты выборки «мужчины»(3) отличны в своем представлении действия «кредит» нежели респонденты выборки «женщины»(4).

По подробно рассмотренному в первой задаче способу ассоциации были условно сгруппированы в рассматриваемых выборках. Вновь получили упорядоченные выборки по означенным шести признакам. Отличия в представлении действия «кредит» значительны и имеют тенденцию.

При попарном сравнении были получены следующие выводы: у женщин более выражен и эмоционально представлен положительный оттенок. Например, более 60 % женщин из «хороших» заемщиков дали такие ассоциации, как «мечты» и «удовольствие». Тот же положительный оттенок у мужчин выражен через более рациональные понятия: «будущее» и «работа». Слова-значения, имеющие нейтральный оттенок или отражающие рациональное поведение, значительно чаше упоминались мужчинами, нежели женщинами. Более 50 % мужчин связывают кредит с негативной стороной: «зависимость», «мошенники». Большим значениям относительных частот встречаемости ассоциаций, означающих упрощение решения проблемы, а также означающих преувеличение своих возможностей, для респондентов выборки «женщины» соответствует значительно меньшие у респондентов выборки «мужчины».

Задача 3. Выявление различий в уровне исследуемого признака – отношение респондентов к действию «кредит» в соответствующих выборках по возрасту и социальному статусу.

Следует учесть на основании предыдущих выводов, что данное исследование следует проводить внутри направленной выборки «мужчины» и «женщины» из выборки респондентов с «хорошей» кредитной историей. При попарном сравнении получены значимые различия в уровне признака «образование», которые удалось подтвердить между респондентами из выборок: «мужчины до 35 лет, имеющие средне-специальное образование»(5) и «мужчины до 35 лет, имеющие высшее образование»(6); «женщины до 25 лет, имеющие высшее образование»(7) и «женщины до 25 лет, имеющие среднеспециальное образование»(8); «женщины до 35 лет, имеющие высшее

образование»(9) и «женщины до 35 лет, имеющие средне-специальное образование»(10);

Значимые различия в уровне признака «возраст» удалось подтвердить между респондентами из выборок: «женщины до 25 лет, имеющие высшее образование»(11) и «женщины до 35 лет, имеющие

40

высшее образование»(12); «женщины до 25 лет, имеющие высшее образование»(13) и «женщины старше 45 лет, имеющие высшее образование»(14); «женщины до 35 лет, имеющие высшее образование»(15) и «женщины старше 45 лет, имеющие высшее образование»(16); «женщины до 25 лет, имеющие средне-специальное образование»(17) и «женщины старше 45 лет, имеющие средне-специальное образование»(18); «женщины до 35 лет, имеющие средне-специальное образо-

вание»(19) и «женщины старше 45 лет, имеющие средне-специальное образование»(20).

Среди мужчин разного возраста так же следует отметить наличие разного представления действия «кредит»: «мужчины до 35 лет, имеющие высшее образование»(21) и «мужчины старше 45 лет, имеющие высшее образование»(22); «мужчины до 25 лет, имеющие среднеспециальное образование»(23) и «мужчины до 35 лет, имеющие сред- не-специальное образование»(24); «мужчины до 25 лет, имеющие средне-специальное образование»(26) и «мужчины старше 45 лет, имеющие средне-специальное образование»(27).

Таким образом, доказанные гипотезы о наличии значимых различий позволяют говорить о возможности идентификации и интерпретации выделенных групп, а так же следует считать социальнодемографические признаки и признак «кредитная история» значимыми для разделения групп на основании консолидации мнений в выделенных группах. Данное положение определяет структуру типологии СПП.

Для осуществления третьей составляющей алгоритма построения СПП, а именно идентификации и интерпретации выделенных структур СЗП, как правило, предлагаются методики, в основе которых лежат методы статистического анализа данных, ориентированных на проверку заранее сформулированных гипотез [97, 98, 55].

Для того чтобы снять субъективную составляющую подхода в выделении СЗП, как наиболее важный момент подтверждения состоятельности выдвигаемых положений работы о наличии существенных различий значимых для разделения групп (на основании консолидации мнений в выделенных группах по отношению к действию «кре-

дит»), необходимо перейти к разработке автоматизированной системы, на базе методов, позволяющих находить закономерности самостоятельно и строить гипотезы о взаимосвязях. Система на основании полученных выводов должна реализовывать возможность создания анкет для осуществления классификации КЗ.

41

Таким образом, в соответствии с классификацией, представленной на рис. 2.1, методы, лежащие в основе модуля, решающего задачу формирования анкеты КЗ, как инструментария извлечения знаний, ориентированы на аналитика; фактические данные получены путем анкетирования на естественном языке; анализ СПП следует осуществлять в соответствии с полученной структурой типологии КЗ с использованием методов психосемантики.

3.2. Разработка алгоритма извлечения и структурирования знаний с целью автоматизированного формирования анкеты КЗ

Применительно к поставленной задаче анализа СПП были рассмотрены работы, посвященные аналогичным задачам [55, 57, 93, 97, 98, 151], из которых следует, что в качестве начального этапа системного анализа подобных объектов используются различные виды группировки или разбиения множества на подмножества, теоретической основой которых всегда является некоторое отношение эквивалентности.

Для обозначения этой процедуры, в том числе в области анализа данных в социальной и экономической психологии, обычно используются термины: типология, кластеризация и классификация [45].

В работе следует придерживаться следующих положений, принятых в данных областях исследований:

«Разбиение, классы которого описаны через признаки, использованные при его построении, называют типологией или типологической группировкой» [138];

«Тип – это совокупность исследуемых объектов, гомогенная относительно заданного множества признаков. А типология – это совокупность типов, выделяемых на множестве исследуемых объектов. Тип может быть представлен некоторым усредненным представите-

лем» [138];

«Выход при разбиении множества исследуемых объектов на уровень гомогенности (однородности) означает, что не осталось способов различать элементы внутри классов, то есть исчерпан набор признаков, порождающих новые разбиения» [98];

«Реальные отличия между двумя объектами имеют две составляющие: интертипные отличия, имеющие системный комплексный качественный характер; отличия внутри типа, имеющие случайный, количественный характер» [98].

42

Далее, использование типологии кредитных заемщиков позволит перейти к их классификации на ее основании, при утверждении, что если «типологическая группировка описана еще и в терминах какойлибо другой системы признаков, относящихся к данному явлению, то есть устанавливает в явной форме теоретические связи между различными сторонами изучаемой системы, то ее называют классификаци-

ей» [45].

В терминах исследуемой предметной области следует построить типологию КЗ, на основе которой будет формироваться анкета КЗ, посредством которой и будет определяться СПП конкретного соискателя для оценки возможных рисков, связанных с субъективным кредитным поведением.

Такую задачу следует отнести к задаче кластеризации и построения классификатора в соответствии с полученной типологией КЗ [72].

При выборе метода выявления типологии как задачи кластеризации необходимо учитывать, что: получение кредита физическим лицом является действием, отношение к которому проявляется через выявленные посредством ассоциативного семантического эксперимента – СПП в связи с анкетируемыми признаками: демографическими (пол, возраст), социальными (семейное положение, образование); признаки имеют разные параметры, имеют разную размерность, имеют дискретные непараметрические распределения, которые задаются таблично; признаки не должны иметь преимуществ, то есть признак «мужчина» не лучше и не хуже признака «женщина» равно, как и полученные ответы на вопросы анкеты; ассоциативные ряды содержат значительно отличное количество ассоциаций у респондентов и имеют грубый шум – единожды встретившиеся ассоциации; группировки, определяющие структуру типологии, содержат разные количества респондентов; автоматизированная система формирования анкеты должна давать возможность автоматически формировать анкету (по умолчанию), и при этом должна быть прозрачная и открытая, чтобы осуществить возможность активного вмешательства ЛПР – аналитика, формирующего анкету КЗ.

По совокупности перечисленных особенностей предметной области исследований были проанализированы работы, посвященные вопросам использования методов выявления типологии, изложенные в работах [24, 32, 33, 151]. Из них следует, что методология интеллектуального анализа данных (ИАД или наиболее часто применимое Data

43

Mining) наиболее актуальна на данный момент и отвечает обозначенной проблеме.

Технологии Data Mining, в том числе, реализуют и наиболее традиционные методы, основанные на выдвижении гипотез и их проверки статистическими критериями. Такие методы выделения типологий в социальных экономических и психологических исследованиях подробно изложены в работах [45, 40, 97, 98, 138]. Так же проблемы выделения типологий решаются методами классификации и снижения размерности, например, факторным и дискриминантным анализами [5, 6, 7, 56, 133]. В рассмотренных работах уделяется внимание кластерному анализу, как наиболее отвечающему вопросам выделения типологии на основе анализа данных, но значительно менее широко используемом в области социологических и психологических исследований из-за сложности его реализации. Подробно материал, посвященный кластерному анализу, изложен в работе [92].

Исходя из перечисленных выше особенностей следует, что наибольший интерес представляют работы, посвященные вопросам дискретной математики [9], а именно теории множеств, математической логики, теории графов. Проблемы наличия противоречий при осуществлении процедуры кластеризации рассмотрены в работе [109].

Далее, для собственно реализации автоматизированной системы построения анкеты КЗ на основе выделения типологии с учетом перечисленных особенностей, изучены вопросы разработки интеллектуальных информационных систем, изложенные авторами в работах [44, 116, 152]. Отметим мнение, что «выделение объектов и их совокупностей – естественный (или) даже единственный способ организации нашего мышления» [100].

Особое внимание было уделено работам, в которых подробно описаны наиболее актуальные аспекты применительно к данной проблеме, а именно типичные модели представления знаний, способы обработки знаний, системы управления знаниями касаемо семантиче-

ских сетей [9, 24, 33, 147].

Так как всем перечисленным выше особенностям в большей мере отвечает методология искусственного интеллекта, реализующая, в том числе технологии Data Mining, основанная на графовом представлении, наибольшее внимание следует уделить работам, положения которых взяты за основу для решения обозначенной проблемы [9, 24, 33,146, 147].

44

Источник: https://studfile.net/preview/16408104/