Таким образом, в результате использования подхода были выявлены признаки пользователей, а также их обратной связи, которые могут быть использованы для построения матрицы взаимодействия (оценок). Помимо обозначенных в таблице 9 признаков пользователя дополнительно добавлены такие признаки, как пол (бинарный) и возраст (целый). Это очень популярные в рекомендательных системах признаки, и они необходимы для адекватного сравнения моделей (см. п. 4.4). В таблице 10 представлены итоговые признаки пользователя, которые были использованы при проведении эксперименты, с учетом того, что данные о пользователях были собраны с помощью опросника (имитация работы рекомендательной системы).
Таблица 10. Описание признаков пользователей, используемых в моделях эксперимента
|
АТРИБУТ |
ТИП ДАННЫХ |
ОПИСАНИЕ |
|
|
User state ID |
int |
Идентификатор очередного состояния пользователя, выявленного системой |
|
|
Timestamp |
int |
Временная метка, когда было выявлено состояние пользователя, в мс относительно 1 января 1970 года |
|
|
Gender |
int |
Пол пользователя, 0 - мужской, 1 - женский |
|
|
Age |
int |
Возраст пользователя |
|
|
Is active |
int |
В каком режиме прослушивается композиция, 0 - в фоновом, 1 - в активном |
|
|
Mood |
string |
Текущее определенное системой настроение пользователя (в рамках эксперимента - указанное при заполнении опросника) |
|
|
Reaction |
int |
Скорость взаимодействия с системой в мс (в рамках эксперимента - время, в течение которого пользователь принимает решение слушать песню/ пропустить, дать оценку) |
|
|
Temperament |
string |
Темперамент пользователя, определенный системой (в рамках эксперимента - значение, указанное пользователем при прослушивании) |
4.4 Построение модели и тестирование гипотезы
В качестве модели рекомендательной системы для эксперимента были выбраны модель коллаборативной фильтрации и гибридная модель. Модель коллаборативной фильтрации позволит оценить вклад признаков пользователя вне влияния признаков музыкальных композиций. На примере же гибридной модели можно будет оценить, как поведет себя модель, если к признакам пользователей также добавить и признаки музыкальных рекомендаций. Модели коллаборативной фильтрации и гибридная модель были разработаны в рамках курсовой работы «Алгоритмы машинного слуха в рекомендательных системах» [37]: модель коллаборативной фильтрации базируется на расчете коэффициента корреляции Пирсона, гибридная модель строится с использованием стратегии stacking, для оценки признаков музыкальных композиций в гибридной модели используется матрица похожести соседей. Для оценки рекомендаций используется бинарная оценка по принципу:
,
В качестве метрик качества рекомендаций были выбраны Average Precision (средняя точность), Average Recall (средняя полнота) и Average F (средняя F-мера), поскольку целевой признак модели - оценка музыкальной рекомендации - является бинарным и используется ранжирование предсказаний, соответственно нужно оценить качество ранжирования. Для оценки используются первые 10 элементов отсортированного списка рекомендаций.
Для тестирования обеих моделей используется следующий набор признаков пользователей: cut_user_features и full_user_features - первый содержит только основную информацию о пользователе: user state ID, timestamp, gender, age, второй - расширенную информацию для тех же самых пользователей: user state ID, timestamp, gender, age, is_active, mood, reaction, temperament. В свою очередь, признаки музыкальных композиций в полном составе (см. табл. 4) используются только в гибридной модели, а в модели коллаборативной фильтрации используется только признак song_id.
Также необходимо отметить, что модели тестируются на малых выборках - всего в эксперименте участвуют 16 пользователей, 82 песни и 160 оценок. Это, безусловно, оказывает большое влияние на качество проведенного эксперимента и в некоторой мере объясняет низкие результаты метрик качества.
Результаты эксперимента для коллаборативной фильтрации и гибридной модели отображены соответственно в таблицах 11 и 12.
Таблица 11. Результат эксперимента на модели коллаборативной фильтрации
|
cut_user_features |
full_user_features |
||
|
Precision (at 10) |
0,71% |
1,43% |
|
|
Recall (at 10) |
3,57% |
10,71% |
|
|
F (at 10) |
1,19% |
2,52% |
Таблица 12. Результат эксперимента на гибридной модели рекомендаций
|
cut_user_features |
full_user_features |
||
|
Precision (at 10) |
0,71% |
3,57% |
|
|
Recall (at 10) |
2,38% |
16,67% |
|
|
F (at 10) |
1,10% |
5,88% |
Поскольку эксперимент проводится на малой выборке и модели формируют предсказания для одних и тех же песен и пользователей, для оценки значимости различий в моделях можно применить статистические тесты для малых парных выборок - критерий Стьюдента (если выборка подчиняется нормальному распределению) / тест Уилкоксона (если выборка не подчиняется нормальному распределению). Для тестирования полученных предсказаний на нормальность используется критерий Шапиро-Уилка. Для тестирования гипотезы о равенстве дисперсий для применения t-критерия используется критерий Флигнера-Килина. Уровень значимости для всех статистических тестов - 5% (=0,05). Результаты статистических тестов представлены в таблице 13.
Таблица 13. Результаты статистического сравнения моделей предсказания
|
cut_user_features (коллаборативная фильтрация) |
full_user_features (коллаборативная фильтрация) |
cut_user_features (гибридная модель) |
full_user_features (гибридная модель) |
||
|
Критерий Шапиро-Уилка |
P value = 0.091745 |
P value = 0.107379 |
P value = 4.713523e-09 |
P value = 4.547347e-09 |
|
|
P value > Гипотеза о нормальности не может быть отвергнута |
P value << Гипотеза о нормальности отвергается |
||||
|
Критерий Флигнера-Килина |
P value = 1.485150e-22 |
- |
|||
|
P value << Гипотеза о равенстве дисперсий отвергается |
Нет необходимости применять, т.к. не может быть применен критерий Стьюдента |
||||
|
Критерий Стьюдента |
P value = 0.059858 |
- |
|||
|
P value > Гипотеза о равенстве средних значений не может быть отвергнута |
Не может быть применен, т.к. выборка не подчиняется нормальному распределению |
||||
|
Тест Уилкоксона |
- |
P value = 1.149056e-14 |
|||
|
Т.к. распределение нормальное, применяется критерий Стьюдента |
P value << Нулевая гипотеза о равенстве медиан в выборках отвергается |
4.5 Оценка эффективности и выводы
Для того, чтобы оценить эффективность от применения предложенного подхода и справедливость заявленной в рамках эксперимента гипотезы, были вычислены не только метрики качества рекомендаций, но и статистические тесты - для оценки значимости различий между предсказаниями моделей. Поскольку размер обучающей и тестовой выборки мал, значения метрик качества получились в общем низкие, а для оценки значимости использовались статистические тесты для малых выборок.
По результирующим значениям метрик качества и проведенных статистических тестов, можно сказать, что:
Модель коллаборативной фильтрации с использованием данных о поведении пользователя в совокупности показала результат выше, чем модель коллаборативной фильтрации с использованием только базовых знаний о пользователе (пол и возраст), однако поскольку результат t-теста показал, что гипотеза о равенстве средних не может быть отвергнута, различия между этими моделями нельзя считать статистически значимыми, то есть разницу в метриках качества моделей рекомендаций считать достоверными нельзя.
Гибридная модель с использованием данных о поведении пользователей показала существенно более высокий результат по метрике Recall-at-10 и F-мере, как в сравнении с гибридной моделью, которая не учитывает данные о пользователе, так и по отношению к модели коллаборативной фильтрации - в отличие от последней, различия между моделями оказались статистически значимыми, о чем говорит критерий Уилкоксона: нулевая гипотеза о равенстве медиан отвергается, поэтому можно считать показания метрик качества рекомендаций достоверными.
Таким образом, хотя на основе проведенной оценки нельзя делать однозначный вывод о преимуществе использования данных о поведении пользователя в различных рекомендательных системах, так как объем данных, на котором проводился эксперимент, мал, тем не менее, гибридная модель рекомендаций показала статистически значимое изменение показателей качества рекомендаций в лучшую сторону, а значит нулевая гипотеза эксперимента - использование данных о паттернах поведения пользователя влияет на качество рекомендаций - не может быть отвергнута.
ЗАКЛЮЧЕНИЕ
В ходе проведенного исследования были решены следующие задачи:
Изучены существующие подходы к пониманию поведения человека, паттернов поведения и их связь с психикой человека. Это позволило выделить ключевые понятия в определении поведения человека и способы его выявления при взаимодействии с окружающим миром.
Исследован процесс решения задач с использованием инструментов машинного обучения, благодаря чему определены все минимально необходимые для решения таких задач действия, а также перечень наиболее часто используемых метрик качества для оценки рекомендательных систем.
Проанализированы существующие решения в области формирования рекомендаций методами машинного обучения с использованием данных о паттернах поведения пользователей, в результате чего выявлено, что слабым местом при решении такого рода задач, является этап разработки признаков, поскольку он является наименее повторяемым и максимально творческим относительно остальных этапов.
Сформирован подход к выявлению и включению данных о поведении пользователя в модель машинного обучения, которая используется для решения задачи формирования рекомендаций в рекомендательных системах.
Разработанный подход по выявлению и включению данных о поведении пользователя продемонстрирован на практике на примере музыкальной рекомендательной системы. Эксперимент проведен на модели коллаборативной фильтрации и гибридной модели. Эффект от применения сформированного подхода оценен с помощью метрик качества рекомендаций.
Таким образом, можно сказать, что обозначенная в рамках данной работы цель - исследовать возможность выявления паттернов поведения пользователей и сформировать подход к их учету в системах машинного восприятия методами машинного обучения на примере рекомендательных систем - достигнута. Результат проведенного практического эксперимента также показал, что гипотеза о том, что использование данных о паттернах поведения пользователя в рекомендательных системах, которые используют методы машинного обучения для формирования рекомендаций, повышает качество рекомендаций, не может быть отвергнута. И хотя из-за использования в рамках эксперимента выборки малого объема нельзя делать однозначные выводы о применимости подхода для всех рекомендательных систем, это тем не менее значит, что тема данного исследования заслуживает дальнейшей проработки и изучения на более больших выборках, сложных механизмах рекомендаций и алгоритмах машинного обучения, в том числе с использованием методов Deep Learning.
СПИСОК ЛИТЕРАТУРЫ
1. Еникеев М. И. Общая и социальная психология: учебник для вузов //М.: Норма - ИНФРА * М. - 1999.
2. Узерина М. С. Этика делового общения //Ульяновск: УлГТУ. - 2004.
3. Столяренко Л. Д. Основы психологии. - Ростов-на-Дону : Феникс, 2001.
4. Столяренко Л. Д., Столяренко В. Е. Психология и педагогика для технических вузов. - Ростов-на-Дону : Феникс, 2001.
5. Леонтьев А. Н. Потребности, мотивы, эмоции: курс лекций //М.: МГУ. - 1994.
6. Ekman P., Cordaro D. What is meant by calling emotions basic //Emotion review. - 2011. - Т. 3. - №. 4. - С. 364-370.
7. Ильин Е. П., Ильин Е. П. Психология индивидуальных различий: [учебное пособие для вузов]. - Издательский дом" Питер", 2011.
8. Карнаух И. Радуга характеров. Психотипы в бизнесе и любви. - Litres, 2018.
9. Коверзнева И. А. Психология активности и поведения //Минск: МИУ. - 2010.
10. Oinas-Kukkonen H., Harjumaa M. Towards deeper understanding of persuasion in software and information systems //First international conference on advances in computer-human interaction. - IEEE, 2008. - С. 200-205.
11. Cristescu I. et al. Emotions in human-computer interaction: the role of nonverbal behavior in interactive systems //Revista Informatica Economicг nr. - 2008. - Т. 2. - №. 46. - С. 110-116.
12. Van Turnhout K. et al. Identifying the intended addressee in mixed human-human and human-computer interaction from non-verbal features //Proceedings of the 7th international conference on Multimodal interfaces. - 2005. - С. 175-182.
13. Bidel S. et al. Statistical machine learning for tracking hypermedia user behavior //2nd Workshop on Machine Learning, Information Retrieval and User Modeling, 9th Int. Conf. in UM. - 2003. - Т. 2003.
14. Fawcett T., Provost F. J. Combining Data Mining and Machine Learning for Effective User Profiling //KDD. - 1996. - С. 8-13.
15. Manavoglu E., Pavlov D., Giles C. L. Probabilistic user behavior models //Third IEEE International Conference on Data Mining. - IEEE, 2003. - С. 203-210.
16. Pennacchiotti M., Popescu A. M. A machine learning approach to twitter user classification //Fifth international AAAI conference on weblogs and social media. - 2011.