Правительство Российской Федерации
Федеральное государственное автономное образовательное
учреждение высшего образования
«Национальный исследовательский университет
«Высшая школа экономики»
Факультет Санкт-Петербургская школа физико-математических и компьютерных наук
Основная образовательная программа
«Анализ больших данных в бизнесе, экономике и обществе»
Выпускная квалификационная работа
На тему: Кредитный скоринг. Оценка вероятности дефолта компаний малого и среднего бизнеса на основе публичных данных
Выполнил:
Полетаев Виталий Дмитриевич
Научный руководитель:
Сироткин Александр Владимирович
Санкт-Петербург 2019
Содержание
Введение
1. Обзор литературы
1.1 Банковский риск-менеджмент
1.2 Подходы к интерпретации сложных моделей
2. Данные
2.1 Общие сведения
2.2 Сбор и обработка
2.3 Репрезентативность
3. Моделирование
3.1 Классическая модель (logit)
3.2 Ансамблевая модель (случайный лес)
4. Результаты
Заключение
Список литературы
Введение
Машинное обучение и аналитика данных набирают все бОльшую популярность и повсеместно внедряются в бизнес-процессы компаний. При этом скорость внедрения в разных отраслях, очевидно, неодинаковая и вот одна из причин почему это так на примере кредитного скоринга - процесса принятия решения о кредитоспособности заемщика перед выдачей ему займа. В кредитном скоринге, в отличие от таких задач как, например, прогнозирование кликов пользователей на сайте или задач, связанных с рекомендательными системами, ответственность за отдельное решение, основанное на прогнозе, сформированном алгоритмом, полностью лежит на конкретном человеке. В связи с этим, сотрудник, который пользуясь тем или иным статистическим инструментом склонен выбирать именно тот метод, который ему понятен и которому он доверяет. К примеру, вряд ли принципиально важно понимать почему конкретному человеку некий алгоритм показывает рекламный баннер А, а не Б, если в целом результат является приемлемым. Но совсем другое дело, когда речь идет о том, почему банк должен одобрить многомилионный кредит для одного заемщика и отказать другому. Иными словами, вопрос о доверии к используемой модели и ее интерпретируемости в рамках кредитного процесса стоит достаточно остро.
Несмотря на большое количество статей, хакатонов и прочих активностей, которые освещают эту тему и в которых производятся различные алгоритмы и подходы, сотрудники, непосредственно работающие с заемщиками, по-прежнему склонны во многом опираться на старые подходы к анализу. Целью данной работы является наглядная демонстрация неэффективности классического подхода к оценке вероятности дефолта корпоративных заемщиков по сравнению с использованием более продвинутых методик на примере модели случайного леса. Помимо этого, ключевым будет является не само по себе превосходство ансамблевого метода над линейным, а, во-первых, размер этого превосходства, и, во-вторых, наличие возможности увеличения предсказательной силы без критической потери интерпретируемости.
В первом разделе мы сделаем обзор на банковский риск-менеджмент, сформировав понятийный аппарат для дальнейшей работы, и на основные подходы к объяснительному анализу сложных моделей машинного обучения. Во втором разделе мы опишем используемые в работе данные, а в третьем - построим на этих данных две модели, оценим результат каждой из них и дадим интерпретацию. В четвертом разделе мы сравним предсказательную силу двух алгоритмов и в заключении сформулируем основные выводы.
1. Обзор литературы
В данной части мы дадим краткое описание двух на первый взгляд крайне разных и несвязанных дисциплин, однако которые будут одинаково необходимы нам для дальнейшего анализа. Первый блок будет посвящен кредитному анализу и базовым подходам, которые в нем применяются. Во втором блоке мы проанализируем современные подходы к интерпретации сложных предсказательных моделей, одну из которых мы будем обучать в разделе с моделированием.
1.1 Банковский риск-менеджмент
Коммерческие банки подвержены огромному количеству различных видов рисков, которые можно классифицировать по различным признакам, в зависимости от решаемых задач. Например, риски можно классифицировать по категориям или видам рисков, по источникам возникновения, уровню существенности, потенциальных последствий реализации риска или по вероятности возникновения риска. Основной целью классификации рисков является объединение рисков, имеющие схожие факторы возникновения, в одну группу и разрабатывать для них единую систему управления.
Виды рисков
По одной из наиболее распространенных классификаций риски можно разделить на кредитный, процентный, рыночный, операционный и риск ликвидности (The essentials of risk management in banking 2019). Наиболее крупный риск в банковском бизнесе -- это кредитный риск, который подразумевает риск невозврата денежных средств должником в оговоренные сроки и на оговоренных условиях. Очевидно, что деятельность банка полностью зависит от эффективности управления рисками, и в частности кредитным риском. На втором месте после убытков от кредитного риска находится объем потерь банков из-за реализации процентного риска - риска возникновения убытков ввиду изменения процентных ставок. Не менее важным для банка, осуществляющего операции на финансовых рынках, является рыночный риск - риск снижения стоимости активов торгового портфеля вследствие изменения рыночных факторов, например цен на нефть или на золото. Риск ликвидности - риск потерь и даже невозможности продолжать свою деятельность из-за несоответствия сроков погашения по активам и пассивам. Проблемы с ликвидностью среди прочих привели к банкротству банка Lehman Brothers, в прошлом одного из ведущих инвестиционных банков в мире. И наконец операционный риск - это риск потерь, возникающих из-за проблем во недостатки во внутренних процессах банка, а также форс-мажорных обстоятельств. В рамках данной работы нас будет интересовать только кредитный риск.
Ожидаемые потери
В рамках нивелирования кредитного риска, компании решают задачу определения ожидаемого уровня потерь (expected losses) при различных сценариях. Данный показатель формулируется следующим образом:
,
где - ожидаемые потери по портфелю заемщиков, - множество кредитуемых заемщиков, - вероятность дефолта -го заемщика, - ожидаемая доля непогашения -ым заемщиком при условии наступления его дефолта, - сумма денежных средств под риском по -му заемщику.
Помимо ожидаемого уровня потерь, банки могут рассчитывать максимальный уровень потерь с заданной вероятностью (Jorion 2000).
Расчет данных показателей помогает банкам решать классическую дилемму риска-доходности, которая заключается в том, что более рискованные активы чаще всего имеют более высокую доходность и наоборот. Кроме того, показатель ожидаемых потерь применяется в формировании банковских резервов, которые являются законодательным требованием РФ (Федеральный закон “О банках и банковской деятельности” от 02.12.1990 N 395-1 (последняя редакция) n.d.). При этом чем выше резервы, тем с одной стороны, банк в большей степень застрахован на случай реализации кредитного риска, с другой стороны, резервированные средства не выдаются заемщикам, а значит не приносят прибыли. Это порождает еще одну дилемму, с которой банку необходимо справляться. И наконец, заметим в формуле ожидаемых потерь компоненту вероятности дефолта заемщика. От качества моделирования данного показателя зависит оценка ожидаемого уровня потерь, а значит, как мы выяснили, существенная часть деятельности банка. Моделирование вероятности дефолта
Под моделированием кредитного риска, в частности его составляющей - вероятности дефолта, подразумевается выделение ключевых факторов, влияющих на эту вероятность. Существенный вклад в моделирование этой величины внес (Altman 1968), которому удалось на маленькой выборке без применения сложных алгоритмов, сформулировать простую, понятную и весьма эффективную балльную систему для оценок кредитоспособности заемщиков. Очевидно, с того момента банкиры испробовали различные методы, среди которых для данной задачи хорошо себя зарекомендовали логистическая регрессия, как удобный инструмент, чьи результаты легко коммуницировать бизнесу, и методы основанные на деревьях, в частности случайный лес и бустинг (Baesens et al. 2003). Однако, качество предсказательной силы модели зависит не только и не столько от выбранного метода, сколько во многом от используемых факторов. Так, например, (Fernandes and Artes 2016) значительно увеличили предсказательную силу модели задействовав географическое положение компаний-заемщиков. А (Psillaki, Tsolas, and Margaritis 2010) добились похожего результата используя фактор эффективности внутреннего менеджмента компании.
При моделировании вероятности дефолта, на первом этапе принято оценивать балл заемщика, который ранжирует их от плохих к хорошим, а затем баллы пересчитывать в вероятность дефолта учитывая портфель банка или всего рынка. Данная процедура, называется калибровкой и нужна для учета динамики и цикличности экономики (Tasche 2013). Кроме того, данный подход рекомендован Безельским комитетом по банковскому надзору. Вероятности дефолта, полученные в результате калибровки, можно корректировать в зависимости от фазы экономического цикла с помощью формулы предложенной (Vasicek 1977), и активно применяющейся по сей день в кредитных процессах многих банков. Иными словами, в литературе и бизнесе с данной задачей уже работают давно, и подходы к ней можно отчасти назвать сформированными.
Однако и без того крупный пласт индустриальных знаний можно дополнить новыми подходами к моделированию, в частности, интерпретацией сложных моделей. Именно этому будет посвящен следующий раздел.
1.2 Подходы к интерпретации сложных моделей
Необходимость интерпретировать сложные модели возникает, разумеется, не только в задачах кредитного скоринга, но и во многих других, и в литературе уже есть несколько инструментов, которые могут быть полезными для наших задач. (Ribeiro, Singh, and Guestrin 2016a) выделяют три аспекта гибкости таких инструментов: 1) гибкость модели - метод интерпретации должен быть адаптируем к любому методу, 2) гибкость объяснений - метод интерпретации не должен быть привязан к однообразной форме объяснения, 3) гибкость представления - интерпретатор должен быть способен работать с разными видами данных - табличные данные, текст, изображения. Частичная зависимость и индивидуальные условные ожидания
Рассмотрение эффектов можно начать с анализа частичной зависимости (partial dependency), которая показывает предельные эффекты от изменения отдельных характеристик (Friedman 2001).
,
где - модель; - фактор, который мы хотим проанализировать на предмет его влияния на прогноз модели; - прочие факторы, которые остаются константными; - отдельное наблюдение.
Построив график на всей области можно проанализировать глобальную зависимость предсказания модели от данного фактора. Данный подход интуитивно понятен, интерпретируем и по факту может быть применен к любой предсказательной модели. Подход при этом имеет ряд недостатков, среди которых наиболее важным является предпосылка о независимости факторов между собой - что, очевидно весьма строгое требование. Кроме того, одновременно можно отобразить влияние двух факторов, но данная проблема обусловлена физическими причинами (невозможность визуализации высокой размерности), а не самим методом. Анализ частичной зависимости показывает общие эффекты характеристик, однако вполне возможно сделать декомпозицию и увидеть предельные эффекты для конкретных наблюдений. Такой анализ называется индивидуальным условным ожиданием (ICE) и обычно проводится параллельно с анализом частичной зависимости PDP.
Важность факторов (feature importance)
Помимо рассмотрения влияния отдельных переменных, исследователям важно понимать общие закономерности и значимость анализируемых характеристик. В этом смысле (Fisher, Rudin, and Dominici 2018) предложили подход к анализу важности переменных (feature importance), который можно применить к любой модели, а не только, например, к случайному лесу. Алгоритм выглядит следующим образом:
На входе: обученная модель , матрица признаков, вектор целевых значений и функция ошибки .
1) Оценивается первоначальная ошибка модели
2) Для каждого фактора
· Генерируется матрица с помощью пермутации значений факторов
· Оценивается новая ошибка
· Сравниваются ошибки до и после пермутации
3) Факторы сортируются по
Данный подход позволяет проанализировать одновременно все факторы, не требует переобучения модели, и опять же интерпретируем. Одним из существенных недостатков является возможная нестабильность весов факторов. Кроме того, не ясно на какой выборке следует показывать результат (тренировочная или тестовая). Тем не менее, в целом данный подход является весьма удобным и вполне эффективным для первичного анализа.
Локальные суррогатные модели (LIME)
Говоря про интерпретацию моделей нельзя не отметить классическую статью (Ribeiro, Singh, and Guestrin 2016b), посвященную алгоритму локальной интерпретации (LIME). Данный подход позволяет анализировать предсказания сложных моделей, с помощью их локальной аппроксимации более простыми и интерпретируемыми моделями. Работу данного алгоритма можно описать следующим образом:
1) Для каждого предсказания раз генерируются наблюдения с помощью перестановок (permutate);
2) Для всех наблюдений из пункта 1. делаются новые предсказания;
3) Рассчитываются расстояния от новых точек до первоначальных;
4) Расстояния трансформируются в меру близости;
5) Выбирается признаков, которые лучше всего описывают результаты модели для генерированных наблюдений.
6) На этих данных обучается простая модель, чьи веса затем используются для объяснения влияния факторов на сложную модель.
Несомненный плюс данного подхода - это его гибкость, а именно возможность аппроксимировать любые сложные модели любыми простыми. Кроме того, данный метод применим не только к табличным данным, но и к текстам и изображениям. И наконец, процесс объяснения весьма прозрачный. Из недостатков наиболее существенным является нерешенный вопрос о том, из какой области сэмплировать наблюдения. Другими словами, как определить слово «локальный» в терминах пространства исследуемых признаков и как избежать генерации нереалистичных наблюдений.