Дипломная работа: Оценка вероятности дефолта компаний малого и среднего бизнеса на основе публичных данных

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Вектор Шэпли

Заключительным в нашем обзоре методов интерпретации будет вектор Шэпли (Shapley value), идея перекочевавшая в машинное обучение из дисциплины кооперативной теории игр (Shapley 1953). В теории игр, данный метод применяется для разделения общего выигрыша между игроками в зависимости о вклада каждого участника. Данную концепцию можно перевести на язык задач машинного обучения. Прирост (gain) - это разница между текущим и средним предсказанием. В получение данного прироста каждый из факторов вносит определенный вклад, который мы пытаемся оценить. Алгоритм описывается следующим образом:

На входе: число итераций , наблюдение , матрица признаков , обученная модель .

1) Для всех :

· Случайным образов выбирается наблюдение из данных

· Случайным образом переставляем значения факторов

· Упорядочиваем наблюдения и :

· Создаем два новых наблюдения:

,

,

· Рассчитываем вклад -го фактора для -го наблюдения:

,

2) Усредняем результат по всем итерациям и получаем вклад фактора:

,

Данный подход пожалуй единственный, кто имеет в своей основе серьезное теоретическое обоснование, а также не имеет проблем с возникновением нереалистичных наблюдений, поскольку сравнение происходит со средними значениями. Структура данного алгоритма позволяет делать наиболее достоверные объяснения вклада предикторов. Разумеется, такое количество несомненным преимуществ компенсируется важным недостатком этого подхода - вычислительное время. Поэтому при решении реальных задач производится лишь оценка вектора Шэпли, а не его полный вывод.

2. Данные

2.1 Общие сведения

Выборка для построения модели была подготовлена на основе открытых данных об около 260 тыс. российских компаниях, с годовым оборотом более 60млн. руб., за финансовые периоды 2008 - 2016 гг. Каждое наблюдение представляет собой набор характеристик (финансовых и нефинансовых) о компании за данный финансовый период. Каждой компании присвоен флаг «дефолт»/«не дефолт», который в дальнейшем будет являться целевой переменной при моделировании. Следует отметить, что при этом в выборке может быть только одно наблюдений для одной компании. Данный факт обусловлен двумя причинами: во-первых, несбалансированностью целевой переменной, а именно бОльшим числом не дефолтных наблюдений При указанной структуре доля дефолтов составляет порядка 12-13% наблюдений, при этом компании обычно выходят в дефолт один раз. Таким образом, при добавлении всех периодов, доля дефолтов в выборке будет снижена пропорционально среднему числу лет, приходящемуся на одну компанию., а, во-вторых, особенностью определения флага дефолта, о чем будет подробнее сказано далее. Итоговая выборка была разделена случайным образом на обучающую и тестовую в пропорции 3:1. Общая информация о них представлена в Таблице 1.

Таблица 1. Характеристики выборки.

Обучающая выборка

Тестовая выборка

Всего наблюдений

194 912

64 971

Не дефолтные наблюдения

170 389

56 922

Дефолтные наблюдения

24 523

8 049

Доля дефолтных наблюдений, %

12.58

12.38

Несмотря, на тот факт, что использованные данные являются открытыми, доступ к ним в агрегированном виде был получен нами на условиях соглашения о конфиденциальности, поэтому многие подробности в отношении используемой информации будут зашифрованы или скрыты. Тем не менее, мы утверждаем, что в конечном итоге, это не помешает достижению поставленных в работе целей.

2.2 Сбор и обработка

В качестве источников для сбора данных выступали различные русскоязычные информационные ресурсы, в частности, Федеральная служба государственной статистики, указы Правительства, различные реестры и перечни компаний (например, перечень стратегических компаний), а также агрегаторы баз данных о российских юридических лицах.

Процесс формирования выборки для валидации состоял из следующих этапов:

A. Из открытых источников была выгружена вся доступная информация о компаниях, имеющих годовую выручку более 60 млн. руб., за финансовые периоды 2008 - 2016 (далее Выборка);

B. Каждому наблюдению Выборки был присвоен флаг дефолт / недефолт на основе индикаторов из публично доступных источников - ликвидация, банкротство, судебные иски и т.д. Для каждого отдельного типа индикатора дефолта и по каждой группе отраслей производилась оценка временного промежутка между возникновением сообщения (индикатора дефолта) до самой даты дефолта;

C. Пропущенные значения в финансовых показателях заполнялись на основе формул бухгалтерского учета (структуры балансовых показателей). Таким образом, пропущенное значение могло быть заполнено нулем только если это прямо вытекало из формулы для данной переменной;

D. Каждое наблюдение проверялось на предмет соответствия правилам бухгалтерского учета (например, Активы = Пассивы. Далее Проверки);

E. Из Выборки исключались все наблюдения которые не прошли хотя бы одну Проверку или имели недостаточно данных для проведения хотя бы одной из Проверок;

F. Из Выборки исключались наблюдения, в которых нет хотя бы одной из перечисленных характеристик: дата регистрации, регион регистрации, ОКВЭД Общероссийский классификатор видов экономической деятельности;

G. Из выборки исключались наблюдения, в которых заемщики относились к индустриям финансового сектора ОКВЭД 65, 66, 67 (КДЕС Ред. 1.1). Данное решение обусловлено особенностями ведения бухгалтерского учета данной индустрии;

H. Для каждого дефолтного и недефолтного наблюдения в Выборке была определена соответствующая дата наблюдения, таким образом итоговая выборка содержала только одну дату наблюдения для каждого заемщика.

Для дефолтных компаний соответствующая дата наблюдения определялась следующим образом (аналогично формированию выборки для разработки):

· Если дата дефолта была позднее I квартала, то отчетной датой будет конец предыдущего года (например, дата дефолта - 20 мая 2017 года, отчетная дата - 31 декабря 2016 года);

· Если дата дефолта была в I-м квартале, то отчетной датой будет конец позапрошлого года (например, дата дефолта - 10 февраля 2017 года, отчетная дата - 31 декабря 2015 года);

Для каждого недефолтного заемщика отчетная дата была выбрана случайным образом.

В дальнейшим на основе этих данных будут формироваться признаки для прогнозных моделей.

Собранная информация может быть представлена в виде Таблицы 2.

Таблица 2. Структура собранных данных

Примеры

Финансовые данные

- Баланс

Внеоборотные активы, Капитал и резервы

- P&L Отчет о прибылях и убытках

Выручка, Чистая прибыль (убыток)

Не финансовые данные

- общие

Дата регистрации, ОКВЭД

- стоп-сигналы

Реестр юр.лиц., имеющих задолженность перед ФНС

- гос. поддержка

Реестр стратегических предприятий

2.3 Репрезентативность

В данном разделе Обучающая и Тестовая выборки анализировались на предмет репрезентативности по ключевым качественным характеристикам.

Рассмотрим теперь распределения визуально. На графике 1 можно увидеть, что число наблюдений со временем растет, что может обусловлено как органическим ростом числа компаний, так и доступностью данных по ним.

График 1. Распределение наблюдений по годам

Такой перекос не является критическим для анализа, более того, поскольку динамичность рынка требует учитывать как можно более свежие данные, а такая асимметрия может рассматриваться как преимущество при моделировании в реальном бизнесе.

График 2. Распределение наблюдений по федеральным округам.

Компании были сгруппированы в отрасли по ОКВЭД. Ниже представлено распределение по данному признаку.

График 3. Распределение наблюдений по отраслям.

Для определения качества репрезентативности было оценено значение индекса PSI. Данный индекс рассчитывается для сравнения распределений разных выборок по общему признаку. В контексте данной работы, это делалось для того, чтобы оценить, насколько тестовая выборка репрезентативна выборке, на которой будет строиться модель.

График 4. Распределение наблюдений по численности штата.

Индекс PSI является отраслевым стандартом и используется для валидации моделей оценки кредитного риска:

,

• Где Ai% - доля наблюдений в корзине i из распределения A

Bi% - доля наблюдений в корзине i из распределения B

• - номер/название корзины, например, отрасль «Электроэнергетика»

- общее количество различных корзин, например, количество доступных отраслей

Критическим значением для данного показателя является значений 0.1. Как мы видим из теста ниже, все интересующие нас разбиения прошли формальный тест.

Таблица 3. Результаты теста на репрезентативность

Переменная

PSI

Репрезентативна

Q1

0.027489

Да

Q2

0.011368

Да

Q3

0.000231

Да

Q4

0.000243

Да

Q5

0.000277

Да

Таким образом, тестовая выборка может быть использована для оценки качества прогнозной модели, построенной на обучающей выборке.

3. Моделирование

В данном разделе мы построим две прогнозные модели для оценки кредитоспособности корпоративных заемщиков. При этом, первая модель будет построена по традиционной отраслевой методике, которая является простой и прозрачной, а вторая - с помощью классического ансамблевого алгоритма машинного обучения - random forest В русскоязычной литературе Случайный лес, чьи прогнозы поддаются объяснению значительно сложнее. Для каждой из моделей мы рассмотрим способы объяснения предсказанных значений, а затем, в следующем разделе, сравним модели по критерию качества прогноза.

3.1 Классическая модель (logit)

Структура модели

Как уже отмечалось, логистическая регрессия, ввиду своих предпосылок и формы, имеет полезное свойство - простота интерпретации. Во многом именно поэтому ее так активно продолжают использовать даже сегодня, в эпоху прогрессирования науки о данных и как следствии более сложных алгоритмов машинного обучения. Напомним, что результатом прогноза модели, в конечном счете, мы считаем балл заемщика, а не вероятность его дефолта. Более того, чем выше балл, тем заемщик будет считаться более качественным, то есть менее склонным к дефолту.

Перейдем непосредственно к описанию модели, и будем представлять ее top-down, постепенно раскрывая каждый из внутренних показателей (модулей). На самом верхнем уровне, балл заемщика формируется как сумма баллов по базовому модулю и сигнальному модулю.

,

где - итоговый балл -го заемщика, - балл -го заемщика по финансовым и общим нефинансовым факторам, - балл -го заемщика по стоп-факторам и сигналам гос. поддержки.

Сигнальный модуль состоит из стоп-факторов (или предупреждающих сигналов), которые говорят о явном неблагополучии заемщика, и флагов наличия государственной поддержки, которые, наоборот, свидетельствуют об устойчивости заемщика, обусловленной государственными интересами.

,

где - наличие (0,1) стоп-фактора у -го заемщика, - наличие признака гос. поддержки у -го заемщика, () - балл -го стоп-фактора (сигнала гос. поддержки).

Теперь перейдем к рассмотрению базового модуля - он состоит из финансового и качественного модулей:

,

где - балл финансового модуля для -го заемщика, - балл качественного модуля для -го заемщика, - вес финансового модуля.

Финансовый и качественный модули складываются из баллов по отдельным факторам:

,

где - балл финансового -го фактора для -го заемщика, - балл качественного -го фактора для -го заемщика, - вес -го фактора, и - количество финансовых и качественных факторов соответственно.

Важно отметить, что баллы факторов и значения факторов - это не одно и тоже. В следующих разделах, мы покажем как с помощью трансформации переменных и логистической регрессии получить описанную выше модель.

Однофакторный анализ

На основе собранных данных было сгенерировано 120 факторов, которые были разделены на три модуля, а также внутри каждого из модулей сгруппированы на отдельные категории. Так, например, в финансовом модуле есть группа факторов, характеризующих компанию с точки зрения ликвидности, а в качественном модуле - факторы дифференцирующие заемщиков по отрасли. Подробная структура представлена в Таблице 4.

Очевидно, что многие факторы, особенно относящиеся к финансовому модулю, имеют высокую корреляцию друг с другом, что не позволяет использовать определенные наборы переменных для оценки логистической регрессии ввиду проблемы мультиколлинеарности. С этой проблемой мы будем разбираться с помощью однофакторного анализа, целью которого является отбор наиболее важных и в то же время не коррелированных признаков (short-list) из исходно набора признаков (long-list).

Источник: https://otherreferats.allbest.ru/download/1180561/