Дипломная работа: Оценка вероятности дефолта компаний малого и среднего бизнеса на основе публичных данных

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Таблица 4. Структура факторов для прогнозной модели

Фактор

Кол-во

Всего

120

Финансовые

93

Финансовый рычаг

15

Ликвидность

16

Обслуживание долга

24

Деловая активность

12

Рентабельность

20

Прочее

6

Качественные

16

Отрасль

4

Регион

2

Возраст

4

Размер

4

Прочее

2

Сигналы

11

Стоп-факторы

5

Гос. поддержка

6

Финансовые факторы

Уточним, что все финансовые факторы (за исключением группы Прочее) являются относительным финансовыми показателями, то есть получаются в результате деления одних переменных на другие (например, Общий долг/ EBITDA объём прибыли до вычета расходов по выплате процентов, налогов, износа и начисленной амортизации и т.д.). В связи с этим, возникает необходимость предусмотреть потенциальные случаи деления на ноль. В рамках данной работы, применялось следующее правило:

,

где - -ый фактор -го заемщика, , - числитель и знаменатель для расчета фактора .

Далее, каждый из факторов Кроме факторов группы Прочее был преобразован с помощью логистической трансформации и стандартизован. Таким образом, мы получаем нормированных балл заемщика по данному фактору:

,

,

,

где - нормированный балл -го заемщика по -му фактору, и - 5ый и 95ый перцентили фактора .

После того как факторы были трансформированы в баллы, мы начали отбор наилучших по следующим критериям:

1) Ранжирующая сила по критерию Gini Gini = 2AUC - 1 > 15%.

2) Доля экстремальных значений (999999999, -999999999) достаточно низкая 5-ый и 95-ый перцентили не равны 999999999 или -999999999, соответственно

3) Доля пропущенных значений ниже 5%.

Далее мы отбросили все факторы, у которых не выполнено хотя бы одно из выше описанных условий, и начали попарно сравнивать наиболее коррелированные между собой признаки по критерию Gini, отдавая приоритет тем, у кого значение этого показателя выше. Таким образом, мы сформировали short-list финансовых факторов, добившись того, чтобы коэффициент корреляции между ними не превышал 50%.

Не финансовые факторы

Не финансовые факторы, как уже отмечалось, можно разделить на качественные факторы и сигналы. В этом контексте, сигналы не подвергались никаким трансформациям, а просто остались в виде индикаторов (0 - нет, 1 - да).

Качественные же факторы трансформировали и стандартизовались похожим образом, как и финансовые:

,

,

,

где - доля дефолтов среди компаний имеющих значение фактора равным . банковский риск менеджмент дефолт

Аналогично для каждого балла был рассчитан коэффициент Gini и в рамках каждой из групп факторов качественного модуля выбран только один.

Оценка коэффициентов

В данном блоке мы построили логистическую регрессию флага «не дефолт» на факторы каждого из модулей:

,

,

где число факторов модуля , - коэффициенты лог-регрессии.

Результаты оценки коэффициентов представлены в таблице 5. Как мы видим, все включенные в итоговую модель коэффициенты являются статистически значимыми и имеют верный с точки зрения логики знак.

Теперь представим полученную модель в виде описанной в п. 3.1.1. структуры. Заметим, что поскольку мы хотим получать балл по каждому заемщику, мы можем пренебречь константой.

Для того, чтобы найти веса внутри финансового модуля, нам нужно просто разделить каждый из коэффициентов финансовых баллов на суммы коэффициентов перед финансовыми баллами:

,

По аналогичной формуле можем получить веса для качественного модуля:

,

Таблица 5. Коэффициенты логистической регрессии

(1)

(2)

(3)

(4)

Intercept

1.0106***

2.2561***

1.3598***

1.4569***

(0.0373)

(0.0083)

(0.0449)

(0.0453)

Leverage_3_score

0.0108***

0.0080***

0.0078***

(0.0003)

(0.0003)

(0.0003)

Business_activity_6_score

0.0037***

0.0045***

0.0044***

(0.0001)

(0.0001)

(0.0001)

Debt_service_8_score

0.0062***

0.0053***

0.0050***

(0.0003)

(0.0003)

(0.0003)

Liquidity_2_score

0.0030***

0.0021***

0.0022***

(0.0002)

(0.0002)

(0.0002)

Profitability_10_score

0.0057***

0.0032***

0.0030***

(0.0002)

(0.0002)

(0.0002)

Profitability_8_score

0.0040***

0.0067***

0.0066***

(0.0003)

(0.0003)

(0.0003)

Q1_score

0.0051***

0.0033***

0.0031***

(0.0002)

(0.0002)

(0.0002)

Q2_score

0.0041***

0.0044***

0.0043***

(0.0001)

(0.0001)

(0.0001)

Q3_score

0.0057***

0.0056***

0.0058***

(0.0001)

(0.0001)

(0.0001)

Q4_score

0.0053***

0.0043***

0.0040***

(0.0002)

(0.0002)

(0.0002)

G1

1.144***

(0.0561)

G2

2.598***

(0.1895)

G3

0.113**

(0.4507)

W1

-0.908***

(0.1028)

W2

-2.553***

(0.0303)

W3

-0.665***

(0.2552)

Obs.

194912

185150

185150

185150

Standard errors in parentheses.

* p<.1, ** p<.05, ***p<.01

Затем веса для качественного и финансового модуля:

,

Чтобы оценить баллы для каждого сигнала, необходимо нормировать коэффициент регрессии перед ними на сумму весов качественного и финансового модулей:

,

Теперь мы воспользовавшись формулами из п. 3.1.1. мы можем рассчитать баллы для каждого заемщика и оценить качество модели в разрезе каждого модуля (график 5.)

График 5. Качество прогнозирования классической модели

Итоговая модели дает результат 42% Gini, при этом, как мы видимо из графика, наиболее существенным для прогноза является финансовый модуль.

В следующем разделе мы рассмотрим варианты интерпретации данной модели для описания отдельных предсказаний.

Интерпретация

Напомним, что в качестве прогнозных значений итоговая модель возвращает не вероятность, а балл, полученный по ранее описанным формулам. Структура построения модели позволяет сделать декомпозицию прогнозных значений на логически разные модули, а именно базовый модуль и сигналы, где к результатам базового модуля прибавляются баллы сигналов при их наличии.

Рассмотрим структуру базового модуля, представленную на графике 6.

Подобная архитектура модели вызывает минимум вопросов даже у непрофессионалов в области статистики, в чем ее несомненное преимущество.

График 6. Структура базового модуля

В таблице 6 представлены три прогноза для трех разных заемщиков. Применив веса и описанную структуры, мы можем получить прогнозные значения, и понять почему заемщику, был присвоен именно такой балл.

Таблица 6. Пример построения прогноза

 

INN_1

INN_2

INN_3

Financial score

36.0187

55.0294

52.3681

F1_score

4.087254

88.4715

36.75893

F2_score

-20.7697

-75.4799

-20.4601

F3_score

143.7914

130.2906

137.4319

F4_score

113.5349

118.7312

70.39712

F5_score

-13.968

-6.32162

1.956883

F6_score

-22.656

-20.1061

89.04881

Qualitative score

-7.07656

47.2853

-33.6886

Q1_score

-19.3419

131.562

27.37788

Q2_score

6.827746

40.23161

40.23161

Q3_score

21.71661

21.71661

-115.119

Q4_score

-54.2681

26.62802

-42.4054

Signals score

-71.9942

0

58.1512

W1_score

0

0

0

W2_score

-57.1163

0

0

W3_score

-14.8779

0

0

G1_score

0

0

0

G2_score

0

0

58.15116

G3_score

0

0

0

Final score

-52.0196

52.1463

78.4809

Декомпозиция итогового балла также может быть визуализирована. Рассмотрим в качестве примера заемщика с индикатором INN_1. На графиках 7-10 представлены примеры визуализации.

График 7. Пример декомпозиции итогового балла

График 8. Пример визуализации финансового профиля заемщика

График 9. Пример визуализации качественного модуля заемщика

График 10. Пример визуализации сигнального модуля заемщика

Таким образом, мы построили модель с помощь логистической регрессии, преобразовав ее затем в балльную систему для оценки качества корпоративных заемщиков. Как было показана, такая постановка позволяет делать прозрачные выводы как относительно глобальных эффектов (коэффициенты лог-регрессии) так и по поводу результатов предсказания для конкретных заемщиков.

3.2 Ансамблевая модель (случайный лес)

В данном разделе мы опишем процесс построения модели оценки корпоративных заемщиков с помощью метода Random Forest, оценим результат, а также постараемся проинтерпретировать его структуру.

Отбор признаков

В отличие от раздела с логистической регрессией, в данном блоке мы не прибегали к трансформации и стандартизации факторов, поскольку алгоритм случайного леса не чувствителен к ним. При этом замена значений при делении на ноль была проведена аналогичным образом.

Говоря об отборе признаков стоит выделить несколько ключевых отличий от подхода, использованного при однофакторном анализе для логистической регрессии:

· Были добавлены абсолютные значения некоторых балансовых показателей. Напомним, что в лог-регрессии участвовали только относительные показатели;

· Ослаблено требование к максимальному значению коэффициента корреляции между признаками с 50% до 90% (чтобы убрать объективно одинаковые метрики);

· В качестве метрики качества использовалось значение веса фактора при применении feature importance на основе модели случайного леса со всеми факторами без подбора гипер-параметров;

· Качественные факторы участвовали в моделировании как в качестве баллов (по структуре классической модели), так и в виде дамми-переменных.

С учетом дамми переменных для всех не финансовых факторов суммарное количество факторов для модели составило - 89.

Обучение и подбор гиперпараметров

С помощью отобранных на предыдущем этапе 89 факторах мы построили модель случайного леса, предварительно подобрав оптимальные гиперпараметры простым перебором. Всего было настроено три гиперпараметра:

· Число деревьев - 1000

· Максимальная глубина - 6

· Максимальное количество факторов - 25

Дополнительно, в функцию потерь были добавлены веса для анализируемых классов обратно пропорционально их долям. Данная надстройка необходима ввиду несбалансированности «дефолтных» и «не дефолтных» наблюдений.

Остальные гиперпараметры (например, минимальное число наблюдений в терминальной вершине дерева и т.д.) были оставлены по умолчанию класса RandomForestClassifier открытой библиотеки scikit-learn (RandomForestClassifier n.d.).

Интерпретация

В данном разделе мы дадим интерпретацию некоторым закономерностям с помощью классических техник, применяемых в отношении сложных моделей.

Feature importance and contribution

Говоря об интерпретации модели случайного леса стоит начать с анализа весов факторов, получаемых с помощью подхода feature importance - того на сколько каждый фактор относительно других уменьшает функцию потерь, или другими словами улучшает разделение между исследуемыми классами. Наиболее важным в этом смысле фактором является показатель Other_4, который в первом приближении отражает размер компании. Затем идут переменные, характеризующие обслуживание долга Debt_service_8 и Profitability_8. Более подробные результаты представлены на Графике 11.

График 11. Feature Importance для Топ20 факторов.

PDP и ICE

Рассмотрим графики ICE и PDP для наиболее значимых по критерию feature importance факторов. Напомним, что они показывают вляние изменения рассмтриваемого признака на предсказание модели (в нашем случае балла от дефолтного 0 до недефолтного 1). По оси ординат откладывается балл, по оси абсцисс - значние фактора (График 12). Каждая линия характеризует одно конкретно наблюдение из тестовой выборки, выделенная линия является усредненным значением по всем наблюдениям. Альтернативой графику 12 является график 13, на котором отображены центрированне ICE, что позволяет более четко отследить эффект от рассматриваемой переменной.

График 12. PDP and ICE plots

График 13. PDP and Centered ICE plots

Из графиков 12-13 видно, что абсолютные показатели (Other_1, Other_4 и Other_5) имеют менее резкий эффект, чем абсолютные (Liquidity_1, Profitability_8 и т.д.). В частности, для показателя Profitability_8 переломным является значение около 0.04, после которого в среднем балл заемщика увеличивается, а затем практически не меняется, в то время как для показателя Other_4 итоговый балл плавно снижается вплоть до значения фактора ~800млн руб.

Относительно ровная структура линий говорит об однородности влияния рассматриваемых переменных на итоговый балл. Другими словами, эффект примерно одинаковый у плохих и хороших заемщиков.

Источник: https://otherreferats.allbest.ru/download/1180561/