Дипломная работа: Речевые маркеры интолерантности и компьютерные инструменты их выявления

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Исходя из результатов предыдущих исследований и представленной классификации маркеров интолерантного речевого поведения, представляется логичным рассматривать уровень речевой интолерантности текста в зависимости от количества и типа обнаруженных в нём маркеров интолерантного речевого поведения. В ходе предыдущего исследования было обнаружено, что конкретные лексические единицы (слова и словосочетания) влияют на общую тональность текста больше, чем фразеосхемы и образованные на их основе синтаксические конструкции, так как последние в большинстве случаев не имеют собственного лексического значения. Также было выяснено, что наиболее часто предметом интолерантного речевого поведения и отрицательной оценки становятся описываемые события, люди и действия, следовательно, наиболее частый тип маркеров - существительные и именные группы, реже встречались прилагательные, глаголы и глагольные группы. К подобным маркерам относились слова с отрицательно-оценочным значением, жаргонизмы, инвективная лексика, метафоры с отрицательно-оценочными коннотациями. Был сформирован список маркеров, содержащий обнаруженные лексические маркеры, которые возможно использовать в качестве материала для программы автоматического выявления маркеров интолерантного речевого поведения и определения уровня текстовой интолерантности. Список маркеров представлен в таблице ниже.

Таблица 1 - Маркеры, обнаруженные в ходе предыдущего исследования

VP

NP

Adj/Adv

плевать

грязь

вопиющий

пилить

спекуляция

фальшивый

презирать

маразм

имитационный

миндальничать

мясорубка

кричащий

смердеть

бойня

сумасшедший

хапать

резня

обезумевший

отмывать

убийца

безумный

понаехать

бандит

засланный

потрошить

головорез

заморский

зализывать

приговор

пагубный

чахнуть

бесстыдство

дьявольский

обливать грязью

клоун

шизофренический

цирк

зажиревший

апокалипсис

заскорузлый

издёвка

разжиревший

издевательство

подлый

катастрофа

бесчеловечный

мигрант

нелегальный

иммигрант

слепой

иностранные граждане

продажный

иностранцы

приезжие

бардак

раздрай

разброд

мракобесы

идиотизм

дерьмо

сволочь

фанатик

беженцы

нелегал

исчадие

переселенцы

трясина

презрение

гнев

агрессия

имитация

видимость

боевик

бомба

ад

распил

вакханалия

беспредельщик

беспредел

понаехавшие

гастарбайтер

пшик

иллюзия

экстремист

Таким образом, данная работа посвящена выявлению в тексте лексических средств, маркирующих интолерантное речевое поведение, для дальнейшего их использования при определении уровня речевой интолерантности текста.

Глава 2. Компьютерные инструменты анализа текста

В настоящее время автоматическая обработка текстов естественного языка применяется во многих областях, в том числе в лингвистике, для выполнения различных научных исследований: синтаксического и морфологического анализов, извлечения информации, синтеза текста и звучащей речи и многих других. Для каждой задачи наиболее эффективными являются только некоторые методы исследования, поэтому в данной главе будут описаны методы, позволяющие выделить в тексте интолерантные маркеры и на их основе сделать вывод о степени интолерантности текста.

2.1 Анализ тональности (sentiment analysis)

Наиболее близким к стоящей задаче является задача анализа тональности или сентимент-анализа (англ. sentiment analysis). Анализ тональности относится к компьютерным методам контент-анализа и предназначен для автоматического выявления в тексте эмоционально окрашенной лексики и определения эмоциональной оценки всего текста в одномерном («позитив»-«негатив») или многомерном (различные виды эмоций) эмотивном пространстве. Выделяются ручной, или экспертный, и автоматический анализы тональности.

Экспертный анализ тональности

Первый тип анализа выполняется экспертом-лингвистом, в связи с чем является более точным, но гораздо более трудоёмким, чем автоматический анализ. Результатом такого анализа становятся готовые тезаурусы оценочной лексики, которые затем могут использоваться в качестве обучающей базы для программ автоматического определения тональности. К подобным тезаурусам относятся разработанный учёными Принстонского университета электронный тезаурус WordNet и созданные на его основе семантические тезаурусы WordNet-Affect, в котором эмоционально окрашенные слова вручную распределены по шести эмоциональным категориям, и SentiWordNet, аннотированный в трёхмерном пространстве (негатив - объективность - позитив). Позже, в 2010 году, был разработан тезаурус SenticNet, отличающийся от своих предшественников тем, что позволяет связывать эмоционально окрашенную лексику не на синтаксическом, а на семантическом уровне. Все эти тезаурусы доступны для загрузки, однако стоит отметить, что только SenticNet разработан для 40 языков, включая русский, в то время как для WordNet-Affect поддержка русского языка была создана сторонними разработчиками из Технического университета Молдовы, при этом тезаурус русского языка был построен на базе английского и румынского путём перевода имеющихся в этих тезаурусах слов. Однако оба этих тезауруса имеют основной целью многомерную классификацию эмоций и выявление семантических связей между словами, что не является целью настоящего исследования, к которой наиболее близок тезаурус SentiWordNet, разработанный только для английского языка.

Если говорить о тезаурусах русского языка, то самыми известными являются RussNet, переведённый тезаурус WordNet для русского языка, разработка и обновление которого в настоящий момент остановлены, и более современный Yet Another RussNet, находящийся в процессе активной разработки и слияния с тезаурусом RussNet. Также ведётся работа над проектом RuThes. Однако все эти тезаурусы направлены на отображение иерархических и синтаксических связей между словами, а не на выявление эмоционально-оценочных коннотаций. К последней цели наиболее приближен лексикон RuSentiLex, разработанный на базе тезауруса RuThes. Последняя версия этого инструмента содержит более 12 тысяч эмоционально-оценочных слов и выражений, размеченных по частям речи, трёхмерному пространству тональности (позитивная, нейтральная, негативная) и источнику (оценка, чувство или факт). Данный тезаурус наиболее приближен к поставленной задаче выявления интолерантных маркеров, поэтому возможно его дальнейшее использование в качестве базового словаря для программы обработки текста.

Нельзя не отметить, что экспертный анализ может применяться не только для ручного составления словарей оценочной лексики, но и для собственно анализа - определения тональности текста. Он является наиболее эффективным, так как эксперт-лингвист может определить различные оттенки тональности и выделить в тексте иронию или сарказм, всё ещё проблематичные для автоматизированного определения. Однако стоимость и трудозатратность такого анализа гораздо выше, чем у автоматического, который с каждым годом становится всё ближе по качеству к анализу профессионального лингвиста.

2.1.2 Автоматический анализ тональности

Методы автоматического анализа тональности можно разделить на несколько групп: основанные на правилах и словарях (rule-based); основанные на использовании машинного обучения с учителем или без учителя; основанные на графовых моделях.

Основанные на правилах программы используют заранее составленные словари тонально маркированной лексики и разработанные правила, определяющие тональность лексических единиц, причём в большинстве случаев созданием правил и словарей занимаются не программисты, а эксперты-лингвисты с помощью лингвистического анализа. Программа анализирует текст на наличие негативной и позитивной (или другой тональности, в зависимости от поставленной задачи) лексики, основываясь на значениях тональности отдельных слов, присвоенных в соответствии с правилами. Однако у такого метода есть ряд проблем, отчасти совпадающих с проблемами экспертного анализа тональности. Как и последний, такие методы нуждаются в объёмной предварительной работе по составлению словаря и разработке правил, которая требует больше трудозатрат и времени, чем при использовании других алгоритмов.

Машинное обучение с учителем (supervised machine learning) является наиболее часто используемым современным методом. Суть такого метода заключается в том, что сначала программа-классификатор (Наивный Байесовский классификатор, логистическая регрессия, КНН или другой) обучается на заранее размеченных экспертом текстах, а затем используется для анализа других текстов, не входивших в обучающую выборку. Такой метод также требует предварительной работы, которая состоит не только в сборе сбалансированного обучающего корпуса, но и в их корректной разметке по тональности и наличию или отсутствию отличительных признаков, если они должны учитываться при классификации. Использование алгоритма для последующей классификации уже неразмеченных текстов делает его проще и быстрее, чем методы, основанные на правилах, но всё же он остаётся более сложным и трудозатратным, чем обучение без учителя.

Методы машинного обучения без учителя (unsupervised machine learning) основываются на автоматическом выделении негативных ключевых слов (терминов) текста, то есть тех слов, которые часто встречаются в конкретном тексте, но при этом редки во всём корпусе текстов. Эти слова имеют наибольшую информационную значимость для текста и, определив их тональность на основе семантического свойства с некоторыми словами, тональность которых известна, программа высчитывает тональность всего текста. Плюсом такого подхода является тот факт, что он практически не требует предварительной работы, кроме подготовки слов с известной тональностью, что является гораздо менее трудозатратным, чем составление словарей и правил или разметка обучающего корпуса текстов.

Методы, использующие теоретико-графовые модели, основываются на гипотезе о неравнозначности слов текста. Как и при машинном обучении без учителя, считается, что определённые слова более информационно значимы и больше влияют на тональность всего текста, чем другие, информационно незначимые слова. При использовании таких методов анализируемый текст трансформируется в граф, в котором вершинами являются слова (или группы слов) текста, а рёбрами - семантические связи между ними. Вершины графа ранжируются, при этом наибольшие веса присваиваются ключевым словам или группам, которые затем классифицируются по тональности. На основе тональности ключевых вершин высчитывается тональность всего текста. Эти методы похожи на машинное обучение без учителя анализом ключевых слов, но отличаются в способе их определения. Кроме того, для них также необходим словарь тональности, по которому будет происходить итоговая классификация слов или групп слов.

Методы автоматического анализа тональности, как и другие алгоритмы, оцениваются по тому, насколько их результаты при тестировании совпадают с результатами экспертного анализа. Основными метриками качества считаются точность - отношение верно определённых текстов к их общему числу, полнота - отношение верно определённых текстов к общему числу текстов, выявленных программой, а также их взвешенное среднее F-мера.

2.2 Автоматическая классификация текстов

И задача анализа тональности, и задача данного исследования основываются на одной из основных задач машинного обучения - задаче классификации. Её суть заключается в том, чтобы на основе определённых признаков отнести анализируемый объект к одному из нескольких классов. В машинном обучении для решения задачи классификации (как бинарной, так и многоклассовой) используются специфические модели классификации.

Большинство классифицирующих алгоритмов относятся к линейным моделям. Они относительно быстро обучаются, легко корректируют свои предсказания в процессе обучения, могут использоваться в том числе для восстановления нелинейных зависимостей, однако ограничены количеством признаков, использующихся при обучении. Одна из самых известных и популярных моделей, наиболее часто использующаяся для классификации текстов - Наивный Байесовский классификатор (Naпve Bayes). Суть работы такого классификатора в том, чтобы отследить, наличие какого признака о каком классе свидетельствует и впоследствии по набору встреченных в тексте признаков отнести его к наиболее вероятному классу. Метод основывается на теореме Байеса по оценке вероятности события при условии наступления другого события:

,

из чего можно вывести формулу принадлежности объекта к определённому классу C при наличии у него признаков F1 и F2:

,

где в знаменателе находится вероятность одновременного наличия признаков F1 и F2, а в числителе - произведение вероятности класса и вероятности наличия признаков в объекте этого класса. Последнюю вероятность достаточно сложно посчитать, однако при использовании наивного предположения о том, что все признаки независимы друг от друга, формула значительно упрощается:

.

Несмотря на то, что такое наивное предположение теоретически неправильно, этот метод хорошо проявляет себя во многих реальных задача классификации, в том числе в задачах классификации текстов.

Другой распространённый метод классификации - логистическая регрессия (Logistic Regression), применимая только для бинарной классификации, так как в качестве результата она выдаёт только число от 0 до 1 - вероятность принадлежности объекта к одному из двух классов. При необходимости многоклассовой классификации при использовании логистической регрессии приходится использовать стратегию «один против всех» (`one vs all' classification), при которой для каждого из классов высчитывается вероятность принадлежности конкретно к этому классу или любому из двух других, и на основе вероятностей для каждого класса делается итоговый вывод. Одним из недостатков логистической регрессии является то, что она требует большой тренировочной выборки для лучшего вычисления вероятностей.

Источник: https://otherreferats.allbest.ru/download/1021400/