Для поиска единиц кодирования в корпусе текстов мы воспользуемся инструментом Extractor. Программа «Extractor» была разработана на базе Национального научно-исследовательского совета Канады и впоследствии привлекала внимание фирмы «DBI Technologies», которая занимается выпуском программного обеспечения. Пробная версия программы, предназначенная для частного использования с целью обработки текстов небольшого объема, доступна на одноименном сайте: extractor.com. Программное обеспечение «DBI Extractor» предназначено для автоматического извлечения содержимого документа в виде ключевых слов и фраз. Программа использует технологию резюмирования, таким образом, система прочитывает текст так, как это сделал бы человек, а затем формирует список ключевых слов. Данная программа может мгновенно обрабатывать тексты любых объемов и извлекать из них ключевые фразы, которые не только встречаются в документе, но и отражают его смысл и контекст. Механизм резюмирования не требует обучения, настройки или вмешательства человека. В качестве одного из возможных примеров использования данной программы указывается борьба с терроризмом, так как «Extractor» может помочь в распознавании текстов террористической тематики.
В таблице 1 приведены ключевые слова для каждого из текстов, полученные с использованием инструмента «Extractor».
Таблица 1
Ключевые слова корпуса текстов
|
Текст |
Слово 1 |
Слово 2 |
Слово 3 |
Слово 4 |
Слово 5 |
|
|
1 |
America |
War |
Regime |
Syria |
President |
|
|
2 |
Syria |
United States |
Congress |
President |
Chemical Weapons |
|
|
3 |
President |
Obama |
Power |
Executive Power |
To act |
|
|
4 |
Syria |
Hama |
Slaughter |
Syrian |
Government |
|
|
5 |
President |
Speech |
To appeal |
To speak |
Diplomatic situation |
Таблица 2
Краткая характеристика исследуемого корпуса текстов
|
No текста |
T1 |
T2 |
T3 |
T4 |
T5 |
|
|
Кол-во слов |
2207 |
759 |
1027 |
1108 |
750 |
Как показывают данные таблицы 1, несмотря на единство тематики, акценты в каждом из текстов расставлены по-разному, чем и объясняется расхождение ключевых слов. Тем не менее выявленные совпадения подтверждают, что каждый из военно-публицистических текстов посвящен выступлению президента и дипломатической ситуации в Сирии. С учетом расхождения ключевых слов мы решили самостоятельно извлечь единицы кодирования, руководствуясь прочитанным. В частности, мы остановились на следующих единицах: We, I, Assad, Chemical Weapons, You, War, Strike, Iraq, Afghanistan.
Выбор данных единиц кодирования объясняется следующим:
Местоимение we («мы»), во-первых, является инструментом противопоставления на уровне «свой - чужой» («мы - они»), а во-вторых, инструментом манипулирования и навязывания коллективной ответственности за принятие важных политических решений.
Местоимение I («я»), с одной стороны, позволяет высказать личное мнение, с другой - является инструментом навязывания собственного мнения в случае, если речь идет об авторитетной персоне, например о президенте страны.
Assad - фамилия сирийского президента, множество раз встречавшаяся в корпусе текстов. Использование имени собственного говорит об отождествлении происходящего в стране с конкретным лицом и, как следствие, о предъявлении ему обвинений за сложившуюся дипломатическую обстановку.
Chemical Weapons («химическое оружие») - использование химического оружия режимом Б. Асада является официальным предлогом для предъявления последнему обвинений со стороны США, именно поэтому данное словосочетание играет особую роль в корпусе текстов.
Местоимение you («вы/ты») - использование данного местоимения является непосредственной формой обращения к реципиенту для получения обратной связи.
War («война») - центральная тема всех текстов, лежащая в основе конфликта власти и СМИ.
Strike («удар») - военная мера, о которой идет речь в выступлении президента и которая активно обсуждается журналистами.
Iraq и Afghanistan - исторические конфликты, тема которых традиционно поднимается, если речь заходит о вмешательстве США во внутреннюю политику других государств. Именно эти войны регулярно приводятся в качестве примера неудач внешней политики США.
Выбранные единицы кодирования достаточно четко могут быть поделены на две более глобальные категории: «свой - чужой» (we, you, I, Assad) и «война» (Chemical Weapons, War, Strike, а также Iraq и Afghanistan как частные случаи военных кампаний).
Таблица 2 представляет собой краткую характеристику корпуса текстов, в котором осуществляется поиск К-переменных.
Т1, Т2 и Т4, представленные в таблице без подчеркивания, являются текстами, поддерживающими сирийскую кампанию, при этом Т1 - текст военно-политического дискурса, а Т2 и Т4 - тексты военно-публицистического дискурса. Соответственно Т3 и Т5, выделенные в таблице подчеркиванием, являются материалами оппозиционного характера, отвергающими возможность военной кампании на территории Сирии.
В таблице 3 представлена обобщенная характеристика текстов по форматам дискурса (военно-политический и военно-публицистический), а также по характеру текста - поддерживающие или отвергающие идею военного вмешательства в Сирию. Как и в предыдущей таблице, подчеркиванием обозначены тексты военно-публицистического дискурса, имеющие оппозиционный характер.
Таблица 3
Обобщенная характеристика текстов исследуемого корпуса
|
No текста |
T1 |
T2+T4 |
T3+T5 |
|
|
Кол-во слов |
2207 |
1867 |
1777 |
Таблица 4
Абсолютная частота встречаемости отдельных словоупотреблений в тексте
|
K |
T1 |
T2 |
T3 |
T4 |
T5 |
|
|
We |
33 |
10 |
3 |
5 |
1 |
|
|
I |
31 |
0 |
0 |
7 |
8 |
|
|
Assad |
24 |
6 |
0 |
3 |
1 |
|
|
Chemical Weapons |
15 |
5 |
1 |
3 |
2 |
|
|
You |
11 |
1 |
0 |
3 |
6 |
|
|
War |
9 |
1 |
8 |
5 |
2 |
|
|
Strike |
7 |
5 |
2 |
3 |
2 |
|
|
Iraq |
6 |
2 |
2 |
6 |
0 |
|
|
Afghanistan |
4 |
0 |
1 |
2 |
0 |
Таблица 5
Относительная частота встречаемости отдельных словоупотреблений в тексте
|
K |
T1 |
T2 |
T3 |
T4 |
T5 |
|
|
We |
0,014952 |
0,013175 |
0,002921 |
0,004513 |
0,001333 |
|
|
I |
0,014046 |
0 |
0 |
0,006318 |
0,010667 |
|
|
Assad |
0,010874 |
0,007905 |
0 |
0,002708 |
0,001333 |
|
|
Chemical Weapons |
0,006797 |
0,006588 |
0,000974 |
0,002708 |
0,002667 |
|
|
You |
0,004984 |
0,001318 |
0 |
0,002708 |
0,008 |
|
|
War |
0,004078 |
0,001318 |
0,00779 |
0,004513 |
0,002667 |
|
|
Strike |
0,003172 |
0,006588 |
0,001947 |
0,002708 |
0,002667 |
|
|
Iraq |
0,002719 |
0,002635 |
0,001947 |
0,005415 |
0 |
|
|
Afghanistan |
0,001812 |
0 |
0,000974 |
0,001805 |
0 |
Статистический анализ данных
типологический военный политический публицистический дискурс
Определение абсолютных и относительных частот К-переменной
Чтобы проанализировать содержательную сторону текста, нам необходимо вычислить абсолютную частоту встречаемости заявленных единиц кодирования. Абсолютная частота включает в себя все случаи употребления искомых единиц кодирования, т. е. сколько раз то или иное слово встретилось в тексте.
Исходя из таблицы 4, мы можем заметить, что наиболее «насыщенным» является текст 1, относящийся к военно-политическому дискурсу, что можно объяснить необходимостью использования широкого арсенала инструментов манипулирования общественным мнением в текстах данного формата. При этом абсолютная частота употребляемости таких единиц кодирования, как We, Assad, Chemical Weapons, Strike, Iraq, Afghanistan, выше всего в текстах военно-политического и военно-публицистического дискурса проправительственного характера, что, с одной стороны, подтверждает их тесную связь, а с другой - ставит вопрос о дальнейшем подразделении военно-публицистического дискурса на проправительственный и оппозиционный.
Несмотря на то, что представленные в таблице 4 данные уже могут быть использованы для анализа текста, учитывая разницу в объемах текстов, более объективная картина будет получена при подсчете относительной частоты встречаемости словоупотреблений.
Относительная частота встречаемости отдельных словоупотреблений - отношение конкретно взятых единиц к общему объему текста. После таких подсчетов мы получаем возможность сравнивать частоту встречаемости отдельных единиц кодирования в разных текстах, руководствуясь одними и теми же коэффициентами.
Жирным шрифтом мы выделили наибольшие значения встречаемости конкретно взятой единицы кодирования, а подчеркиванием - наименьшие.
Таким образом, исходя из данных, представленных в таблице 5, мы видим, что большинство единиц кодирования чаще всего встречается в тексте военно-политического дискурса (Т1), что подтверждает наше предположение о наиболее выраженной потребности манипуляции общественным мнением. В частности, президент регулярно ссылается на необходимость коллективного принятия решения и сплочения перед всеобщей угрозой (местоимение we), а также на собственный авторитет и собственное отношение к происходящему (местоимение I). Частое упоминание имени Асада говорит о персонификации ответственности за напряженную ситуацию в международных отношениях, что также объясняет частое упоминание сирийского президента в еще одном тексте (Т2) проправительственного характера. Аналогичным образом больше всего упоминаний химического оружия приходится на выступление президента и на материалы проправительственного характера (Т2 и Т4), призванные нагнетать ощущение реальности угрозы, исходящей от ближневосточного государства.
Местоимение you создает несколько другую картину и выражает функцию апелляции в статье антиправительственного характера (Т5), благодаря чему журналист призывает читателей задуматься над тем, какой ценой может обойтись очередная военная кампания для американского народа. Более того, местоимение we встречается в данной статье реже всего, что говорит о том, что автор не отождествляет себя с читателями, а позволяет им сформировать собственную позицию относительно происходящего.
Наиболее частое упоминание войны (war) характерно для военно-публицистического текста оппозиционного характера (Т3), в котором реже всего встречаются такие единицы кодирования, как I, Assad, Chemical Weapons, You, Strike, что позволяет сделать вывод о том, что данный текст всецело посвящен тематике войны и ее пагубности для США. К подобному выводу можно прийти и в связи с тем, что автор не упоминает в достаточной степени ни сирийского лидера, ни его арсеналы химического оружия, ни военный удар, а учитывая, что местоимения «я» и «вы/ты» также используются крайне редко, автор пытается вызвать у читателя ощущение непредвзятости собственной позиции и объективности фактов, изложенных в его статье.