Дипломная (вкр): Изучение пунктуации на примерах корпуса школьных текстов

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Изучение пунктуации на примерах корпуса школьных текстов

ОГЛАВЛЕНИЕ

ВВЕДЕНИЕ

Глава 1. Корпус текстов школьников

.1 Корпус текстов школьников в контексте корпусной лингвистики

.2 содержание корпуса текстов школьников

.3 Пополнение корпуса текстов школьников

Глава 2. Пунктуационный разметчик Интерробанг

.1 Техническое описание программы Интерробанг

.2 Язык разметки TEI для кодировки пунктуации

.3 Описание интерфейса. Работа в программе Интерробанг

Глава 3. Пунктуационная разметка текстов школьников. Классификация пунктуационных ошибок

Глава 4. Обработка корпуса с помощью программы интерробанг и анализ полученных данных

4.1 Статистический анализ данных

.2 Анализ данных разметки и статистической обработки

4.2.1 Оформление заголовков

.2.2 Удаленные знаки препинания

.2.3 Парность знаков

4.2.4 Пробелы

.2.5 Абзацное членение

.2.6 Разделительные знаки

.2.7 Выделительные знаки

.2.8 Другие пунктуационные случаи

.2.9 Лишние знаки неясной этиологии

ЗАКЛЮЧЕНИЕ

СПИСОК ИСПОЛЬЗОВАННЫХ ИСТОЧНИКОВ И ЛИТЕРАТУРЫ

ПРИЛОЖЕНИЯ

ВВЕДЕНИЕ

Направление корпусной лингвистики, которая занимается сбором, обработкой и анализом текстовых данных, активно развивается сегодня по всему миру. Увеличивается число национальных корпусов (собрание текстов в электронной форме, представляющих определенный язык во всем многообразии жанров, стилей, территориальных и социальных вариантов), возникают новые форматы и типы корпусов: корпусы текстов одного писателя, корпусы синонимов, мультимедийные корпусы, представляющие данные сразу нескольких языковых и экстралингвистических уровней речи, корпусы эмоционально окрашенной речи и т.д.

Корпусные данные исследуются и используются для решения различных прикладных задач - от создания словарей до интеллектуальных диалоговых систем. Но на фоне многообразия данных, современных методов и алгоритмов обработки данных и их представления, до сих пор остаются области, не вполне охваченные исследователями, например, речь современных подростков.

Дискуссия о целесообразности создании корпуса ученических текстов, представляющих родную речь, ведется уже почти на протяжении целого десятилетия. За последние годы, наконец, сформировалось понимание того, что в условиях высокой технической оснащенности образовательных учреждений собирать школьный дискурс (сочинения, изложения, диктанты, пересказы, устные доклады и т.п.) перестало быть затруднительным, а практика корпусного анализа текстов дает ощутимый результат в развитии обучающих систем (В.А. Плунгян, 2005; О.Н. Камшилова, 2011; О.Э. Садовникова, 2013; Е.В. Рахилина, 2015).

Возможности корпусных технологий уже давно оценили и взяли на вооружение вузовские преподаватели: они используют их для того, чтобы оценить, какие ошибки учащиеся допускают чаще и с какими стоит и нужно специально работать, создают на базе корпусов специальные тренажеры для повышения уровня грамотности учащихся. Пример успешной работы с корпусными для создания тренировочных упражнений (О.Н. Камшилова и др., 2008).

Несмотря на положительный опыт учителей иностранного языка и давно прозвучавшее предложение лингвистов использовать актуальные корпусные данные (Н.Р. Добрушина, 2005; Н.Р. Добрушина, А.И. Левинзон, 2006), методисты, сталкивающиеся с вопросом, чем наполнить учебники и задачники по русскому языку, до сих пор не проявили интереса к текстам школьников.

Как правило, в случае отбора текстов для анализа и тренировки языкового навыка переиздают хорошо известные пособия; по традиции выбирают тексты из классической литературы, к сожалению, часто тяжелые, морально устаревшие, неблизкие и непонятные современному школьнику; либо тексты конструируются искусственно, и их неестественность вызывает у ребенка реакцию отторжения и нежелания изучать родной язык. Между тем материал для создания тренажеров под рукой - написанные учащимися тексты, в которых допущены типичные орфографические, пунктуационные и речевые ошибки.

У учеников и родителей часто возникает ложное ощущение, что учителей мало заботит, какие ошибки допускают школьники, где «больное место» у конкретного ребенка, в каких случаях ошибаются почти все учащиеся, и какую помощь им оказать. На самом деле учителю-русисту, ведущему в нескольких классах с большим количеством детей, сложно заметить, что усваивается школьниками, а какие правила и навыки так и не удалось закрепить. У него до сих пор не было инструмента и достаточной статистической информации, которые позволили бы представить полную картину ученических проблем исправиться с ними.

Кроме того, мониторинг корпусных данных, возможно, позволит учителю видеть, какие случаи не стоит исправлять в детских текстах. Язык меняется, и, хотя справочниками это еще не зафиксировано, на самом деле речь часто идет уже не об ошибке, а о языковой норме (достаточно вспомнить пример с предлогом «про» в значении «о»).

Именно такие соображения наводят на мысль о необходимости смены подхода к созданию справочного материала по русскому языку.

Корпус школьных текстов с размеченными ошибками может быть использован и в практических целях: для создания учебных тренажеров и как готовая база примеров и статистических данных для создания спелчекеров - современных систем проверки правописания. Разработчики таких программ на данный момент применяют данные, полученные преимущественно из справочной литературы и корпусов с текстами, написанными грамотно и проверенными корректорами (Орфограммка, Орфус, Литера5 и др.). Только некоторые спелчекеры (Орфограммка) обрабатывают данные об ошибках пользователей для улучшения процедуры проверки. Особый интерес для авторов спелчекеров представляют данные о пунктуационных ошибках - в связи с нехваткой данных ни одна из существующих систем проверки на сегодняшний день не может обеспечить качественной проверки пунктуации.

В рамках настоящей магистерской работы мы поставили цель изучить пунктуацию на примерах из собранного нами Корпуса школьных текстах. Анализ пунктуации и особенно пунктуационных ошибок представляет для нас исследовательский интерес как с теоретической точки зрения, так и с практической. С одной стороны, мы рассчитываем получить данные, позволяющие под иным углом взглянуть на методику изучения пунктуационных правил, с другой, мы видим одной из задач после наполнения корпуса и сбора статистических данных создание школьного спелчекера - программы, которая автоматически будет исправлять ошибки в загруженных текстах и выставлять оценки.


Глава 1. Корпус текстов школьников


Корпус текстов школьников (КТШ) - совокупность текстов, написанных подростками на уроках русского языка и словесности и в рамках домашних заданий по этим предметам. Тексты корпуса могут использоваться для лингвистических исследований регламентированной письменной речи, для разработки учебно-методических материалов.

Тексты собирались в ходе эксперимента, проводившегося в 2014-2015 гг. на базе школы 179 г. Москвы. В течение учебного года учащимся нескольких 7-х и 8-х классов школы предлагалось сдавать на проверку тексты, написанные в рамках курса словесности и русского языка, в удобном им формате - рукописном или напечатанном.

Учащиеся быстро оценили преимущества текстов, сданных на проверку в электронном виде: работа над ошибками - редактирование текста, включающее переписывание текста, по мнению учащихся, была менее трудоемким занятием в том случае, если текст был написан не от руки, а напечатан.

Глава представлена тремя разделами. В первом разделе речь пойдет о Корпусе школьных текстов в контексте корпусной лингвистики в целом: о предмете корпусной лингвистики, об истории вопроса, о предназначении корпусов, о корпусах подростковой речи и Корпусе текстов школьников как материале для социолингвистических и лингвистических исследований. Во втором разделе будет рассказано о технологии сбора текстов для КТШ. В третьем - о проблемах, с которыми мы столкнулись при наполнении Корпуса.

1.1 Корпус текстов школьников в контексте корпусной лингвистики


Корпусная лингвистика, возникшая во второй половине XX - одно из самых молодых направлений в науке и в то же время весьма популярное среди ученых-исследователей всего мира. Корпусная лингвистика позволяет изучать письменную и устную речь, предлагая для исследований большое количество данных, удобных для полуавтоматической и автоматической обработки, по результатам которой строятся и проверяются сложные лингвистические, исторические, социологические и др. гипотезы.

Объектом изучения корпусной лингвистики являются собранные в большом количестве тексты и записи звучащей речи на определенном языке или нескольких языках. Задача лингвиста не только собрать речевые данные, но и обработать их, исходя из целей и задач собираемого корпуса, а также анализируемых языковых уровней. В результате такой обработки исследователь получает разметку корпуса, т.е. не только текст как последовательность словоформ или лемм и знаков препинания, но и дополнительную информацию о тексте в целом (метатекстовая разметка: автор текста, жанр, врем создания и т.д.) и информацию о различных единицах текста (разметка, включающая леммы, теги с морфологической или семантической характеристикой слова, выделение синтагм, синтаксическую разметку предложений и т.д.). Аннотированные и размеченные тексты, т.е. материал, подготовленный для заключительного этапа исследовательской работы, анализа языковых фактов, - это и есть корпус.

В большинстве случаев современные корпусные данные формируются и обрабатываются с помощью специальных программ - утилит для сбора данных, программы, очищающие от избыточных данных и форматирующие, программы для разметки, программы для статистической обработки, программы, формирующие гипотезы, и, конечно, комплексные решения (WordSmith Tools, AntConc и др.).

Основное внимание в корпусной лингвистике долгое время было приковано к созданию содержащих метаразметку и грамматические пометы национальных корпусов, корпусов языков с большим числом носителей - английского, чешского, хорватского, венгерского, итальянского, русского, японского и т.п. Основой для таких корпусов в большинстве случаев служила классическая литература. Впоследствии такие корпуса пополнялись публицистическими произведениями и научными текстами, сегодня в них находится место интернет-дискурсу, устной речи и созданию мультимедийному контенту (в корпусах аудио и видеозаписи сопровождаются письменной расшифровкой и разметкой жестового сопровождения).

В конце XX-начале XXI вв. наметилась тенденция к созданию параллельных корпусов для двух или нескольких языков (English-Norwegian Parallel Corpus). Такие корпуса часто содержат мататекстовую, грамматическую и эрратологическую разметку, т.е. информацию об ошибках при переводе. Параллельные корпуса в значительной степени изменили подход в методике преподавания иностранных языков.

В наше время с целью сохранения мирового наследия активно создаются корпуса языков малых народов, например, электронный корпус текстов на языках малочисленных народов Сибири (на материалах ненецкого, телеутского, шорского и эвенкийского языков); корпуса древних текстов (например, Helsinki Corpus - корпус древне- и среднеанглийских текстов с 8 по 17 вв.) и текстов на языках, которые находятся под угрозой исчезновения (например, Сorpus of Chipaya texts).

На фоне повышенного интереса к концепции использования интернета как огромного корпуса, предназначенного для машинной обработки, и к разработкам по переводу текстового контента в онтологии знаний (В.Д. Соловьев и др., 2006) широкое распространение получили тематические корпуса (медицинские, юридические, экономические и др.).

В последние десятилетия интерес корпусной лингвистики прикован, в том числе и в России, к глубокому, многоаспектному изучению родного языка.

Работа ведется сразу по нескольким направлениям.

Изучается детская (дошкольная) речи (например, CHILDES Corus: содержит транскрибированную речь детей 20 национальностей, речь детей с нормальным развитием и с афазией или аутизмом) и речь билингвов и мультилинговов (например, Корпус устной речи русско-болгарских билингвов). На данных, полученных в этой области, строятся модели порождения речи.

Изучается наследуемый язык (например, Эритажный корпус, являющийся частью проекта «Корпуса и коллекции интерферированных вариантов русского языка»). После публикаций Кембриджского университета о подкорпусе CIC Cambridge Learner Corpus, который позволяет отслеживать наиболее частое употребление узуальных конструкций и типичных ошибок в академической речи, а потому используется при составлении учебников и тренажеров по английскому языку, повсеместно стали в университетах стали разворачиваться корпуса академической речи. Наконец, обозначился интерес к речи школьника.

Именно последнему направлению будет посвящено данное исследование.

На сегодняшний день известны два корпуса подростковой речи - SCOSE (создавался исследователям из Саарского университета (Germany), содержит речь подростков из Лондона и пригородов, около 12,000 словоупотреблений) и COLT (собран исследователями из Бергенского Университета; разработан на базе спонтанной устной речи детей в возрасте от 13 до 17 лет из разных пригородов Лондона; включает в себя около 5 000 000 слов; записи сопровождаются метаразметкой, сообщающей возраст, пол, социальный статус говорящего).

В первую очередь интерес такие корпуса вызывают у социолингвистов, изучающих сленг современных подростков (например, A.B. Stenström, G. Andersen и др., 2012; E.M.D Drange. и др., 2014).

В данном исследовании ставится другая цель. КТШ собирается и обрабатывается таким образом, чтобы посмотреть на тексты школьников с эрратологической точки зрения: изучается, какие ошибки чаще всего допускают современные подростки в регламентированной учебным процессом речи - в сочинениях, изложениях, диктантах и других формах школьного языкового дискурса.

1.2 Содержание корпуса текстов школьников


Корпус текстов школьников - пополняемая база ученических текстов.

Ученические тексты, включенные в КТШ, - это тексты, написанные от руки (затем набранные на компьютере волонтерами) или напечатанные, авторами которых являются учащиеся 7-9 классов, т.е. подростки 12-15 лет. Все тексты? включенные в базу, переведены в текстовый формат (.txt) txt c кодировкой utf-8 и рассортированы по папкам: 7б1-2014, 8е-2013, 8е-2014, 9е-2014, неразобранное-2014. В настоящее время (июнь 2015г.) таких файлов 238 (приблизительно 100 000 словоупотреблений). Ожидают форматирования и сортировки 123 текста - преимущественно домашние сочинения семиклассников, написанные в почтовых редакторах; набора и форматирования - 220 рукописных текстов шестиклассников и семиклассников, написанных на уроке (не диктанты).

Во всех папках с отформатированными работами, кроме тех, которые содержат в своем название слово «неразобранные», содержатся тексты в формате .txt (имеют названия на кириллице) и их аннотированные и размеченные дубли в формате .ieb (имеют названия на латинице). На данный момент в корпусной базе 126 файлов в формате .ieb. (47 448 словоупотреблений).

Каждый такой файл аннотирован в программе Интерробанг с помощью метаразметки на языке TEI (#"862958.files/image001.jpg">

Рис. 1. Главное рабочее окно программы Интерробанг

· Меню «Сервис» с двумя пунктами: «Статистика» - выводит статистическую информацию об ошибках, отмеченных проверяющим в открытом файле, и «Дамп» - открывает окно с TEI-разметкой открытого файла.

·        Меню «Справка» - выводит справку по графическим обозначениям причин постановки/удаления знака препинания.

Под меню расположена панель инструментов с кнопками основных операций:

 - кнопка «Открыть»

 - кнопка «Импорт»

Источник: https://www.bibliofond.ru/detail.aspx?id=862958