Дипломная работа: Экспериментальное исследование эволюции автоматического перевода научно-технических текстов

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

В 1991 году в России была создана компания "Промт" (СМП Translate). Ее костяк составили сотрудники лаборатории инженерной лингвистики Ленинградского пединститута им. А.И. Герцена. Уже через год фирма выиграла тендер NASA на поставку систем машинного перевода с английского языка на русский.

В 2003 году была запущена функция автоматического перевода в крупнейшей поисковой системе Google. Компания Google создала собственную программу, основанную на принципах статистического перевода. Она считается более эффективной, но менее "интеллектуальной". В 2009 году компания Yandex объявила о запуске автоматического перевода на основе технологии "Промт". (http://linguisticus.com)

В сентябре 2016 года компания Google представила систему нейронного машинного перевода (Google Neural Machine Translation system, GNMT). По мнению компании, она превосходит по качеству все прочие технологии в этой области. Применение GNMT сокращает количество ошибок в машинном переводе на 55-85%. (https://www.searchengines.ru)

Компания Yandex запустила нейросетевой перевод в 2017 году. Главным отличием компания заявили гибридность. СМП Yandex переводит предложение сразу двумя методами - статистическим и нейросетевым, а потом с помощью алгоритма CatBoost, в основе которого лежит машинное обучение, находит наиболее подходящий.

Как заявляет компания Google, GNMT совершает значительные ошибки, которые не допустил бы человек-переводчик. Например, не переводит определенные слова, неверно переводит имена собственные или редкие термины, переводит предложения по отдельности, а не рассматривает контекст абзаца или страницы.

В общем случае перевод с применением нейронных сетей превосходит перевод статистический, и у этой технологии есть огромный потенциал для развития.

Системы машинного перевода, их преимущества и недостатки

Существует несколько систем машин переводы, описание которых содержится в следующих подпунктах.

Машинный перевод, основанный на правилах

Rule - based Machine Translation (RBMT, Машинный перевод, основанный на правилах) - это технология, которая основана на словарной информации и анализе грамматических правил конкретных языков. Такие системы строятся на основе лингвистического описания двух естественных языков (двуязычных словарей и других баз данных, содержащих морфологическую, грамматическую и семантическую информацию), формальных грамматик и собственно алгоритмов перевода. Качество перевода зависит от объемов лингвистических баз данных (словарей) и глубины описания естественных языков, т. е., необходим учет максимального количества особенностей грамматической структуры как входного, так и выходного языка.

Существует два типа rule-based систем:

· системы по типу Transfer - предполагают морфологический, синтаксический и семантический анализ текста на языке входа; преобразование в структуру выходного языка; синтез текста на выходном языке,

· системы по типу Interlingua - предполагают анализ входного текста в терминах метаязыка и синтез метаструктуры текста на выходном языке.

К преимущества RBMT-систем относятся как синтаксическая и морфологическая точность, так и стабильность и предсказуемость результата. Недостатки RBMT-систем в необходимости поддерживать и актуализировать лингвистические базы данных.

Основные компании-производители систем машинного перевода на основе технологии rule-based - это PROMT, Systran, Linguatec.

Статистический машинный перевод

Statistical Machine Translation (SMT, Статистический машинный перевод) - это технология, основанная на поиске наиболее вероятного перевода предложения с использованием данных, полученных из двуязычной совокупности текстов. Такие системы перевода строятся на основе сравнения больших объемов корпусов параллельных текстов. Корпус параллельных текстов - это тексты, содержащие предложения на одном языке и соответствующие им предложения на втором. Статистический машинный перевод обладает свойством "самообучения": чем больше в распоряжении имеется параллельных корпусов и чем точнее они соответствуют друг другу, тем лучше результат статистического машинного перевода.

К преимуществам SMT-систем относятся понятность перевода, легкость в построении при достаточном количестве параллельных корпусов и переносимость технологии на любые языковые пары.

Основные еедостатки SMT - это ограниченность параллельных корпусов, неумение справляться с морфологией и синтаксисом, а также искажение информации (дублирование, пропуск, подмена информации).

Далее представлены компании-производители систем статистического машинного перевода: PROMT, Google, SDL Language Weaver, Microsoft, Asia Online, IBM.

Гибридный машинный перевод

Hybrid Machine Translation (HMT, Гибридный машинный перевод) - это технология, которая основана на совмещении методов RBMT и SMT . В связи с тем, что технологии SMT и RBMT имеют свои недостатки и сложности, а также достигли определенного предела в своем развитии, разработчики решений по МП рассчитывают на технологический прорыв за счет создания гибридной технологии перевода. Такой подход позволяет взять сильные стороны обеих технологий (грамматическую точность при переводе от RBMT и человекообразность перевода от SMT).

Основные компании-производители систем машинного перевода на основе гибридной технологии- это PROMT, Systran.

Помимо систем машинного перевода, существуют программы, принцип работы которых основан на технологии Translation Memory.

Нейронный машинный перевод

Нейронный машинный перевод (Neural Machine Translation, NMT) - это подход к машинному переводу, в котором используется большая искусственная нейронная сеть. Он отличается от методов машинного перевода, основанных на статистике фраз (SMT), которые используют отдельно разработанные подкомпоненты (Procedia Computer Science, 2015, 64). Модели NMT используют глубинное обучение и обучение признаков. Для их работы требуется лишь малая часть памяти по сравнению с традиционными системами статистического машинного перевода (SMT). Кроме того, в отличие от традиционных систем перевода, все части модели нейронного перевода обучаются совместно (от начала до конца), чтобы максимизировать эффективность перевода.

Компания Google является производителем нейронного машинного перевода.

Память переводов

Translation Memory (TM, Память переводов) - это многоязычные (чаще двуязычные) базы часто встречающихся предложений из фрагментов и так называемых сегментов. В основе технологии лежит принцип "не переводить один и тот же текст дважды".

Технологию Translation Memory часто путают с машинным переводом (Machine Translation). Использование технологии ТМ повышает скорость перевода за счет уменьшения объема механической работы. Однако важно отметить, что TM не выполняет перевод за переводчика, а является мощным инструментом для сокращения затрат при переводе повторяющихся текстов (Прохоров, 2006).

Технология базируется на сравнении документа, который нужно перевести, с данными, хранящимися в предварительно созданной базе переводов. В общем массиве текста система находит сегменты, которые уже были однажды переведены, и берет максимально похожие переводы из базы переводов Translation Memory оставляя выбор за переводчиком.

Далее приведены основные компании-производители систем TM: PROMT, SDL Trados, Atril (системы Dйjа Vu), OmegaT.

Для перевода больших объемов типовой документации принято использовать технологии TM и МТ вместе, так как каждая из них решает разные подзадачи в рамках общей задачи: базы TM обеспечивают извлечение и подстановку переведенного ранее контента, а с помощью MT производится перевод нового контента (http://www.promt.ru/company).

Методы оценки перевода

Проблемой оценки эффективности СМП занимаются на протяжении длительного времени. Предлагались и предлагаются самые различные методы: от статистических до учета мнения конечного пользователя. Несмотря на все многообразие предлагаемых методик, на настоящий момент нет единой общепринятой методики оценки эффективности СМП. Высказываются мнения о принципиальной невозможности сравнения различных систем МП в силу неравноценности таких программ еще на начальном этапе сравнения. Как можно сравнивать две системы, разработкой одной из которых занимается целая группа лингвистов, программистов при значительной финансовой помощи спонсоров, а другая разрабатывается энтузиастами своего дела. К. Буатэ отмечает, что для проведения действительно четкого сравнения нужны значительные капиталовложения, направленные на проведение идентичной настройки систем, выработки единых критериев (Воitet, 1991, 45-47).

Марчук Ю.Н. отмечает, что нет единого критерия оценки эффективности СМП и предлагает учитывать стоимость систем и оценивать ее работу за некоторый промежуток времени (Марчук, 2007).

Кроме практического подхода к оценке переводов, выполненных с помощью систем МП, которая до настоящего времени проводится в большей степени эмпирическим путем, скорее интуитивно, основываясь на профессиональном опыте и знаниях оценивающего, существуют и теоретические аспекты данной деятельности. "В теории перевода адекватность переводов традиционно сводится к категориям семантической (смысловой) полноты и точности, дополняемым стилистической эквивалентностью, включающей, в частности принцип соответствия текста перевода стилистическим нормам языка перевода. Именно на основе этих параметров чаще всего и выводятся оценки качества перевода" (Ванников, 1982, 5). Как полагает автор, существуют различные типы адекватности перевода: семантико-стилистическая, функциональная и дезидеративная. Кроме этого, адекватность, в зависимости от коммуникативной установки оригинала, может приобретать валоративный, инцитивный, информационный и селективный типы (Ванников, 1982а, 7).

Соотнесенность перевода с оригиналом также может быть выявлена на основе их преобразований в базисные структуры и последующего сравнения с учетом некоторого числа допустимых расхождений. Такие трансформации в глубинно-синтетические структуры предлагаются Мартемьяновым Ю.С (Мартемьянов, 1975), a Шаляпина З.М. (Шаляпина, 1975) преобразует их в глубинно-семантические структуры.

А.И. Новиков предлагает сравнивать тексты оригинала и перевода на основе денoтатной структуры предложений (Новиков, 1979). При таком подходе создается денoтатная структура для каждого из текстов. Узлами такой структуры являются понятия, а отношения между ними являются предикатами, выражая тем самым связь между узлами. Сравнение происходит на основе выявления близости или отдаленности между соответствующими денoтатными структурами.

Королев Э.И., придерживаясь традиционного подхода к оценке качества перевода, предлагает считать основными критериями эффективности перевода понятность и адекватность (Королев, 1991). Кулагина О.С. в своей работе отмечает, что для репрезентативности оценки эффективности СМП необходимо проводить их тестирование на представительных массивах информации (Кулагина, 1979). Проблемой понятности и адекватности перевода, выполненного СМП, занимались не только отечественные ученые, но и их зарубежные коллеги. Одним из первых результатов оценки эффективности СМП можно считать знаменитый доклад ALPAC (Trujillo, 1999).

Под критерием понятности подразумевается, насколько понятен текст перевода при его прочтении без обращения к оригиналу. Существуют различные методики оценки понятности переведенного машиной текста. Предлагают оценивать понятность как по четырехбалльной (Arnold et al, 1994) и пятибалльной шкале (Nogaо et al, 1988), так и по десятибалльной, которая использовалась при подготовке доклада ALPAC. Ниже приведена пятибалльная шкала оценки перевода, предложенная Нагао:

1. Смысл предложения понятен и не возникает никаких вопросов. Грамматика, словоупотребление и стиль соответствуют общей структуре текста и не требуют постредактирования.

2. Смысл предложения понятен, но возникают большие проблемы с грамматикой, словоупотреблением и стилем.

3. Общий смысл предложения понятен, но смысл некоторых его частей вызывает сомнение из-за неправильного грамматического строя, словоупотребления и стилистических ошибок. Требуется обращение к оригиналу.

4. В предложении имеется большое количество грамматических, слово- употребительных и стилистических ошибок. Смысл предложения с трудом можно понять после внимательного изучения.

5. Смысл предложения непонятен.

Схожая классификация, расположенная в обратном порядке, используется для оценки качества перевода Кристофером Хоганом и Робертом Фредеркингом (Hogan et al, 1998, 113):

5. Отлично.

4. Одна-две ошибки, а в остальном хорошо.

3. Несколько ошибок, но смысл понять можно.

2. Некоторые части переведены правильно, но понять смысл сложно.

1. Совершенно непонятно.

Авторы предлагают, учитывая концепцию генерализации оценочной шкалы некоторых исследователей (Gates et al., 1996, 195-206), сократить указанную выше шкалу до трехбалльной:

Хорошо (5 в прежней классификации).

Приемлемо (4,3 в прежней классификации).

Неприемлемо (2,1 в прежней классификации).

Тем не менее, о единстве мнений в этой области судить сложно, поскольку для вынесения исторического решения в докладе ALPAC использовалась десятибалльная шкала (ALPAC, 1966).

Однако, несмотря на многообразие предлагаемых классификаций, ни одна из них не может в полной мере считаться объективной. Уровень понимания текста реципиентом во многом зависит от индивидуальных, а значит субъективных, факторов (уровня образованности, степени знакомства с предметной областью, представленной в тексте, и т.д.).

Понятие адекватности подразумевает обязательное обращение к тексту оригинала с тем, чтобы выяснить, насколько точно перевод соответствует первоисточнику. В такого рода экспериментах обычно участвуют специалисты, хорошо владеющие как языком оригинала, так и выходным языком, на котором собственно и выполняется перевод. Критерий адекватности служит для подтверждения правильной передачи смысла оригинала, так как нередки случаи, когда реципиент прекрасно понимает содержание текста, но это содержание не соответствует в полной мере содержательной стороне исходного текста. В качестве примера приведена семибалльная оценочная шкала адекватности предложенная Нагао:

Источник: https://otherreferats.allbest.ru/download/1183667/