Реферат: Фразеологический машинный перевод. Структура машинного словаря

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

Размещено на http: //www. allbest. ru/

Факультет Прикладной математики и информатики

Кафедра Информационных технологий и прикладной математики

Реферат по дисциплине:

«Экономическая информатика»

на тему: «Фразеологический машинный перевод. Структура машинного словаря»

Москва 2019

Содержание

Введение

1. История появления машинного перевода

2. Классификация систем машинного перевода

3. Системы машинного перевода и их структура

4. Последовательность формальных операций, обеспечивающих анализ и синтез в системе машинного перевода

5. Концепции развития систем МП

6. Система фразеологического машинного перевода

7. Принципы построения систем фразеологического машинного перевода

8. Основные способы перевода образной фразеологии

9. Проблемы перевода фразеологизмов

Заключение

Список использованной литературы

Приложения

Введение

Осуществление перевода компьютером - сложная, но интересная научная задача. Основная ее сложность состоит в том, что естественные языки плохо поддаются формализации. Отсюда и невысокое получаемого с помощью систем МП текста качество.

Термин машинный перевод (МП) понимается по крайней мере в двух смыслах. Машинный перевод в узком смысле - это процесс перевода некоторого текста с одного естественного языка на другой, реализуемый компьютером полностью или почти полностью. В ходе данного процесса на вход машины подается текст, словесная честь которого не сопровождается никакими дополнительными указаниями, а на выходе получается текст на другом языке, являющийся переводом входного, причем преобразование входного текста в выходной происходит без вмешательства человека (иногда допускается постредактирование).

Машинный перевод в широком смысле - это область научных исследований, находящаяся на стыке лингвистики, математики, кибернетики, и имеющая целью построение систем, реализующих машинный перевод в узком смысле. машинный перевод образный фразеология

1. История появления систем машинного перевода

Идея машинного перевода уходит корнями далеко в прошлое. Впервые мысль о возможности машинного перевода высказал Чарльз Бэббидж, разработавший в 1836-1848 гг. проект цифровой аналитической машины. Его идея состояла в том, что память объемом 1000 50-разрядных десятичных чисел можно использовать для хранения словарей. Однако аналитическую машину, ему так и не удалось построить.

А через 100 лет, в 1947 году, У. Уивер предложил использовать технику дешифрования для перевода текстов. Этот год считается годом рождения машинного перевода. В этом же году был разработан алгоритм осуществления пословного перевода. В последующие два десятилетия системы машинного перевода бурно развивались. Но в 1967 году специально созданная Комиссия Национальной Академии Наук США признала машинный перевод нерентабельным, что существенно затормозило исследования в этой области. Новый подъем машинный перевод переживает в 70-е годы, а в 80-е становится экономически выгодным за счет сравнительной дешевизны машинного времени.

2. Классификация систем машинного перевода

Классификация систем машинного перевода по Лари Чайлду:

- полностью автоматический перевод;

- автоматизированный машинный перевод при участии человека;

- перевод, осуществляемый человеком с использованием компьютера.

Полностью автоматизированный машинный перевод

Этот вид машинного перевода и подразумевается большинством людей, когда они говорят о машинном переводе. Смысл здесь прост: в компьютер вводится текст на одном языке, этот текст обрабатывается и компьютер выводит этот же текст на другом языке. К сожалению, реализация такого вида автоматического перевода сталкивается с определенными препятствиями, которые еще предстоит преодолеть.

Основной проблемой является сложность языка как такового. Возьмем, к примеру, значения слова "can". Помимо основного значения модального вспомогательного глагола, у слова "can" имеется несколько официальных и жаргонных значений в качестве существительного: "банка", "отхожее место", "тюрьма". Кроме этого, существует архаичное значение этого слова - "знать или понимать". Если предположить, что у выходного языка для каждого из этих значений имеется отдельное слово, каким образом может компьютер их различить?

Как оказалось, определенные успехи были достигнуты в сфере разработки программ перевода, различающих смысл основываясь на контексте. Более поздние исследования при анализе текстов опираются больше на теории вероятности. Тем не менее, полностью автоматизированный машинный перевод текстов с обширной тематикой все еще является невыполнимой задачей.

Автоматизированный машинный перевод при участии человека

Этот вид машинного перевода теперь вполне осуществим. Говоря о машинном переводе при участии человека, обычно подразумевают редактирование текстов как до, так и после их обработки компьютером. Люди-переводчики изменяют тексты так, чтобы они были понятны машинам. После того, как компьютер сделал перевод, люди опять редактируют грубый машинный перевод, делая текст на выходном языке правильным. Помимо такого порядка работы, существуют системы МП, во время перевода требующие постоянного присутствия человека-переводчика, помогающего компьютеру делать перевод особенно сложных или неоднозначных конструкций.

Перевод, осуществляемый человеком с использованием компьютера

При этом подходе человек-переводчик оказывается в центре процесса перевода, в то время как программа компьютера становится инструментом, делающим процесс перевода более эффективным, а перевод - точным. Это обычные электронные словари, которые обеспечивают перевод требуемого слова, возлагая на человека ответственность за выбор нужного варианта и смысл переведенного текста. Такие словари значительно облегчают процесс перевода, но требуют от пользователя определенного знания языка и затрат времени на его осуществление. И все же сам процесс перевода значительно ускоряется и облегчается.

Среди систем, помогающих переводчику в работе, важнейшее место занимают так называемые системы Translation Memory (TM). Системы ТМ представляют собой интерактивный инструмент для накопления в базе данных пар эквивалентных сегментов текста на языке оригинала и перевода с возможностью их последующего поиска и редактирования. Эти программные продукты не имеют целью применение высокоинтеллектуальных информационных технологий, а наоборот, основаны на использовании творческого потенциала переводчика. Переводчик в процессе работы сам формирует базу данных, и чем больше единиц она содержит, тем больше отдача от ее использования.

Наиболее известные системы Translation Memory (TM):

- Transit швейцарской фирмы Star,

- Trados (США),

- Translation Manager от IBM,

- Eurolang Optimizer французской фирмы LANT,

- DejaVu от ATRIL (США),

- WordFisher (Венгрия).

Системы ТМ позволяют исключить повторный перевод идентичных фрагментов текста. Перевод сегмента осуществляется переводчиком один раз, а затем каждый следующий сегмент проверяется на совпадение с базой данных, и, если найден идентичный или похожий сегмент, то он предлагается в качестве варианта перевода.

Несмотря на широкий ассортимент систем TM, они имеют несколько общих функций:

- Функция сопоставления (Alignment). Одно из преимуществ систем ТМ - это возможность использования уже переведенных материалов по данной тематике. База данных ТМ может быть получена путем посегментного сопоставления файлов оригинала и перевода.

- Наличие фильтров импорта - экспорта. Это свойство обеспечивает совместимость систем ТМ с множеством текстовых процессоров и издательских систем и дает переводчику относительную независимость от заказчика.

- Механизм поиска нечетких или полных совпадений. Именно этот механизм и представляет собой основное достоинство систем ТМ. Если при переводе текста система встречает сегмент, идентичный или близкий к переведенному ранее, то уже переведенный сегмент предлагается переводчику как вариант перевода текущего сегмента, который может быть подкорректирован.

- Поддержка тематических словарей. Эта функция помогает переводчику придерживаться глоссария. Если в переводимом сегменте встречается слово или словосочетание из тематического словаря, то оно выделяется цветом и предлагается его перевод, который можно вставить в переводимый текст автоматически.

- Средства поиска фрагментов текста. Этот инструмент очень удобен при редактировании перевода. Если в процессе работы был найден более удачный вариант перевода какого-либо фрагмента текста, то этот фрагмент может быть найден во всех сегментах ТМ, после чего в сегменты ТМ последовательно вносятся необходимые изменения.

Конечно, как и любой программный продукт, системы ТМ имеют свои достоинства и недостатки, и свою область применения. Однако в отношении систем TM, основным недостатком является их дороговизна.

Особенно удобно использовать системы ТМ при переводе таких документов, как руководства пользователя, инструкции по эксплуатации, конструкторская и деловая документация, каталоги продукции и другой однотипной документации с большим количеством совпадений.

3. Системы машинного перевода и их структура

Системы МП осуществляют автоматизированный перевод текста. Единицами перевода при этом служат слова или словосочетания, причем последние разработки позволяют учитывать морфологию переводимого слова. Развитые системы МП осуществляют перевод по заданным разработчиком и/или корректируемым пользователем алгоритмам перевода.

Для осуществления машинного перевода в компьютер вводится специальная программа, реализующая алгоритм перевода, под которым понимается последовательность однозначно и строго определенных действий над текстом для нахождения переводных соответствий в данной паре языков L1 - L2 при заданном направлении перевода (с одного конкретного языка на другой). Система машинного перевода включает в себя двуязычные словари, снабженные необходимой грамматической информацией для обеспечения передачи переводных соответствий, а также средства грамматического анализа, реализующие какую-либо из принятых для автоматической переработки текста формальных грамматик. Имеются также отдельные системы машинного перевода, рассчитанные на перевод трех и более языков, но они в настоящее время являются экспериментальными.

Структура систем машинного перевода :

1. Вспомогательные программные средства.

2. Состав лингвистической базы данных.

3. Лингвистический процессор.

1. Вспомогательные программные средства.

На этапе обработки исходного текста в системе машинного перевода должны присутствовать определенные вспомогательные программные средства. Чтобы преобразовывать тексты из одного кодового представления в другое, необходимы конверторы. Типичный конвертор поддерживает подмножество кодовых таблиц, используемых для символов конкретного языка. При обработке документов возникает задача преобразования исходного документа в обычный текст (plain text), для дальнейшей его семантической и синтаксической обработки. При этом на этапе преобразования необходимо сохранить полезную информацию о структуре документа и его стилевом оформлении, о взаимосвязи между абзацами, о заголовках и т.д. В задачу преформатора входит распознавание различных форматов документов поступающих на вход и выделение текстовой информации из этих документов с сохранением ее структуры.

Отдельным блоком можно выделить программы взаимодействия с базами данных, которые необходимы для полноценного лингвистического анализа исходного текста и синтеза текста на переводном языке.

Для удобной работы с системой машинного перевода необходимо обеспечить дружественный интерфейс, оперирующий доступным для любого пользователя языком управления заданиями. Именно с помощью этого интерфейса пользователь должен иметь возможность без программирования ввести, отредактировать и проверить текст, сделать его перевод, вывести его на печать, провести статистическую обработку материала, получить нужную справку и т. п.

2. Состав лингвистической базы данных.

Лингвистическая база данных для системы машинного перевода включает в себя накопленные лингвистические данные, объективированные текстами, картотеками, словарями, грамматиками и другими лингвистическими источниками. Типичный состав лингвистической базы данных можно ограничить следующими компонентами:

а) Лексико-грамматический классификатор свойств исходного языка и переводного языка (система морфологического кодирования). При анализе исходного текста каждое слово в нем должно получить соответствующие морфологические характеристики: признак части речи, род, падеж, наклонение, число и др. Система кодирования должна быть единой для конкретной системы машинного перевода.

б) Базовый двуязычный морфологический словарь. В этом словаре устанавливается пословное соответствие каждой словоформы исходного языка словоформам языка перевода.

Источник: https://otherreferats.allbest.ru/download/1199704/