в) Словарь сокращений и аббревиатур. Словарь используется на этапе разбиения исходного текста на слова и предложения. Сокращения и аббревиатуры должны быть по возможности расшифрованы, так как они могут являться членами предложения, следовательно, их необходимо учитывать при синтаксическом и семантическом анализе.
г) Словарь идиом. Данный словарь применяется до синтаксического анализа, поскольку очень часто идиома является одним членом предложения и рассматривается как единое целое; при переводе идиома на исходном языке может соответствовать одному слову на переводном языке.
д) Терминологические словари по предметным областям. Дополнительные словари подключаются при необходимости перевода специализированных текстов.
е) Синтаксический словарь. В данном словаре должна содержаться информация о синтаксической сочетаемости членов предложения как в языке оригинала, так и в переводном языке, а также синтаксические соответствия, необходимые при переводе.
ж) Семантический словарь (тезаурус, онтология). Данный компонент содержит информацию о семантической сочетаемости лексем, о лексикосемантических полях, применяется на этапе построения семантического графа предложения.
з) Корпус параллельных текстов. Корпус содержит тексты на языке оригинала и их переводы на другой язык. При нахождении предложения или его фрагмента в корпусе параллельных текстов в текст перевода вставляется его соответствие на переводном языке. На использовании корпуса текстов построена технология памяти переводов.
3. Лингвистический процессор.
Лингвистический процессор предназначен для полного лингвистического анализа текста на исходном языке, а также синтеза текста на языке перевода. Лингвистический процессор включает следующие компоненты:
а) Программа разбиения текста на предложения и слова.
б) Программа распознавания устойчивых словосочетаний. Идиомы
должны анализироваться и переводиться как неделимое целое.
в) Программа расшифровки сокращений и аббревиатур.
г) Программа морфологического аннотирования исходного текста.
д) Программа синтаксического анализа и построения дерева зависимостей.
е) Программа семантического анализа и построения семантического
графа каждого предложения исходного текста.
ж) Программа выбора переводного соответствия из двуязычного словаря
или корпуса параллельных текстов.
з) Программа семантического синтеза текста на переводном языке.
и) Программа построения синтаксической структуры предложения и
определения порядка слов в синтезируемом предложении.
к) Программа морфологического синтеза словоформ в переведенном тексте.
4. Последовательность формальных операций, обеспечивающих анализ и синтез в системе машинного перевода
1. На первом этапе осуществляется ввод текста и поиск входных словоформ (слов в конкретной грамматической форме, например дательного падежа множественного числа) в словаре языка, с которого производится перевод с сопутствующим морфологическим анализом, в ходе которого устанавливается принадлежность данной словоформы к определенной лексеме (слову как единице словаря).
2. Следующий этап включает в себя перевод идиоматических словосочетаний, фразеологических единств или штампов данной предметной области (например, при англо-русском переводе обороты типа in case of, in accordance with получают единый цифровой эквивалент и исключаются из дальнейшего грамматического анализа); определение основных грамматических) характеристик элементов входного текста ексический анализ и перевод лексем. Обычно на этом этапе однозначные слова отделяются от многозначных (имеющих более одного переводного эквивалента в выходном языке), после чего однозначные слова переводятся по спискам эквивалентов, а для перевода многозначных слов используются так называемые контекстологические словари, словарные статьи которых представляют собой алгоритмы запроса к контексту на наличие/отсутствие контекстных определителей значения.
3. Окончательный грамматический анализ, в ходе которого окончательно определяется необходимая грамматическая информация с учетом данных выходного языка (например, при русских существительных типа сани, ножницы глагол должен стоять в форме множественного числа, несмотря на то, что в оригинале может быть и единственное число).
4. Синтез выходных словоформ и предложения в целом на выходном языке.
В зависимости от особенностей морфологии, синтаксиса и семантики конкретной языковой пары, а также направления перевода общий алгоритм перевода может включать и другие этапы, а также модификации названных этапов или порядка их следования, но вариации такого рода в современных системах незначительны. Анализ и синтез могут производиться как пофразно, так и для всего текста, введенного в память компьютера; в последнем случае алгоритм перевода предусматривает определение так называемых анафорических связей (такова, например, связь местоимения с замещаемым им существительным - скажем, местоимения им со словом местоимения в самом этом пояснении в скобках).
5. Концепции развития систем МП
Первая: Модель «большого словаря со сложной структурой», которая заложена в большинство современных программ-переводчиков;
Вторая: Модель «смысл-текст», впервые сформулированная А.А. Ляпуновым, но пока что не реализована ни в одном коммерческом продукте.
На сегодняшний день наиболее известны следующие системы машинного перевода:
ь PROMT 2000/XT компании PROMT
ь - Retrans Vista компаний Vista и Advantis;
ь - Сократ - набор программ компании Арсеналъ.
В большинстве случаев при работе над проектом применение систем МП не оправдано, поскольку:
- Системы МП не дают приемлемого качества выходного текста. Более высокого качества можно добиться с помощью предварительной настройки, что неудабно при небольших объемах переводимого текста.
- Системы МП не гарантируют соблюдения единства терминологии, особенно при работе коллектива переводчиков над большим проектом
Однако в некоторых случаях использование систем МП все же помогает сократить временные затраты. Это происходит, если текст достаточно объемный и содержит однообразную терминологию, что позволяет сравнительно быстро настроить под него систему МП. Тогда редактирование текста не займет слишком много времени. Однако в этом случае следует особенно внимательно отнестись к стилю текста перевода.
Вообще говоря, системы МП вполне могут применяться там, где используется максимально стандартизованный язык с простой грамматикой и сравнительно небольшим запасом слов. Довольно успешным проектом системы МП считается немецкая программа Meteo, выполняющая перевод метеопрогнозов с французского языка на английский и обратно. Для облегчения работы переводчиков и технических писателей компанией Boeing в свое время был разработан стандарт языка для написания технической документации, который известен как Boeing English.
6. Система фразеологического машинного перевода
Системы машинного перевода текстов с одних естественных языков на другие моделируют работу человека-переводчика. Их эффективность зависит от того, в какой степени в них учитываются объективные законы функционирования языка и мышления. Решая проблему машинного перевода, необходимо учитывать богатый опыт межнационального общения и опыт переводческой деятельности, накопленный человечеством. А этот опыт свидетельствует о том, что в процессе перевода в качестве основных единиц смысла рассматриваются, прежде всего, фразеологические словосочетания, выражающие целостные понятия, а не отдельные слова. Именно понятия являются теми элементарными мыслительными образами, используя которые можно строить более сложные языковые модели, соответствующие переводимому тексту.
Системы машинного перевода, в которых в качестве основных минимальных единиц смысла рассматриваются не отдельные слова, а фразеологические словосочетания, называют системами фразеологического машинного перевода. В этих системах отдельные слова также могут использоваться, но они рассматриваются как вспомогательные единицы смысла.
Система фразеологического машинного перевода включает в себя базу знаний, содержащую переводные эквиваленты для наиболее часто встречающихся фраз, фразеологических сочетаний и отдельных слов, и программные средства для морфологического и синтаксического анализа и синтеза текстов и для их редактирования человеком. В процессе перевода текстов система использует хранящиеся в ее базе знаний переводные эквиваленты в следующем порядке: сначала делается попытка перевести всю фразу как целостную единицу; далее, в случае неудачи, входящие в ее состав словосочетания; и, наконец, осуществляется пословный перевод тех фрагментов текста, которые не удалось перевести первыми двумя способами. Фрагменты выходного текста, полученные всеми тремя способами, должны грамматически согласовываться друг с другом.
7. Принципы построения систем фразеологического машинного перевода состоят в следующем
1. Основными единицами языка и речи, которые, прежде всего, включают в машинный словарь, это фразеологические единицы (словосочетания, фразы). Отдельные слова также могут быть включены в словарь, но они должны использоваться только случаях, когда не удается осуществить перевод, опираясь только на фразеологические единицы.
2. Наряду с фразеологическими единицами, состоящими из непрерывных последовательностей слов, в системах машинного перевода следует использовать и так называемые "речевые модели" - фразеологические единицы с "пустыми местами", которые могут заполняться различными словами и словосочетаниями, порождая осмысленные отрезки речи.
3. Машинный словарь, предназначенный для перевода текстов даже только из одной тематической области, должен быть политематическим. Он должен создаваться, прежде всего, на основе автоматизированной обработки двуязычных текстов, являющихся переводами друг друга, и в процессе функционирования систем перевода.
4. Наряду с основным политематическим словарем большого объема, в системах фразеологического машинного перевода целесообразно использовать также набор небольших по объему дополнительных тематических словарей. Дополнительные словари должны содержать только ту информацию, которая отсутствует в основном словаре.
5. Основным средством разрешения полисемии (многозначности) слов в системах фразеологического перевода является их использование в составе фразеологических словосочетаний. Дополнительным - аппарат дополнительных тематических словарей, где для каждого многозначного слова или словосочетания указывается его приоритетный переводной эквивалент, специфичный для рассматриваемой предметной области.
6. Большую роль в системах фразеологического машинного перевода текстов могут играть разработанные авторами процедуры морфологического и синтаксического анализа и синтеза русских и английских текстов, построенные на основе принципа аналогии. Эти процедуры позволяют отказаться от хранения в словарях большого объема грамматической информации и порождать ее по мере необходимости автоматически, в процессе перевода. Они делают систему перевода открытой - способной обрабатывать тексты с "новой" лексикой.
7. Наряду с переводом текстов в автоматическом режиме, в системах фразеологического машинного перевода целесообразно предусмотреть и интерактивный режим их работы. В этом режиме пользователь должен иметь возможность вмешиваться в процесс перевода и настраивать дополнительные машинные словари на тематику переводимых текстов.
На основе описанных принципов были построены две системы фразеологического машинного перевода:
1) система русско-английского перевода (RETRANS)
2) система англо-русского перевода (ERTRANS).
8. Основные способы перевода образной фразеологии
1)Эквивалентным фразеологизмом языка перевода (с сохранением образа)
При использовании таких соответствий сохраняется весь комплекс значений переводимой единицы. В этом случае в переводимом языке имеется образный фразеологизм, совпадающий по всем параметрам с фразеологической единицей оригинала, например:
to play with fire - «играть с огнем»; to read between lines - «читать между строк».
2) Замена образа при сохранении семантической близости.
В случае отсутствия фразеологического эквивалента, следует подобрать в ПЯ фразеологизм с таким же переносным значением, основанном на ином образе. Например:
move heaven and earth to get smth.- «свернуть горы на пути к чему-либо» ; a pig in a poke - «кот в мешке»
Использование соответствия этого типа обеспечивает достаточно высокую степень эквивалентности. Однако и здесь существуют некоторые ограничения.
Во-первых, необходимо сохранить эмоциональные и стилистические значения фразеологизма.
Во-вторых, следует учитывать два фактора: стилистическую неравноценность некоторых аналоговых фразеологизмов и национальную окраску фразеологических единиц