Чтобы адаптировать нейронный переводчик под отрасль, не нужно обучать нейросеть с нуля. Достаточно взять готовую базовую модель и дообучить ее на качественных данных конкретной предметной области.
Нейронный машинный перевод уже давно стал рабочим инструментом для бюро переводов, штатных отделов перевода, международных отделов компаний и любых подразделений, которые регулярно работают с большими объемами многоязычной документации. Но у универсальных моделей перевода есть важное ограничение: они должны быть одновременно полезны для множества тематик, поэтому не всегда хорошо учитывают специфику конкретной отрасли, компании или проекта.
При переводе технической документации, юридических текстов, медицинских и фармацевтических документов, исследований по нефтегазовой тематике или инструкций по установке оборудования это особенно заметно. Одно и то же слово может переводиться по-разному в зависимости от контекста. У компаний или целой отрасли есть своя терминология, свои аббревиатуры, есть необходимость соблюдать определенный стиль при переводе типовой отраслевой документации.
Единственный эффективный способ для компании существенно повлиять на качество перевода в этом случае — это тюнировать, т.е. дообучить, нейронную модель на собственных данных, где представлена вся терминология и есть образцы стиля типовой документации.
Но возникает закономерный вопрос: обязательно ли для этого иметь в штате специалиста по машинному обучению или программиста?
Нет. Современные инструменты позволяют выполнять тюнинг моделей через пользовательский интерфейс, без самостоятельного написания кода.
В этой статье:
Универсальная модель обучается на больших объемах разнородных данных и умеет переводить тексты самых разных типов. Однако ее знания не обязательно совпадают с терминологией конкретной компании.
Например, английское слово boring в общем контексте может означать «скучный», тогда как в техническом тексте нефтегазовой отрасли — «бурение».
Чем уже предметная область, тем важнее, чтобы модель учитывала контекст и специализированную лексику.
Универсальная модель скорее всего не обучалась на достаточном количестве текстов по нефтегазовой тематике и не справится с переводом.
Тюнинг позволяет продолжить обучение уже готовой базовой модели на более узком наборе данных. В результате модель адаптируется к определенной предметной области, стилю и терминологии.
Важно понимать разницу между обучением и тюнингом. Создание базовой нейронной модели требует огромных объемов данных — десятков миллионов сегментов. Тюнинг — это дополнительное обучение существующей модели на данных конкретной предметной области. Поэтому задача становится значительно более доступной для компаний и бюро переводов.

Главный ресурс для тюнинга — даже не вычислительная мощность, а качественные данные.
Для дообучения используются параллельные данные — оригинальные тексты и их переводы, в которых каждому предложению на одном языке соответствует предложение на другом. На практике одним из наиболее ценных источников таких данных становятся Translation Memories (TM), накопленные отделом переводов или бюро переводов за годы работы в CAT-системах (например, Trados, Smartcat, PROMT Translation Factory). CAT-системы – это программное обеспечение для профессионального перевода, которое сегодня широко распространено в работе практически любой переводческой команды.
Например, если компания много лет переводит техническую документацию с английского на русский, в ее TM уже содержится значительный объем профессионально выверенных переводов - с корректной лексикой, с принятыми в компании аббревиатурами, имена собственными и с принятым стилем. Эти данные можно использовать для дообучения нейронной модели.
Для PROMT Custom AI, приложения для тюнинга нейронных моделей перевода, рекомендуемый объем данных начинается примерно от 10 000 параллельных сегментов. При этом чем больше качественных и тематически однородных данных используется для обучения, тем больше возможностей для улучшения результата. Тематически однородные данные по определенной предметной области часто называют доменные данные (от domain – область, сфера).
Но количество — не единственный фактор.
Качество данных важнее их количества.
Обучающий корпус должен быть:
Именно поэтому миллион случайных сегментов из разных тематик не обязательно даст лучший результат, чем несколько десятков тысяч хорошо подобранных предложений из нужной предметной области.
Это один из практических вопросов, который часто возникает у специалистов отдела переводов.
В PROMT Custom AI предусмотрены алгоритмы автоматической очистки данных. Они проверяют, в частности, длину оригинального предложения и его перевода (они не должны сильно отличаться), оригинальный язык и язык перевода. Если в переводе вдруг встречается оригинальный текст, т.е. предложение случайно не переведено, то такой сегмент просто исключается из обучающего сета. Также в ходе автоматической проверки исключаются дубликаты, сегменты с техническим «мусором» и другие.
Для англо-русского и русско-английского направлений дополнительно используется оценка параллельности данных с помощью NMT-моделей.
Таким образом, специалисту, который будет проводить тюнинг, не требуется вручную просматривать весь массив TM перед каждой тренировкой. Достаточно выбрать тематически релевантные данные для обучения, после чего система выполняет необходимые процедуры предварительной прочистки, чтобы исключить из обучения сомнительные данные.
С точки зрения пользователя процесс можно представить как последовательность нескольких шагов.
1. Выбрать предметную область
Сначала необходимо определить, для каких текстов должна работать специализированная модель: например, для технических текстов по нефтегазовой тематики, юридических документов или фармацевтической документации по регистрации препаратов.
2. Найти подходящие параллельные данные
Это могут быть TM из CAT-системы или другие массивы оригинальных и переведенных текстов.
PROMT Custom AI поддерживает данные в формате TMX, а также текстовые файлы в кодировке UTF-8. TMX можно получить, например, экспортировав Translation Memories из PROMT Translation Factory или других CAT-систем.
3. Запустить обучение
Пользователь задает параметры обучения через интерфейс PROMT Custom AI. Специальные знания в области программирования для этого не требуются, достаточно ознакомиться с документацией или получить консультацию у экспертов PROMT.
4. Оценить результат
Система автоматически выделяет тестовую часть из массива данных для обучения, что позволит сравнить качество базовой и обученной модели на тестовой части. Как правило, тестовая часть - это 1% от общего количества данных.
Для объективной оценки могут использоваться автоматические метрики качества, например BLEU.
5. Использовать обученную модель в работе
Созданную специализированную модель можно подключить к решениям PROMT, таким как корпоративный сервер перевода PROMT Neural Translation Server или CAT-система PROMT Translation Factory, и использовать для реального перевода документов.

Практические эксперименты показывают, что даже относительно небольшой корпус может дать существенный прирост качества.
В одном из экспериментов при увеличении объема обучающих данных с 10 до 100 тысяч сегментов показатель BLEU вырос с 31,41 до 44,77.
При этом не существует универсальной формулы вида «100 тысяч сегментов гарантируют определенный результат». Эффект зависит от качества и однородности корпуса, его тематики и того, насколько обучающие данные соответствуют базовой модели.
Поэтому оптимальный подход — не просто собрать как можно больше переводов, а подобрать наиболее релевантный корпус.

На реальных данных эффект от тюнинга может быть значительно выше, чем ожидается от небольшой настройки универсального переводчика.
Например, при обучении англо-русской модели на корпусе объемом около 25 тысяч сегментов показатель BLEU вырос с 37,54 до 48,32. На корпусе более 400 тысяч сегментов — с 36,93 до 52,58.
Для пары русский–сербский при использовании корпуса объемом более 500 тысяч сегментов показатель BLEU вырос с 31,39 до 56,93.
Это показывает главный принцип кастомизации: модель становится лучше не просто потому, что получает больше данных, а потому, что получает данные, релевантные конкретной задаче.

Еще несколько лет назад обучение нейронных моделей ассоциировалось с мощными серверами и значительными вычислительными ресурсами.
Для PROMT Custom AI требования существенно ниже, чем принято ожидать от инфраструктуры для разработки моделей с нуля.
Согласно актуальным требованиям продукта, необходим компьютер с процессором уровня Intel Core i5/Xeon E3 или выше, минимум 4 ядрами, 32 ГБ оперативной памяти и GPU с выделенной видеопамятью от 16 ГБ. Для диска требуется около 50 ГБ свободного пространства.
При этом конкретное время обучения зависит от объема корпуса и мощности оборудования.
Иными словами, речь идет не о создании нейронной сети с нуля, а о тюнинге уже существующей модели перевода.
Для многих организаций данные, используемые для перевода, относятся к конфиденциальной информации: техническая документация, проектная документация, договоры и другие коммерческие документы, научные исследовательские данные, патентная документация.
Поэтому передача таких данных во внешний облачный сервис может быть нежелательной или невозможной.
PROMT Custom AI устанавливается в локальной инфраструктуре компании, а обучение происходит внутри корпоративного контура. Данные не передаются внешнему провайдеру.
Это позволяет одновременно решать две задачи: повышать качество машинного перевода и сохранять контроль над корпоративными данными.
Главный эффект от тюнинга — не сама по себе новая нейронная модель, а изменение рабочего процесса.
Если модель лучше знает терминологию и стиль компании, переводчику приходится меньше исправлять машинный перевод вручную. Это сокращает объем постредактирования и позволяет быстрее обрабатывать большие массивы документации.
Например, в одном из представленных кейсов нефтегазовой компании обучение англо-русской модели на TM объемом около 1 млн сегментов позволило увеличить BLEU на тестовой выборке с 36 до 53 пунктов. По экспертной оценке, отдела переводов, скорость перевода документации в отделе выросла на 20–30%.
В другом кейсе бюро переводов настроило несколько десятков моделей для разных языковых направлений. Для корпуса объемом до 5 млн сегментов максимальное время тюнинга составило 48 часов. Снижение трудозатрат бюро переводов оценивает в 50%.
Разумеется, результаты конкретного проекта будут зависеть от данных, языковой пары, тематики.
Да — если речь идет именно о настройке существующей модели, а не о разработке собственной нейронной архитектуры с нуля.
В этом и заключается принципиальное отличие современных инструментов кастомизации от классического подхода к машинному обучению.
ИТ-специалисту потребуется подготовить инфраструктуру и установить программное обеспечение. Но после этого специалист отдела переводов может самостоятельно выбирать данные, запускать обучение, сравнивать результаты и создавать новые версии специализированной модели через пользовательский интерфейс.
PROMT Custom AI не требует навыков программирования для тюнинга моделей. Количество тренировок не ограничено в течение срока действия лицензии, поэтому компания может экспериментировать с разными наборами данных и постепенно улучшать результат.
Универсальный машинный переводчик остается эффективным инструментом для широкого спектра задач. Но когда компания регулярно работает с одной или несколькими специализированными тематиками, использование собственных переводческих данных позволяет перейти на следующий уровень качества.
Схема выглядит просто:
Данные: корпоративные TM → качественные параллельные данные для обучения
Тюнинг: тюнинг базовой модели → специализированная модель
Результат: меньше постредактирования → более высокая производительность.
Таким образом, переводческие данные компании превращаются из архива выполненных проектов в инструмент дальнейшего повышения качества и производительности машинного перевода, результатами которого могут пользоваться как профессиональные переводчики компании, так и любой сотрудник компании и даже всего холдинга, что существенно повышает эффективность сотрудников при работе с данными на иностранных языках.
Если вы хотите узнать больше про тюнинг нейронных моделей перевода, обратитесь за консультацией в компанию PROMT по электронной почте corporate@promt.ru или по телефону +7(495)580-48-48
Подписаться на новости
Веб-форма не найдена.
