Mozilla развива собствена система за машинен превод

Компания Mozilla в рамките на проекта Bergamot започна разработването на система за машинен превод, работеща в браузера. Проектът ще позволи интеграцията на самостоятелен преводен двигател в Firefox, който не се свързва с външни облачни услуги и обработва данните изключително на системата на потребителя. Главната цел на разработването е да осигури конфиденциалност и защита на данните на потребителя от възможни изтичания при превод на съдържанието на отворените в браузера страници.

Разработването на Bergamot се извършва в берлинския офис на Mozilla с участието на изследователи от няколко университети в Обединеното кралство, Естония и Чехия. Разработването се финансира от Европейския съюз по програма Horizon 2020. Размерът на гранта е три милиона евро. Проектът е предвиден за три години. В Mozilla е отворена има свободна позиция за специалист по системи за машинно обучение, който да участва в разработването на двигател за превод от един език на друг.

Сред свързаните разработки, имащи отношение към проекта Bergamot, се споменават:

  • Развиващата се в Университета в Единбург рамка за машинен превод Marian, изградена на базата на рекурентна невронна мрежа. Рамката е написана на C++, може да използва GPU за ускоряване на обучението и превода, и се предоставя под лиценз MIT.
  • Създаденият в Университета в Прага инструментариум Neural Monkey за обработка на информация на естествен език, използващ методи за последователно машинно обучение. Проектът прилага рамката TensorFlow и може да се използва за бързо създаване на прототипи на системи за машинен превод и класификация на информация на естествен език. Кодът е наличен под лиценз BSD.
  • Подготвеният в Университета в Шефилд проект QuEst++, приложим за оценка и прогнозиране на качеството на системите за машинен превод.
  • Разработваните в Mozilla синтезатор за реч (TTS) и двигател за разпознаване на реч (Deep Speech)
  • Финансираният от Европейския съюз проект ParaCrawl, събиращ база данни от синхронни преводи на различни фрази на различни езици, която може да бъде използвана за обучение на системи за машинно обучение. Основата на проекта е ботът bitextor, който индексира многоезични уеб-сайтове и автоматично намира еднакви текстове, представени на няколко езика. Базата от примери за паралелни преводи се формира за 24 езика, включително и за руски.БД за руски език заема 637MB в компресиран вид и включва над 12 млн. примера за превод.

Разработката на Bergamot започна през януари тази година, но напредъкът на проекта все още не е наличен за публично тестване. Все пак, преди няколко дни разработчиците публикуваха публикуваха видео с демонстрация на начален прототип.

Пуснете видеото

Припомняме, че в Firefox вече има има вграден механизъм за превод на страници, но той е свързан с използването на външни облачни услуги (поддържат се Google, Yandex и Bing) и не е активиран по подразбиране (за да се включи, е необходимо да се промени настройката „browser.translation“ в about:config). Механизмът за превод поддържа автоматично разпознаване на езика при отваряне на страница на непознат език и показва специален индикатор с предложение за извършване на превод. Развиванният в рамките на проекта Bergamot прототип на системата за превод използва същия интерфейс за взаимодействие с потребителя, но вместо да се свързва с външни услуги, стартира вграден обработчик.

Източник: opennet.ru

Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри 🔥 Купете надежден хостинг за сайтове с защита от DDoS, VPS VDS сървъри | ProHoster