Mozilla arendab oma masintõlke süsteemi

Mozilla ettevõte on projekti raames Bergamot alustanud brauseripoolse masintõlke süsteemi loomisega. Projekt võimaldab Firefoxis integreerida iseseisva lehe tõlkimise mootori, mis ei kasuta väliseid pilveteenuseid ja töötleb andmeid ainult kasutaja süsteemis. Arenduse peamine eesmärk on tagada konfidentsiaalsus ja kaitsta kasutaja andmeid võimalike lekkide eest avatud lehtede sisu tõlkimisel.

Bergamot arendust viib läbi Mozilla Berliini kontoris koos teadlastega mõnest Suurbritannia, Eesti ja Tšehhi ülikoolist. Arendust rahastab Euroopa Liit Horizon 2020 programmi raames saadud toetuse abil, Horizon 2020. Toetuse suurus on kolm miljonit eurot. Projekt kestab kolm aastat. Mozilla avatud otsib masinõppespetsialisti, et osaleda tõlkemootori arendamisel ühelt keelelt teisele.

Bergamotiga seotud kõrvalarendustest mainitakse:

  • Edinburgi ülikoolis arendatavat masintõlke raamistikku Marian, mis loodud rekurseeruva närvivõrgu baasil. Raamistiku on kirjutatud C++ keeles, see suudab kasutada GPU-d õppimise ja tõlke kiirendamiseks, ja on saadaval on MIT litsentsi all.
  • Tšehhi Ülikoolis loodud tööriist Neural Monkey , mis töötleb loomuliku keele teavet, kasutades järjestikuse masinõppe meetodeid. Projekt rakendab TensorFlow raamistiku ja seda saab kasutada loomuliku keele masintõlke ja teabe klassifitseerimise süsteemide kiireks prototüüpimiseks. Kood on BSD litsentsi all saadaval.
  • Sheffieldi Ülikoolis ettevalmistatud projekt QuEst++, mida kasutatakse masintõlkesüsteemide kvaliteedi hindamiseks ja prognoosimiseks.
  • Mozilla arendatud häälte sünteesija (TTS) ja kõnetuvastuse mootor (Deep Speech)
  • Euroopa Liidu rahastatud projekt ParaCrawl, mis kogub erinevate keelte vaheliste fraaside sünkroonsete tõlgete andmebaasi, mida saab kasutada masinõppesüsteemide koolitamiseks. Projekti aluseks on bot bitextor, mis indeksib mitmekeelseid veebisaite ja leiab automaatselt samu tekste, mis on esitatud mitmes keeles. Paralleelsete tõlgete näidiste andmebaas moodustatakse 24 keele jaoks, sealhulgas vene keele jaoks (Andmebaas vene keele jaoks on see kompaktse kujul 637MB ja sisaldab rohkem kui 12 miljonit tõlke näidet).

Bergamoti arendus algas käesoleva aasta jaanuaris, kuid projekti arendustööd on praegu puuduvad avalikuks testimiseks. Siiski, paar päeva tagasi jagasid arendajad avalikustasid videot, kus on demonstreeritud algset prototüüpi.

Vaata videot

Tuletame meelde, et Firefoxis on juba on olemas lehitav sisseehitatud lehekülgede tõlke mehhanism, mis on sidustatud väliste pilveserivustega (toetatakse Google'i, Yandexi ja Bingi) ning pole vaikimisi aktiveeritud (et seda lubada, tuleb muuta seadeid 'browser.translation' aadressil about:config). Tõlkemehhanism toetab ka automaatset keele määramist, kui avatakse leht tundmatul keelel, ja kuvab erilist indikaatorit, mis pakub lehe tõlkimist. Bergamot projekti raames arendatav tõlkesüsteemi prototüüp kasutab sama liidest kasutajaga suhtlemiseks, kuid väliste teenuste asemel käivitab sisseehitatud töötleja.

Allikas: opennet.ru

Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster