Firma Mozilla esitles kÔnetuvastuse mootorit DeepSpeech 0.6.

Esitletud Mozilla arendatav kÔnetuvastuse mootor DeepSpeech 0.6, mis realiseerib nimetatud kÔnetuvastuse arhitektuuri, mille on soovitanud Baidust pÀrinevad teadlased. Teostus on kirjutatud Pythonis, kasutades masinÔppe platvormi TensorFlow ja levitatakse on vabakasutusele antud MPL 2.0 litsentsi alusel. Töö toetamine on vÔimalik Linuxis, Androidis, macOS-is ja Windowsis. JÔudlus on piisav, et kasutada mootorit LePotato, Raspberry Pi 3 ja Raspberry Pi 4 plaadidel.

Komplekt sisaldab ka pakuvad treenitud mudeleid, nĂ€idiste helifailide ja kĂ€surealt kĂ”netuvastamiseks vajalikke tööriistu. KĂ”netuvastuse funktsiooni integreerimiseks oma programmidesse on pakutud valmis mooduleid Pythonile, NodeJS-ile, C++-le ja .NET-ile (kolmandate osapoolte arendajad on eraldi valmistanud moodulid) Rustis ja Go). Valmis mudel on saadaval ainult inglise keeles, kuid teiste keelte jaoks on kaasasoleva juhendis kaudu vĂ”imalik sĂŒsteemi iseseisvalt treenida, kasutades hÀÀlandmeid, mis on kogutud projekti Common Voice kaudu.

DeepSpeech on oluliselt lihtsam kui traditsioonilised sĂŒsteemid ja samas pakub paremat tuvastamise kvaliteeti, isegi kui on kĂ”rvalisi helisid. Arenduses ei kasutata traditsioonilisi akustilisi mudeleid ning fonemide kontseptsiooni, selle asemel rakendatakse hĂ€sti optimeeritud masinĂ”ppe sĂŒsteemi, mis pĂ”hineb nĂ€rvivĂ”rgul ning vĂ”imaldab vĂ€ltida eri komponentide arendamist erinevate kĂ”rvalekallete, nagu mĂŒra, kaja ja kĂ”nehÀÀlte omaduste modelleerimiseks.

Selle lĂ€henemise tagajĂ€rg on see, et kvaliteetse tuvastamise ja nĂ€rvivĂ”rgu treenimise saavutamiseks vajab DeepSpeech suurtes kogustes mitmekesiseid andmeid, mis on dikteeritud reaalsetes tingimustes erinevate hÀÀlte poolt ja loomulike mĂŒra olemasolul.
Sarnaste andmete kogumisega tegeleb Mozillas loodud projekt Common Voice, mis pakub kontrollitud andmestikku, milles on 780 tundi inglise keeles, 325 tundi saksa keeles, 173 tundi prantsuse keeles ja 27 tundi vene keeles.

Projekti Common Voice lĂ”ppeesmĂ€rk on koguda 10 000 tundi erineva hÀÀldusega inimkĂ”ne tĂŒĂŒpiliste fraaside salvestusi, et saavutada vastuvĂ”etav vigade tase Ă€ratundmisel. Praegusel hetkel on projekti osalistelt juba dikteeritud kokku 4,3 tuhat tundi, millest 3,5 tuhat on lĂ€binud kontrolli. DeepSpeechi ingliskeelse lĂ”ppmudeli koolitamiseks on kasutatud 3816 tunni rÀÀgitud kĂ”net, lisaks Common Voice'ile, millel on andmed projektidest LibriSpeech, Fisher ja Switchboard, ning mis sisaldab umbes 1700 tunni transkribeeritud raadiosaate salvestusi.

Pakutud laadimiseks valmis ingliskeelse mudeli kasutamisel on DeepSpeechi Àratundmisvigade tase 7,5%, kui hindamine toimub testkomplekti abil. LibriSpeech. VÔrdluseks, inimeste Àratundmise vigade tase hinnatakse on 5,83%.

DeepSpeech koosneb kahest alamsĂŒsteemist — akustilisest mudelist ja dekooderist. Akustiline mudel kasutab sĂŒvaĂ”ppe meetodeid, et arvutada tĂ”enĂ€osust, et teatud sĂŒmbolid esinevad sisendiks saadud helis. Dekooder rakendab kiirendusalgoritmi, et muuta sĂŒmbolite tĂ”enĂ€osuse andmed tekstiliseks esituseks.

Peamised uuendused DeepSpeech 0.6 (0.6 haru ei ole ĂŒhilduv varasemate vĂ€ljaannetega ja vajab koodi ja mudelite uuendamist):

  • Pakutud on uus voogedastusdekooder, mis pakub kĂ”rgemat reageerimiskiirusel ja ei sĂ”ltu töödeldavate helifailide suurusest. LĂ”ppkokkuvĂ”ttes on uues DeepSpeechi versioonis Ă”nnestunud vĂ€hendada Ă€ratundmise latentsust 260 ms-ni, mis on 73% kiiremini kui varem, ning vĂ”imaldab rakendada DeepSpeechi kĂ”netuvastuse lahendustes reaalajas.
  • API-s on tehtud muudatusi ja on tehtud tööd funktsioonide nimede ĂŒhtlustamiseks. Lisatud on funktsioonid tĂ€iendavate metaandmete saamiseks sĂŒnkroniseerimise kohta, mis vĂ”imaldavad mitte ainult saada vĂ€ljundiks tekstilist esitust, vaid ka jĂ€lgida eraldi sĂŒmbolite ja lausete seondumist helivoo positsiooniga.
  • Koolituspaketti on lisatud moodulite toetamist CuDNN rekurssed on ĂŒheks neutraalsete nĂ€rvivĂ”rkude töö optimeerimiseks (RNN), mis vĂ”imaldas saavutada mĂ€rkimisvÀÀrset (umbes kaks korda) suurenemist mudeli koolitusvĂ”imekuses, kuid see nĂ”udis koodis muudatuste tegemist, mis rikkusid ĂŒhilduvust varasemate mudelitega.
  • Minimaalsed nĂ”uded TensorFlow versioonile tĂ”steti 1.13.1-lt 1.14.0-le. Lisatud on toetus kergemale TensorFlow Lite versioonile, mille kasutamisega vĂ€henes DeepSpeech paketihulk 98 MB-lt 3.7 MB-le. Ka integreeritud ja mobiilseadmete puhul voimaline failide suurus vĂ€henes 188 MB-lt 47 MB-le (kvantimise meetodit kasutati pĂ€rast mudeli koolitamist).
  • Keelemudel on ĂŒmber tĂ”lgitud teise andmestruktuuride formaati, mis vĂ”imaldab failide laadimisel neid mĂ€llu kaardistada. Vanale formaadile toetus lĂ”petatakse.
  • Keelemudeli faili laadimise reĆŸiim on muudetud, mis aitas vĂ€hendada mĂ€lu tarbimist ja vĂ€hendada viivitusi mudeli loomise jĂ€rel esimeses pĂ€ringus. DeepSpeech tarbib nĂŒĂŒd töötamise kĂ€igus 22 korda vĂ€hem mĂ€lu ja kĂ€ivitub 500 korda kiiremini.

    Firma Mozilla esitles kÔnetuvastuse mootorit DeepSpeech 0.6.
  • Keelemudelit rakendati haruldaste sĂ”nade filtreerimine. SĂ”nade koguarv on vĂ€hendatud 500 000 kĂ”ige populaarsema sĂ”nani, mis esinesid koolitusel kasutatud tekstides. Tehtud puhastamine aitas vĂ€hendada keelemudeli suurust 1800 MB-lt 900 MB-le, mĂ”jutamata praktiliselt Ă€ra arvamise taseme nĂ€itajaid.
  • Erinevate toetamine on lisatud tehnikaid lisavariatsioonide (augmentation) loomise jaoks helidetektiidena, mida kasutatakse koolituse ajal (nĂ€iteks variante on lisatud, mis on moonutatud vĂ”i sisaldavad mĂŒra).
  • Lisatud on raamatukogu, millel on sidemed integreerimiseks .NET platvormil pĂ”hinevate rakendustega.
  • Dokumentatsioon on ĂŒmber töötatud ja nĂŒĂŒd on see kogutud eraldi saidile deepspeech.readthedocs.io.

Allikas: opennet.ru

Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster