Mozilla arendatav kÔnetuvastuse mootor , mis realiseerib nimetatud kÔnetuvastuse arhitektuuri, Baidust pÀrinevad teadlased. Teostus on kirjutatud Pythonis, kasutades masinÔppe platvormi TensorFlow ja on vabakasutusele antud MPL 2.0 litsentsi alusel. Töö toetamine on vÔimalik Linuxis, Androidis, macOS-is ja Windowsis. JÔudlus on piisav, et kasutada mootorit LePotato, Raspberry Pi 3 ja Raspberry Pi 4 plaadidel.
Komplekt sisaldab ka treenitud mudeleid, helifailide ja kĂ€surealt kĂ”netuvastamiseks vajalikke tööriistu. KĂ”netuvastuse funktsiooni integreerimiseks oma programmidesse on pakutud valmis mooduleid Pythonile, NodeJS-ile, C++-le ja .NET-ile (kolmandate osapoolte arendajad on eraldi valmistanud moodulid) ja ). Valmis mudel on saadaval ainult inglise keeles, kuid teiste keelte jaoks on kaudu vĂ”imalik sĂŒsteemi iseseisvalt treenida, kasutades , mis on kogutud projekti Common Voice kaudu.
DeepSpeech on oluliselt lihtsam kui traditsioonilised sĂŒsteemid ja samas pakub paremat tuvastamise kvaliteeti, isegi kui on kĂ”rvalisi helisid. Arenduses ei kasutata traditsioonilisi akustilisi mudeleid ning fonemide kontseptsiooni, selle asemel rakendatakse hĂ€sti optimeeritud masinĂ”ppe sĂŒsteemi, mis pĂ”hineb nĂ€rvivĂ”rgul ning vĂ”imaldab vĂ€ltida eri komponentide arendamist erinevate kĂ”rvalekallete, nagu mĂŒra, kaja ja kĂ”nehÀÀlte omaduste modelleerimiseks.
Selle lĂ€henemise tagajĂ€rg on see, et kvaliteetse tuvastamise ja nĂ€rvivĂ”rgu treenimise saavutamiseks vajab DeepSpeech suurtes kogustes mitmekesiseid andmeid, mis on dikteeritud reaalsetes tingimustes erinevate hÀÀlte poolt ja loomulike mĂŒra olemasolul.
Sarnaste andmete kogumisega tegeleb Mozillas loodud projekt , mis pakub kontrollitud andmestikku, milles on 780 tundi , 325 tundi saksa keeles, 173 tundi prantsuse keeles ja 27 tundi vene keeles.
Projekti Common Voice lĂ”ppeesmĂ€rk on koguda 10 000 tundi erineva hÀÀldusega inimkĂ”ne tĂŒĂŒpiliste fraaside salvestusi, et saavutada vastuvĂ”etav vigade tase Ă€ratundmisel. Praegusel hetkel on projekti osalistelt juba dikteeritud kokku 4,3 tuhat tundi, millest 3,5 tuhat on lĂ€binud kontrolli. DeepSpeechi ingliskeelse lĂ”ppmudeli koolitamiseks on kasutatud 3816 tunni rÀÀgitud kĂ”net, lisaks Common Voice'ile, millel on andmed projektidest LibriSpeech, Fisher ja Switchboard, ning mis sisaldab umbes 1700 tunni transkribeeritud raadiosaate salvestusi.
Pakutud laadimiseks valmis ingliskeelse mudeli kasutamisel on DeepSpeechi Àratundmisvigade tase 7,5%, kui hindamine toimub testkomplekti abil. . VÔrdluseks, inimeste Àratundmise vigade tase on 5,83%.
DeepSpeech koosneb kahest alamsĂŒsteemist â akustilisest mudelist ja dekooderist. Akustiline mudel kasutab sĂŒvaĂ”ppe meetodeid, et arvutada tĂ”enĂ€osust, et teatud sĂŒmbolid esinevad sisendiks saadud helis. Dekooder rakendab kiirendusalgoritmi, et muuta sĂŒmbolite tĂ”enĂ€osuse andmed tekstiliseks esituseks.
Peamised DeepSpeech 0.6 (0.6 haru ei ole ĂŒhilduv varasemate vĂ€ljaannetega ja vajab koodi ja mudelite uuendamist):
- Pakutud on uus voogedastusdekooder, mis pakub kÔrgemat reageerimiskiirusel ja ei sÔltu töödeldavate helifailide suurusest. LÔppkokkuvÔttes on uues DeepSpeechi versioonis Ônnestunud vÀhendada Àratundmise latentsust 260 ms-ni, mis on 73% kiiremini kui varem, ning vÔimaldab rakendada DeepSpeechi kÔnetuvastuse lahendustes reaalajas.
- API-s on tehtud muudatusi ja on tehtud tööd funktsioonide nimede ĂŒhtlustamiseks. Lisatud on funktsioonid tĂ€iendavate metaandmete saamiseks sĂŒnkroniseerimise kohta, mis vĂ”imaldavad mitte ainult saada vĂ€ljundiks tekstilist esitust, vaid ka jĂ€lgida eraldi sĂŒmbolite ja lausete seondumist helivoo positsiooniga.
- Koolituspaketti on lisatud moodulite toetamist rekurssed on ĂŒheks neutraalsete nĂ€rvivĂ”rkude töö optimeerimiseks (RNN), mis vĂ”imaldas saavutada mĂ€rkimisvÀÀrset (umbes kaks korda) suurenemist mudeli koolitusvĂ”imekuses, kuid see nĂ”udis koodis muudatuste tegemist, mis rikkusid ĂŒhilduvust varasemate mudelitega.
- Minimaalsed nÔuded TensorFlow versioonile tÔsteti 1.13.1-lt 1.14.0-le. Lisatud on toetus kergemale TensorFlow Lite versioonile, mille kasutamisega vÀhenes DeepSpeech paketihulk 98 MB-lt 3.7 MB-le. Ka integreeritud ja mobiilseadmete puhul voimaline failide suurus vÀhenes 188 MB-lt 47 MB-le (kvantimise meetodit kasutati pÀrast mudeli koolitamist).
- Keelemudel on ĂŒmber tĂ”lgitud teise andmestruktuuride formaati, mis vĂ”imaldab failide laadimisel neid mĂ€llu kaardistada. Vanale formaadile toetus lĂ”petatakse.
- Keelemudeli faili laadimise reĆŸiim on muudetud, mis aitas vĂ€hendada mĂ€lu tarbimist ja vĂ€hendada viivitusi mudeli loomise jĂ€rel esimeses pĂ€ringus. DeepSpeech tarbib nĂŒĂŒd töötamise kĂ€igus 22 korda vĂ€hem mĂ€lu ja kĂ€ivitub 500 korda kiiremini.
- Keelemudelit rakendati haruldaste sÔnade filtreerimine. SÔnade koguarv on vÀhendatud 500 000 kÔige populaarsema sÔnani, mis esinesid koolitusel kasutatud tekstides. Tehtud puhastamine aitas vÀhendada keelemudeli suurust 1800 MB-lt 900 MB-le, mÔjutamata praktiliselt Àra arvamise taseme nÀitajaid.
- Erinevate toetamine on lisatud lisavariatsioonide (augmentation) loomise jaoks helidetektiidena, mida kasutatakse koolituse ajal (nĂ€iteks variante on lisatud, mis on moonutatud vĂ”i sisaldavad mĂŒra).
- Lisatud on raamatukogu, millel on sidemed integreerimiseks .NET platvormil pÔhinevate rakendustega.
- Dokumentatsioon on ĂŒmber töötatud ja nĂŒĂŒd on see kogutud eraldi saidile .
Allikas: opennet.ru
