Mozilla poolt arendatud kõnetuvastuse mootor , mis rakendab samanimelist kõnetuvastuse arhitektuuri, Baidu teadlased. Teostus on kirjutatud Pythonis, kasutades masinõppe platvormi TensorFlow ning on vabade litsentside MPL 2.0 all. Töötab Linuxis, Androidis, macOS-is ja Windowsis. Jõudlus on piisav, et kasutada mootorit LePotato, Raspberry Pi 3 ja Raspberry Pi 4 platvormidel.
Pakendis on samuti treenitud mudelid, helifailid ja käsurea kõnetuvastustööriistad. Kõnetuvastuse funktsiooni oma programmidesse integreerimiseks on pakutud valmis mooduleid Pythonile, NodeJS-ile, C++-le ja .NET-ile (kolmandate osapoolte arendajad on eraldi valmis teinud moodulid ja ). Valmis mudel on saadaval ainult ingliskeelsena, kuid teiste keelte jaoks on võimalik süsteemi ise välja õpetada, kasutades , mis on kogutud projekti Common Voice raames.
DeepSpeech on oluliselt lihtsam kui traditsioonilised süsteemid ja samas pakub see kõrgemat tuvastamise kvaliteeti, isegi kui taustal on müra. Arenduses ei kasutata traditsioonilisi akustilisi mudeleid ja foneemide kontseptsiooni, vaid rakendatakse hästi optimeeritud närvivõrgu süsteemi masinõppel, mis võimaldab loobuda erinevate kõrvalekallete modelleerimise jaoks eraldi komponentide arendamisest, näiteks müra, kaja ja kõne omadused.
Selle lähenemise varjuküljeks on see, et DeepSpeech'i mootori jaoks kvaliteetse tuvastamise ja närvivõrgu koolitamiseks on vajalik suur hulk erinevaid andmeid, mis on dikteeritud reaalsetes tingimustes erinevate häälte poolt ja looduslike müraisolatsioonidega.
Sarnaste andmete kogumisega tegeleb Mozilla loodud projekt , mis pakub kontrollitud andmekogumit 780 tunni ulatuses , 325 tunni jagu saksa keeles, 173 tunni jagu prantsuse keeles ja 27 tunni jagu vene keeles.
Common Voice projekti peamine eesmärk on koguda 10 000 tundi erinevate hääldustega tavaliste inimkõne fraaside salvestusi, mis aitab saavutada vastuvõetava taseme vigade määras äratundmisel. Praegusel hetkel on projekti osalised juba salvestanud kokku 4,3 tuhat tundi, millest 3,5 tuhat on läbinud kontrolli. DeepSpeechi ingliskeelse lõppmudeli treenimiseks on kasutatud 3816 tunni kõnet, lisaks Common Voice'ile, mis hõlmab teavet projektidest LibriSpeech, Fisher ja Switchboard, ning sisaldab ka umbes 1700 tundi transkribeeritud raadiošõude salvestusi.
Pakutava ingliskeelse mudeli kasutamisel on DeepSpeechi äratundmisvea määr 7,5% testkomplekti hindamisel . Võrdluseks, inimene äratundmise veamäär on 5,83%.
DeepSpeech koosneb kahest alamsüsteemist - akustilisest mudelist ja dekooderist. Akustiline mudel kasutab sügava masinõppe meetodeid, et arvutada tõenäosust, et teatud sümbolid esinevad sisendiks antud helis. Dekooder rakendab kiirusotsingu algoritmi, et muuta sümbolite tõenäosuse andmed tekstiliseks esituseks.
Peamised DeepSpeech 0.6 (0.6 haru ei ühildu varasemate väljaannetega ja nõuab koodi ja mudelite värskendamist):
- Uus voogedastuse dekooder, mis pakub paremat reageerimiskiirust ja ei sõltu töödeldavate helifailide suurusest. Uues versioonis on DeepSpeech suutnud vähendada tuvastamise latentsust 260 ms-ni, mis on 73% kiiremini kui varem, võimaldades kasutada DeepSpeech'i reaalajas kõnetuvastuslahendustes.
- Tehtud on muudatusi API-s ja tehtud tööd funktsioonide nimede ühtlustamiseks. Lisatud funktsioonid täiendavate metaandmete saamiseks sünkroniseerimise kohta, mis võimaldavad mitte ainult saada tekstilist esitamist, vaid ka jälgida üksikute sümbolite ja lausete seotust helivoo positsiooniga.
- Opetustööriistade komplekti on lisatud tugi raamatukogu kasutamiseks , et optimeerida korduvate närvivõrkude (RNN) tööd, mis on võimaldanud saavutada märkimisväärset (umbes kaks korda) jõudluse suurenemist mudeli õpetamisel, kuid on nõudnud koodi muutmist, mis rikub varasemate mudelite ühilduvust.
- TensorFlow versiooni miinimumnõuded on tõstetud 1.13.1-lt 1.14.0-le. On lisatud tugi kergetele TensorFlow Lite versioonidele, mille kasutamine on vähendanud DeepSpeech paketi suurust 98 MB-lt 3.7 MB-le. Integreeritud ja mobiilseadmete kasutamiseks on paketitud mudeli failide suurust vähendatud 188 MB-lt 47 MB-le, kasutades mudeli õpetamise lõpetamisel kvantimist.
- Keelemudel on ümber vormindatud teistsuguseks andmestruktuuriks, mis võimaldab failide laadimisel mälus mappimist. Vanade formaatide tugi on lõpetatud.
- Faili laadimise režiim keelemudeli jaoks on muudetud, mis on võimaldanud vähendada mälutarvet ja vähendada viivitusi esimese päringu töötlemisel pärast mudeli loomist. DeepSpeech tarbib nüüd töötamise käigus 22 korda vähem mälu ja käivitub 500 korda kiiremini.
- Keeles mudelis on filtreeritud haruldasi sõnu. Sõnade koguarv on vähendatud 500 000 kõige populaarsemale sõnale, mis esinevad mudeli treenimisel kasutatud tekstis. Teostatud puhastus võimaldas vähendada keelemudeli suurust 1800MB-lt 900MB-le, mõjutamata praktiliselt vigade tuvastamise määra.
- Lisatud erinevate toetamine lisaversioonide (augmentation) loomisel helidatades, mis on kasutatud treenimisel (näiteks variatsioonide komplekti lisamine, kus on tehtud moonutusi või müra).
- Lisatud raamatukogu .NET platvormil põhinevates rakendustes integreerimiseks.
- Dokumentatsioon on üle vaadatud ja kogutud eraldi veebisaidile .
Allikas: opennet.ru
