publikimi i motorit të njohjes së zërit të zhvilluar nga Mozilla , i cili implementon arkitekturën e njohjes së zërit me të njëjtin emër, nga hulumtuesit e Baidu. Implementimi është shkruar në Python duke përdorur platformën e mësimit të makinerive TensorFlow dhe nën licencën e lirë MPL 2.0. Mbështet funksionimin në Linux, Android, macOS dhe Windows. Performanca është e mjaftueshme për të përdorur motorin në pajisjet LePotato, Raspberry Pi 3 dhe Raspberry Pi 4.
Në paketë gjithashtu përfshihen modele të trajnuara, skedarë audio dhe një mjet për njohjen përmes linjës së komandës. Për integrimin e funksionit të njohjes së zërit në programet e tua, janë ofruar module të gatshme për përdorim për Python, NodeJS, C++ dhe .NET (module të përgatitura veçmas nga zhvillues të tretë për dhe ). Modeli i gatshëm ofrohet vetëm për gjuhën angleze, por për gjuhë të tjera sipas mund të trajnohet sistemi vetë, duke përdorur , të mbledhura nga projekti Common Voice.
DeepSpeech është shumë më i thjeshtë se sistemet tradicionale dhe njëkohësisht siguron një cilësi më të lartë njohjeje në prani të zhurmave të jashtme. Në zhvillim nuk përdoren modelet tradicionale akustike dhe koncepti i fonemave, por zbatohen një sistem mësimi të makinerive të optimizuar mirë në bazë të një nervozi, i cili lejon shmangien e zhvillimit të komponenteve të veçanta për modelimin e njohjes së ndryshimeve të ndryshme, si zhurma, jehona dhe karakteristikat e të folurit.
Ankthi i këtij qasje është se për të arritur një njohje cilësore dhe për të trajnuar nervin e rrjetit, motorit DeepSpeech i nevojitet një sasi e madhe e të dhënave të larmishme, të diktuara në kushte reale nga zëra të ndryshëm dhe në prani të zhurmave natyrore.
Grumbullimi i të dhënave të tilla merret me projektin e krijuar në Mozilla , duke ofruar një grup të verifikuar të dhënash me 780 orë në , 325 në gjermanisht, 173 në frëngjisht dhe 27 orë në rusisht.
Qëllimi përfundimtar i projektit Common Voice është akumulimi i 10,000 orëve me regjistrime të shqiptimit të frazave të zakonshme të njerëzve, gjë që do të lejojë arritjen e një niveli të pranueshëm të gabimeve në njohje. Në gjendjen aktuale, pjesëmarrësit e projektit tashmë kanë diktuar një total prej 4.3 mijë orësh, nga të cilat 3.5 mijë kanë kaluar verifikimin. Gjatë trajnimit të modelit përfundimtar të gjuhës angleze për DeepSpeech janë përdorur 3816 orë zëri, përveç Common Voice, e cila mbulon të dhëna nga projektet LibriSpeech, Fisher dhe Switchboard, si dhe përfshin rreth 1700 orë regjistrimesh të transkripuara nga emisionet radio.
Për përdorimin e modelit të gatshëm për shkarkim të gjuhës angleze, niveli i gabimeve të njohjes në DeepSpeech është 7.5% sipas vlerësimit të grupit të testit . Për krahasim, niveli i gabimeve në njohjen e njeriut është 5.83%.
DeepSpeech përbëhet nga dy nën-sisteme - modeli akustik dhe dekoduesi. Modeli akustik përdor metoda të thella të mësimit të makinerive për të llogaritur probabilitetin e pranisë së simboleve të caktuara në zërin e paraqitur si input. Dekoduesi aplikon algoritmin e kërkimit me rrezet për të transformuar të dhënat e probabilitetit të simboleve në një përfaqësim tekstual.
Ndryshimet kryesore DeepSpeech 0.6 (dega 0.6 nuk është e përputhshme me versione e kaluara dhe kërkon përditësimin e kodit dhe modeleve):
- U ofrua një dekodues i ri në mënyrë stream-u, që siguron një përgjigje më të lartë dhe që nuk varet nga madhësia e të dhënave audio të nxjerra. Si rezultat, në versionin e ri të DeepSpeech arriti të ulë vonesën e njohjes deri në 260 ms, që është 73% më i shpejtë se më parë dhe lejon aplikimin e DeepSpeech në zgjidhjet për njohjen e zërit në kohë reale.
- Janë kryer ndryshime në API dhe janë kryer punë për unifikimin e emrave të funksioneve. Janë shtuar funksione për marrjen e metadata shtesë rreth sinkronizimit, që lejojnë jo vetëm marrjen e një përfaqësimi tekstual si dalje, por gjithashtu ndjekjen e lidhjes së simboleve dhe fjalisë me pozitat në rrjedhën e zërit.
- Në mjetet për trajnimin e moduleve është shtuar mbështetje për përdorimin e bibliotekës për optimizimin e punës me rrjetet nervore të rikurrentes (RNN), gjë që ka lejuar arritjen e një rritjeje të konsiderueshme (rreth dy herë) të performancës së trajnimit të modelit, por ka kërkuar ndryshime në kod që dëmtojnë përputhshmërinë me modelet e përgatitura më parë.
- KĂ«rkesat minimale pĂ«r versionin TensorFlow janĂ« rritur nga 1.13.1 nĂ« 1.14.0. ĂshtĂ« shtuar mbĂ«shtetje pĂ«r edicionin e lehtĂ« TensorFlow Lite, me pĂ«rdorimin e tĂ« cilit masa e paketĂ«s DeepSpeech Ă«shtĂ« tkurrur nga 98 MB nĂ« 3.7 MB. PĂ«r pĂ«rdorimin nĂ« pajisje tĂ« integruara dhe mobile, masa e skedarit tĂ« paketuar me modelin Ă«shtĂ« gjithashtu reduktuar nga 188 MB nĂ« 47 MB (pĂ«r komprimim Ă«shtĂ« pĂ«rdorur metoda e kuantizimit pas pĂ«rfundimit tĂ« trajnimitt tĂ« modelit).
- Modeli i gjuhës është translokuar në një format tjetër të struktura të dhënash, që lejon tëekzistimin e hartëzim të skedarëve në memori gjatë ngarkimit. Mbështetja për formatin e vjetër është ndërprerë.
- ĂshtĂ« ndryshuar mĂ«nyra e ngarkimit tĂ« skedarit me modelin e gjuhĂ«s, e cila e ka lejuar uljen e konsumit tĂ« memorjes dhe reduktimin e vonesave gjatĂ« pĂ«rpunimit tĂ« kĂ«rkesĂ«s sĂ« parĂ« pas krijimit tĂ« modelit. GjatĂ« punĂ«s, DeepSpeech tani konsumon 22 herĂ« mĂ« pak memorie dhe aktivizohet 500 herĂ« mĂ« shpejt.
- ĂshtĂ« kryer filtrimi i fjalĂ«ve tĂ« rralla nĂ« modelin e gjuhĂ«s. Numri total i fjalĂ«ve Ă«shtĂ« reduktuar nĂ« 500,000 fjalĂ«t mĂ« tĂ« popullarizuara qĂ« shfaqen nĂ« tekstin e pĂ«rdorur pĂ«r trajnim tĂ« modelit. Pas pastrimit tĂ« kryer, masa e modelit tĂ« gjuhĂ«s Ă«shtĂ« reduktuar nga 1800MB nĂ« 900MB, pa ndikuar nĂ« mĂ«nyrĂ« tĂ« konsiderueshme nĂ« treguesit e nivelit tĂ« gabimeve tĂ« njohjes.
- ĂshtĂ« shtuar mbĂ«shtetje pĂ«r ndryshme krijimit tĂ« variacioneve shtesĂ« (augmentation) tĂ« tĂ« dhĂ«nave audio, qĂ« pĂ«rdoren gjatĂ« trajtimit (p.sh., shtimi nĂ« grupin e variacioneve qĂ« pĂ«rfshijnĂ« deformime ose zhurma).
- ĂshtĂ« shtuar njĂ« bibliotekĂ« me bindings pĂ«r integrim me aplikacione bazuar nĂ« platformĂ«n .NET.
- Dokumentacioni është rishikuar, tani është i përmbledhur në një sit të veçantë .
Burimi: opennet.ru
