Kompania Mozilla prezantoi motorin e njohjes së zërit DeepSpeech 0.6

Presented lëshimi i motorit të njohjes së zërit të zhvilluar nga kompania Mozilla DeepSpeech 0.6, i cili realizon arkitekturën e njohjes së zërit me të njëjtin emër, të propozuar nga hulumtuesit e kompanisë Baidu. Implementimi është shkruar në gjuhën Python duke përdorur platformën e të mësuarit të makinerive TensorFlow dhe shpërndahet nën licencën e lirë MPL 2.0. Mbështet funksionimin në Linux, Android, macOS dhe Windows. Performanca është e mjaftueshme për të përdorur motorin në plakat LePotato, Raspberry Pi 3 dhe Raspberry Pi 4.

Në paketë gjithashtu ofrohen janë modelet e trajnuara, shembuj skedat audio dhe mjetet për njohjen nga linja e komandës. Për integrimin e funksionit të njohjes së zërit në programet tuaja, janë ofruar modula të gatshme për përdorim për Python, NodeJS, C++ dhe .NET (modulet për Rust dhe Gojanë përgatitur veçmas nga zhvillues të tretë). Modeli i gatshëm ofrohet vetëm për gjuhën angleze, por për gjuhët e tjera, për dokumentacionin e ofruar udhëzimet mund të mësohet sistemi vetë, duke përdorur të dhëna vokale, të mbledhura nga projekti Common Voice.

DeepSpeech është ndjeshëm më i thjeshtë se sistemet tradicionale dhe megjithatë siguron cilësi më të lartë njohjeje në prani të zhurmave të tjera. Në zhvillim nuk përdoren modelet tradicionale akustike dhe koncepti i fonemave, por zbatohen një sistem i optimizuar mirë i të mësuarit të makinerive i bazuar në rrjeta neuronale, i cili lejon të evitohet zhvillimi i komponenteve të veçanta për modelimin e devijimeve të ndryshme, si zhurma, jehona dhe veçoritë e të folurit.

Anë tjetër e këtij qasje është se për të marrë njohje cilësore dhe për të trajnuar rrjetin neuronal, motori DeepSpeech kërkon një sasi të madhe të dhënash të ndryshme, të diktuara në kushte reale nga zëra të ndryshëm dhe në prani të zhurmave natyrore.
Mbledhjen e të dhënave të tilla e menaxhon projekti i krijuar në Mozilla Common Voice, që ofron një set të dhënash të verifikuara me 780 orë në gjuhën angleze, 325 në gjermanisht, 173 në frëngjisht dhe 27 orë në rusisht.

Qëllimi përfundimtar i projektit Common Voice është grumbullimi i 10 mijë orëve me regjistrime të ndryshme të shqiptimeve të frazave standarde të generuara nga njeriu, që do të mundësojë arritjen e një nivele të pranueshme të gabimeve në njohjen e zërit. Aktualisht, pjesëmarrësit në projekt kanë regjistruar gjithsej 4.3 mijë ora, prej të cilave 3.5 mijë kanë kaluar verifikimin. Në trajnimin e modelit përfundimtar të gjuhës angleze për DeepSpeech janë përdorur 3816 orë zëri, përveç Common Voice që përfshin të dhëna nga projektet LibriSpeech, Fisher dhe Switchboard, si dhe rreth 1700 orë regjistrimesh të transkriptuara të shfaqjeve radiofonike.

Me përdorimin e modelit të gatshëm për shkarkim për gjuhën angleze, niveli i gabimeve të njohjes në DeepSpeech është 7.5% sipas vlerësës së setit testues LibriSpeech. Për krahasim, niveli i gabimeve në njohjen nga njeriu përcaktohet në 5.83%.

DeepSpeech përbëhet nga dy nën-sisteme — modeli akustik dhe dekoduesi. Modeli akustik përdor metoda të mësimit të thellë të makinës për të llogaritur probabilitetin e pranishmërisë së simboleve të caktuara në zërin e ofruar në input. Dekoduesi aplikon një algoritem kërkimi në beams për të përkthyer të dhënat e probabilitetit të simboleve në një përfaqësim tekstual.

Main innovations DeepSpeech 0.6 (dega 0.6 nuk është e kompatibilshme me versionet e mëparshme dhe kërkon përditësimin e kodit dhe modeleve):

  • Është propozuar një dekodues i ri në rrjedhë që ofron ndjeshmëri më të lartë dhe nuk varet nga madhësia e të dhënave audio që përpunohen. Si rezultat, në versionin e ri të DeepSpeech, është arritur të zvogëlohet vonesa e njohjes deri në 260 ms, që është 73% më e shpejtë se më parë, dhe lejon përdorimin e DeepSpeech në zgjidhje për njohjen e zërit në kohë reale.
  • Janë bërë ndryshime në API dhe është punuar për unifikimin e emrave të funksioneve. Janë shtuar funksione për të marrë metadatat shtesë mbi sinkronizimin, duke e lejuar jo vetëm që të merrni një përfaqësim tekstual në dalje, por gjithashtu të ndihmoni në ndjekjen e lidhjes së simboleve dhe fjali me pozitat në fluksin audio.
  • Një mbështetje për përdorimin e biblioteka CuDNN për optimizimin e punës me rrjetet neurale rekursive (RNN), gjë që lehtësoi arritjen e një rritjeje të dukshme (afërsisht dyfish) të eficiencës së trajnimit të modelit, por kërkoi ndryshime në kod që dëmtonin kompatibilitetin me modelet e përgatitura më herët.
  • Kërkesat minimale për versionin e TensorFlow janë rritur nga 1.13.1 në 1.14.0. Shtohet mbështetje për edicionin e lehtë TensorFlow Lite, e cila, duke u përdorur, ka ulur madhësinë e paketës DeepSpeech nga 98 MB në 3.7 MB. Për përdorimin në pajisje të integruara dhe mobile, madhësia e skedarit të paketuar me modelin është reduktuar gjithashtu nga 188 MB në 47 MB (metoda e kvantizimit është përdorur pas përfundimit të trajnimit të modelit).
  • Modeli gjuhësor është transferuar në një format tjetër të strukturave të dhënash, që lejon realizimin e mapimit të skedarëve në memorje gjatë ngarkimit. Mbështetje për formatin e vjetër është ndalur.
  • Kushti i ngarkesës së skedarit me modelin gjuhësor është ndryshuar, duke lehtësuar konsumimin e memories dhe duke reduktuar vonesat gjatë përpunimit të kërkesës së parë pas krijimit të modelit. Gjatë funksionimit, DeepSpeech tani konsumon 22 herë më pak memorie dhe niset 500 herë më shpejt.

    Kompania Mozilla prezantoi motorin e njohjes së zërit DeepSpeech 0.6
  • Është bërë filtrimi i fjalëve të rralla në modelin gjuhësor. Numri total i fjalëve është reduktuar në 500 mijë fjalët më të njohura, që hasen në tekstin e përdorur për trajnimin e modelit. Pas pastrimit të kryer, madhësia e modelit gjuhësor është ulur nga 1800MB në 900MB, duke mos ndikuar pothuajse fare në treguesit e nivelit të gabimeve në njohjen.
  • Shtohet mbështetje për teknika të ndryshme të krijimit të variacioneve shtesë (augmentation) të të dhënave audio, që përdoren gjatë trajnimit (për shembull, duke shtuar një grup variantesh, të cilat kanë përfshirë deformacione ose zhurma). Shtohet një bibliotekë me binde për integrimin me aplikacionet mbi platformën .NET.
  • Dokumentacioni është rishikuar dhe tani është i mbledhur në një faqe të veçantë
  • deepspeech.readthedocs.io Konfigurimi i rrjetit të shtëpisë + NAS në unRAID (pjesa 2).

Burimi: opennet.ru

Blini hostim të besueshëm për faqe interneti me mbrojtje DDoS, serverë VPS VDS 🔥 Blini hostim të besueshëm për faqe interneti me mbrojtje DDoS, serverë VPS VDS - ProHoster