Kompania Mozilla prezantoi motorin e njohjes së zërit DeepSpeech 0.6

Presented lëshimi i motorit të njohjes së zërit të zhvilluar nga kompania Mozilla DeepSpeech 0.6, i cili realizon arkitekturën e njohjes së zërit me të njëjtin emër, të propozuar nga hulumtuesit e kompanisë Baidu. Implementimi është shkruar në gjuhën Python duke përdorur platformën e të mësuarit të makinerive TensorFlow dhe shpërndahet nën licencën e lirë MPL 2.0. Mbështet funksionimin në Linux, Android, macOS dhe Windows. Performanca është e mjaftueshme për të përdorur motorin në plakat LePotato, Raspberry Pi 3 dhe Raspberry Pi 4.

Në paketë gjithashtu ofrohen janë modelet e trajnuara, shembuj skedat audio dhe mjetet për njohjen nga linja e komandës. Për integrimin e funksionit të njohjes së zërit në programet tuaja, janë ofruar modula të gatshme për përdorim për Python, NodeJS, C++ dhe .NET (modulet për Rust dhe Gojanë përgatitur veçmas nga zhvillues të tretë). Modeli i gatshëm ofrohet vetëm për gjuhën angleze, por për gjuhët e tjera, për dokumentacionin e ofruar udhëzimet mund të mësohet sistemi vetë, duke përdorur të dhëna vokale, të mbledhura nga projekti Common Voice.

DeepSpeech është ndjeshëm më i thjeshtë se sistemet tradicionale dhe megjithatë siguron cilësi më të lartë njohjeje në prani të zhurmave të tjera. Në zhvillim nuk përdoren modelet tradicionale akustike dhe koncepti i fonemave, por zbatohen një sistem i optimizuar mirë i të mësuarit të makinerive i bazuar në rrjeta neuronale, i cili lejon të evitohet zhvillimi i komponenteve të veçanta për modelimin e devijimeve të ndryshme, si zhurma, jehona dhe veçoritë e të folurit.

Anë tjetër e këtij qasje është se për të marrë njohje cilësore dhe për të trajnuar rrjetin neuronal, motori DeepSpeech kërkon një sasi të madhe të dhënash të ndryshme, të diktuara në kushte reale nga zëra të ndryshëm dhe në prani të zhurmave natyrore.
Mbledhjen e të dhënave të tilla e menaxhon projekti i krijuar në Mozilla Common Voice, që ofron një set të dhënash të verifikuara me 780 orë në gjuhën angleze, 325 në gjermanisht, 173 në frëngjisht dhe 27 orë në rusisht.

Qëllimi përfundimtar i projektit Common Voice është grumbullimi i 10 mijë orëve me regjistrime të ndryshme të shqiptimeve të frazave standarde të generuara nga njeriu, që do të mundësojë arritjen e një nivele të pranueshme të gabimeve në njohjen e zërit. Aktualisht, pjesëmarrësit në projekt kanë regjistruar gjithsej 4.3 mijë ora, prej të cilave 3.5 mijë kanë kaluar verifikimin. Në trajnimin e modelit përfundimtar të gjuhës angleze për DeepSpeech janë përdorur 3816 orë zëri, përveç Common Voice që përfshin të dhëna nga projektet LibriSpeech, Fisher dhe Switchboard, si dhe rreth 1700 orë regjistrimesh të transkriptuara të shfaqjeve radiofonike.

Me përdorimin e modelit të gatshëm për shkarkim për gjuhën angleze, niveli i gabimeve të njohjes në DeepSpeech është 7.5% sipas vlerësës së setit testues LibriSpeech. Për krahasim, niveli i gabimeve në njohjen nga njeriu përcaktohet në 5.83%.

DeepSpeech pĂ«rbĂ«het nga dy nĂ«n-sisteme — modeli akustik dhe dekoduesi. Modeli akustik pĂ«rdor metoda tĂ« mĂ«simit tĂ« thellĂ« tĂ« makinĂ«s pĂ«r tĂ« llogaritur probabilitetin e pranishmĂ«risĂ« sĂ« simboleve tĂ« caktuara nĂ« zĂ«rin e ofruar nĂ« input. Dekoduesi aplikon njĂ« algoritem kĂ«rkimi nĂ« beams pĂ«r tĂ« pĂ«rkthyer tĂ« dhĂ«nat e probabilitetit tĂ« simboleve nĂ« njĂ« pĂ«rfaqĂ«sim tekstual.

Main innovations DeepSpeech 0.6 (dega 0.6 nuk është e kompatibilshme me versionet e mëparshme dhe kërkon përditësimin e kodit dhe modeleve):

  • ËshtĂ« propozuar njĂ« dekodues i ri nĂ« rrjedhĂ« qĂ« ofron ndjeshmĂ«ri mĂ« tĂ« lartĂ« dhe nuk varet nga madhĂ«sia e tĂ« dhĂ«nave audio qĂ« pĂ«rpunohen. Si rezultat, nĂ« versionin e ri tĂ« DeepSpeech, Ă«shtĂ« arritur tĂ« zvogĂ«lohet vonesa e njohjes deri nĂ« 260 ms, qĂ« Ă«shtĂ« 73% mĂ« e shpejtĂ« se mĂ« parĂ«, dhe lejon pĂ«rdorimin e DeepSpeech nĂ« zgjidhje pĂ«r njohjen e zĂ«rit nĂ« kohĂ« reale.
  • JanĂ« bĂ«rĂ« ndryshime nĂ« API dhe Ă«shtĂ« punuar pĂ«r unifikimin e emrave tĂ« funksioneve. JanĂ« shtuar funksione pĂ«r tĂ« marrĂ« metadatat shtesĂ« mbi sinkronizimin, duke e lejuar jo vetĂ«m qĂ« tĂ« merrni njĂ« pĂ«rfaqĂ«sim tekstual nĂ« dalje, por gjithashtu tĂ« ndihmoni nĂ« ndjekjen e lidhjes sĂ« simboleve dhe fjali me pozitat nĂ« fluksin audio.
  • NjĂ« mbĂ«shtetje pĂ«r pĂ«rdorimin e biblioteka CuDNN pĂ«r optimizimin e punĂ«s me rrjetet neurale rekursive (RNN), gjĂ« qĂ« lehtĂ«soi arritjen e njĂ« rritjeje tĂ« dukshme (afĂ«rsisht dyfish) tĂ« eficiencĂ«s sĂ« trajnimit tĂ« modelit, por kĂ«rkoi ndryshime nĂ« kod qĂ« dĂ«mtonin kompatibilitetin me modelet e pĂ«rgatitura mĂ« herĂ«t.
  • KĂ«rkesat minimale pĂ«r versionin e TensorFlow janĂ« rritur nga 1.13.1 nĂ« 1.14.0. Shtohet mbĂ«shtetje pĂ«r edicionin e lehtĂ« TensorFlow Lite, e cila, duke u pĂ«rdorur, ka ulur madhĂ«sinĂ« e paketĂ«s DeepSpeech nga 98 MB nĂ« 3.7 MB. PĂ«r pĂ«rdorimin nĂ« pajisje tĂ« integruara dhe mobile, madhĂ«sia e skedarit tĂ« paketuar me modelin Ă«shtĂ« reduktuar gjithashtu nga 188 MB nĂ« 47 MB (metoda e kvantizimit Ă«shtĂ« pĂ«rdorur pas pĂ«rfundimit tĂ« trajnimit tĂ« modelit).
  • Modeli gjuhĂ«sor Ă«shtĂ« transferuar nĂ« njĂ« format tjetĂ«r tĂ« strukturave tĂ« dhĂ«nash, qĂ« lejon realizimin e mapimit tĂ« skedarĂ«ve nĂ« memorje gjatĂ« ngarkimit. MbĂ«shtetje pĂ«r formatin e vjetĂ«r Ă«shtĂ« ndalur.
  • Kushti i ngarkesĂ«s sĂ« skedarit me modelin gjuhĂ«sor Ă«shtĂ« ndryshuar, duke lehtĂ«suar konsumimin e memories dhe duke reduktuar vonesat gjatĂ« pĂ«rpunimit tĂ« kĂ«rkesĂ«s sĂ« parĂ« pas krijimit tĂ« modelit. GjatĂ« funksionimit, DeepSpeech tani konsumon 22 herĂ« mĂ« pak memorie dhe niset 500 herĂ« mĂ« shpejt.

    Kompania Mozilla prezantoi motorin e njohjes së zërit DeepSpeech 0.6
  • ËshtĂ« bĂ«rĂ« filtrimi i fjalĂ«ve tĂ« rralla nĂ« modelin gjuhĂ«sor. Numri total i fjalĂ«ve Ă«shtĂ« reduktuar nĂ« 500 mijĂ« fjalĂ«t mĂ« tĂ« njohura, qĂ« hasen nĂ« tekstin e pĂ«rdorur pĂ«r trajnimin e modelit. Pas pastrimit tĂ« kryer, madhĂ«sia e modelit gjuhĂ«sor Ă«shtĂ« ulur nga 1800MB nĂ« 900MB, duke mos ndikuar pothuajse fare nĂ« treguesit e nivelit tĂ« gabimeve nĂ« njohjen.
  • Shtohet mbĂ«shtetje pĂ«r teknika tĂ« ndryshme tĂ« krijimit tĂ« variacioneve shtesĂ« (augmentation) tĂ« tĂ« dhĂ«nave audio, qĂ« pĂ«rdoren gjatĂ« trajnimit (pĂ«r shembull, duke shtuar njĂ« grup variantesh, tĂ« cilat kanĂ« pĂ«rfshirĂ« deformacione ose zhurma). Shtohet njĂ« bibliotekĂ« me binde pĂ«r integrimin me aplikacionet mbi platformĂ«n .NET.
  • Dokumentacioni Ă«shtĂ« rishikuar dhe tani Ă«shtĂ« i mbledhur nĂ« njĂ« faqe tĂ« veçantĂ«
  • deepspeech.readthedocs.io Konfigurimi i rrjetit tĂ« shtĂ«pisĂ« + NAS nĂ« unRAID (pjesa 2).

Burimi: opennet.ru

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster