Kompania Mozilla lançoi motorin e njohjes së gjuhës DeepSpeech 0.6

Të paraqitura publikimi i motorit të njohjes së zërit të zhvilluar nga Mozilla DeepSpeech 0.6, i cili implementon arkitekturën e njohjes së zërit me të njëjtin emër, të propozuar nga hulumtuesit e Baidu. Implementimi është shkruar në Python duke përdorur platformën e mësimit të makinerive TensorFlow dhe distribuohet nën licencën e lirë MPL 2.0. Mbështet funksionimin në Linux, Android, macOS dhe Windows. Performanca është e mjaftueshme për të përdorur motorin në pajisjet LePotato, Raspberry Pi 3 dhe Raspberry Pi 4.

Në paketë gjithashtu përfshihen ofruar modele të trajnuara, shembuj skedarë audio dhe një mjet për njohjen përmes linjës së komandës. Për integrimin e funksionit të njohjes së zërit në programet e tua, janë ofruar module të gatshme për përdorim për Python, NodeJS, C++ dhe .NET (module të përgatitura veçmas nga zhvillues të tretë për Rust dhe Go). Modeli i gatshëm ofrohet vetëm për gjuhën angleze, por për gjuhë të tjera sipas dokumentacionit të udhëzues mund të trajnohet sistemi vetë, duke përdorur të dhëna zanore, të mbledhura nga projekti Common Voice.

DeepSpeech është shumë më i thjeshtë se sistemet tradicionale dhe njëkohësisht siguron një cilësi më të lartë njohjeje në prani të zhurmave të jashtme. Në zhvillim nuk përdoren modelet tradicionale akustike dhe koncepti i fonemave, por zbatohen një sistem mësimi të makinerive të optimizuar mirë në bazë të një nervozi, i cili lejon shmangien e zhvillimit të komponenteve të veçanta për modelimin e njohjes së ndryshimeve të ndryshme, si zhurma, jehona dhe karakteristikat e të folurit.

Ankthi i këtij qasje është se për të arritur një njohje cilësore dhe për të trajnuar nervin e rrjetit, motorit DeepSpeech i nevojitet një sasi e madhe e të dhënave të larmishme, të diktuara në kushte reale nga zëra të ndryshëm dhe në prani të zhurmave natyrore.
Grumbullimi i të dhënave të tilla merret me projektin e krijuar në Mozilla Common Voice, duke ofruar një grup të verifikuar të dhënash me 780 orë në gjuhën angleze, 325 në gjermanisht, 173 në frëngjisht dhe 27 orë në rusisht.

Qëllimi përfundimtar i projektit Common Voice është akumulimi i 10,000 orëve me regjistrime të shqiptimit të frazave të zakonshme të njerëzve, gjë që do të lejojë arritjen e një niveli të pranueshëm të gabimeve në njohje. Në gjendjen aktuale, pjesëmarrësit e projektit tashmë kanë diktuar një total prej 4.3 mijë orësh, nga të cilat 3.5 mijë kanë kaluar verifikimin. Gjatë trajnimit të modelit përfundimtar të gjuhës angleze për DeepSpeech janë përdorur 3816 orë zëri, përveç Common Voice, e cila mbulon të dhëna nga projektet LibriSpeech, Fisher dhe Switchboard, si dhe përfshin rreth 1700 orë regjistrimesh të transkripuara nga emisionet radio.

Për përdorimin e modelit të gatshëm për shkarkim të gjuhës angleze, niveli i gabimeve të njohjes në DeepSpeech është 7.5% sipas vlerësimit të grupit të testit LibriSpeech. Për krahasim, niveli i gabimeve në njohjen e njeriut vlerësohet është 5.83%.

DeepSpeech përbëhet nga dy nën-sisteme - modeli akustik dhe dekoduesi. Modeli akustik përdor metoda të thella të mësimit të makinerive për të llogaritur probabilitetin e pranisë së simboleve të caktuara në zërin e paraqitur si input. Dekoduesi aplikon algoritmin e kërkimit me rrezet për të transformuar të dhënat e probabilitetit të simboleve në një përfaqësim tekstual.

Ndryshimet kryesore risitë DeepSpeech 0.6 (dega 0.6 nuk është e përputhshme me versione e kaluara dhe kërkon përditësimin e kodit dhe modeleve):

  • U ofrua njĂ« dekodues i ri nĂ« mĂ«nyrĂ« stream-u, qĂ« siguron njĂ« pĂ«rgjigje mĂ« tĂ« lartĂ« dhe qĂ« nuk varet nga madhĂ«sia e tĂ« dhĂ«nave audio tĂ« nxjerra. Si rezultat, nĂ« versionin e ri tĂ« DeepSpeech arriti tĂ« ulĂ« vonesĂ«n e njohjes deri nĂ« 260 ms, qĂ« Ă«shtĂ« 73% mĂ« i shpejtĂ« se mĂ« parĂ« dhe lejon aplikimin e DeepSpeech nĂ« zgjidhjet pĂ«r njohjen e zĂ«rit nĂ« kohĂ« reale.
  • JanĂ« kryer ndryshime nĂ« API dhe janĂ« kryer punĂ« pĂ«r unifikimin e emrave tĂ« funksioneve. JanĂ« shtuar funksione pĂ«r marrjen e metadata shtesĂ« rreth sinkronizimit, qĂ« lejojnĂ« jo vetĂ«m marrjen e njĂ« pĂ«rfaqĂ«simi tekstual si dalje, por gjithashtu ndjekjen e lidhjes sĂ« simboleve dhe fjalisĂ« me pozitat nĂ« rrjedhĂ«n e zĂ«rit.
  • NĂ« mjetet pĂ«r trajnimin e moduleve Ă«shtĂ« shtuar mbĂ«shtetje pĂ«r pĂ«rdorimin e bibliotekĂ«s CuDNN pĂ«r optimizimin e punĂ«s me rrjetet nervore tĂ« rikurrentes (RNN), gjĂ« qĂ« ka lejuar arritjen e njĂ« rritjeje tĂ« konsiderueshme (rreth dy herĂ«) tĂ« performancĂ«s sĂ« trajnimit tĂ« modelit, por ka kĂ«rkuar ndryshime nĂ« kod qĂ« dĂ«mtojnĂ« pĂ«rputhshmĂ«rinĂ« me modelet e pĂ«rgatitura mĂ« parĂ«.
  • KĂ«rkesat minimale pĂ«r versionin TensorFlow janĂ« rritur nga 1.13.1 nĂ« 1.14.0. ËshtĂ« shtuar mbĂ«shtetje pĂ«r edicionin e lehtĂ« TensorFlow Lite, me pĂ«rdorimin e tĂ« cilit masa e paketĂ«s DeepSpeech Ă«shtĂ« tkurrur nga 98 MB nĂ« 3.7 MB. PĂ«r pĂ«rdorimin nĂ« pajisje tĂ« integruara dhe mobile, masa e skedarit tĂ« paketuar me modelin Ă«shtĂ« gjithashtu reduktuar nga 188 MB nĂ« 47 MB (pĂ«r komprimim Ă«shtĂ« pĂ«rdorur metoda e kuantizimit pas pĂ«rfundimit tĂ« trajnimitt tĂ« modelit).
  • Modeli i gjuhĂ«s Ă«shtĂ« translokuar nĂ« njĂ« format tjetĂ«r tĂ« struktura tĂ« dhĂ«nash, qĂ« lejon tĂ«ekzistimin e hartĂ«zim tĂ« skedarĂ«ve nĂ« memori gjatĂ« ngarkimit. MbĂ«shtetja pĂ«r formatin e vjetĂ«r Ă«shtĂ« ndĂ«rprerĂ«.
  • ËshtĂ« ndryshuar mĂ«nyra e ngarkimit tĂ« skedarit me modelin e gjuhĂ«s, e cila e ka lejuar uljen e konsumit tĂ« memorjes dhe reduktimin e vonesave gjatĂ« pĂ«rpunimit tĂ« kĂ«rkesĂ«s sĂ« parĂ« pas krijimit tĂ« modelit. GjatĂ« punĂ«s, DeepSpeech tani konsumon 22 herĂ« mĂ« pak memorie dhe aktivizohet 500 herĂ« mĂ« shpejt.

    Kompania Mozilla lançoi motorin e njohjes së gjuhës DeepSpeech 0.6
  • ËshtĂ« kryer filtrimi i fjalĂ«ve tĂ« rralla nĂ« modelin e gjuhĂ«s. Numri total i fjalĂ«ve Ă«shtĂ« reduktuar nĂ« 500,000 fjalĂ«t mĂ« tĂ« popullarizuara qĂ« shfaqen nĂ« tekstin e pĂ«rdorur pĂ«r trajnim tĂ« modelit. Pas pastrimit tĂ« kryer, masa e modelit tĂ« gjuhĂ«s Ă«shtĂ« reduktuar nga 1800MB nĂ« 900MB, pa ndikuar nĂ« mĂ«nyrĂ« tĂ« konsiderueshme nĂ« treguesit e nivelit tĂ« gabimeve tĂ« njohjes.
  • ËshtĂ« shtuar mbĂ«shtetje pĂ«r ndryshme teknika krijimit tĂ« variacioneve shtesĂ« (augmentation) tĂ« tĂ« dhĂ«nave audio, qĂ« pĂ«rdoren gjatĂ« trajtimit (p.sh., shtimi nĂ« grupin e variacioneve qĂ« pĂ«rfshijnĂ« deformime ose zhurma).
  • ËshtĂ« shtuar njĂ« bibliotekĂ« me bindings pĂ«r integrim me aplikacione bazuar nĂ« platformĂ«n .NET.
  • Dokumentacioni Ă«shtĂ« rishikuar, tani Ă«shtĂ« i pĂ«rmbledhur nĂ« njĂ« sit tĂ« veçantĂ« deepspeech.readthedocs.io.

Burimi: opennet.ru

Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Bleni hostim tĂ« besueshĂ«m pĂ«r faqe me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster