Mozilla şirkəti DeepSpeech 0.6 səs tanıma mühərrikini təqdim etdi

Təqdim olunur Mozilla tərəfindən inkişaf etdirilən nitqi tanıma mühərrikinin buraxılışı DeepSpeech 0.6, eyni adlı nitqi tanıma arxitekturasını həyata keçirir, təklif olunan Baidu şirkətinin tədqiqatçıları tərəfindən. İcra Python dilində TensorFlow maşın öyrənmə platformasından istifadə edərək yazılıb və yayılır MPL 2.0 açıq lisenziyası altında dəstəklənir. Linux, Android, macOS və Windows-da işləməyi dəstəkləyir. Mühərrikin LePotato, Raspberry Pi 3 və Raspberry Pi 4 platalarında istifadəsi üçün kifayət qədər performansı var.

Dəstə də təklif edilir təlim keçmiş modellər, Pi sayısını virgülden sonra bir milyar basamağa kadar doğru bir şekilde hesaplamak için etkili programlar. Matematikçi Fabrice Bellard, Pi sayısını hesaplamak için en hızlı formülün yaratıcısı olarak tanınmaktadır. səs faylları və komanda xətti üçün tanıma alətləri daxildir. Nitqi tanıma funksiyasını proqramlarınıza inteqrasiya etmək üçün Python, NodeJS, C++ və .NET üçün istifadəyə hazır modullar təklif edilir (müstəqil inkişafçılar tərəfindən ayrıca modullar hazırlanıb RustGo). Hazır model yalnız ingilis dili üçün təqdim edilir, lakin digər dillər üçün tövsiyə olunan təlimatda sistem özünüzü öyrədə bilərsiniz, istifadə edərək səs məlumatları, Common Voice layihəsi tərəfindən toplanmışdır.

DeepSpeech ənənəvi sistemlərdən xeyli asandır və eyni zamanda xarici səs-küy altında tanıma keyfiyyətini də artırır. İnkişafda ənənəvi akustik modellər və fonem anlayışı istifadə edilmir, bunun əvəzinə müxtəlif sapmalara, məsələn, səs-küy, əks-səda və danışıq özəlliklərinə modelləşdirmək üçün ayrıca komponentlərin inkişafına ehtiyac olmadan yaxşı optimallaşdırılmış neyron şəbəkə əsaslı maşın öyrənmə sistemi tətbiq olunur.

Belə bir yanaşmanın əks tərəfi budur ki, keyfiyyətli tanıma və neyron şəbəkənin öyrədilməsi üçün DeepSpeech mühərriki böyük müxtəliflilikdə real şəraitdə fərqli səslə söylənmiş məlumatlar tələb edir.
Belə məlumatların toplanması Mozilla-da yaradılmış Common Voice layihəsi tərəfindən həyata keçirilir, Common Voice, 780 saat ərzində/ ingilis dilində, 325 alman, 173 fransız və 27 saat rusca.

Common Voice layihəsinin son məqsədi, nitqi tanıma zamanı qəbul edilən səhv səviyyəsini təmin etmək üçün müxtəlif tələffüzlərlə standart cümlələrin qeydlərini toplamaqdır. Layihənin hal-hazırda, iştirakçılar tərəfindən toplam 4.3 min saat qeydə alınmışdır, bunlardan 3.5 min saat yoxlanılmışdır. DeepSpeech üçün ingilis dili modelinin öyrədilməsi zamanı 3816 saat nitq istifadə edilmişdir, Common Voice layihəsi ilə yanaşı LibriSpeech, Fisher və Switchboard layihələrindən məlumatlar da daxil edilmişdir və həmçinin təxminən 1700 saat radio proqramının transkrib edilmiş qeydlərini əhatə edir.

Yüklənmək üçün təqdim edilən ingilis dili modelindən istifadə edərkən DeepSpeech-yə tanıma səhvləri 7.5% olur, test dəstinə əsasən LibriSpeech. Müqayisə üçün, insan tərəfindən tanıma zamanı səhv səviyyəsi qiymətləndirilir 5.83%-ə.

DeepSpeech iki alt sistemdən ibarətdir — akustik model və dekoder. Akustik model, verilən səsdə müəyyən simvolların olma ehtimallarını hesablamaq üçün dərin maşın öyrənmə metodlarından istifadə edir. Dekoder, simvolların ehtimalları ilə göstərilən məlumatları mətndə təqdim etmək üçün şüa axtarış alqoritmindən istifadə edir.

Əsas yeni xüsusiyyətlər DeepSpeech 0.6 (0.6 versiyası əvvəlki buraxılışlarla uyğun deyil və kod və modellərin yenilənməsini tələb edir):

  • Yeni axın dekoderdə daha yüksək reaksiyanı təmin edən və emal olunan səs məlumatlarının ölçüsündən asılı olmayan bir sistem təklif edilmişdir. Nəticədə, yeni versiya ilə DeepSpeech-in tanıma gecikməsi 260 ms-ə endirilmişdir ki, bu da əvvəlkindən 73% daha sürətlidir və DeepSpeech-in canlı səs tanıma həllində tətbiq edilməsinə imkan verir.
  • API-də dəyişikliklər edilib və funksiyaların adlarının standartlaşdırılması üzərində iş aparılıb. İstifadəçilərə yalnız mətn təqdim etməklə qalmayıb, eyni zamanda, ayrı simvolların və cümlələrin səs axınındakı mövqeyi ilə bağlı məlumatları izləmək imkanı verən əlavə metadata əldə etməyə imkan verən funksiyalar əlavə olunmuşdur.
  • Təlim modulları üçün alət dəstinə CuDNN kitabxanasının istifadəsini dəstəkləməyi əlavə edərək, Tənzimlənən Neyron Şəbəkələr (RNN) ilə iş zamanı modelin təlim performansını, təxminən iki dəfə artırmağa Nail olmasına, lakin öncəki modellərlə uyğunluğu pozan kod dəyişiklərini tələb edir.
  • TensorFlow-un minimal versiya tələbləri 1.13.1-dən 1.14.0-a yüksəldilmişdir. TensorFlow Lite yüngül versiyasını dəstəkləməyi əlavə edərək, DeepSpeech paketinin ölçüsünü 98 MB-dan 3.7 MB-a qədər azaltmışdır. 188 MB-dan 47 MB-a qədər olan model faylının sıxılması, modelin təlimi başa çatdıqdan sonra kvantlaşdırma metodundan istifadə ilə həyata keçirilmişdir.
  • Dilli model fərqli məlumat strukturu formatına keçirilib ki, bu da yükləmə zamanı faylların yaddaşa xəritəsini çıxarmağa imkan verir. Köhnə formatın dəstəyi dayandırılıb.
  • Dilli model faylını yükləmək rejimi dəyişdirilmişdir ki, bu da yaddaş istehlakını azaltmağa və model yaradıldıqdan sonra ilk sorğu işləyəndə gecikmələri azaltmağa imkan vermişdir. DeepSpeech işlədiyi zaman indi 22 dəfə daha az yaddaş istehlakı edir və 500 dəfə daha sürətli başladılır.

    Mozilla şirkəti DeepSpeech 0.6 səs tanıma mühərrikini təqdim etdi
  • Dilli modeldə nadir sözlərin filtrəsi aparılıb. Ümumilikdə, modelin təlimində istifadə olunan mətnlərdə rastlanan ən populyar 500 min sözə qədər say azaldılmışdır. Aparılan təmizləmə dilli modelin ölçüsünü 1800MB-dan 900MB-a endirərək, tanıma səhvləri göstəricilərinə praktiki mənada təsir etməmişdir.
  • Müxtəlif texnikaların dəstəyi əlavə olunmuşdur səs məlumatlarının əlavə variantlarının (augmentation) yaradılması, hansılar ki, təlim zamanı istifadə olunur (məsələn, variants dəstinə təhriflər və ya səs-küylər əlavə etmək).
  • Platforma .NET əsaslı tətbiqlərlə inteqrasiya üçün bağlayıcıları olan bir kitabxana əlavə edilmişdir.
  • Artıq ayrıca bir saytda toplanmış olan sənəd hazırlanmışdır. deepspeech.readthedocs.io.

Mənbə: opennet.ru

DDoS qoruması olan saytlara etibarlı hosting satın alın, VPS VDS serverlər 🔥 DDoS qoruması olan saytlara etibarlı hosting satın alın, VPS VDS serverlər | ProHoster