Mozilla ընկերությունը ներկայացրեց DeepSpeech 0.6 խոսի ճանաչողական շարժիչը

Ներդրված է Mozilla ընկերության կողմից զարգացվող խոսի ճանաչման շարժիչի թողարկում DeepSpeech 0.6որն իրականացնում է նույնանուն խոսի ճանաչման ճարտարապետությունը, առաջարկված Baidu ընկերության հետազոտողների կողմից: Իրականացումը գրված է Python լեզվով և օգտագործում է TensorFlow մեքենայական ուսուցման հարթակը, բաշխվում է MPL 2.0 ազատ լիցենզիայի ներքո: Աջակցում է Linux, Android, macOS և Windows-ում աշխատելուն: Առկա կատարողականությունը բավարար է շարժիչի օգտագործման համար LePotato, Raspberry Pi 3 և Raspberry Pi 4 թախտերում:

Սահմանում են նաև առաջարկված են ուսումնասիրած մոդելներ, օրինակներ հնչյունային ֆայլեր և հրահանգային շարքից խոսի ճանաչման գործիքներ: Խոսի ճանաչման ֆունկցիան ձեր ծրագրերում ներդնելու համար առաջարկվում են պատրաստի օգտագործման մոդուլներ Python, NodeJS, C++ և .NET համար (նրա հետ մեկտեղ պատրաստվել են կողմնակի մշակողների կողմից մոդուլներ հանդիսացող) Rust և Go). Պատրաստի մոդելը մատուցվում է միայն անգլերեն լեզվով, սակայն այլ լեզուների համար ներկայացված հ οδηγίες կարող եք ինքնուրույն ուսուցանել համակարգը օգտագործելով հնչյունային տվյալներ, որոնք հավաքվել են Common Voice նախագծի կողմից:

DeepSpeech-ը զգալիորեն պարզ է ավանդական համակարգերից և միաժամանակ ապահովում է ավելի բարձր ճանաչման որակ արտաքին աղմուկի առկայության դեպքում: Տեղեկատվության մշակումը չի օգտագործում ավանդական ակուստիկ մոդելներ և ֆոնեմների կոնցեպցիան, այդ փոխարեն օգտագործվում է լավ օպտիմիզացված մեքենայական ուսուցման համակարգ, որն ակնարկում է հատուկ բաղադրիչների մշակման անհրաժեշտությանը տարբեր շեղումների մոդելավորման համար, ինչպիսիք են աղմուկը, օրվա մասին խոսակցությունները և խոսքի առանձնահատկությունները:

Այս մոտեցման հակառակ կողմը այն է, որ որոշակի ճանաչման որակ և նեյրոնային ցանցի ուսուցման համար DeepSpeech շարժիչը պահանջում է մեծ քանակություն տարբեր տվյալների, որոնք հավաքվել են իրական պայմաններում տարբեր ձայներից և բնական աղմուկների առկայության դեպքում:
Այս տվյալների հավաքմամբ զբաղվում է Mozilla-ի կողմից ստեղծված Common Voice, որն առաջարկում է 780 ժամ ուսումնասիրված տվյալների անգլերեն լեզվով, , 325 գերմաներեն, 173 ֆրանսերեն և 27 ժամ ռուսերեն:Common Voice ծրագրի վերջնական նպատակը 10 հազար ժամ տարբեր արտաբանման մարդու խոսքի տիպային արտահայտություններով գրառման հավաքագրումն է, ինչը կհաջողվի հասնել բավարար սխալների մակարդակի ճանաչման դեպքում: Այս պահին նախագծի մասնակիցները արդեն միասին նահանգվել են 4.3 հազար ժամ, որոնցից 3.5 հազար ժամ անցել են ստուգում: DeepSpeech-ի համար անգլերենի վերջնական մոդելը ուսուցանվել է 3816 ժամ խոսքով, որի ներքո Common Voice-ում ընդգրկված են LibriSpeech, Fisher և Switchboard նախագծերից տվյալներ, ինչպես նաև ներառում են շուրջ 1700 ժամ ռադիոհաղորդումների տրանսկրիբացված գրառումներ:

Առաջարկվող ներբեռնման համար պատրաստի անգլերենի մոդելների օգտագործման դեպքում DeepSpeech-ի ճանաչման սխալների մակարդակը կազմում է 7.5% LibriSpeech թեստային հավաքածուի գնահատմամբ:

Համեմատության համար, մարդկանց կողմից ճանաչման սխալների մակարդակը LibriSpeech. գնահատվում է 5.83%-ով։

DeepSpeech-ը բաղկացած է երկու ենթակառուցվածքներից՝ акустական մոդելից և դեկոդերից: Ակուստական մոդելը օգտագործում է խորքային մեքենայական ուսուցման մեթոդներ՝ մուտքագրվող ձայնում որոշակի սիմվոլներ հայտնվելու հավանականությունը հաշվելու համար: Դեկոդերը կիրառոում է ճառագայթային որոնման ալգորիթմ՝ սիմվոլների հավանականության տվյալները վերափոխելու համար տեքստային ներկայացման:

Հիմնական նորություններ DeepSpeech 0.6 (0.6 ճյուղը չհամատեղելի է նախորդ թողարկումների հետ և պահանջում է կոդի և մոդելների թարմացում):

  • Նոր պլանավորող դեկոդեր է առաջարկվել, որը ապահովում է ավելի բարձր արձագանքունակություն և չկախված է մշակվող ձայնային տվյալների չափից: Միջապես, նոր DeepSpeech տարբերակով հաջողվեց նվազեցնել ճանաչման ուշացումը 260 մ.ս.-ով, ինչը 73%-ով ավելի արագ է, քան նախկինում, և թույլ է տալիս օգտագործել DeepSpeech-ի ելքային ճանաչման լուծումների մեջ:
  • API-ում կատարվել են փոփոխություններ և ֆունկցիաների անունների միասնականացում: Ավելացվել են ֆունկցիաներ՝ լրացուցիչ մետադատաների ստացման համար, որոնք թույլ են տալիս ոչ միայն ստանալ տեքստային ներկայացում, այլ նաև հետևել առանձին սիմվոլների և նախադասությունների կապը ձայնային հոսքի դիրքի հետ:
  • Ուսուցման գործիքակազմում ավելացել է CuDNN-ի ուկպրաժեշտությունը RNN-ների (ռեկուրսիվ նյարդային ցանցեր) հետ աշխատելու օպտիմիզացման համար, ինչը թույլ տվեց զգալի (մոտ 2 անգամ) ավելացնել մոդելի ուսուցման արտադրողականությունը, սակայն պահանջեց կոդում փոփոխություներ, որոնք խախտում են առաջիկա մոդելների պատրաստվածության համապատասխանությունը:
  • TensorFlow-ի տարբերակի նվազագույն պահանջները բարձրացվել են 1.13.1-ից 1.14.0: Ավելացվել է TensorFlow Lite-ի թեթև տարբերակի աջակցություն, որի օգտագործման արդյունքում DeepSpeech-ի փաթեթի չափը նվազեցվել է 98 MB-ից մինչև 3.7 MB: Մշտացվող և շարժական սարքեր համար 188 MB-ից մինչև 47 MB-ի կրճատվել է փաթեթավորված մոդելի ֆայլի չափը (սեղմման համար օգտագործվել է ուսուցման ավարտվելուց հետո քվանտավորման մեթոդ):
  • Լեզվային մոդելը փոխվել է այլ տվյալ结构ի ձևի, որը թույլ է տալիս ֆայլերի մապինգ իրականացնել փոխադրելու ընթացքում: Արդյունքով հին ձևաչափին աջակցության դադարեցման գործընթաց իրականանում է:
  • Փոփոխություն է կատարվել լեզվային մոդելի ֆայլի բեռնման ռեժիմում, ինչը թույլ է տվել նվազեցնել հիշողության սպառումը և նվազեցնել ձայնային մոդելի ստեղծումից հետո առաջին հարցման մշակման delays: Դիպազգային ժամանակ DeepSpeech-ը այժմ սպառում է 22 անգամ ավելի քիչ հիշողություն և գործարկվում է 500 անգամ ավելի արագ։

    Mozilla ընկերությունը ներկայացրեց DeepSpeech 0.6 խոսի ճանաչողական շարժիչը
  • Լեզվային մոդելի редких բառերի ֆիլտրացում է իրականացվել: Ընդհանուր բառերի թիվը կրճատվել է 500 հազար ամենատարածված բառերի, որոնք հանդիպել են մոդելի ուսուցման ժամանակ օգտագործված տեքստում: Կատարելագործված մաքրման միջոցով լեզվային մոդելի չափը նվազեցվել է 1800 ՄԲ-ից մինչև 900 ՄԲ, գրեթե չազդելով ճանաչման սխալի մակարդակի ցուցանիշների վրա։
  • Ավելացվել է տարբեր տեխնիկաների աջակցություն այսօր նոր տարբերակների (augmentation) ձայնի տվյալների ստեղծում, որ օգտագործվում են ուսուցման ընթացքում (օրինակ, տարբերակների հավաքածուին աղմուկ կամ խեղումների ավելացմամբ):
  • Ավելացված է բինդինգների գրադարան, որը ինտեգրվում է .NET պլատֆորմայի հիման վրա կառուցված ծրագրերի հետ:
  • Ավելի լավացված փաստաթղթավորում, որն այժմ մեկ տարածքում է հավաքվել deepspeech.readthedocs.io.

Ընտանիք: opennet.ru

Գնել հուսալի հյուրընկալում DDoS պաշտպանությամբ, VPS VDS սերվերներով 🔥 Գնել հուսալի հյուրընկալում DDoS պաշտպանությամբ, VPS VDS սերվերներով | ProHoster