Mozilla ընկերության կողմից զարգացվող խոսի ճանաչման շարժիչի թողարկում որն իրականացնում է նույնանուն խոսի ճանաչման ճարտարապետությունը, Baidu ընկերության հետազոտողների կողմից: Իրականացումը գրված է Python լեզվով և օգտագործում է TensorFlow մեքենայական ուսուցման հարթակը, MPL 2.0 ազատ լիցենզիայի ներքո: Աջակցում է Linux, Android, macOS և Windows-ում աշխատելուն: Առկա կատարողականությունը բավարար է շարժիչի օգտագործման համար LePotato, Raspberry Pi 3 և Raspberry Pi 4 թախտերում:
Սահմանում են նաև ուսումնասիրած մոդելներ, հնչյունային ֆայլեր և հրահանգային շարքից խոսի ճանաչման գործիքներ: Խոսի ճանաչման ֆունկցիան ձեր ծրագրերում ներդնելու համար առաջարկվում են պատրաստի օգտագործման մոդուլներ Python, NodeJS, C++ և .NET համար (նրա հետ մեկտեղ պատրաստվել են կողմնակի մշակողների կողմից մոդուլներ հանդիսացող) և ). Պատրաստի մոդելը մատուցվում է միայն անգլերեն լեզվով, սակայն այլ լեզուների համար կարող եք ինքնուրույն ուսուցանել համակարգը օգտագործելով , որոնք հավաքվել են Common Voice նախագծի կողմից:
DeepSpeech-ը զգալիորեն պարզ է ավանդական համակարգերից և միաժամանակ ապահովում է ավելի բարձր ճանաչման որակ արտաքին աղմուկի առկայության դեպքում: Տեղեկատվության մշակումը չի օգտագործում ավանդական ակուստիկ մոդելներ և ֆոնեմների կոնցեպցիան, այդ փոխարեն օգտագործվում է լավ օպտիմիզացված մեքենայական ուսուցման համակարգ, որն ակնարկում է հատուկ բաղադրիչների մշակման անհրաժեշտությանը տարբեր շեղումների մոդելավորման համար, ինչպիսիք են աղմուկը, օրվա մասին խոսակցությունները և խոսքի առանձնահատկությունները:
Այս մոտեցման հակառակ կողմը այն է, որ որոշակի ճանաչման որակ և նեյրոնային ցանցի ուսուցման համար DeepSpeech շարժիչը պահանջում է մեծ քանակություն տարբեր տվյալների, որոնք հավաքվել են իրական պայմաններում տարբեր ձայներից և բնական աղմուկների առկայության դեպքում:
Այս տվյալների հավաքմամբ զբաղվում է Mozilla-ի կողմից ստեղծված , որն առաջարկում է 780 ժամ ուսումնասիրված տվյալների անգլերեն լեզվով, Common Voice ծրագրի վերջնական նպատակը 10 հազար ժամ տարբեր արտաբանման մարդու խոսքի տիպային արտահայտություններով գրառման հավաքագրումն է, ինչը կհաջողվի հասնել բավարար սխալների մակարդակի ճանաչման դեպքում: Այս պահին նախագծի մասնակիցները արդեն միասին նահանգվել են 4.3 հազար ժամ, որոնցից 3.5 հազար ժամ անցել են ստուգում: DeepSpeech-ի համար անգլերենի վերջնական մոդելը ուսուցանվել է 3816 ժամ խոսքով, որի ներքո Common Voice-ում ընդգրկված են LibriSpeech, Fisher և Switchboard նախագծերից տվյալներ, ինչպես նաև ներառում են շուրջ 1700 ժամ ռադիոհաղորդումների տրանսկրիբացված գրառումներ:
Առաջարկվող ներբեռնման համար պատրաստի անգլերենի մոդելների օգտագործման դեպքում DeepSpeech-ի ճանաչման սխալների մակարդակը կազմում է 7.5% LibriSpeech թեստային հավաքածուի գնահատմամբ:
Համեմատության համար, մարդկանց կողմից ճանաչման սխալների մակարդակը . 5.83%-ով։
DeepSpeech-ը բաղկացած է երկու ենթակառուցվածքներից՝ акустական մոդելից և դեկոդերից: Ակուստական մոդելը օգտագործում է խորքային մեքենայական ուսուցման մեթոդներ՝ մուտքագրվող ձայնում որոշակի սիմվոլներ հայտնվելու հավանականությունը հաշվելու համար: Դեկոդերը կիրառոում է ճառագայթային որոնման ալգորիթմ՝ սիմվոլների հավանականության տվյալները վերափոխելու համար տեքստային ներկայացման:
Հիմնական DeepSpeech 0.6 (0.6 ճյուղը չհամատեղելի է նախորդ թողարկումների հետ և պահանջում է կոդի և մոդելների թարմացում):
- Նոր պլանավորող դեկոդեր է առաջարկվել, որը ապահովում է ավելի բարձր արձագանքունակություն և չկախված է մշակվող ձայնային տվյալների չափից: Միջապես, նոր DeepSpeech տարբերակով հաջողվեց նվազեցնել ճանաչման ուշացումը 260 մ.ս.-ով, ինչը 73%-ով ավելի արագ է, քան նախկինում, և թույլ է տալիս օգտագործել DeepSpeech-ի ելքային ճանաչման լուծումների մեջ:
- API-ում կատարվել են փոփոխություններ և ֆունկցիաների անունների միասնականացում: Ավելացվել են ֆունկցիաներ՝ լրացուցիչ մետադատաների ստացման համար, որոնք թույլ են տալիս ոչ միայն ստանալ տեքստային ներկայացում, այլ նաև հետևել առանձին սիմվոլների և նախադասությունների կապը ձայնային հոսքի դիրքի հետ:
- Ուսուցման գործիքակազմում ավելացել է ուկպրաժեշտությունը RNN-ների (ռեկուրսիվ նյարդային ցանցեր) հետ աշխատելու օպտիմիզացման համար, ինչը թույլ տվեց զգալի (մոտ 2 անգամ) ավելացնել մոդելի ուսուցման արտադրողականությունը, սակայն պահանջեց կոդում փոփոխություներ, որոնք խախտում են առաջիկա մոդելների պատրաստվածության համապատասխանությունը:
- TensorFlow-ի տարբերակի նվազագույն պահանջները բարձրացվել են 1.13.1-ից 1.14.0: Ավելացվել է TensorFlow Lite-ի թեթև տարբերակի աջակցություն, որի օգտագործման արդյունքում DeepSpeech-ի փաթեթի չափը նվազեցվել է 98 MB-ից մինչև 3.7 MB: Մշտացվող և շարժական սարքեր համար 188 MB-ից մինչև 47 MB-ի կրճատվել է փաթեթավորված մոդելի ֆայլի չափը (սեղմման համար օգտագործվել է ուսուցման ավարտվելուց հետո քվանտավորման մեթոդ):
- Լեզվային մոդելը փոխվել է այլ տվյալ结构ի ձևի, որը թույլ է տալիս ֆայլերի մապինգ իրականացնել փոխադրելու ընթացքում: Արդյունքով հին ձևաչափին աջակցության դադարեցման գործընթաց իրականանում է:
- Փոփոխություն է կատարվել լեզվային մոդելի ֆայլի բեռնման ռեժիմում, ինչը թույլ է տվել նվազեցնել հիշողության սպառումը և նվազեցնել ձայնային մոդելի ստեղծումից հետո առաջին հարցման մշակման delays: Դիպազգային ժամանակ DeepSpeech-ը այժմ սպառում է 22 անգամ ավելի քիչ հիշողություն և գործարկվում է 500 անգամ ավելի արագ։
- Լեզվային մոդելի редких բառերի ֆիլտրացում է իրականացվել: Ընդհանուր բառերի թիվը կրճատվել է 500 հազար ամենատարածված բառերի, որոնք հանդիպել են մոդելի ուսուցման ժամանակ օգտագործված տեքստում: Կատարելագործված մաքրման միջոցով լեզվային մոդելի չափը նվազեցվել է 1800 ՄԲ-ից մինչև 900 ՄԲ, գրեթե չազդելով ճանաչման սխալի մակարդակի ցուցանիշների վրա։
- Ավելացվել է տարբեր այսօր նոր տարբերակների (augmentation) ձայնի տվյալների ստեղծում, որ օգտագործվում են ուսուցման ընթացքում (օրինակ, տարբերակների հավաքածուին աղմուկ կամ խեղումների ավելացմամբ):
- Ավելացված է բինդինգների գրադարան, որը ինտեգրվում է .NET պլատֆորմայի հիման վրա կառուցված ծրագրերի հետ:
- Ավելի լավացված փաստաթղթավորում, որն այժմ մեկ տարածքում է հավաքվել .
Ընտանիք: opennet.ru
