Codka Guud ee Mozilla 7.0 Cusbooneysii

Компании NVIDIA и Mozilla представили обновление наборов голосовых данных, собранных в результате инициативы Common Voice и включающих примеры произношения 182 тысяч людей, что на 25% больше, чем 6 месяцев назад. Данные опубликованы как общественное достояние (CC0). Предложенные наборы можно использовать в системах машинного обучения для построения моделей распознавания и синтеза речи.

По сравнению с прошлым обновлением размер объём речевого материала в коллекции увеличился с 9 до 13.9 тысяч часов речи. Число поддерживаемых языков возросло с 60 до 76, в том числе впервые добавлена поддержка Белорусского, Казахского, Узбекского, Болгарского, Армянского, Азербайджанского и Башкирского языков. Набор для русского языка охватывает 2136 участников и 173 часа речевого материала (было 1412 участников и 111 часов), а для украинского языка — 615 участников и 66 часов (было 459 участников и 30 часов).

В подготовке материалов на английском языке приняли участие более 75 тысяч человек, надиктовавших 2637 часов подтверждённой речи (было 66 тысяч участников и 1686 часов). Интересно, что на втором месте по размеру накопленных данных язык руанда, для которого собрано 2260 часов. Затем следуют немецкий (1040), каталонский (920) и эсперанто (840). Из наиболее динамично наращивающих размер голосовых данных языков называются тайский язык (рост базы в 20 раз, с 12 до 250 часов), луганда (с 8 до 80 часов), эсперанто (со 100 до 840 часов) и тамильский язык (с 24 до 220 часов).

В рамках своего участия в проекте Common Voice компания NVIDIA подготовила на базе собранных данных готовые натренированные модели для систем машинного обучения (поддерживается PyTorch). Модели распространяются в составе бесплатного и открытого инструментария NVIDIA NeMo, который, например, уже используется в автоматизированных голосовых сервисах МТС и Сбербанка. Модели ориентированы на использование в системах распознавания речи, синтеза речи и обработки информации на естественном языке, и могут оказаться полезными для исследователей, занимающихся созданием голосовых диалоговых систем, платформ для транскрипции и автоматизированных колл-центров. В отличие от доступных ранее проектов, опубликованные модели не ограничиваются распознанием английского языка и охватывают различные языки, акценты и формы речи.

Aan ku xasuusino in mashruuca Codka Guud uu ujeedadiisu tahay abaabulka shaqada wadajirka ah si loo ururiyo xogta qaababka codka taas oo tixgalinaysa kala duwanaanshaha codadka iyo qaababka hadalka. Isticmaalayaasha waxaa lagu martiqaadaa weedho cod ah oo lagu soo bandhigay shaashadda ama waxay qiimeeyaan tayada xogta ay ku dareen isticmaalayaasha kale. Xogta la ururiyey oo leh diiwaannada ku dhawaaqida kala duwan ee weedhaha caadiga ah ee hadalka aadanaha waxaa loo isticmaali karaa iyada oo aan la xaddidin nidaamyada barashada mashiinka iyo mashaariicda cilmi-baarista.

Sida laga soo xigtay qoraaga maktabadda aqoonsiga hadalka joogtada ah ee Vosk, faa'iido darrada Qalabka Codka Guud waa hal dhinac oo ka mid ah qalabka codka (badanaa dadka ragga ah ee 20-30 sano jir ah, iyo la'aanta qalabka codka haweenka. , carruurta iyo waayeelka), kala duwanaansho la'aanta qaamuuska (ku celcelinta weedho isku mid ah) iyo qaybinta duubista qaabka MP3 ee qalloocan.

Source: opennet.ru

Add a comment