Aktualizacja danych głosowych Mozilla Common Voice 19.0

Firma Mozilla zaktualizowała zestawy danych głosowych Common Voice, które zawierają przykłady wymowy ponad 200 tysięcy osób. Dane zostały opublikowane jako własność publiczna (CC0). Proponowane zestawy można wykorzystywać w systemach uczenia maszynowego do budowy modeli rozpoznawania i syntezy mowy. W porównaniu do poprzedniej aktualizacji objętość materiału mowy w kolekcji zwiększyła się z 31,8 do 32,6 tysiąca godzin mowy, z czego ponad 20 tysięcy godzin przeszło procedurę weryfikacji. Liczba obsługiwanych języków wzrosła z 129 do 131.

W przygotowaniu materiałów w języku angielskim wzięło udział 93,9 tysiąca osób, które nagrały 3587 godzin mowy (wcześniej 93,3 tysiąca uczestników i 3554 godziny). Zestaw dla języka białoruskiego obejmuje 8444 uczestników i 1846 godzin materiału mowy (wcześniej — 8400 uczestników i 1815 godzin), dla języka rosyjskiego — 3296 uczestników i 278 godzin (wcześniej 3241 uczestnik i 277 godzin), dla uzbeckiego — 2200 uczestników i 265 godzin (wcześniej 2189 uczestników i 265 godzin), dla języka ukraińskiego — 1104 uczestników i 114 godzin (wcześniej 1091 uczestnik i 113 godzin).

Projekt Common Voice koncentruje się na organizacji wspólnej pracy nad gromadzeniem bazy wzorców głosowych, która uwzględnia wszelkie różnorodności głosów i manier mowy. Użytkownicy są zachęcani do wymawiania wyświetlanych na ekranie zdań lub oceny jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnorodnej wymowy typowych fraz mowy ludzkiej bez ograniczeń można wykorzystać w systemach uczenia maszynowego oraz w projektach badawczych.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster