Firma Mozilla zaktualizowała zestawy danych głosowych Common Voice, które obejmują przykłady wymowy ponad 200 tysięcy osób. Dane opublikowane są jako domena publiczna (CC0). Proponowane zestawy można wykorzystać w systemach uczenia maszynowego do budowy modeli rozpoznawania i syntezowania mowy. W porównaniu do wcześniejszej aktualizacji objętość materiału mówionego w kolekcji wzrosła z 31,1 do 31,8 tysięcy godzin mowy, z czego 20,8 tysiąca godzin przeszło procedurę weryfikacji. Liczba wspieranych języków zwiększyła się z 124 do 129 (dodano języki afrykańskich plemion: kosa, kalenjin, kidawida, doluwo i tswana).
W przygotowaniu materiałów w języku angielskim wzięło udział 93,3 tysiąca osób, które nagrały 3554 godziny mowy (wcześniej było 92,3 tysiąca uczestników i 3508 godzin). Zestaw dla języka białoruskiego obejmuje 8400 uczestników i 1815 godzin materiału mówionego (wcześniej — 8291 uczestników i 1766 godzin), języka rosyjskiego — 3241 uczestników i 277 godzin (wcześniej 3206 uczestników i 274 godziny), języka uzbeckiego — 2189 uczestników i 265 godzin (wcześniej 2170 uczestników i 264 godziny), języka ukraińskiego — 1091 uczestników i 113 godzin (wcześniej 1075 uczestników i 112 godzin).
Projekt Common Voice koncentruje się na organizacji wspólnej pracy nad gromadzeniem bazy wzorców głosowych, która uwzględnia wszelkie różnorodności głosów i manier mowy. Użytkownicy są zachęcani do wymawiania wyświetlanych na ekranie zdań lub oceny jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnorodnej wymowy typowych fraz mowy ludzkiej bez ograniczeń można wykorzystać w systemach uczenia maszynowego oraz w projektach badawczych.
Źródło: opennet.ru
