Firma Mozilla zaktualizowała zestawy danych głosowych Common Voice, obejmujące przykłady wymowy ponad 200 tysięcy osób. Dane te zostały opublikowane jako własność publiczna (CC0). Proponowane zestawy można wykorzystać w systemach uczenia maszynowego do budowy modeli rozpoznawania i syntezy mowy. W porównaniu do poprzedniej aktualizacji, objętość materiału mowy w kolekcji wzrosła z 28,7 do 30,3 tysiąca godzin mowy, z czego 19,7 tysiąca godzin przeszło procedurę weryfikacji. Liczba obsługiwanych języków wzrosła z 114 do 120 (dodano jidysz, łatgalski, liguryjski, osetyński, telugu i zachodni sierra-pueblan nahuatl).
W przygotowaniu materiałów w języku angielskim wzięło udział 90,67 tysiąca osób, które nagrały 3438 godzin mowy (wcześniej było 88,9 tysiąca uczestników i 3347 godzin). Zbiór dla języka białoruskiego obejmuje 8249 uczestników i 1641 godzin materiału mowy (wcześniej było 8205 uczestników i 1632 godziny), dla języka rosyjskiego - 3133 uczestników i 265 godzin (wcześniej 3053 uczestników i 260 godzin), dla uzbeckiego - 2151 uczestników i 264 godziny (wcześniej 2141 uczestników i 263 godziny), dla ukraińskiego - 1058 uczestników i 108 godzin (wcześniej 1024 uczestników i 105 godzin).
Projekt Common Voice koncentruje się na organizacji wspólnej pracy nad gromadzeniem bazy wzorców głosowych, która uwzględnia wszelkie różnorodności głosów i manier mowy. Użytkownicy są zachęcani do wymawiania wyświetlanych na ekranie zdań lub oceny jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnorodnej wymowy typowych fraz mowy ludzkiej bez ograniczeń można wykorzystać w systemach uczenia maszynowego oraz w projektach badawczych.
Źródło: opennet.ru
