Firma Mozilla zaktualizowała zestawy danych głosowych Common Voice, które zawierają przykłady wymowy ponad 200 tysięcy osób. Dane zostały opublikowane jako własność publiczna (CC0). Proponowane zestawy można wykorzystywać w systemach uczenia maszynowego do budowy modeli rozpoznawania i syntezy mowy. W porównaniu do poprzedniej aktualizacji objętość materiału mowy w kolekcji zwiększyła się z 31,8 do 32,6 tysiąca godzin mowy, z czego ponad 20 tysięcy godzin przeszło procedurę weryfikacji. Liczba obsługiwanych języków wzrosła z 129 do 131.
W przygotowaniu materiałów w języku angielskim wzięło udział 93,9 tysiąca osób, które nagrały 3587 godzin mowy (wcześniej 93,3 tysiąca uczestników i 3554 godziny). Zestaw dla języka białoruskiego obejmuje 8444 uczestników i 1846 godzin materiału mowy (wcześniej — 8400 uczestników i 1815 godzin), dla języka rosyjskiego — 3296 uczestników i 278 godzin (wcześniej 3241 uczestnik i 277 godzin), dla uzbeckiego — 2200 uczestników i 265 godzin (wcześniej 2189 uczestników i 265 godzin), dla języka ukraińskiego — 1104 uczestników i 114 godzin (wcześniej 1091 uczestnik i 113 godzin).
Projekt Common Voice koncentruje się na organizacji wspólnej pracy nad gromadzeniem bazy wzorców głosowych, która uwzględnia wszelkie różnorodności głosów i manier mowy. Użytkownicy są zachęcani do wymawiania wyświetlanych na ekranie zdań lub oceny jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnorodnej wymowy typowych fraz mowy ludzkiej bez ograniczeń można wykorzystać w systemach uczenia maszynowego oraz w projektach badawczych.
Źródło: opennet.ru
