Firma Mozilla zaprezentowała aktualizację zestawów danych głosowych Common Voice, w których znajdują się przykłady wymowy około 200 tysięcy osób. Dane zostały opublikowane jako własność publiczna (CC0). Proponowane zestawy można wykorzystać w systemach uczenia maszynowego do budowy modeli rozpoznawania i syntezowania mowy.
W porównaniu do poprzedniej aktualizacji, objętość materiału głosowego w kolekcji zwiększyła się o 10% — z 18,2 do 20,2 tysiąca godzin mowy. Liczba obsługiwanych języków wzrosła z 87 do 93. Dla 27 języków zgromadzono ponad 100 godzin danych głosowych, a dla 9 — ponad 500 godzin danych głosowych. W przypadku 9 języków udało się również osiągnąć udział mowy kobiet wynoszący co najmniej 45%.
W przygotowaniu materiałów w języku angielskim wzięło udział ponad 81 tysięcy osób, które nagrały 2953 godziny mowy (wcześniej 79 tysięcy uczestników i 2886 godzin). Zestaw dla języka białoruskiego obejmuje 6326 uczestników i 1054 godziny materiału głosowego (wcześniej 6160 uczestników i 987 godzin), języka rosyjskiego — 2585 uczestników i 201 godzin (wcześniej 2452 uczestników i 193 godziny), języka uzbeckiego — 1503 uczestników i 231 godzin (wcześniej 1355 uczestników i 227 godzin), języka ukraińskiego — 696 uczestników i 79 godzin (wcześniej 684 uczestników i 76 godzin).
Projekt Common Voice koncentruje się na organizacji wspólnej pracy nad gromadzeniem bazy wzorców głosowych, która uwzględnia wszelkie różnorodności głosów i manier mowy. Użytkownicy są zachęcani do wymawiania wyświetlanych na ekranie zdań lub oceny jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnorodnej wymowy typowych fraz mowy ludzkiej bez ograniczeń można wykorzystać w systemach uczenia maszynowego oraz w projektach badawczych.
Źródło: opennet.ru
