Firma Mozilla zaktualizowała zestawy danych głosowych Common Voice, zawierające przykłady wymowy ponad 200 tysięcy osób. Dane zostały opublikowane jako domena publiczna (CC0). Proponowane zestawy można wykorzystać w systemach uczenia maszynowego do budowy modeli rozpoznawania i syntezy mowy. W porównaniu do poprzedniej aktualizacji, objętość materiału mowy w kolekcji wzrosła z 32,6 do 33,1 tysiąca godzin, z czego 22,1 tysiąca godzin przeszło procedurę weryfikacji. Liczba obsługiwanych języków wzrosła z 129 do 133 — dodano języki aragoński, isindebele, południowo soto i tupuuri.
W przygotowaniu materiałów w języku angielskim wzięło udział 94,9 tysiąca osób, które nagrały 3631 godzin mowy (wcześniej 93,9 tysiąca uczestników i 3587 godzin). Zestaw dla języka białoruskiego obejmuje 8521 uczestników i 1860 godzin materiału głosowego (wcześniej — 8444 uczestników i 1846 godzin), języka rosyjskiego — 3365 uczestników i 281 godzin (wcześniej 3296 uczestników i 278 godzin), uzbeckiego — 2211 uczestników i 265 godzin (wcześniej 2200 uczestników i 265 godzin), języka ukraińskiego — 1120 uczestników i 114 godzin (wcześniej 1104 uczestników i 114 godzin).
Projekt Common Voice organizuje wspólną pracę nad gromadzeniem bazy wzorców głosowych, uwzględniającą różnorodność głosów i stylów mowy. Użytkownicy są proszeni o odczytanie wyświetlanych na ekranie fraz lub ocenę jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnorodnej wymowy standardowych fraz mowy ludzkiej można bez ograniczeń wykorzystać w systemach uczenia maszynowego i w projektach badawczych.
Źródło: opennet.ru
