Firma Mozilla zaprezentowała aktualizację zestawów danych głosowych Common Voice, obejmujących przykłady wymowy około 200 tysięcy osób. Dane zostały opublikowane jako własność publiczna (CC0). Proponowane zestawy można wykorzystać w systemach uczenia maszynowego do budowania modeli rozpoznawania i syntezy mowy. W porównaniu do poprzedniej aktualizacji objętość materiału mówionego w kolekcji wzrosła o 30% — z 13,9 do 18,2 tysiąca godzin mowy. Liczba obsługiwanych języków wzrosła z 67 do 87.
Zestaw dla języka rosyjskiego obejmuje 2452 uczestników i 193 godziny materiału dźwiękowego (wcześniej 2136 uczestników i 173 godziny), dla języka białoruskiego — 6160 uczestników i 987 godzin (wcześniej 3831 uczestników i 356 godzin), dla języka ukraińskiego — 684 uczestników i 76 godzin (wcześniej 615 uczestników i 66 godzin). W przygotowaniu materiałów w języku angielskim uczestniczyło ponad 79 tysięcy osób, które nagrały 2886 godzin potwierdzonej mowy (wcześniej 75 tysięcy uczestników i 2637 godzin).
Przypominamy, że projekt Common Voice ma na celu organizację wspólnej pracy nad gromadzeniem bazy wzorców głosowych, uwzględniającej całe bogactwo głosów i stylów mowy. Użytkownicy są zapraszani do wyrównania wyświetlanych na ekranie fraz lub oceniania jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnych wymów typowych fraz mowy ludzkiej bez ograniczeń można wykorzystać w systemach uczenia maszynowego i w projektach badawczych. Według autora biblioteki rozpoznawania płynnej mowy Vosk, wadami zestawu Common Voice są jednostronność materiału głosowego (przewaga mężczyzn w wieku 20-30 lat oraz brak materiałów z głosami kobiet, dzieci i osób starszych), brak zmienności słownictwa (powtarzanie tych samych fraz) oraz rozpowszechnienie nagrań w formacie MP3, który wprowadza zniekształcenia.
Dodatkowo warto wspomnieć o wydaniu narzędzia NVIDIA NeMo 1.6, które oferuje metody uczenia maszynowego do tworzenia systemów rozpoznawania mowy, syntezatora mowy oraz przetwarzania informacji w języku naturalnym. NeMo zawiera gotowe, wytrenowane modele dla systemów uczenia maszynowego oparte na frameworku PyTorch, przygotowane przez firmę NVIDIA z wykorzystaniem danych mowy Common Voice i obejmujące różne języki, akcenty i formy mowy. Modele te mogą okazać się przydatne dla badaczy zajmujących się tworzeniem systemów dialogowych, platform transkrypcyjnych oraz zautomatyzowanych call center. Na przykład, NVIDIA NeMo jest wykorzystywane w zautomatyzowanych usługach głosowych MTS i Sberbanku. Kod NeMo jest napisany w języku Python z użyciem PyTorch i udostępniany na licencji Apache 2.0.
Źródło: opennet.ru
