Aktualizacja danych głosowych Mozilla Common Voice 8.0

Firma Mozilla zaprezentowała aktualizację zestawów danych głosowych Common Voice, obejmujących przykłady wymowy około 200 tysięcy osób. Dane zostały opublikowane jako własność publiczna (CC0). Proponowane zestawy można wykorzystać w systemach uczenia maszynowego do budowania modeli rozpoznawania i syntezy mowy. W porównaniu do poprzedniej aktualizacji objętość materiału mówionego w kolekcji wzrosła o 30% — z 13,9 do 18,2 tysiąca godzin mowy. Liczba obsługiwanych języków wzrosła z 67 do 87.

Zestaw dla języka rosyjskiego obejmuje 2452 uczestników i 193 godziny materiału dźwiękowego (wcześniej 2136 uczestników i 173 godziny), dla języka białoruskiego — 6160 uczestników i 987 godzin (wcześniej 3831 uczestników i 356 godzin), dla języka ukraińskiego — 684 uczestników i 76 godzin (wcześniej 615 uczestników i 66 godzin). W przygotowaniu materiałów w języku angielskim uczestniczyło ponad 79 tysięcy osób, które nagrały 2886 godzin potwierdzonej mowy (wcześniej 75 tysięcy uczestników i 2637 godzin).

Przypominamy, że projekt Common Voice ma na celu organizację wspólnej pracy nad gromadzeniem bazy wzorców głosowych, uwzględniającej całe bogactwo głosów i stylów mowy. Użytkownicy są zapraszani do wyrównania wyświetlanych na ekranie fraz lub oceniania jakości danych dodanych przez innych użytkowników. Zgromadzoną bazę danych z nagraniami różnych wymów typowych fraz mowy ludzkiej bez ograniczeń można wykorzystać w systemach uczenia maszynowego i w projektach badawczych. Według autora biblioteki rozpoznawania płynnej mowy Vosk, wadami zestawu Common Voice są jednostronność materiału głosowego (przewaga mężczyzn w wieku 20-30 lat oraz brak materiałów z głosami kobiet, dzieci i osób starszych), brak zmienności słownictwa (powtarzanie tych samych fraz) oraz rozpowszechnienie nagrań w formacie MP3, który wprowadza zniekształcenia.

Dodatkowo warto wspomnieć o wydaniu narzędzia NVIDIA NeMo 1.6, które oferuje metody uczenia maszynowego do tworzenia systemów rozpoznawania mowy, syntezatora mowy oraz przetwarzania informacji w języku naturalnym. NeMo zawiera gotowe, wytrenowane modele dla systemów uczenia maszynowego oparte na frameworku PyTorch, przygotowane przez firmę NVIDIA z wykorzystaniem danych mowy Common Voice i obejmujące różne języki, akcenty i formy mowy. Modele te mogą okazać się przydatne dla badaczy zajmujących się tworzeniem systemów dialogowych, platform transkrypcyjnych oraz zautomatyzowanych call center. Na przykład, NVIDIA NeMo jest wykorzystywane w zautomatyzowanych usługach głosowych MTS i Sberbanku. Kod NeMo jest napisany w języku Python z użyciem PyTorch i udostępniany na licencji Apache 2.0.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster