Firmy NVIDIA i Mozilla zaprezentowały aktualizację zestawów danych głosowych, zebranych w ramach inicjatywy Common Voice, które zawierają przykłady wymowy 182 tysięcy osób, co stanowi wzrost o 25% w porównaniu do 6 miesięcy temu. Dane zostały opublikowane jako dobra publiczne (CC0). Proponowane zestawy można wykorzystać w systemach uczenia maszynowego do budowy modeli rozpoznawania i syntezowania mowy.
W porównaniu z poprzednią aktualizacją, ilość materiału dźwiękowego w kolekcji wzrosła z 9 do 13,9 tysięcy godzin mowy. Liczba obsługiwanych języków wzrosła z 60 do 76, w tym po raz pierwszy dodano wsparcie dla języka białoruskiego, kazachskiego, uzbeckiego, bułgarskiego, armeńskiego, azerskiego i baszkirskiego. Zestaw dla języka rosyjskiego obejmuje 2136 uczestników i 173 godziny materiału dźwiękowego (wcześniej 1412 uczestników i 111 godzin), a dla języka ukraińskiego — 615 uczestników i 66 godzin (wcześniej 459 uczestników i 30 godzin).
W przygotowaniu materiałów w języku angielskim wzięło udział ponad 75 tysięcy osób, które nagrały 2637 godzin potwierdzonej mowy (wcześniej 66 tysięcy uczestników i 1686 godzin). Interesujące jest to, że na drugim miejscu pod względem zgromadzonych danych znalazł się język rwandzki, dla którego zebrano 2260 godzin. Następnie plasują się niemiecki (1040), kataloński (920) i esperanto (840). Spośród najbardziej dynamicznie rozwijających się języków głosowych wymienia się język tajski (wzrost bazy 20 razy, z 12 do 250 godzin), luganda (z 8 do 80 godzin), esperanto (z 100 do 840 godzin) i język tamilski (z 24 do 220 godzin).
W ramach swojego udziału w projekcie Common Voice firma NVIDIA przygotowała na bazie zebranych danych gotowe wytrenowane modele dla systemów uczenia maszynowego (wsparcie dla PyTorch). Modele są dystrybuowane w ramach bezpłatnego i otwartego narzędzia NVIDIA NeMo, które np. jest już wykorzystywane w zautomatyzowanych usługach głosowych MTS i Sberbanku. Modele są skierowane do systemów rozpoznawania mowy, syntezowania mowy oraz przetwarzania informacji w języku naturalnym i mogą okazać się użyteczne dla badaczy zajmujących się tworzeniem systemów dialogowych, platform transkrypcyjnych oraz zautomatyzowanych centrów telefonicznych. W przeciwieństwie do wcześniejszych dostępnych projektów, opublikowane modele nie ograniczają się do rozpoznawania języka angielskiego i obejmują różnorodne języki, akcenty i formy mowy.
Przypomnijmy, że projekt Common Voice ma na celu organizację wspólnej pracy nad gromadzeniem bazy wzorców głosowych, uwzględniającą całe bogactwo głosów i stylów mówienia. Użytkownicy są zachęcani do wymawiania wyświetlanych na ekranie fraz lub oceny jakości danych dodanych przez innych użytkowników. Zgromadzona baza danych z nagraniami różnorodnego wymowy typowych fraz mowy ludzkiej bez ograniczeń może być wykorzystywana w systemach uczenia maszynowego oraz w projektach badawczych.
Według autora biblioteki rozpoznawania mowy ciągłej Vosk, niedoskonałości zestawu Common Voice to jednowymiarowość materiału głosowego (przewaga mężczyzn w wieku 20-30 lat i niedobór materiału z głosami kobiet, dzieci i osób starszych), brak wariacyjności słownika (powtarzanie tych samych fraz) oraz rozpowszechnienie nagrań w formacie MP3, który wprowadza zniekształcenia.
Źródło: opennet.ru
