Mozilla ogłosiła wydanie 18. zestawu danych Common Voice, który jest teraz dostępny do pobrania. Zestaw danych jest częścią strategii Mozilla mającej na celu zapewnienie szerszego dostępu do technologii głosowych. To bezpłatny zestaw danych wielojęzycznych fragmentów głosowych i powiązanych danych tekstowych, który jest rozpowszechniany na licencji CC0 (domena publiczna). Tworzenie zestawu danych to wspólna praca społeczności, w tym uczestników dostarczających głos i tekst, aktywistów w dziedzinie języków, techników, naukowców i innych członków społeczności Common Voice.
Całkowity czas zestawu danych Common Voice osiągnął 31 841 godziny, z czego 20 789 godzin danych głosowych zostało zweryfikowanych przez społeczność. To o 700 godzin więcej danych głosowych w porównaniu do ostatniego wydania zestawu danych i o 381 godzinę więcej nowych danych zweryfikowanych. 18. zestaw danych składa się z fragmentów w 129 językach, w tym 5 nowych języków dodanych w tym wydaniu.
W nowym zestawie danych pojawiło się pięć nowych języków: Kosa (Xhosa, RPA), Kalenjdżin (Kalenjin, Kenia), Dabidi (Kidaw’ida, Kenia), Doluo (Dholuo, Kenia i Tanzania) oraz Tswana (Setswana, Botswana, Zimbabwe, Namibia, RPA). W tych językach mówi setki milionów ludzi na całym świecie, którzy teraz mogą uzyskać lepsze wsparcie w zakresie technologii głosowych.
Jeśli jesteś zainteresowany Common Voice, istnieje wiele sposobów, aby dołączyć do społeczności uczestników. Możesz podzielić się swoim głosem lub napisać i wprowadzić oryginalne propozycje w swoim języku, aby pomóc stworzyć następny zestaw danych. Jeśli twój język nie jest jeszcze w Common Voice, możesz zażądać jego dodania za pomocą specjalnego formularza. Techniczne wkłady do otwartego projektu na Githubie również są mile widziane.
Mozilla zawsze chętnie przyjmuje opinie na temat nowych wydań. Możesz skontaktować się z nimi na forach Common Voice, porozmawiać z nimi na Matrix lub napisać do zespołu bezpośrednio na adres commonvoice@mozilla.com. Są szczególnie zainteresowani tym, co użytkownicy zestawów danych tworzą lub badają, korzystając z zestawu danych. Lepsze zrozumienie potrzeb użytkowników zestawów danych może pomóc im określić kierunek, który lepiej odpowiada potrzebom użytkowników.
Źródło: linux.org.ru
