Die Mozilla Corporation hat die SprachdatensĂ€tze von Common Voice aktualisiert, die Sprachbeispiele von ĂŒber 200.000 Personen enthalten. Die Daten sind als Gemeinebeseitz (CC0) veröffentlicht. Die angebotenen SĂ€tze können in maschinellen Lernsystemen zur Erstellung von Sprach- und Synthesemodellen verwendet werden. Im Vergleich zur letzten Aktualisierung hat sich das Volumen des Sprachmaterials in der Sammlung von 31,8 auf 32,6 Tausend Stunden Sprache erhöht, von denen ĂŒber 20.000 Stunden ĂŒberprĂŒft wurden. Die Anzahl unterstĂŒtzter Sprachen ist von 129 auf 131 gestiegen.
An der Vorbereitung der Materialien in englischer Sprache haben 93.900 Personen teilgenommen, die 3.587 Stunden Sprache diktierten (es waren 93.300 Teilnehmer und 3.554 Stunden). Das Set fĂŒr die belarussische Sprache umfasst 8.444 Teilnehmer und 1.846 Stunden Sprachmaterial (es waren 8.400 Teilnehmer und 1.815 Stunden), fĂŒr die russische Sprache 3.296 Teilnehmer und 278 Stunden (es war 3.241 Teilnehmer und 277 Stunden), fĂŒr die usbekische Sprache 2.200 Teilnehmer und 265 Stunden (es waren 2.189 Teilnehmer und 265 Stunden), fĂŒr die ukrainische Sprache 1.104 Teilnehmer und 114 Stunden (es waren 1.091 Teilnehmer und 113 Stunden).
Das Projekt Common Voice zielt darauf ab, die Zusammenarbeit zur Ansammlung einer Datenbank von Sprachmustern zu organisieren, die die gesamte Vielfalt von Stimmen und Sprachstilen berĂŒcksichtigt. Den Nutzern wird angeboten, die auf dem Bildschirm angezeigten SĂ€tze zu sprechen oder die QualitĂ€t der von anderen Nutzern hinzugefĂŒgten Daten zu bewerten. Die angesammelte Datenbank mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher SprachsĂ€tze kann ohne EinschrĂ€nkungen in maschinellen Lernsystemen und in Forschungsprojekten verwendet werden.
Quelle: opennet.ru
