Die Mozilla Corporation hat die Sprachdatensätze von Common Voice aktualisiert, die Aussprachebeispiele von über 200.000 Personen enthalten. Die Daten wurden als Gemeingut (CC0) veröffentlicht. Die angebotenen Datensätze können in maschinellen Lernsystemen zum Aufbau von Spracherkennungs- und Sprachsynthesemodellen verwendet werden. Im Vergleich zum letzten Update hat sich das Volumen des Sprachmaterials in der Sammlung von 31,1 auf 31,8 Tausend Stunden Sprache erhöht, von denen 20,8 Tausend Stunden geprüft wurden. Die Anzahl der unterstützten Sprachen ist von 124 auf 129 gestiegen (es wurden Sprachen der afrikanischen Stämme Xhosa, Kalenjin, Kĩdavo, Dholuo und Tswana hinzugefügt).
An der Erstellung von Materialien in englischer Sprache waren 93.300 Personen beteiligt, die 3.554 Stunden Sprache diktiert haben (es waren 92.300 Teilnehmer und 3.508 Stunden). Der Satz für die belarussische Sprache umfasst 8.400 Teilnehmer und 1.815 Stunden Sprachmaterial (vorher waren es 8.291 Teilnehmer und 1.766 Stunden), für Russisch - 3.241 Teilnehmer und 277 Stunden (vorher 3.206 Teilnehmer und 274 Stunden), für Usbekisch - 2.189 Teilnehmer und 265 Stunden (vorher 2.170 Teilnehmer und 264 Stunden), für die ukrainische Sprache - 1.091 Teilnehmer und 113 Stunden (vorher 1.075 Teilnehmer und 112 Stunden).
Das Projekt Common Voice zielt darauf ab, die Zusammenarbeit zur Ansammlung einer Datenbank von Sprachmustern zu organisieren, die die gesamte Vielfalt von Stimmen und Sprachstilen berücksichtigt. Den Nutzern wird angeboten, die auf dem Bildschirm angezeigten Sätze zu sprechen oder die Qualität der von anderen Nutzern hinzugefügten Daten zu bewerten. Die angesammelte Datenbank mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher Sprachsätze kann ohne Einschränkungen in maschinellen Lernsystemen und in Forschungsprojekten verwendet werden.
Quelle: opennet.ru
