Die Mozilla Corporation hat die SprachdatensĂ€tze von Common Voice aktualisiert, die Aussprachebeispiele von ĂŒber 200.000 Personen enthalten. Die Daten wurden als Gemeingut (CC0) veröffentlicht. Die angebotenen DatensĂ€tze können in maschinellen Lernsystemen zum Aufbau von Spracherkennungs- und Sprachsynthesemodellen verwendet werden. Im Vergleich zum letzten Update hat sich das Volumen des Sprachmaterials in der Sammlung von 31,1 auf 31,8 Tausend Stunden Sprache erhöht, von denen 20,8 Tausend Stunden geprĂŒft wurden. Die Anzahl der unterstĂŒtzten Sprachen ist von 124 auf 129 gestiegen (es wurden Sprachen der afrikanischen StĂ€mme Xhosa, Kalenjin, KÄ©davo, Dholuo und Tswana hinzugefĂŒgt).
An der Erstellung von Materialien in englischer Sprache waren 93.300 Personen beteiligt, die 3.554 Stunden Sprache diktiert haben (es waren 92.300 Teilnehmer und 3.508 Stunden). Der Satz fĂŒr die belarussische Sprache umfasst 8.400 Teilnehmer und 1.815 Stunden Sprachmaterial (vorher waren es 8.291 Teilnehmer und 1.766 Stunden), fĂŒr Russisch - 3.241 Teilnehmer und 277 Stunden (vorher 3.206 Teilnehmer und 274 Stunden), fĂŒr Usbekisch - 2.189 Teilnehmer und 265 Stunden (vorher 2.170 Teilnehmer und 264 Stunden), fĂŒr die ukrainische Sprache - 1.091 Teilnehmer und 113 Stunden (vorher 1.075 Teilnehmer und 112 Stunden).
Das Projekt Common Voice zielt darauf ab, die Zusammenarbeit zur Ansammlung einer Datenbank von Sprachmustern zu organisieren, die die gesamte Vielfalt von Stimmen und Sprachstilen berĂŒcksichtigt. Den Nutzern wird angeboten, die auf dem Bildschirm angezeigten SĂ€tze zu sprechen oder die QualitĂ€t der von anderen Nutzern hinzugefĂŒgten Daten zu bewerten. Die angesammelte Datenbank mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher SprachsĂ€tze kann ohne EinschrĂ€nkungen in maschinellen Lernsystemen und in Forschungsprojekten verwendet werden.
Quelle: opennet.ru
