Die Mozilla Corporation hat ein Update für die Sprachausgabedaten des Common Voice-Sets veröffentlicht, das Sprachbeispiele von etwa 200.000 Personen umfasst. Die Daten sind als Gemeinwohl (CC0) veröffentlicht. Die vorgeschlagenen Sets können in maschinellen Lernsystemen verwendet werden, um Modelle zur Sprach- und Syntheserecognition zu erstellen.
Im Vergleich zum vorherigen Update hat sich das Volumen des Sprachmaterials in der Sammlung um 10 % erhöht – von 18,2 auf 20,2 Tausend Stunden Sprache. Die Anzahl der unterstützten Sprachen ist von 87 auf 93 gestiegen. Für 27 Sprachen wurden über 100 Stunden Sprachdaten gesammelt, für 9 Sprachen sogar über 500 Stunden. Bei 9 Sprachen gelang es auch, einen Frauenanteil von mindestens 45 % zu erreichen.
An der Erstellung der Materialien in englischer Sprache waren über 81.000 Personen beteiligt, die 2.953 Stunden Sprache diktiert haben (es waren 79.000 Teilnehmer und 2.886 Stunden). Das Set für die belarussische Sprache umfasst 6.326 Teilnehmer und 1.054 Stunden Sprachmaterial (es waren 6.160 Teilnehmer und 987 Stunden), für die russische Sprache 2.585 Teilnehmer und 201 Stunden (es waren 2.452 Teilnehmer und 193 Stunden), für die usbekische Sprache 1.503 Teilnehmer und 231 Stunden (es waren 1.355 Teilnehmer und 227 Stunden), und für die ukrainische Sprache 696 Teilnehmer und 79 Stunden (es waren 684 Teilnehmer und 76 Stunden).
Das Projekt Common Voice zielt darauf ab, die Zusammenarbeit zur Ansammlung einer Datenbank von Sprachmustern zu organisieren, die die gesamte Vielfalt von Stimmen und Sprachstilen berücksichtigt. Den Nutzern wird angeboten, die auf dem Bildschirm angezeigten Sätze zu sprechen oder die Qualität der von anderen Nutzern hinzugefügten Daten zu bewerten. Die angesammelte Datenbank mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher Sprachsätze kann ohne Einschränkungen in maschinellen Lernsystemen und in Forschungsprojekten verwendet werden.
Quelle: opennet.ru
