Das Unternehmen Mozilla hat die SprachdatensĂ€tze von Common Voice aktualisiert, die Beispiele fĂŒr die Aussprache von ĂŒber 200.000 Personen enthalten. Die Daten wurden als öffentliches DomĂ€nenwerk (CC0) veröffentlicht. Die vorgeschlagenen DatensĂ€tze können in maschinellen Lernsystemen zum Aufbau von Modellen zur Sprach- und Sprachsynthese verwendet werden. Im Vergleich zum letzten Update hat sich das Volumen des Sprachmaterials in der Sammlung von 32.6 auf 33.1 Tausend Stunden Sprache erhöht, von denen 22.1 Tausend Stunden validiert wurden. Die Anzahl der unterstĂŒtzten Sprachen wurde von 129 auf 133 erhöht â hinzugefĂŒgt wurden die Sprachen Aragonisch, Isindebele, SĂŒd-Sotho und Tupuri.
An der Erstellung der Materialien in englischer Sprache haben 94.9 Tausend Personen teilgenommen, die 3631 Stunden Sprache diktiert haben (es waren 93.9 Tausend Teilnehmer und 3587 Stunden). Der Satz fĂŒr die belarussische Sprache umfasst 8521 Teilnehmer und 1860 Stunden Sprachmaterial (es waren 8444 Teilnehmer und 1846 Stunden), fĂŒr die russische Sprache â 3365 Teilnehmer und 281 Stunden (es waren 3296 Teilnehmer und 278 Stunden), fĂŒr die usbekische Sprache â 2211 Teilnehmer und 265 Stunden (es waren 2200 Teilnehmer und 265 Stunden), fĂŒr die ukrainische Sprache â 1120 Teilnehmer und 114 Stunden (es waren 1104 Teilnehmer und 114 Stunden).
Das Projekt Common Voice organisiert die gemeinsame Arbeit zum Aufbau einer Datenbank von Sprachmustern, die die gesamte Vielfalt von Stimmen und Sprechweisen berĂŒcksichtigt. Den Benutzern wird angeboten, die auf dem Bildschirm angezeigten Phrasen auszusprechen oder die QualitĂ€t der von anderen Benutzern hinzugefĂŒgten Daten zu bewerten. Die gesammelte Datenbank mit Aufnahmen unterschiedlicher Aussprache von typischen Phrasen der menschlichen Sprache kann ohne EinschrĂ€nkungen in maschinellen Lernsystemen und in Forschungsprojekten verwendet werden.
Quelle: opennet.ru
