Aktualisierung der Sprachdaten Mozilla Common Voice 16.0

Die Firma Mozilla hat die Datenpakete von Common Voice aktualisiert, die Aussprachebeispiele von ĂŒber 200.000 Personen enthalten. Die Daten wurden als Gemeingut (CC0) veröffentlicht. Die vorgeschlagenen Pakete können in maschinellen Lernsystemen zur Erstellung von Sprach- und Synthesemodellen verwendet werden. Im Vergleich zum vorherigen Update ist das Volumen des Sprachmaterials in der Sammlung von 28,7 auf 30,3 Tausend Stunden Sprache gestiegen, davon wurden 19,7 Tausend Stunden ĂŒberprĂŒft. Die Anzahl der unterstĂŒtzten Sprachen hat sich von 114 auf 120 erhöht (neu hinzugekommen sind Jiddisch, Lettgallisch, Ligurisch, Ossetisch, Telugu und Westsierra-Puebla Nahuatl).

Bei der Erstellung der Materialien in englischer Sprache haben 90.670 Personen teilgenommen, die 3.438 Stunden Sprache diktierten (zuvor waren es 88.900 Teilnehmer und 3.347 Stunden). Das Paket fĂŒr die belarussische Sprache umfasst 8.249 Teilnehmer und 1.641 Stunden Sprachmaterial (zuvor — 8.205 Teilnehmer und 1.632 Stunden), fĂŒr die russische Sprache — 3.133 Teilnehmer und 265 Stunden (zuvor 3.053 Teilnehmer und 260 Stunden), fĂŒr die usbekische Sprache — 2.151 Teilnehmer und 264 Stunden (zuvor 2.141 Teilnehmer und 263 Stunden), fĂŒr die ukrainische Sprache — 1.058 Teilnehmer und 108 Stunden (zuvor 1.024 Teilnehmer und 105 Stunden).

Das Projekt Common Voice zielt darauf ab, die Zusammenarbeit zur Ansammlung einer Datenbank von Sprachmustern zu organisieren, die die gesamte Vielfalt von Stimmen und Sprachstilen berĂŒcksichtigt. Den Nutzern wird angeboten, die auf dem Bildschirm angezeigten SĂ€tze zu sprechen oder die QualitĂ€t der von anderen Nutzern hinzugefĂŒgten Daten zu bewerten. Die angesammelte Datenbank mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher SprachsĂ€tze kann ohne EinschrĂ€nkungen in maschinellen Lernsystemen und in Forschungsprojekten verwendet werden.

Quelle: opennet.ru

60GB SSD 8Gb DDR4