Mozilla hat ein Update der Common Voice SprachdatensĂ€tze vorgestellt, das Aussprachebeispiele von etwa 200.000 Menschen umfasst. Die Daten wurden als Public Domain (CC0) veröffentlicht. Die vorgeschlagenen DatensĂ€tze können in maschinellen Lernsystemen zur Erstellung von Sprach- und Synthesemodellen genutzt werden. Im Vergleich zum letzten Update ist das Volumen des Sprachmaterials in der Sammlung um 30 % gestiegen â von 13,9 auf 18,2 Tausend Stunden Sprache. Die Anzahl der unterstĂŒtzten Sprachen ist von 67 auf 87 gestiegen.
Das Set fĂŒr die russische Sprache umfasst 2452 Teilnehmer und 193 Stunden Sprachmaterial (vorher 2136 Teilnehmer und 173 Stunden), fĂŒr die belarussische Sprache â 6160 Teilnehmer und 987 Stunden (vorher 3831 Teilnehmer und 356 Stunden), fĂŒr die ukrainische Sprache â 684 Teilnehmer und 76 Stunden (vorher 615 Teilnehmer und 66 Stunden). Bei der Erstellung der Materialien in englischer Sprache haben mehr als 79.000 Personen mitgewirkt, die 2886 Stunden bestĂ€tigter Sprache diktiert haben (vorher 75.000 Teilnehmer und 2637 Stunden).
Wir erinnern daran, dass das Projekt Common Voice darauf abzielt, die gemeinsame Arbeit zur Ansammlung einer Datenbasis von Sprachmustern zu organisieren, die die gesamte Vielfalt der Stimmen und Sprechstile berĂŒcksichtigt. Den Nutzern wird angeboten, die auf dem Bildschirm dargestellten Phrasen zu sprechen oder die QualitĂ€t der von anderen Nutzern hinzugefĂŒgten Daten zu bewerten. Die gesammelte Datenbank mit Aufnahmen verschiedener Aussprachen gĂ€ngiger Phrasen menschlicher Sprache kann ohne EinschrĂ€nkungen in maschinellen Lernsystemen und in Forschungsprojekten verwendet werden. Nach Meinung des Autors der Spracherkennungsbibliothek Vosk bestehen die Nachteile des Common Voice Satzes in der einseitigen Vertretung des Sprachmaterials (Ăbergewicht mĂ€nnlicher Stimmen im Alter von 20 bis 30 Jahren und Mangel an Materialien mit Stimmen von Frauen, Kindern und Ă€lteren Menschen), dem Fehlen von VariabilitĂ€t im Wortschatz (Wiederholung der gleichen Phrasen) und der Verbreitung von Aufnahmen im störanfĂ€lligen MP3-Format.
ZusĂ€tzlich kann die Veröffentlichung des NVIDIA NeMo 1.6-Werkzeugs erwĂ€hnt werden, das Methoden des maschinellen Lernens zur Erstellung von Sprach- und Informationsverarbeitungssystemen in natĂŒrlicher Sprache bereitstellt. NeMo umfasst vortrainierte Modelle fĂŒr maschinelles Lernen basierend auf dem PyTorch-Framework, die von NVIDIA mit Hilfe von Sprachdaten aus Common Voice erstellt wurden und verschiedene Sprachen, Akzente und Sprachformen abdecken. Diese Modelle können fĂŒr Forscher nĂŒtzlich sein, die Sprachdialogsysteme, Transkriptionsplattformen und automatisierte Callcenter entwickeln. Zum Beispiel wird NVIDIA NeMo in den automatisierten Sprachdiensten von MTS und Sberbank eingesetzt. Der NeMo-Code ist in Python unter Verwendung von PyTorch geschrieben und steht unter der Lizenz Apache 2.0.
Quelle: opennet.ru
