Aktualisierung der Sprachdaten von Mozilla Common Voice 8.0

Das Unternehmen Mozilla hat ein Update für die Datensätze der Common Voice-Stimmen vorgestellt, das Aussprachebeispiele von etwa 200.000 Menschen enthält. Die Daten wurden als Gemeingut (CC0) veröffentlicht. Die vorgeschlagenen Datensätze können in maschinellen Lernsystemen zur Erstellung von Sprach- und Sprachsynthesemodellen verwendet werden. Im Vergleich zum letzten Update hat sich das Volumen des Sprachmaterials in der Sammlung um 30 % erhöht – von 13,9 auf 18,2 Tausend Stunden Sprache. Die Anzahl der unterstützten Sprachen ist von 67 auf 87 gestiegen.

Das russische Sprachset umfasst 2452 Teilnehmer und 193 Stunden Sprachmaterial (früher waren es 2136 Teilnehmer und 173 Stunden), für die belarussische Sprache sind es 6160 Teilnehmer und 987 Stunden (früher waren es 3831 Teilnehmer und 356 Stunden), für die ukrainische Sprache 684 Teilnehmer und 76 Stunden (früher waren es 615 Teilnehmer und 66 Stunden). Bei der Vorbereitung der Materialien in englischer Sprache haben über 79.000 Personen mitgewirkt, die 2886 Stunden bestätigter Sprache diktiert haben (früher waren es 75.000 Teilnehmer und 2637 Stunden).

Das Projekt Common Voice zielt darauf ab, die gemeinsame Arbeit zur Sammlung einer Datenbasis von Sprachmustern zu organisieren, die die gesamte Vielfalt der Stimmen und Sprechstile berücksichtigt. Nutzern wird angeboten, die auf dem Bildschirm angezeigten Sätze zu vertonen oder die Qualität der von anderen Nutzern hinzugefügten Daten zu bewerten. Die gesammelte Datenbasis mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher Sätze kann ohne Einschränkungen in Systemen des maschinellen Lernens und in Forschungsprojekten verwendet werden. Der Autor der Bibliothek zur Erkennung kontinuierlicher Sprache, Vosk, hebt jedoch die Nachteile des Common Voice-Sets hervor, darunter die Einseitigkeit des Sprachmaterials (Überwiegung von Männern im Alter von 20 bis 30 Jahren und Mangel an Aufnahmen von Frauen, Kindern und älteren Menschen), das Fehlen von Variation im Wortschatz (Wiederholung derselben Phrasen) und die Verbreitung von Aufnahmen im verzerrten MP3-Format.

Zusätzlich ist die Veröffentlichung des NVIDIA NeMo 1.6-Tools erwähnenswert, das Methoden des maschinellen Lernens zur Erstellung von Spracherkennungssystemen, Sprachsynthese und Verarbeitung natürlicher Sprache bereitstellt. NeMo umfasst vortrainierte Modelle für maschinelles Lernen auf Basis des PyTorch-Frameworks, die von NVIDIA unter Verwendung von Sprachdaten aus Common Voice erstellt wurden und eine Vielzahl von Sprachen, Dialekten und Spracharten abdecken. Diese Modelle können für Forscher, die Sprachdialogsysteme, Transkriptionsplattformen und automatisierte Callcenter entwickeln, von Nutzen sein. Zum Beispiel wird NVIDIA NeMo in den automatisierten Sprachdiensten von MTS und Sberbank eingesetzt. Der Code von NeMo ist in Python unter Verwendung von PyTorch geschrieben und wird unter der Apache 2.0-Lizenz bereitgestellt.

Quelle: opennet.ru

Erwerben Sie zuverlässiges Hosting für Websites mit DDoS-Schutz, VPS VDS-Server 🔥 Kaufen Sie zuverlässiges Hosting für Websites mit DDoS-Schutz, VPS VDS-Server | ProHoster