Aktualisierung der Sprachdaten von Mozilla Common Voice 8.0

Das Unternehmen Mozilla hat ein Update fĂŒr die DatensĂ€tze der Common Voice-Stimmen vorgestellt, das Aussprachebeispiele von etwa 200.000 Menschen enthĂ€lt. Die Daten wurden als Gemeingut (CC0) veröffentlicht. Die vorgeschlagenen DatensĂ€tze können in maschinellen Lernsystemen zur Erstellung von Sprach- und Sprachsynthesemodellen verwendet werden. Im Vergleich zum letzten Update hat sich das Volumen des Sprachmaterials in der Sammlung um 30 % erhöht – von 13,9 auf 18,2 Tausend Stunden Sprache. Die Anzahl der unterstĂŒtzten Sprachen ist von 67 auf 87 gestiegen.

Das russische Sprachset umfasst 2452 Teilnehmer und 193 Stunden Sprachmaterial (frĂŒher waren es 2136 Teilnehmer und 173 Stunden), fĂŒr die belarussische Sprache sind es 6160 Teilnehmer und 987 Stunden (frĂŒher waren es 3831 Teilnehmer und 356 Stunden), fĂŒr die ukrainische Sprache 684 Teilnehmer und 76 Stunden (frĂŒher waren es 615 Teilnehmer und 66 Stunden). Bei der Vorbereitung der Materialien in englischer Sprache haben ĂŒber 79.000 Personen mitgewirkt, die 2886 Stunden bestĂ€tigter Sprache diktiert haben (frĂŒher waren es 75.000 Teilnehmer und 2637 Stunden).

Das Projekt Common Voice zielt darauf ab, die gemeinsame Arbeit zur Sammlung einer Datenbasis von Sprachmustern zu organisieren, die die gesamte Vielfalt der Stimmen und Sprechstile berĂŒcksichtigt. Nutzern wird angeboten, die auf dem Bildschirm angezeigten SĂ€tze zu vertonen oder die QualitĂ€t der von anderen Nutzern hinzugefĂŒgten Daten zu bewerten. Die gesammelte Datenbasis mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher SĂ€tze kann ohne EinschrĂ€nkungen in Systemen des maschinellen Lernens und in Forschungsprojekten verwendet werden. Der Autor der Bibliothek zur Erkennung kontinuierlicher Sprache, Vosk, hebt jedoch die Nachteile des Common Voice-Sets hervor, darunter die Einseitigkeit des Sprachmaterials (Überwiegung von MĂ€nnern im Alter von 20 bis 30 Jahren und Mangel an Aufnahmen von Frauen, Kindern und Ă€lteren Menschen), das Fehlen von Variation im Wortschatz (Wiederholung derselben Phrasen) und die Verbreitung von Aufnahmen im verzerrten MP3-Format.

ZusĂ€tzlich ist die Veröffentlichung des NVIDIA NeMo 1.6-Tools erwĂ€hnenswert, das Methoden des maschinellen Lernens zur Erstellung von Spracherkennungssystemen, Sprachsynthese und Verarbeitung natĂŒrlicher Sprache bereitstellt. NeMo umfasst vortrainierte Modelle fĂŒr maschinelles Lernen auf Basis des PyTorch-Frameworks, die von NVIDIA unter Verwendung von Sprachdaten aus Common Voice erstellt wurden und eine Vielzahl von Sprachen, Dialekten und Spracharten abdecken. Diese Modelle können fĂŒr Forscher, die Sprachdialogsysteme, Transkriptionsplattformen und automatisierte Callcenter entwickeln, von Nutzen sein. Zum Beispiel wird NVIDIA NeMo in den automatisierten Sprachdiensten von MTS und Sberbank eingesetzt. Der Code von NeMo ist in Python unter Verwendung von PyTorch geschrieben und wird unter der Apache 2.0-Lizenz bereitgestellt.

Quelle: opennet.ru

Kaufen Sie zuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz, VPS VDS-Server đŸ”„ Kaufen Sie zuverlĂ€ssiges Hosting fĂŒr Websites mit DDoS-Schutz, VPS VDS-Server | ProHoster