Aktualisierung der Sprachdaten von Mozilla Common Voice 7.0

Die Unternehmen NVIDIA und Mozilla haben ein Update der Sprachdatensätze veröffentlicht, die im Rahmen der Initiative Common Voice gesammelt wurden und Beispiele für die Aussprache von 182.000 Menschen enthalten, was einem Anstieg von 25 % im Vergleich zu vor 6 Monaten entspricht. Die Daten wurden als öffentliches Gut (CC0) veröffentlicht. Die vorgeschlagenen Datensätze können in maschinellen Lernsystemen zur Entwicklung von Spracherkennungs- und Sprachsynthesemodellen verwendet werden.

Im Vergleich zum letzten Update hat sich das Volumen des sprachlichen Materials in der Sammlung von 9 auf 13,9 Tausend Stunden Sprache erhöht. Die Anzahl der unterstützten Sprachen ist von 60 auf 76 gestiegen, wobei erstmals die Sprachen Weißrussisch, Kasachisch, Usbekisch, Bulgarisch, Armenisch, Aserbaidschanisch und Baschkirisch hinzugefügt wurden. Der Datensatz für die russische Sprache umfasst 2136 Teilnehmer und 173 Stunden Sprachmaterial (zuvor 1412 Teilnehmer und 111 Stunden), und für die ukrainische Sprache finden sich 615 Teilnehmer und 66 Stunden (zuvor 459 Teilnehmer und 30 Stunden).

An der Erstellung von Materialien in englischer Sprache haben über 75.000 Menschen teilgenommen, die 2637 Stunden bestätigte Sprache diktiert haben (zuvor 66.000 Teilnehmer und 1686 Stunden). Interessant ist, dass die Sprache Ruanda mit 2260 Stunden die zweitgrößte Sammlung an Daten aufweist. Danach folgen Deutsch (1040), Katalanisch (920) und Esperanto (840). Zu den am schnellsten wachsenden Sprachen mit Sprachdaten gehören Thai (Zuwachs der Datenbasis um das 20-Fache, von 12 auf 250 Stunden), Luganda (von 8 auf 80 Stunden), Esperanto (von 100 auf 840 Stunden) und Tamil (von 24 auf 220 Stunden).

Im Rahmen seiner Teilnahme am Projekt Common Voice hat die Firma NVIDIA auf Basis der gesammelten Daten vortrainierte Modelle für maschinelles Lernen (unterstützt PyTorch) entwickelt. Die Modelle werden im Rahmen des kostenlosen und offenen Tools NVIDIA NeMo verteilt, das beispielsweise bereits in den automatisierten Sprachdiensten von MTS und Sberbank verwendet wird. Die Modelle sind auf die Nutzung in Sprach- und Sprachsynthesesystemen sowie in Systemen zur Verarbeitung natürlicher Sprache ausgerichtet und könnten für Forscher, die an der Erstellung von Sprachdialogsystemen, Transkriptionsplattformen und automatisierten Callcentern arbeiten, von Nutzen sein. Im Gegensatz zu früher verfügbaren Projekten beschränken sich die veröffentlichten Modelle nicht auf die Erkennung der englischen Sprache und umfassen verschiedene Sprachen, Akzente und Spracharten.

Wir erinnern daran, dass das Projekt Common Voice darauf abzielt, die gemeinsame Arbeit zur Ansammlung einer Datenbank von Sprachmustern zu organisieren, die die gesamte Vielfalt der Stimmen und Sprechweisen berücksichtigt. Benutzern wird angeboten, die auf dem Bildschirm angezeigten Phrasen zu sprechen oder die Qualität von Daten zu bewerten, die von anderen Benutzern hinzugefügt wurden. Die angesammelte Datenbank mit Aufnahmen unterschiedlicher Aussprachen typischer menschlicher Sprachphrasen kann ohne Einschränkungen in Systemen des maschinellen Lernens und in Forschungsprojekten verwendet werden.

Nach Meinung des Autors der Bibliothek zur Erkennung fließender Sprache Vosk sind die Nachteile des Sets Common Voice die einseitige Sprachmaterial (vorausgesetzt Überzahl männlicher Stimmen im Alter von 20-30 Jahren und Mangel an Material mit Frauen-, Kinder- und älteren Stimmen), das Fehlen von Variabilität im Wortschatz (Wiederholung derselben Phrasen) und die Verbreitung von Aufnahmen im verzerrenden Format MP3.

Quelle: opennet.ru

60GB SSD 8Gb DDR4