Compania Mozilla a lansat o actualizare a seturilor de date vocale Common Voice, incluzând exemple de pronunție de la aproximativ 200.000 de persoane. Datele sunt publicate ca domeniu public (CC0). Seturile propuse pot fi utilizate în sistemele de învățare automată pentru construirea de modele de recunoaștere și sinteză vocală. Comparativ cu actualizarea anterioară, volumul materialului vocal din colecție a crescut cu 30% — de la 13,9 la 18,2 mii ore de vorbire. Numărul limbilor sprijinite a crescut de la 67 la 87.
Setul pentru limba rusă acoperă 2452 de participanți și 193 de ore de material vocal (fuseseră 2136 de participanți și 173 de ore), pentru limba belarusă — 6160 de participanți și 987 de ore (fuseseră 3831 de participanți și 356 de ore), pentru limba ucraineană — 684 de participanți și 76 de ore (fuseseră 615 de participanți și 66 de ore). În pregătirea materialelor în limba engleză au participat peste 79.000 de persoane, care au dictat 2886 de ore de vorbire confirmată (fuseseră 75.000 de participanți și 2637 de ore).
Reamintim că proiectul Common Voice are ca scop organizarea colaborativă a acumulării unei baze de șabloane vocale care să reflecte toată diversitatea vocii și a stilurilor de vorbire. Utilizatorii sunt invitați să pronunțe frazele afișate pe ecran sau să evalueze calitatea datelor adăugate de alți utilizatori. Baza de date acumulată cu înregistrări de pronunție diversă a frazelor tipice ale vorbirii umane poate fi utilizată fără restricții în sistemele de învățare automată și în proiecte de cercetare. Potrivit autorului bibliotecii de recunoaștere a vorbirii continue Vosk, dezavantajele setului Common Voice sunt unilateritatea materialului vocal (predominanța bărbaților cu vârste între 20 și 30 de ani și lipsa materialului cu voci de femei, copii și vârstnici), lipsa de variabilitate a vocabularului (repetarea acelorași fraze) și utilizarea unor înregistrări în format MP3 care distorsionează.
Printre noutăți se numără lansarea instrumentului NVIDIA NeMo 1.6, care oferă metode de învățare automată pentru crearea de sisteme de recunoaștere vocală, sinteză vocală și procesare a informațiilor în limbaj natural. NeMo include modele antrenate gata pentru sisteme de învățare automată bazate pe cadrul PyTorch, dezvoltate de NVIDIA utilizând datele vocale Common Voice și acoperind diverse limbi, accente și forme de vorbire. Modelele pot fi utile pentru cercetătorii care dezvolta sisteme de dialog vocal, platforme de transcriere și centre de apeluri automatizate. De exemplu, NVIDIA NeMo este utilizat în serviciile vocale automatizate ale MTS și Sberbank. Codul NeMo este scris în limbajul Python folosind PyTorch și este distribuit sub licența Apache 2.0.
Sursa: opennet.ro
