Google opublikował kodek audio Lyra do transmisji mowy przy słabej jakości połączenia

Firma Google zaprezentowała nowy kodek audio Lyra, zoptymalizowany pod kątem uzyskania maksymalnej jakości transmisji mowy nawet przy wykorzystaniu bardzo wolnych łączy komunikacyjnych. Kod implementacji Lyra został napisany w C++ i udostępniony na licencji Apache 2.0, jednak wśród zależności wymaganych do działania znajduje się własnościowa biblioteka libsparse_inference.so z implementacją jądra do obliczeń matematycznych. Zaznaczono, że biblioteka własnościowa ma charakter tymczasowy — w przyszłości Google zapowiada opracowanie otwartego zamiennika oraz zapewnienie obsługi różnych platform.

Pod względem jakości przesyłanych danych głosowych przy niskich przepływnościach Lyra wyraźnie przewyższa tradycyjne kodeki wykorzystujące metody cyfrowego przetwarzania sygnału. Aby zapewnić wysoką jakość transmisji głosu przy ograniczonej ilości przesyłanych danych, w Lyrze oprócz standardowych metod kompresji dźwięku i przekształcania sygnałów stosowany jest model mowy oparty na systemie uczenia maszynowego, który pozwala odtworzyć brakujące informacje na podstawie typowych cech mowy. Model używany do generowania dźwięku został wytrenowany z wykorzystaniem kilku tysięcy godzin nagrań głosowych w ponad 70 językach.

Google opublikował kodek audio Lyra do transmisji mowy przy słabej jakości połączenia

Kodek obejmuje koder i dekoder. Działanie kodera polega na wyodrębnianiu parametrów danych głosowych co 40 milisekund, ich kompresji i przesyłaniu do odbiorcy przez sieć. Do transmisji danych wystarcza łącze o przepustowości 3 kilobitów na sekundę. Wyodrębniane parametry dźwięku obejmują logarytmiczne mel-spektrogramy, uwzględniające charakterystykę energii mowy w różnych zakresach częstotliwości i przygotowane z uwzględnieniem modelu ludzkiej percepcji słuchowej.

Google opublikował kodek audio Lyra do transmisji mowy przy słabej jakości połączenia

W dekoderze zastosowano model generatywny, który na podstawie przekazanych parametrów dźwięku odtwarza sygnał mowy. Aby zmniejszyć złożoność obliczeń, wykorzystano lekki model oparty na rekurencyjnej sieci neuronowej, będący odmianą modelu syntezy mowy WaveRNN. Używa on niższej częstotliwości próbkowania, ale równolegle generuje kilka sygnałów w różnych zakresach częstotliwości. Uzyskane sygnały są następnie nakładane na siebie, aby otrzymać jeden sygnał wyjściowy odpowiadający zadanej częstotliwości próbkowania.

W celu przyspieszenia działania zastosowano również wyspecjalizowane instrukcje procesora dostępne w 64-bitowych procesorach ARM. W rezultacie, mimo wykorzystania uczenia maszynowego, kodek Lyra może być używany do kodowania i dekodowania mowy w czasie rzeczywistym na smartfonach ze średniej półki cenowej, zapewniając opóźnienie transmisji sygnału na poziomie 90 milisekund.

Źródło: opennet.ru

Kup niezawodny hosting stron z ochroną DDoS, serwery VPS VDS 🔥 Kup niezawodny hosting stron z ochroną DDoS, serwery VPS VDS - ProHoster