Założyciel QEMU i FFmpeg opublikował kodek dźwiękowy TSAC

Francuski matematyk Fabrice Bellard, założyciel projektów QEMU, FFmpeg, BPG, QuickJS, TinyGL i TinyCC, opublikował format kodowania dźwięku TSAC oraz powiązane narzędzia do kompresji i dekompresji plików dźwiękowych. Format ten jest zoptymalizowany do przesyłania danych z bardzo niskim bitrate'em, na przykład 5,5 kb/s dla mono i 7,5 kb/s dla stereo, przy zachowaniu akceptowalnej jakości muzyki i mowy. Użycie TSAC pozwala na spakowanie utworu muzycznego o długości 3,5 minut i częstotliwości próbkowania 44,1 kHz (stereo) w plik o rozmiarze 192 KB, który prawie nie różni się od oryginału dla nieprzeszkolonego ucha. Kod projektu jest udostępniany na licencji MIT.

Jako bazowy przy tworzeniu TSAC wykorzystano kodek dźwiękowy Descript, który został rozszerzony w celu obsługi dźwięku stereo i przekształcony do wykorzystania innego modelu uczenia maszynowego opartego na sieci neuronowej z architekturą typu „transformer”, co umożliwiło zwiększenie stopnia kompresji poprzez rekonstrukcję utraconych szczegółów w oparciu o model percepcji słuchowej człowieka. Model zajmuje około 200 MB w skompresowanej formie i jest zaprezentowany w formie deterministycznej, co gwarantuje uzyskanie tych samych rezultatów niezależnie od wykorzystywanych CPU/GPU i liczby używanych w obliczeniach wątków.

Kodujący może pracować, wykorzystując do obliczeń jedynie CPU (dla przyspieszenia wspierane są instrukcje AVX2), ale dla osiągnięcia wysokiej wydajności zaleca się wykorzystywanie GPU. W obecnej wersji może być stosowane API CUDA dla przyspieszenia z użyciem GPU NVIDIA opartego na mikroarchitekturach Ampere, ADA i Hopper (RTX 3090, RTX 4090, RTX A6000, A100 i H100), które mają co najmniej 4 GB pamięci wideo. Do przekształcania plików dźwiękowych przed kodowaniem stosuje się FFmpeg.

oryginalnystereo 6,21 kb/smono 4,71 kb/sstereo 2,57 kb/s

Warto również zauważyć aktualizację narzędzia ts_zip, rozwijanego przez Bellarda, które służy do efektywnego kompresowania danych tekstowych, wykorzystując mechanizm przewidywania tokenów oparty na systemie uczenia maszynowego oraz dużym modelu językowym RWKV 169M v4. Podczas kompresowania archiwum Wikipedii narzędzie ts_zip umożliwiło skompresowanie danych w stosunku 7.3 do 1, a przy kompresji kodu jądra Linux 1.2 — w stosunku 7.8 do 1. Dla porównania, poziomy kompresji przy użyciu narzędzia xz wyniosły odpowiednio 4.7 i 5.5 razy. Cené wysokiej efektywności kompresji są niska prędkość kompresji oraz wysokie wymagania dotyczące zasobów (minimum 4 GB RAM). Na systemie z GPU RTX 4090 wydajność kompresji wynosi około 1 MB/s.

Źródło: opennet.ru

Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS 🔥 Kup solidny hosting stron z ochroną przed DDoS, serwery VPS VDS | ProHoster