Der Gründer von QEMU und FFmpeg hat den Audiocodec TSAC veröffentlicht.

Der französische Mathematiker Fabrice Bellard, der in seiner Zeit Projekte wie QEMU, FFmpeg, BPG, QuickJS, TinyGL und TinyCC ins Leben rief, veröffentlichte das Audio-Codierungsformat TSAC sowie die dazugehörigen Werkzeuge zur Komprimierung und Dekomprimierung von Audiodateien. Das Format ist auf die Übertragung von Daten mit einer sehr niedrigen Bitrate ausgerichtet, zum Beispiel 5,5 kb/s für Mono und 7,5 kb/s für Stereo, bei gleichzeitiger Beibehaltung einer akzeptablen Qualität für Musik und Sprache. Die Verwendung von TSAC ermöglicht es, ein musikalisches Stück mit einer Länge von 3,5 Minuten und einer Abtastrate von 44,1 kHz (Stereo) in einer Datei von 192 KB zu verpacken, die für das ungeschulte Ohr kaum vom Original zu unterscheiden ist. Der Code des Projekts wird unter der MIT-Lizenz verbreitet.

Als Grundlage für die Erstellung von TSAC wurde der Audio-Codec Descript verwendet, der für die Unterstützung von Stereo-Sound erweitert und auf ein anderes Modell des maschinellen Lernens umgestellt wurde, das auf einem neuronalen Netzwerk mit einer „Transformator“-Architektur basiert. Dies ermöglichte eine erhöhte Kompressionsrate durch die Rekonstruktion verlorener Details unter Berücksichtigung des menschlichen Hörens. Das Modell benötigt im komprimierten Format etwa 200 MB und ist in einer deterministischen Darstellung gestaltet, die garantiert, dass unabhängig von der verwendeten CPU/GPU und der Anzahl der bei den Berechnungen verwendeten Threads das gleiche Ergebnis erzielt wird.

Der Encoder kann berechnend nur CPU verwenden (zur Beschleunigung werden AVX2-Anweisungen unterstützt), jedoch wird empfohlen, zur Erzielung einer hohen Leistung GPU zu nutzen. Derzeit kann die CUDA-API zur Beschleunigung unter Verwendung von NVIDIA-GPUs basierend auf den Mikroarchitekturen Ampere, ADA und Hopper (RTX 3090, RTX 4090, RTX A6000, A100 und H100) verwendet werden, die mindestens über 4 GB Grafikspeicher verfügen. Vor der Kodierung von Audiodateien wird FFmpeg zur Umwandlung eingesetzt.

originalstereo 6,21 kb/smono 4,71 kb/sstereo 2,57 kb/s

Zusätzlich kann das aktualisierte Tool ts_zip, das von Bellard entwickelt wurde, erwähnt werden. Es dient der effizienten Kompression von Textdaten mithilfe eines Token-Vorhersagemechanismus, der auf einem maschinellen Lernsystem und dem großen Sprachmodell RWKV 169M v4 basiert. Bei der Kompression von Wikipedia-Archiven ermöglichte das Tool ts_zip eine Datenkompression von 7,3-fach, während es beim Komprimieren des Linux-Kernel-Codes 1.2 eine Kompression von 7,8-fach erreichte. Zum Vergleich betrugen die Kompressionsraten mit dem Tool xz 4,7 und 5,5-fach. Der Preis für die hohe Kompressionseffizienz ist jedoch eine niedrige Kompressionsgeschwindigkeit und hohe Ressourcenanforderungen (mindestens 4 GB RAM). Auf einem System mit GPU RTX 4090 beträgt die Kompressionsgeschwindigkeit etwa 1 MB/s.

Quelle: opennet.ru

60GB SSD 8Gb DDR4