Il fondatore di QEMU e FFmpeg ha pubblicato il codec audio TSAC

Il matematico francese Fabrice Bellard, fondatore dei progetti QEMU, FFmpeg, BPG, QuickJS, TinyGL e TinyCC, ha pubblicato il formato di codifica audio TSAC e gli strumenti correlati per la compressione e la decompressione dei file audio. Il formato è orientato alla trasmissione di dati a bassissimo bit rate, ad esempio, 5.5 kb/s per il mono e 7.5 kb/s per lo stereo, mantenendo una qualità accettabile per la musica e il parlato. L'uso di TSAC permette di comprimere una composizione musicale della durata di 3.5 minuti e con frequenza di campionamento di 44.1 kHz (stereo) in un file di dimensione 192 KB, che sarà quasi indistinguibile dall'originale per l'orecchio di un ascoltatore non esperto. Il codice del progetto è distribuito con licenza MIT.

Come base per la creazione di TSAC è stato utilizzato il codec audio Descript, ampliato per supportare il suono stereo e adattato per utilizzare un modello di machine learning basato su una rete neurale con architettura "transformer", che ha consentito di aumentare il tasso di compressione ricostruendo i dettagli persi in base al modello di percezione uditiva umana. Il modello occupa circa 200 MB in forma compressa ed è presentato in una forma deterministica, che garantisce di ottenere lo stesso risultato indipendentemente dai CPU/GPU utilizzati e dal numero di thread coinvolti nei calcoli.

Il codec può funzionare utilizzando solo la CPU per i calcoli (per aumentare la velocità, sono supportate le istruzioni AVX2), ma per ottenere elevate prestazioni si raccomanda di utilizzare la GPU. Nella versione attuale è possibile utilizzare l'API CUDA per l'accelerazione con GPU NVIDIA basate su architetture Ampere, ADA e Hopper (RTX 3090, RTX 4090, RTX A6000, A100 e H100), che abbiano almeno 4 GB di memoria video. Per la conversione dei file audio prima della codifica viene utilizzato FFmpeg.

originalstereo 6.21 kb/smono 4.71 kb/sstereo 2.57 kb/s

In aggiunta, si segnala l'aggiornamento dell'utilità ts_zip, sviluppata da Bellar, destinata alla compressione efficace dei dati testuali, utilizzando un meccanismo di previsione dei token basato su un sistema di machine learning e il grande modello linguistico RWKV 169M v4. Durante la compressione di un archivio di Wikipedia, l'utilità ts_zip ha consentito di comprimere i dati di 7,3 volte, mentre per la compressione del codice del kernel Linux 1.2 è stata di 7,8 volte. A titolo di confronto, i livelli di compressione ottenuti con l'utilità xz sono stati rispettivamente di 4,7 e 5,5 volte. Il prezzo dell'elevata efficienza di compressione è una bassa velocità di compressione e grandi requisiti di risorse (minimo 4 GB di RAM). Su un sistema con GPU RTX 4090, le prestazioni di compressione sono di circa 1 MB/s.

Fonte: opennet.ru

Acquista un hosting affidabile per siti web con protezione DDoS, VPS VDS server 🔥 Acquista un hosting affidabile per siti web con protezione DDoS, VPS VDS server | ProHoster