Un gruppo di ricercatori dell'Università di Tel Aviv ha rilasciato i testi sorgente relativi al sistema di apprendimento automatico MDM (Motion Diffusion Model), che permette di generare movimenti realistici dell'uomo. Il codice è scritto in Python utilizzando il framework PyTorch ed è distribuito con licenza MIT. Per condurre esperimenti, si possono utilizzare sia modelli pronti all'uso sia addestrare i modelli autonomamente utilizzando gli script forniti, ad esempio, impiegando la raccolta di immagini tridimensionali umane HumanML3D. Per l'addestramento del sistema è necessario un GPU con supporto CUDA.
L'uso delle tradizionali capacità per animare i movimenti umani è complicato a causa delle difficoltà legate alla grande varietà di movimenti possibili e alla difficoltà di una loro descrizione formale, così come per l'alta sensibilità della percezione umana ai movimenti innaturali. Le precedenti tentativi di utilizzare modelli generativi di apprendimento automatico hanno avuto problemi di qualità e una limitata espressività.
Nel sistema proposto è stata tentata l'uso di modelli di diffusione per la generazione di movimenti, i quali sono intrinsecamente più adatti alla simulazione dei movimenti umani ma non privi di difetti, come elevati requisiti di calcolo e complessità di gestione. Per minimizzare i difetti dei modelli di diffusione, MDM utilizza una rete neurale con architettura 'transformer' e prevede un campione (sample) invece della previsione di rumore a ogni passo, semplificando la prevenzione di anomalie come la perdita di contatto della superficie con il piede.
Per controllare la generazione è prevista la possibilità di utilizzare una descrizione testuale dell'azione in linguaggio naturale (ad esempio, 'una persona cammina in avanti e si piega per raccogliere qualcosa da terra') o di impiegare azioni standard, come 'corsa' e 'salti'. Il sistema può anche essere applicato per modificare i movimenti e ripristinare i dettagli mancanti. I ricercatori hanno condotto test in cui ai partecipanti veniva chiesto di scegliere tra diverse opzioni il risultato di migliore qualità: nel 42% dei casi le persone hanno preferito i movimenti sintetizzati rispetto a quelli reali.

Fonte: opennet.ru
