Un groupe de chercheurs de l'Université de Tel-Aviv a publié les textes sources liés au système d'apprentissage automatique MDM (Motion Diffusion Model), permettant de générer des mouvements humains réalistes. Le code est écrit en Python en utilisant le framework PyTorch et est distribué sous licence MIT. Pour mener des expériences, il est possible d'utiliser des modèles préexistants ou de former des modèles par soi-même à l'aide des scripts proposés, par exemple en utilisant la collection d'images 3D humaines HumanML3D. Un GPU avec support CUDA est requis pour former le système.
L'application des capacités traditionnelles pour animer les mouvements humains est compliquée en raison des défis liés à la grande variété des mouvements possibles et à la difficulté de leur description formelle, ainsi que de la grande sensibilité de la perception humaine aux mouvements non naturels. Les tentatives antérieures d'utiliser des modèles génératifs d'apprentissage automatique avaient des problèmes de qualité et d'expressivité limitée.
Dans le système proposé, une tentative a été faite d'utiliser des modèles de diffusion pour la génération de mouvements, qui sont intrinsèquement mieux adaptés à la simulation des mouvements humains, mais ne sont pas sans inconvénients, tels que de fortes exigences en ressources de calcul et la complexité de gestion. Pour minimiser les inconvénients des modèles de diffusion, MDM implique un réseau neuronal avec une architecture de type 'transformer' et prévoit la prédiction d'un échantillon au lieu de la prédiction du bruit à chaque étape, ce qui simplifie la prévention des anomalies, telles que la perte de contact de la surface avec le pied.
Pour contrôler la génération, il est prévu d'utiliser une description textuelle de l'action en langage naturel (par exemple, « un homme avance et se penche pour ramasser quelque chose par terre ») ou d'utiliser des actions standard, telles que « courir » et « sauter ». Le système peut également être appliqué pour éditer des mouvements et compléter des détails manquants. Des tests ont été effectués par les chercheurs, où les participants devaient choisir parmi plusieurs options la meilleure qualité de résultat — dans 42 % des cas, les gens ont préféré les mouvements synthétisés plutôt que réels.

Source : opennet.ru
