Një grup hulumtuesish nga Universiteti i Tel Avivit ka publikuar kodin burimor të lidhur me sistemin e mësimit të makinerive MDM (Motion Diffusion Model), i cili lejon gjenerimin e lëvizjeve realiste të njerëzve. Kodi është shkruar në gjuhën Python duke përdorur kornizën PyTorch dhe shpërndahet nën licencën MIT. Për të kryer eksperimente, mund të përdoren modele të gatshme, si dhe të kryhet stërvitja e modeleve vetë me ndihmën e skripteve të ofruara, për shembull, duke përdorur koleksionin e imazheve tre-dimensionale të njeriut HumanML3D. Për të trajnuar sistemin, nevojitet një GPU me mbështetje CUDA.
Aplikimi i mundësive tradicionale për animimin e lëvizjeve të njerëzve është i vështirë për shkak të komplikimeve që lidhen me ndryshueshmërinë e madhe të lëvizjeve të mundshme dhe vështirësinë e përshkrimit të tyre formal, si dhe për shkak të ndjeshmërisë së madhe të perceptimit njerëzor ndaj lëvizjeve të paqëndrueshme. Përpjekjet e mëparshme për të përdorur modelet gjenerative të mësimit të makinerive patën probleme me cilësinë dhe shprehshmërinë e kufizuar.
Në sistemin e propozuar, është bërë një përpjekje për të përdorur modele difuzive për gjenerimin e lëvizjeve, të cilat në thelb janë më të përshtatshme për simulimin e lëvizjeve të njerëzve, por nuk janë pa mangësi, siç janë kërkesat e larta për burime kompjuterikë dhe vështirësia e menaxhimit. Për të minimizuar mangësitë e modeleve difuzive, në MDM është angazhuar një rrjet neuro me një arkitekturë 'transformer' dhe parashikimi i mostrave (sample) në vend të parashikimit të zhurmës në çdo hap, që e thjeshton parandalimin e anomalive, siç është humbja e kontaktit të sipërfaqes me këmbën.
PĂ«r tĂ« kontrolluar gjenerimin, Ă«shtĂ« parashikuar mundĂ«sia e pĂ«rdorimit tĂ« pĂ«rshkrimeve tekstuale tĂ« veprimeve nĂ« gjuhĂ«n e natyrshme (p.sh., 'njĂ« njeri ecĂ«n pĂ«rpara dhe pĂ«rkulet pĂ«r tĂ« marrĂ« ndonjĂ« gjĂ« nga toka') ose pĂ«rdorimi i veprimeve model si 'vrapim' dhe 'kĂ«rcime'. Sistemi mund tĂ« pĂ«rdoret gjithashtu pĂ«r tĂ« redaktuar lĂ«vizjet dhe pĂ«r tĂ« plotĂ«suar detajet e humbura. Hulumtuesit realizuan njĂ« testim, ku pjesĂ«marrĂ«sit u kĂ«rkuan tĂ« zgjidhnin rezultatin mĂ« cilĂ«sor nga disa variante â nĂ« 42% tĂ« rasteve, njerĂ«zit preferuan lĂ«vizjet e sintetizuara ndaj atyre reale.

Burimi: opennet.ru
