Sistemi i mësimit të makinerive Stable Diffusion është adaptuar për sintezën e muzikës.

Projekti Riffusion zhvillon një variant të sistemit të mësimit makinerik Stable Diffusion, të adaptuar për gjenerimin e muzikës në vend të imazheve. Muzika mund të sintetizohet nga një përshkrim tekstual në gjuhën e natyrshme ose në bazë të një shablloni të propozuar. Komponentët për sintezën e muzikës janë shkruar në gjuhën Python duke përdorur framework-un PyTorch dhe janë të disponueshëm nën licencën MIT. Ndërfaqja është realizuar në gjuhën TypeScript dhe gjithashtu shpërndahet nën licencën MIT. Modelet e trajnuara janë të hapura sipas licencës permissive Creative ML OpenRAIL-M, që lejon përdorimin për qëllime komerciale.

Проект интересен тем, что продолжает использовать для генерации музыки модели «из текста в изображение» и «из изображения в изображение», но в качестве изображений манипулирует спектрограммами. Иными словами, классический Stable Diffusion натренирован не на фотографиях и картинках, а на изображениях спектрограмм, отражающих изменение частоты и амплитуды звуковой волны со временем. Соответственно на выходе тоже формируется спектрограмма, которая затем преобразуется в звуковое представление.

Sistemi i mësimit të makinerive Stable Diffusion është adaptuar për sintezën e muzikës.

Metoda mund të përdoret gjithashtu për të ndryshuar kompozitat ekzistuese të zërit dhe për të sintetizuar muzikë sipas një modeli, në analogji me modifikimin e imazheve në Stable Diffusion. Për shembull, gjatë gjenerimit mund të caktohen modele spektrogramesh me stilin referues, të kombinohen stile të ndryshme, të bëhet një kalim i butë nga një stil në tjetrin ose të bëhen ndryshime në zërin ekzistues për të zgjidhur detyra të tilla si rritja e volumit të instrumenteve të veçanta, ndryshimi i ritmit dhe ndërrimi i instrumenteve. Modelet gjithashtu përdoren për të gjeneruar kompozita të gjatë, të përbërë nga një seri fragmentesh që ndodhen afër njëri tjetrit, që pak ndryshojnë me kalimin e kohës. Fragmente të gjeneruara veçmas bashkohen në një rrjedhë të vazhdueshme përmes interpolimit të parametrave të brendshëm të modelit.

Sistemi i mësimit të makinerive Stable Diffusion është adaptuar për sintezën e muzikës.

Për krijimin e spektrogramit nga zëri përdoret transformimi i Feruit me dritare. Kur riprodhohet zëri nga spektrogrami, lind problemi i përcaktimit të fazës (në spektrogram ndodhen vetëm frekuenca dhe amplituda), për rinovimin e së cilës përdoret algoritmi i aproksimimit Griffin-Lim.



Burimi: opennet.ru
Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS 🔥 Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS | ProHoster