Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Naljakas, kuidas avatud mudelite vĂ€ljalaskmise ajalugu, mille on vĂ€lja töötanud ja treeninud ettevĂ”te Stability AI, sarnaneb jĂ€rjestikuste Microsofti operatsioonisĂŒsteemide tĂ”usude ja langustega. PĂ€rast legendaarset ja edukat XP-d, meenutame, ilmus probleemne Vista; siis kaunis «seitsmes» — ja selle jĂ€rel viljatuks osutunud Windows 8. Stable Diffusioni esialgu ebaĂŒhtlane, kuid entusiastide kĂ€tega kohendatud versioon 1.5 jĂ€rgnes avameelselt ebaĂ”nnestunud SD 2.0-le — ebaĂ”nnestunud, kuna see sisaldas ebatĂŒĂŒpilist selliste mudelite jaoks OpenCLIP kooderijat, mis on treenitud vĂ€ga kaheldavalt valitud piltidel API-s avatud LAION-5B andmestikul. Selle valiku kĂ€igus kĂ”rvaldati mitte ainult sobimatud (NSFW) visuaalsed viidatud, vaid ka teosed ja illustratsioonid tuntud kunstnikelt, nagu tuntud Greg Rutkowski. Just viimane ajendas entusiaste pettuma: kui SD 1.5 puhul isegi algversioonis, ilma eriharitud kontrollpunktideta, töötasid lihtsalt stiilide suunised - „epic mediefal fantasy landscape, in the style of Greg Rutkowski” - ja tulemus oli muljetavaldav, siis SD 2.0 ei hakanud enam

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

⇡#istunud — tĂ”usnud, istunud — tĂ”usnud

Muudetud kooderiga (tekstimĂ€rguande digitaalseteks tokeniteks muundamiseks, millega mudel hiljem töötab) ei olnud vĂ”imalik kasutada nimetatud stiile, mis lihtsalt vĂ”ttis entusiasmidelt motivatsiooni "kahe" tĂ€iustamiseks oma kĂ€tega. TĂ”epoolest: siin tuli korraga tegeleda ka sellega, kuidas kohandada juba töötavat nĂ€punĂ€idete koostamise tehnikat uue koodriga ning edasi koolitada mudelit nende piltide ja teemade tuvastamiseks, millega loojad esialgsel treeningperioodil teda ei tutvustanud — ja kvaliteedierinevust "poolteise" genereeritud piltide vahel ei garanteerinud. Jah, standardse SD 1.5 suurusega 512×512 punkte toimus kvaliteedihĂŒpe 768×768, kuid selleks ajaks kasutas kogukond juba aktiivselt suurendajaid, outpaintereid ja muud tööriista pildi lĂ”ppsuure suurendamiseks, nii et SD 2.0 lĂ€ks suuresti mĂ€rkamatuks. SDXL naasis standardse (OpenAI poolt vĂ€lja töötatud ja mida rakendab muu hulgas DALL-E projekt) kooder CLIP — selle kood on samuti avatud, kuid andmebaas, mille peal see on treenitud, erinevalt OpenCLIPist, on proprietary. Lisaks on «Oversized» standardse lĂ”uendi suurus kasvanud 1024×1024 juurde, pluss on ilmunud terve rida tĂ€iendavaid tĂ€iustusi, — nii et entusiasmid asusid rÔÔmuga selle tĂ€iustamisega tegelema. Ja tĂ€naseks peetakse SDXL-i (ka tema hiljuti ilmunud vĂ€hem nĂ”udlikud "rahatĂŒkid", nagu SDXL Turbo ja SDXL Lightning) tĂ”eliselt populaarseks avatud lĂ€htekoodiga pildigeneraatoriks. Siiski vaieldavad SD 1.5 innukad toetajad sellega argumenteeritult, vĂ€ites, et sellised olulised tööriistad nagu ControlNet ei ole SDXL-is veel korralikult ĂŒle viidud.

Ja nii on alates 12. juunist 2024, mil mudeli kood "vabastatakse loodusesse", mis vĂ”imaldab kohalikke genereerimisi, pidanud saabuma "avatud" versioon SD 3 — tĂ€psemalt öeldes, Stable Diffusion 3 Medium (SD3M vĂ”i SD3 2B) koos 2 miljardi tööparameetriga. Üksikasjalikult, meenutame, vastab see number kĂ”igi mudeli perceptronite sisendite kogusummale. Veel varem, aprillis, viis Stability AI liikuma 8-miljoni (parameetrite arvu jĂ€rgi) tĂ€iustatud Stable Diffusion 3 Large, samuti SD3 8B. SDXL 1.0 puhul, meenutame, on 3,5 miljardit parameetrit, kuid SD3M, arendajate vĂ€idete kohaselt, on «kĂ”ige keerukam mudel piltide genereerimiseks, mida me oleme seni loonud». TĂ€hendatud oli, et madalamate videomĂ€lu vajadustega, kui «Oversize», peab see isegi lihtsatele vihjetele vastates nĂ€itama pilte «uue fotorealistlikkuse tasemega». «Kolmiku» eeliste hulka kuulusid ka «enneolematu kvaliteet genereeritud piltidel olevas tĂŒpograafias», «sĂŒgavam arusaam vihjetest tĂ€nu kolme kodeerija koostööle» ja «valmidus tĂ”husaks fine-tuning'iks isegi piiratud andmekogudel».

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Oletati, et entusiastide kogukond, saades endale pikaoodatud mĂ€nguasja, asub seda sama innukalt parandama nagu «poolteist» ja «Oversize» omal ajal. Kuid algusest peale lĂ€ks kĂ”ik valesti: SD3M suutis esimestel tundidel pĂ€rast mudeli failide avaldamist Hugging Face'is ja Civitai's sĂŒĂŒdistada sĂŒgavale pettumusele oma publikule, ja seda kahel korral. Esimene kord — esmapilgul seletamatu idiosĂŒnkraatia vihjete suhtes, mis sisaldavad sĂŒĂŒtut lauset «lamades rohul» (lying on/in the grass); teine — ĂŒlihĂ€marad sĂ”nastused kasutajatingimustes, milles isegi professionaalsed juristid ei suutnud kohe aru saada. Ja kuigi tavalise entusiasti silmis tundub viimane tĂŒhine, mĂ”jutab mudeli edasine areng kĂ”ige otsesemas mĂ”ttes just seaduslikku kĂŒlge kĂŒsimusest — isegi nii kaugele, et areng ei pruugi ĂŒldse jĂ€rgneda.

Eelnevad Stable Diffusion'i avatud lĂ€htekoodiga loometeosed (tĂ€psemalt, avatud nĂ€rvivĂ”rgumasside vÀÀrtused, mis on tasuta allalaadimiseks ja hilisemaks kohapealseks tĂ€itmiseks saadaval), nagu SDXL, olid seotud ĂŒhe tĂŒĂŒpilise generatiivsete mudelitega CreativeML Open RAIL++-M License selliste omadustega nagu „piiramatu, globaalne, mitteeksklusiivne, tasuta, kompensatsioonita, tagasivĂ”etamatu autoriĂ”iguse litsents, mis vĂ”imaldab paljundamist, ettevalmistamist, avalikku esitlust, alaliselt luba andmist ja tĂ€iendavate materjalide jagamist nii mudeli kui ka sellest tuletatud materjalide osas“. „Kolmik“ eeldab aga kahte litsentseerimise varianti: mittekommertsiaalset kasutamist — vĂ€ga vabastavate sĂ”nastustega, nagu „Stability AI annab teile mitteeksklusiivse, globaalse, mitteĂŒlekantava, alaliselt tagasivĂ”etava, tasuta ja piiratud litsentsi intellektuaalomandi osas“ — ja oluliselt koormavama kaubandusliku.

⇡#Rohtu ei tooda head

Vahed, mis ei kesta kaua, leiti, et Stable Diffusion 3 ei ole Open Source. Ja sisuliselt kuulutas ta vĂ€lja boikoti arendajafirmale, soovimata raisata aega ja energiat liialt toore ja vigase mudeli edasiĂ”ppimisele — teades, et Stability AI vĂ”ib igal ajal oma meediajuhtide kapriisi tĂ”ttu tagasi vĂ”tta varasemalt konkreetsele entusiastile antud litsentsi, kes teostas selle edasiĂ”piku. Litsentsileping on sĂ”nastatud nii, et mittejuristide jaoks tekib mulje, nagu oleks SD3M kaubandusliku kasutamise loa tagasivĂ”tmise jĂ€rel endine saaja kohustatud kustutama kĂ”ik loodud tuletised litsentsitud intellektuaalomandist, sealhulgas nii edasiĂ”ppinud mudelid (LoRA, tekstilised vastandid, tĂ€iskohustused) kui ka nende tuletised (tsitaat: „Selle lepingu lĂ”ppemisel peate kustutama ja lĂ”petama igasuguste tarkvara toodete vĂ”i tuletatud tööde kasutamise“) — st teised inimesed, kes on kasutanud neid tuletatud mudeleid oma töö aluseks; eriti mitte kellegi poolt tasustatud, puhtal entusiasmial.

Peagi pĂ€rast seda, kui rahulolematuse laine jĂ”udis stratosfÀÀriliselt kĂ”rgustesse, hakkasid ilmuma teated ametlikelt advokaatidelt, et ei ole kĂ”ik nii halb Ja, ja on oluline, et ĂŒlevaade kasutuskeelust puudutaks vaid mĂ”ningaid abitooteid, mille sulgudega kood Stability AI edastab kaubanduslikule kasutajale (ĂŒtleme, SD3M-i treenimise kiirendamiseks ja optimeerimiseks), kuid ettevĂ”te pole veel selgitanud, mis see tĂ€pselt tĂ€hendab. Lisaks, see, et ettevĂ”te on kolm nĂ€dalat hoidnud vaiki (kui vaadata kĂ€esoleva artikli kirjutamise hetke), alates «kolmiku» avalikustamisest, kahandab arendaja mainet oluliselt enam kui loodud algoritmi genereeritud tĂŒdrukud.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Mis puutub kuulsa muruni, mis on mĂ”ne tunni jooksul muutunud meemiks esialgu Hugging Face-is, ja peaaegu kĂ”igil teistel sarnastel platvormidel Internetis, siis selgus, et sĂ”na „a girl lying on the grass” sisestamine viib «kolmiku» vĂ€ljundis mitte lihtsalt hallutsinatsioonide, vaid ka Ă”udsete ja haige - meditsiinilises mĂ”ttes - kunstnike ja filmitegijate kujutiste ilmumiseni, kes spetsialiseeruvad body horror'ile (palume, kui teie mĂ”istus ja elu on teile kallid, hoiduge sellisest kaugel ja Ă€rge proovige neid fraase pildiga otsingusse trĂŒkkida, kui turvafilter on vĂ€lja lĂŒlitatud). Samuti saavutavad seisev - ja pisut vĂ€hem istuv - inimeste vaated «kolmikust» kindla nelja plussiga, samas kui portreed on mĂ”nikord tĂ€iesti veatud; vĂ€hemalt pole nad halvemad kui pĂ”hiversiooni SDXL 1.0 omad, takistus peitub pigem mingis sisemises tabu inimese keha horisontaalse asendi suhtes.

Vastavalt Emad Mostaque'i kommentaarile, Stability AI asutajale ja endisele (enne mĂ€rtsi 2024) juhile, kes lahkus ettevĂ”ttest, et „tegeleda detsentraliseeritud tehisintellekti projektidega”, SD3M-iga toimuv bruto vĂ€givald, vahetult enne selle avamist piiratud mittekaubanduslikuks kasutamiseks (meenutame, et API suurema SD3 8B mudeli online genereerimiseks, on saadaval partnerite saitide kaudu juba aprillist, kuid selle kaalu on endiselt peidetud), tuleneb praeguse juhtkonna soovist tagada ohutus - „seoses regulatiivsete kohustustega”, mis formuleeriti juba kĂ€esoleva aasta mĂ€rtsis kui Aktseptitav Kasutuspoliitika. Just in the framework of this policy using the generative model SD3M, users are prohibited from "committing, promoting, facilitating, encouraging, planning, inciting, or contributing to further violence, terrorism, or creating content that incites hatred, which discriminates against or threatens a protected group of people (whether based on gender, ethnicity, sexual identity or orientation, religion, etc.)" — so no images of pandas in their natural state fighting rabid dragons! Only cats in funny hats, dogs in cute jackets, bottles with unknown contents, and fresh cookies right out of the oven!

Technically speaking, it seems that the dilution of the model involved simply excluding images of people lying down and other pictures that somehow implied indecent interpretations from the training dataset — and for this reason, the "three" simply "doesn't understand" the meaning of the word "lie down." Alternatively, the updated SD3 architecture has allowed for confident identification of weights on perceptrons that activate during the generation of "unsafe" images — and these weights were selectively zeroed right before the release, a side effect of which was the "forced hallucination." Probably, this can already be compared to a lobotomy: the encoder correctly translates text into tokens, but in the "secured" latent space, these tokens no longer refer to anything specific — and therefore the resulting pixels are arranged on the image somewhat haphazardly.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Given the availability of a full but closed SD3 8B API for several months now and the enthusiastic assurances from media managers at Stability AI that the "compactified" 2B will be almost the same in terms of text perception and image generation quality,AI drawing enthusiasts welcomed the public release of the weights for SD3M on June 12 with great enthusiasm: in the first 24 hours, the model was downloaded 2.7 million times. Sel hetkel on seda siiski vĂ”imalik saada, ehkki veidi keerulisema tee kaudu, kui on tavaline SDXL ja SD 1.5 kontrollpunktide puhul. Tegelikult on tavapĂ€rane tee Civitai veebisaidi poole pöörduda, kust enamus mudeleid laaditakse alla ilma registreerimiseta, kuid alates 17. juunist ja kuni kĂ€esoleva artikli tĂ”lkimiseni on selle saidi „kolmiku” leht ajutises keelus. Ja pĂ”hjus on ĂŒks: SD3M kaubanduslik litsents on kirjutatud nii segaselt, et isegi Civitai juristid vĂ”tsid pausi, et seda tĂ€helepanelikumalt uurida. Kui mĂ”ni entusiasmist treenib oma arvutis LoRA „kolmikule” ja paneb selle Civitai'sse ĂŒles, ja Stability AI otsustab, et tulemus on sobimatu ning tĂŒhistab sĂŒĂŒdlase litsentsi, - kuidas sellisel juhul hostimisveebile kĂ€ituda? Ta ei paigalda lihtsalt oma kontrollpunkte, abitsĂŒkleid ja mudeleid, vaid pakub ka kĂŒlastajatele vĂ”imalust nii pilte pilve genereerida kui ka samu LoRA-sid, tekstipĂ”hiseid inversioone jne treenida. Üldiselt, seni kuni asi kohtus, on modelleid ja kolme neile kaasasolevat tekstiparandajat vĂ”imalik saada ainult oma Stability AI lehelt Hugging Face portaalis.

⇡#Hakkame minema

Kuid on nĂŒanss: et laadimislinkidele juurde pÀÀseda, on vajalik veebisaidil autentimine ja seejĂ€rel nimetatud eelnevalt mainitud raske litsentsilepinguga nĂ”ustumise kinnitamine - siiski on see protseduur tasuta ja Venemaalt tĂ€iesti ligipÀÀsetav. Kokku on valimiseks neli variant mudelit (models) ja neli - tekstiparandajaid (encoders), lisaks kolm standardset töötsĂŒkki ComfyUI keskkonnas teostamiseks, millest oleme millalgi juba rÀÀkinud:

mudelid:

  • sd3_medium.safetensors
  • sd3_medium_incl_clips.safetensors
  • sd3_medium_incl_clips_t5xxlfp8.safetensors
  • sd3_medium_incl_clips_t5xxlfp16.safetensors

kodeerijad:

  • clip_g.safetensors
  • clip_l.safetensors
  • t5xxl_fp8_e4m3fn.safetensors
  • t5xxl_fp16.safetensors

tsĂŒkloid:

  • sd3_medium_example_workflow_basic.json
  • sd3_medium_example_workflow_multi_prompt.json
  • sd3_medium_example_workflow_upscaling.json

KĂ€esolevas „Töötubas” piirdume pĂ”hiversiooni sd3_medium.safetensors (4,2 GB) kasutamisega, kolme kodeerijaga — clip_g.safetensors (1,3 GB), clip_l.safetensors (234 MB) ja t5xxl_fp8_e4m3fn.safetensors (4,7 GB), samuti tsĂŒkloogrammiga sd3_medium_example_workflow_multi_prompt.json. Fakt on see, et meie testmasinal on, meenutamiseks, graafikakaart GeForce GTX 1070, millel on 8 GB videomĂ€lu, ja sellesse mahtu ei pruugi mahtuda suuremad mudelid koos kĂ”igi integreeritud muundajatega. SD 1.5 ja SDXL pĂ”hipunktide puhul on kodeerijad vaikimisi integreeritud pĂ”hifaili, kuid antud juhul on neid muundajaid mitte kaks, vaid kolm, kokku ĂŒle 6 GB — koos ise mudeliga ĂŒletab see juba 10 GB; ja kui vĂ”tta 16-bitine versioon kodeerijast T5XXL, siis on vaja veelgi jĂ”ulisemat graafikakaarti. Kuid juhul, kui esmalt laaditakse videomĂ€lu tekstist tokeniteks muundajad ja seejĂ€rel töötleb mudel neid tokene, on tĂ€iesti piisav ka 6 GB graafikakaardist. Selle vaatenurgast modularne „kolmik” on kahtlemata parem tĂŒĂŒpilisest SDXL pĂ”hipunktist, mis on 5-7 GB suurune.

SD3M on multimodaalsete difusioonitransformaatide (Multimodal Diffusion Transformer, MMDiT) alusel töötav mudel — ja seega eristub see pĂ”himĂ”tteliselt varasemate Stability AI (ja mitte ainult tema) arenduste seast, mis pĂ”hinevad arhitektuuril U-Net, mis on esitatud juba 2015. aastal. „Töötuba” ei ole koht, kus sĂŒveneda sĂŒgavale nende lĂ€henemiste vaheliste erinevuste uurimisse pildi AI genereerimisel; öelda tuleb vaid, et MMDiT tagab suurema mudeli jĂ”udluse, selle vĂ”ime töötada suurema arvu tokenitega (mis omakorda vĂ”imaldab operaatoril sĂ”nastada ĂŒsna ulatuslikke tekstilisi vihjed ning sĂŒsteemil – neist piisavalt tĂ€pselt kinni pidada), aga ka parema kvaliteedi lĂ”ppkokkuvĂ”ttes saadud piltide osas. TĂ€ismÔÔtuline SD3 8B suudab genereerida pilte 4 MP (2048×2048 punkti) lĂ”uenditel ja ĂŒletab DALL-E 3, Midjourney v6 ja Ideogram v1 nendes kategooriates, nagu teksti rekonstrueerimine pildil, saadud pildi tĂ€psus tekstivihje suhtes ja ĂŒldine visuaalne esteetika. Teksti muundamine tokenite vektoriteks toimub siin kohe kolme kodeerijaga (kaks CLIP mudelit ja ĂŒks T5-XXL — „T5”, muide, on Text-To-Text Transfer Transformer) — ja, ĂŒleĂŒldiselt, nad ei pea töötama sama vihjega.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Aga piisavalt eessĂ”nu: lĂ€heme sellele, milleks "Töötuba" on pĂŒhendatud — piltide genereerimisele SD3M mudeli alusel. Kasutame selleks, nagu juba öeldud, ComfyUI töökeskkonda, mille saab alla laadida otsemingist GitHubist. TĂ”stame esile, et see variant on mĂ”eldud ainult NVIDIA graafikakaartide jaoks vĂ”i otse AMD vĂ”i Intel protsessorite kĂ€ivitamiseks (mis on loomulikult oluliselt aeglasem): AMD graafikakaardi omanikud peavad kasutama tööriista pakettide rocm ja pytorch, mis on installitavad pip allalaadimismanajeri kaudu.

PĂ€rast töökeskkonna installimist tuleb varem alla laetud .safetensors failid paigutada: mudelid — ComfyUImodelscheckpoints katalooge, teksti tokenite konverterid — ComfyUImodelsclip. Ja — saame alustada!

⇡#Aeg kiirusel edasi liikuda

Tasub mainida, et AUTOMATIC1111, mis on hĂ€sti tuttav varasemate "Töötubade" lugejatele, mis kĂ€sitlesid AI-piltide genereerimist, on juuni lĂ”puks samuti saavutanud vĂ”imaluse teostada SD3M, kuid ComfyUI tugi uuele mudelile on endiselt kĂ”ige ulatuslikum. Pole ĂŒllatav — kuni ĂŒsna hiljuti oli "makaronide koletise" autor, tuntud entusiastide seas nimega ComfyAnonimous, vĂ”i lihtsalt Comfy, Stability AI töötaja, kus ta töötas muu hulgas ka sise-ettevĂ”tte töökeskkonna kallal, mida kasutavad arendajad ise. Nagu me peagi nĂ€ha saame, nĂ€itab ComfyUI uusim versioon tĂ”epoolest, et selle autori kĂ€es on teatud teadmised selle vastuolulise mudeli toimimise ja ĂŒlesehituse osas — teadmised, millega teiste kohalike teostuste loojad Stable Diffusion 3 Medium jaoks ei saa mĂ”istlikel pĂ”hjustel uhkustada.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

ComfyUI installimine Windowsi kaasaskantavas (portable) versioonis on ÀÀrmiselt lihtne: pĂ€rast vastava ZIP-arhiivi allalaadimist projekti ametlikult lehelt Piisab selle unbundle'i tegemiseks lihtsalt sobivasse kataloogi; eelistatavalt, muidugi, SSD-l pĂ”hinevasse loogilisse jaotisesse, mitte HDD-d, — vahetus mĂ€luseadmest ja mĂ€lu vahel, arvestades tulevasi laadimis-tĂŒhjendamis tsĂŒkleid mudelite jaoks isegi ĂŒheainsa pildi genereerimiseks (keskkonda tuleb kĂ”igepealt laadida videomĂ€lu tekstide tokeniteks teisendajad, seejĂ€rel tĂŒhjendada videomĂ€lu ja laadida SD3M ise) peaks olema seda rohkem mĂ€rkimisvÀÀrne, mida vĂ€hem on antud arvutil videomĂ€lu. Muide, portatiivne installimine on hea ka oma tĂ€ieliku sĂ”ltumatuse poolest: miski — vĂ€lja arvatud vabade ruumide maht loogilisel diskil — ei takista kohalikult kĂ€ivitamast nii palju ComfyUI koopiaid, kui soovite, et katsetada erinevaid laiendusi, kartmata, et rikutakse juba hÀÀlestatud ja suurepĂ€raselt töötavat sĂŒsteemi.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Veenduge, et SD3M pĂ”himasina fail, kus ei ole tekstide tokeniteks kodeerijaid (fail stableDiffusion3SD3_sd3Medium.safetensors, 4,2 GB) on asetatud alamkatalooge checkpoints (meie testinstallatsiooni puhul on tĂ€ielik tee — C:Fun-n-GamesComfyUI-SD3ComfyUImodelscheckpoints), ja kĂ”ik kolm kodeerijate mudelit (failid stableDiffusion3SD3_textEncoderClipG.safetensors, stableDiffusion3SD3_textEncoderClipL.safetensors ja stableDiffusion3SD3_textEncoderT5E4m3fn.safetensors; 1,3 GB, 234 MB ja 4,7 GB vastavalt) — alamkatalooge clip (C:Fun-n-GamesComfyUI-SD3ComfyUImodelsclip). NĂŒĂŒd saab töökeskkonda kĂ€ivitada kahekordse klĂ”psuga failil run_nvidia_gpu.bat juurkataloogis (meie puhul C:Fun-n-GamesComfyUI-SD3). Serveri kĂ€ivitamise jĂ€rel avaneb Windowsi kĂ€surea aknas automaatselt uues vahekaardis, mis pĂ”hineb vaikeseadetel, brauseris aadressil 127.0.0.1/8188 ja seal on kergesti ligipÀÀsetav veebiliides. meie poolt juba tutvustatud (las see jÀÀda ainult esimeses lĂ€henemises) «makaronide kummitusele».

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

PĂ”himĂ”tteliselt, kui teil on kĂ€sutuses uuem NVIDIA graafikakaart (RTX seeriast, mitte GTX, isegi kui sellel on vaid 6 GB videomĂ€lu), saate kohe laadida töökeskkonda tugitsĂŒkli, mille on loonud ComfyAnonimous, millest on juba varem rÀÀgitud — fail comfy_example_workflows_sd3_medium_example_workflow_multi_prompt.json, mis sisaldab mitmeid aknaid sisendi vihjete jaoks, ĂŒhe iga kolme kodeerija jaoks — ja töötada sellega. TĂ”si, kĂ”igepealt peate kuue faili nimed mudelite (nende laadimise sĂ”lmedes) viima kooskĂ”lla olemasolevatega. TugitsĂŒkli autor on ilmselt töötanud oma töökojas (Stability AI-s, nagu juba mainitud) kohalikeks saanud failidega, mille nimed olid veidi teistsugused, nii et kui vajutate nuppu „Queue Prompt” ComfyUI spartani liideses vahetult pĂ€rast tsĂŒkli laadimist, annab töökeskkond veateate.

⇡#Kolme vilja mustand AI genereerimiseks

Kuid seda on ĂŒsna lihtne parandada: palju rohkem masendab see, et olemasolev GTX 1070, mis on oma aja lĂ€bi elanud, töötleb SD3M-d kohutavalt aeglaselt — pildi genereerimise aeg on 27-30 sekundit iga iteratsiooni kohta, ja arvestades, et tugitsĂŒkli parameeter „Steps” on seadistatud vÀÀrtusele „28”, kulub aega ĂŒlemÀÀra palju. SeetĂ”ttu teeme vĂ€ikese optimeerimise — kasutame Python-moodulit venv (virtuaalsed keskkonnad), mis on loodud muu hulgas kiirendama generatiivsete AI mudelite tööd. Portatiivse ComfyUI versiooni komplekti see ei kuulu, kuid paigaldamiseks on mitmeid viise, mis lĂ”puks seisnevad tĂ€ieliku Python keskkonna kĂ€ivitamises kohalikus arvutis — ja vajaliku mooduli aktiveerimises juba sellest keskkonnast.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Loodame, et meie „Ateljeed” jĂ€lgivad lugejad omavad juba aktiivset tööinstalleerimist AUTOMATIC1111 oma masinates. Sellisel juhul on kĂ”ik palju lihtsam: moodul venv on seal juba kĂ€ivitatud ja kĂ”ik, mis on vajalik, et aktiveerida see ComfyUI töökeskkonna kĂ€ivitamisel, on Ă”igesti kutse teostamine. Esiteks tuleks server lĂ”petada, liitudes selle aknaga ja vajutades «Ctrl» + «C», seejĂ€rel sisestage «y» kinnitamiseks; pĂ€rast seda kopeerige BAT-fail run_nvidia_gpu.bat uude, nĂ€iteks run_with_venv.bat nimelisse failisse. Algne kĂ€ivitusfail on ĂŒsna lakooniline — see kutsub lihtsalt esile kaasasoleva Python'i koopia parameetriga —windows-standalone-build:

.python_embededpython.exe -s ComfyUImain.py —windows-standalone-build

pause

See parameeter pole oma olemuselt liiga ĂŒhemĂ”tteline — see viitab teatud optimeeringutele, mis on tĂ”enĂ€oliselt suunatud uuematele NVIDIA graafikakaartidele ja seetĂ”ttu vĂ”ivad halvendada olukorda neil, kes on endiselt truud oma vÀÀrikatele GTX-idele. SeetĂ”ttu eemaldame kĂ€surealt —windows-standalone-build ning loobume ka teisest stiilsest optimeerimisest — vaikimisi aktiveeritud «nutikast mĂ€luhaldurist», smart memory, mis pĂŒĂŒab hoida vĂ”imalikult palju teavet video RAM-is, mitte seda eemaldades. See tĂ”epoolest kiirendab AI-piltide joonistamist, kuid samas muudab meie vaimselt aegunud arvuti ĂŒhesĂŒsteemseks — ei saa enam veebisirvida, mĂ€ngida ega isegi dokumentidena ja postiga töötada, samal ajal kui töökeskkond on aktiivne. Seega, neile, kes ei saa eraldi arvutit AI-kunsti jaoks, tundub optimaalseks selline BAT-fail ComfyUI kĂ€ivitamiseks (mitte ainult SD3M piltide genereerimise eesmĂ€rgil, muide — see sobib ka SDXL jaoks):

@echo off

call cd C:Fun-n-GamesGitstable-diffusion-webuivenvScripts

echo %

call activate.bat

echo venv activated

call cd C:Fun-n-GamesComfyUI-SD3

echo %

call .python_embededpython.exe -s ComfyUImain.py —disable-smart-memory

pause

Siin eeldatakse, et ComfyUI kaasaskantav installatsioon on tehtud katalooge C:Fun-n-GamesComfyUI-SD3 ja AUTOMATIC1111 on varem paigaldatud C:Fun-n-GamesGitstable-diffusion-webui. Rohked «echo» on vajalikud lihtsalt visuaalse kontrolli jaoks, et vahetus direktorites on sujuv ja vajalikud kĂ€sud tĂ€idetakse — pĂ€rast tarkvara tĂ”rkeotsingu lĂ”ppu saab need BAT-failist eemaldada.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

TaaskĂ€ivitame töökeskkonna, seekord kahekordse klĂ”psuga run_with_venv.bat failil. Kuna me lihtsalt sulgesime serveri ja veebiliides jĂ€i puutumatuks, peaks vastavas vahekaardis olema endiselt see sama alusprotsess ComfyUI, millega on modelle nimetatud. Pöörame tĂ€helepanu selle paremale poolele: seal asub sĂ”lm „Preview Image”, mis ei salvesta valmista pilti kĂ”vakettale, vaid lihtsalt demonstreerib seda. Kui iga kord kĂ€ivitada protsess ĂŒhe pildi genereerimiseks, hinnata seda visuaalselt, muuta parameetreid ja uuesti kĂ€ivitada — on see tĂ€iesti toimiv variant: meeldinud pildi saab alati kĂ€sitsi salvestada hiire parema nupuga klĂ”psates. Aga kui töötada keskkonnas jĂ€rjestikku mitme genereerimisega, on parem, kui nende tulemused automaatselt kogunevad pĂŒsivasse mĂ€llu (vaikimisi ComfyUIoutput kataloogis).

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Seega on parem kohe muuta sĂ”lme „Preview Image” sĂ”lmeks „Save Image”. Selleks klĂ”psa vasaku hiire nupuga kahekordselt mĂ”nel vabal kohal protsessis — avaneb sĂ”lmede valimise aken koos otsingureaga. Sellele reale hakkame kirjutama „Save
” — ja peaaegu kohe nĂ€eme vajaliku nime. Edasi jÀÀb vaid sellele klĂ”psata ja ĂŒhendada Ă€sja ilmunud sĂ”lme sisend „IMAGE” sĂ”lmega „VAE Decode”, kuhu algselt oli ĂŒhendatud „Preview Image”. Isegi „Preview Image” saab edaspidi eemaldada — lihtsalt valige see, klĂ”psates pealkirjal, ja vajutage klaviatuuril klahvi „Del”.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Ja nĂŒĂŒd on just Ă”ige aeg kĂ€ivitada alusprotsess ComfyAnonimous autorilt (meie tagasihoidlikud korrektuurid) tĂ€itmiseks. Tulemus on jĂ€rgmine:

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

VĂ€ga muljetavaldav pilt, isegi meeleoluga — ja ei ĂŒtleks, et see on loodud sama mudeli abil, mille puhul on juhend tassitud, et joonistada maapinnal lamavaid inimesi. Samal ajal töötab sĂŒsteem ĂŒsna aktiivselt — umbes 5-6 sekundi jooksul pildi genereerimiseks, mille pindala on 1 Mpiks GTX 1070-l, vĂ”ib pidada korralikuks nĂ€itajaks. VĂ”rdlemiseks: sama arvuti sama ComfyUI-s sama BAT-failiga genereerib SDXL pilte sarnaste suurustega, kulutades umbes 6-7 sekundit iga iteratsiooni jaoks, seega on „kolm” tĂ€iesti Ă”igustatud vĂ€hem nĂ”udlik arvuti riistvarale, millega AI genereerimine toimub.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Korrigeerime nĂŒĂŒd lĂ”uendi mÔÔtmed. Peagi nodi «EmptySD3LatentImage», mis need mÀÀrab, asub lĂ€hedal 'tĂŒhja' (mĂ”ttes, ei ole ĂŒhendatud milleski) abistamise nodi «Note», kus on oluline meeldetuletus: SD3M puhul peaks piltide kogupindala olema umbes 1 Mpx, — seega tuleks valida ristkĂŒliku lĂ”uendi kĂŒlgede suurused. Seame need siis vÀÀrtusteks 1344×768 — see on just umbes 1,03 Mpx ja sobib.

TĂ”mbame tĂ€helepanu: ĂŒlal asub nodi «Seed», kus on mÀÀratud iseasi seeme, sel juhul «945512652412924», ja on mĂ€rkitud, et see ei tohi pĂ€rast genereerimist muutuda (parameeter «fixed»).

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Teostame sama tsĂŒkli varasema seemnega, kuid nĂŒĂŒd ristkĂŒliku lĂ”uendi jaoks. Koheselt on mĂ€rgata, et aega lĂ€heb kokkuvĂ”ttes vĂ€hem, kuigi joonistamise kiirus on jÀÀnud samaks — vĂ€hem kui 6 s iteratsiooni kohta. Ja see on loogiline: kuna tekstilised vihjed ei muutunud, ei ole neid kodereid uuesti laadida vaja. VĂ€ljundpilt on, nagu oodata vĂ”ib, veidi erinev esimesest, ruudukujulisest, kuid mitte pĂ”himĂ”tteliselt — ĂŒldine kompositsioon, nagu oodati, on sĂ€ilinud.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

NĂŒĂŒd pöörame tĂ€helepanu nodidele «CLIPTextEncodeSD3» ja «CLIP Text Encode (Negative Prompt)». Esimene eristub selle poolest, et sisaldab kohe kolme sisendvĂ€lja; kui nende tekst eemaldada, on nĂ€htavad mĂ€rkused, mille jaoks kodeerijad need mĂ”eldud on, — ĂŒlevalt alla on need CLIP G, CLIP L ja T5XXL. Eelnevaid sarnaseid node ComfyUI-s ei olnud pĂ”hjusega. Toetav tsĂŒkkel sisaldab kahekordistuvaid lĂŒhikesi vihjeid kahe esimese tekstivĂ€lja (CLIP G ja CLIP L konverterite jaoks) ning palju mahukamat kolmanda jaoks — T5XXL. Selge on see, et nende vĂ€ljade sisu osas saab laialdaselt mĂ€ngida, ja tekstimuutuse mĂ”ju lĂ”plikule pildile uurimine on mitte triviaalne, kuid ĂŒlihuvitav ĂŒlesanne. Kuid mĂ”ne aja pĂ€rast selguvad pĂ”hjused, nii et me ei tegele selle kiirelt hetkel.

Kuid sĂ”lmes „CLIP Text Encode (Negative Prompt)” ei ole midagi erilist, - kuid hinnake, kui keeruline on teekond selle ja peamise sĂ”lme „KSampler” vastava sisenemise „conditioning” vahel! See tee jaguneb kaheks haruks, kusjuures ĂŒks haru (ĂŒlemine antud juhul) nĂ€itab, et alates 10% genereerimise sammudest ja kuni selle lĂ”petamiseni ei vĂ”ta sĂŒsteem negatiivset sisendit arvesse (tee ĂŒlemise sĂ”lme „ConditioningZeroOut” kaudu tĂ€hendab tingimuse nullimist). Teine haru aga laseb negatiivsel sisendil (samuti tinglikult poole kaaluga) edasi töötlusse ilma muudatusteta - kuid ainult esimese 10% genereerimise kogu sammudest.

⇡#Udune kaugus

Veel kord: esimesed 10%, st 3 28-st mÀÀratud sammudest, negatiivne juhis edastatakse sĂ”lmele „KSampler”, mis tegeleb pildi loomisega latentruumis (piksliruumi, st inimesega arusaadavasse pildiformaati, mille vĂ€ljundi edastab jĂ€rgmine sĂ”lm, „VAE Decoder”), normaalses jĂ€rjekorras: ĂŒlemine haru (tingimuse nullimisega) ei ole aktiivne, vaid töötab ainult alumine. JÀÀnud 90% sammudest (25 28-st meie puhul) negatiivne juhis ei toimi ĂŒldse: aktiivne on just ĂŒlemine haru, kus tingimused on nullitud, samas kui alumine liikumine blokeeritakse vastava sĂ”lme „ConditioningSetTimestepRange” piirarvuga. NĂŒĂŒd on selge, miks mitmed arvustajad vĂ€idavad, et negatiivseid juhiseid SD3M puhul ei ole pĂ”himĂ”tteliselt vaja kasutada, - nende mĂ”ju (kui arvestada just seda, tugitegurit ja oletada, et veebigeneratsioonis mudeli SD3 Medium juures kehtivad sarnased reeglid) on minimaalne.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Ja siiski on see olemas: kui lihtsalt vĂ”tta ja otse ĂŒhendada node 'CLIP Text Encode (Negative Prompt)' vastava 'KSampler' sisendiga (vĂ”i mĂ€rkida kĂ”ik vahepealsed nodid selle tee tingimustega kui 'pĂ”hi', 'Bypass', mis toob sama efekti), siis lĂ”pp-pildi kvaliteet halveneb selgelt. Seda vĂ”ib muide pidada kaudseks tĂ”estuseks 'poolpĂ”letamise' SD3M kohta, kuna arendada negatiivse nĂ€punĂ€ite tugevust ja olulisust, rangelt öeldes, pidi arendajatele olema vĂ”imalik juba enne mudeli kaalude avalikustamist. Kaks kahest keeruliselt seatud tingimuste haru negatiivse nĂ€punĂ€ite rakendamiseks on omamoodi tilk ja sellega seoses entusiastide kurtmine selle ĂŒle, et 'kolmik' jÀÀb selgelt alla Stability AI turundusosakonna poolt selle suhtes seatud ootustele, on tĂ€iesti Ă”igustatud.

Ahnuse mĂ”ningate ametlike juhendite puudumine SD3M kasutamiseks on viinud selleni, et internetis liiguvad kuulujutud, justkui seda mudelit oleks ĂŒldse mitte treenitud negatiivsete nĂ€punĂ€idete rakendamiseks.Mis, muidugi, ei ole tĂ”si, kuid igal juhul tuleb neid nĂ€punĂ€iteid rakendada tĂ€pselt teistmoodi kui SD 1.5 ja SDXL operaatorid on harjunud.EelkĂ”ige vĂ€idavad entusiastid tĂ”siselt, et negatiivsete vĂ€ljendite vĂ€ljakutsumiseks on detailsete kirjelduste lisamine ĂŒha suurematele ebaviisakustele (jah- jah, vana hea 'nsfw, nude' ei piisa - peate tĂ”siselt oma kujutlusvĂ”imet pingutama) toob mĂ€rgatavat parandamist vĂ€limuses isegi kurikuulus tĂŒdruk, kes lamab murul. Kas see nii on vĂ”i ei - ei ole vĂ”imalik kontrollida pĂ”hjaliku kontrollimisega (ja see ei ole isegi kindel, et meie saidi ĂŒlaosas olev '18+' mĂ€rgistus kaitseb meid moraalitunde kaitsjate kaebuste eest, kui riskime avaldamisega, mis on kokku pandud entusiastide 'ime-nĂ€punĂ€itega' - olgu see inglise keeles). See naljakas olukord meenutab juhtumit varakeskaja Ă”petustest paganluse vastu, mille tĂ”ttu - just seetĂ”ttu, et need sisaldasid suhteliselt detaile, milliseid asju ja kuidas ei tohiks korralikud kristlased teha, - on meieni jĂ”udnud isegi killud kirjalikke tĂ”endeid uskumustest ja harjumustest enne kristlikku Vene.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

NĂŒĂŒd tahaks loota, et on selgem, miks sĂŒveneda SD3M uurimisse sel hetkel ei tundu olevat kĂ”ige mĂ”istlikum ajaraisk. Seal on tĂ”epoolest sellest, millest rÀÀkida, ja mida uurida: ja ĂŒsna jĂ€igalt soovitatud genereerimise parameetrid sĂ”lmes „KSampler“ (CFG – 4,5-5,0; sammude arv – umbes 28; paar sampler/scheduler – ainult dpmpp_2m/sgm_uniform, vastasel juhul kvaliteet lasub tĂ”siselt); ja ÀÀrmiselt suur subjektiivse kvaliteedi varieerumine rangelt ĂŒhesuguste algparameetrite puhul, kuid erinevate alamkĂ€skude puhul; ning haledast „rohu peal lamamise needusest“ vabanemine (milleks on juba pakutud ĂŒsna ebatavalised lahendused); ja samuti selguse saavutamine, millistele just parameetritele genereerimine iga kolme tekstist tokeniteks muundaja mĂ”ju avaldab – ja kuidas neid kasutades tĂ”eliselt suurepĂ€raste kunstiteoste loomist saavutada (kui see on „kolmega” ĂŒldse vĂ”imalik, muidugi).

Eriti arvestades, et Emad Mostaqi vallandamine mĂ€rtsis ja ComfyAnonimous'i juunis, ja kaugel mitte ainult nende kahte, – ei ole ainukesed probleemid, mis Stability AI'l on. Reutersi andmetel, viidates The Information'ile, on see briti idufirma just Ă€sja (artikli kirjutamise hetkel) jĂ€rjekordselt vahetanud tegevjuhti , kelleks sai Prem Akkaraju, tuntud globaalsete IT-investeerijate rĂŒhma soovitatud kandidaat – ja see, omakorda, on valmis ettevĂ”ttesse mĂ€rkimisvÀÀrse summa sisenema (rÀÀgime 80 miljonist USA dollarist). Stability AI olukord Ă€riĂŒksusena on praegu ausalt öeldes ebastabiilne; paljud pettunud entusiastid ennustavad sellele kiiret lĂ”ppu – ja sellises olukorras on keeruline oodata ettevĂ”ttelt lĂ€bimĂ”eldud tööd isegi nii ilmsete vigade ĂŒle.

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

MĂ”tlemata litsentsipoliitika hoiab, kahjuks, kogukonda tagasi SD3M iseseisvast tĂ€iustamisest, nagu seda tehti SD 1.5 ja SDXL puhul. Kuid vĂ€hemalt viimased kaks mudelit, koos nende tuletiste checkpoints ja tööriistade, nagu LoRA, jÀÀvad kindlasti lokaalselt kasutatavaks, isegi kui (ja kui) Stability AI lĂ”petab oma tee kui Ă€ri. Kohe pĂ€rast "kolmiku" kohutavat fiaskot hakkasid erialafoorumites rohkem ja rohkem kostma hÀÀli, mis toetasid mittekaubandusliku projekti loomist tekstide piltideks muutmiseks, mis pĂ”hineks rahastamisel — ja praeguseks on see liikumine hakanud kujunema nime alla Open Model Initiative. Valmisolek aktiivselt liituda on juba vĂ€lja öelnud Invoke (ĂŒks platvorme veebipĂ”hiseks AI-geneerimiseks, suunatud professionaalsetele stuudiotele), Comfy Org (meeskond, kes toetab ja arendab ComfyUI-d), Civitai (ei vaja tutvustamist) ja meeskond, kes seisab taga LAION-i (annotatsioonidega piltide andmebaas, millel enamik selliseid mudeleid treenitakse).

Nii et lĂ€hitulevikus on uued "Töötuba" vĂ€ljaanded, tĂ”enĂ€oliselt suunatud mudelitele, mille jaoks on kogukond juba loonud laia kogumi tĂ€iustusi ja lisatööriistu — "poolteist" ja "Oversize". VĂ”ib-olla tuleb SD3M triumf veel, — kuid tĂ€na on raske isegi ennustada, millal tĂ€pselt. Ja seni saavad huvilised alla laadida arhiivi kĂ€esolevas artiklis toodud SD3M generaatsioonidega (tsĂŒkkelogrammid on integreeritud otse PNG-failidesse; piisab, kui lohistada pilt ComfyUI töölauale Windowsi „File Explorerist“, et taastada kogu genereerimise jĂ€rjestus ja parameetrid) siin. VĂ”ib-olla suudab keegi meie lugejatest leida enne Redditi ja Hugging Face'i pidevaid kĂŒlastajaid optimaalse viisi teksti jaotamiseks kolme vĂ€ljundisse, nĂ€iteks?

Uus artikkel: AI-joonistamise praktikum, osa ĂŒheksa: SD3M — "kolm" kolme asja kohta

Teemaga seotud materjalid:

Stability AI vahetas juhtkonda ja tÔi sisse 80 miljonit dollarit investeeringuid.

Esitatud on AI-piltide genereerija Stable Diffusion Medium, milleks piisab 5 GB mÀlu oma videokaardist.

Stability AI on sattunud vĂ”lgadesse ja otsib nĂŒĂŒd endale ostjat.

AI-startup Stability AI vÀhendab 10% töötajaskonnast konkurentsi suurenemise tÔttu.

Teatatud Stable Diffusion 3.0 — kunstlik intelligentsus joonistamiseks on muutnud arhitektuuri ja Ă”ppinud kirjutama.

Allikas: 3dnews.ru

Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne hostimine veebilehtede jaoks DDoS-i kaitsega, VPS VDS serverid | ProHoster