Naljakas, kuidas avatud mudelite vĂ€ljalaskmise ajalugu, mille on vĂ€lja töötanud ja treeninud ettevĂ”te Stability AI, sarnaneb jĂ€rjestikuste Microsofti operatsioonisĂŒsteemide tĂ”usude ja langustega. PĂ€rast legendaarset ja edukat XP-d, meenutame, ilmus probleemne Vista; siis kaunis «seitsmes» â ja selle jĂ€rel viljatuks osutunud Windows 8. Stable Diffusioni esialgu ebaĂŒhtlane, kuid entusiastide kĂ€tega kohendatud versioon 1.5 jĂ€rgnes avameelselt ebaĂ”nnestunud SD 2.0-le â ebaĂ”nnestunud, kuna see sisaldas ebatĂŒĂŒpilist selliste mudelite jaoks OpenCLIP kooderijat, API-s . Selle valiku kĂ€igus kĂ”rvaldati mitte ainult sobimatud (NSFW) visuaalsed viidatud, vaid ka teosed ja illustratsioonid tuntud kunstnikelt, nagu tuntud Greg Rutkowski. Just viimane ajendas entusiaste pettuma: kui SD 1.5 puhul isegi algversioonis, ilma eriharitud kontrollpunktideta, töötasid lihtsalt stiilide suunised - âepic mediefal fantasy landscape, in the style of Greg Rutkowskiâ - ja tulemus oli muljetavaldav, siis SD 2.0 ei hakanud enam

istunud â tĂ”usnud, istunud â tĂ”usnud
Muudetud kooderiga (tekstimĂ€rguande digitaalseteks tokeniteks muundamiseks, millega mudel hiljem töötab) ei olnud vĂ”imalik kasutada nimetatud stiile, mis lihtsalt vĂ”ttis entusiasmidelt motivatsiooni "kahe" tĂ€iustamiseks oma kĂ€tega. TĂ”epoolest: siin tuli korraga tegeleda ka sellega, kuidas kohandada juba töötavat nĂ€punĂ€idete koostamise tehnikat uue koodriga ning edasi koolitada mudelit nende piltide ja teemade tuvastamiseks, millega loojad esialgsel treeningperioodil teda ei tutvustanud â ja kvaliteedierinevust "poolteise" genereeritud piltide vahel ei garanteerinud. Jah, standardse SD 1.5 suurusega 512Ă512 punkte toimus kvaliteedihĂŒpe 768Ă768, kuid selleks ajaks kasutas kogukond juba aktiivselt suurendajaid, outpaintereid ja muud tööriista pildi lĂ”ppsuure suurendamiseks, nii et SD 2.0 lĂ€ks suuresti mĂ€rkamatuks. SDXL (OpenAI poolt vĂ€lja töötatud ja mida rakendab muu hulgas DALL-E projekt) â selle kood on samuti avatud, kuid andmebaas, mille peal see on treenitud, , on proprietary. Lisaks on «Oversized» standardse lĂ”uendi suurus kasvanud 1024Ă1024 juurde, pluss on ilmunud terve rida tĂ€iendavaid tĂ€iustusi, â nii et entusiasmid asusid rÔÔmuga selle tĂ€iustamisega tegelema. Ja tĂ€naseks peetakse SDXL-i (ka tema hiljuti ilmunud vĂ€hem nĂ”udlikud "rahatĂŒkid", nagu ja ) tĂ”eliselt populaarseks avatud lĂ€htekoodiga pildigeneraatoriks. Siiski vaieldavad SD 1.5 innukad toetajad sellega argumenteeritult, vĂ€ites, et sellised olulised tööriistad nagu ControlNet ei ole SDXL-is .
Ja nii on alates 12. juunist 2024, mil mudeli kood "vabastatakse loodusesse", mis vĂ”imaldab kohalikke genereerimisi, pidanud saabuma "avatud" versioon SD 3 â tĂ€psemalt öeldes, (SD3M vĂ”i SD3 2B) koos 2 miljardi tööparameetriga. Ăksikasjalikult, meenutame, vastab see number kĂ”igi mudeli perceptronite sisendite kogusummale. Veel varem, aprillis, viis Stability AI liikuma 8-miljoni (parameetrite arvu jĂ€rgi) tĂ€iustatud , samuti SD3 8B. SDXL 1.0 puhul, meenutame, on , kuid SD3M, arendajate vĂ€idete kohaselt, on . TĂ€hendatud oli, et madalamate videomĂ€lu vajadustega, kui «Oversize», peab see isegi lihtsatele vihjetele vastates nĂ€itama pilte «uue fotorealistlikkuse tasemega». «Kolmiku» eeliste hulka kuulusid ka «enneolematu kvaliteet genereeritud piltidel olevas tĂŒpograafias», «sĂŒgavam arusaam vihjetest tĂ€nu kolme kodeerija koostööle» ja «valmidus tĂ”husaks fine-tuning'iks isegi piiratud andmekogudel».

Oletati, et entusiastide kogukond, saades endale pikaoodatud mĂ€nguasja, asub seda sama innukalt parandama nagu «poolteist» ja «Oversize» omal ajal. Kuid algusest peale lĂ€ks kĂ”ik valesti: SD3M suutis esimestel tundidel pĂ€rast mudeli failide avaldamist Hugging Face'is ja Civitai's oma publikule, ja seda kahel korral. Esimene kord â esmapilgul seletamatu idiosĂŒnkraatia vihjete suhtes, mis sisaldavad sĂŒĂŒtut lauset «lamades rohul» (lying on/in the grass); teine â ĂŒlihĂ€marad sĂ”nastused kasutajatingimustes, milles isegi professionaalsed juristid ei suutnud kohe aru saada. Ja kuigi tavalise entusiasti silmis tundub viimane tĂŒhine, mĂ”jutab mudeli edasine areng kĂ”ige otsesemas mĂ”ttes just seaduslikku kĂŒlge kĂŒsimusest â isegi nii kaugele, et areng ei pruugi ĂŒldse jĂ€rgneda.
Eelnevad Stable Diffusion'i avatud lĂ€htekoodiga loometeosed (tĂ€psemalt, avatud nĂ€rvivĂ”rgumasside vÀÀrtused, mis on tasuta allalaadimiseks ja hilisemaks kohapealseks tĂ€itmiseks saadaval), nagu SDXL, olid seotud ĂŒhe tĂŒĂŒpilise generatiivsete mudelitega selliste omadustega nagu âpiiramatu, globaalne, mitteeksklusiivne, tasuta, kompensatsioonita, tagasivĂ”etamatu autoriĂ”iguse litsents, mis vĂ”imaldab paljundamist, ettevalmistamist, avalikku esitlust, alaliselt luba andmist ja tĂ€iendavate materjalide jagamist nii mudeli kui ka sellest tuletatud materjalide osasâ. âKolmikâ eeldab aga kahte litsentseerimise varianti: â vĂ€ga vabastavate sĂ”nastustega, nagu âStability AI annab teile mitteeksklusiivse, globaalse, mitteĂŒlekantava, alaliselt tagasivĂ”etava, tasuta ja piiratud litsentsi intellektuaalomandi osasâ â ja .
Rohtu ei tooda head
Vahed, mis ei kesta kaua, leiti, et . Ja sisuliselt kuulutas ta vĂ€lja boikoti arendajafirmale, soovimata raisata aega ja energiat liialt toore ja vigase mudeli edasiĂ”ppimisele â teades, et Stability AI vĂ”ib igal ajal oma meediajuhtide kapriisi tĂ”ttu tagasi vĂ”tta varasemalt konkreetsele entusiastile antud litsentsi, kes teostas selle edasiĂ”piku. Litsentsileping on sĂ”nastatud nii, et mittejuristide jaoks tekib mulje, nagu oleks SD3M kaubandusliku kasutamise loa tagasivĂ”tmise jĂ€rel endine saaja kohustatud kustutama kĂ”ik loodud tuletised litsentsitud intellektuaalomandist, sealhulgas nii edasiĂ”ppinud mudelid (LoRA, tekstilised vastandid, tĂ€iskohustused) kui ka nende tuletised (tsitaat: âSelle lepingu lĂ”ppemisel peate kustutama ja lĂ”petama igasuguste tarkvara toodete vĂ”i tuletatud tööde kasutamiseâ) â st teised inimesed, kes on kasutanud neid tuletatud mudeleid oma töö aluseks; eriti mitte kellegi poolt tasustatud, puhtal entusiasmial.
Peagi pĂ€rast seda, kui rahulolematuse laine jĂ”udis stratosfÀÀriliselt kĂ”rgustesse, hakkasid ilmuma teated ametlikelt advokaatidelt, Ja, ja on oluline, et ĂŒlevaade kasutuskeelust puudutaks vaid mĂ”ningaid abitooteid, mille sulgudega kood Stability AI edastab kaubanduslikule kasutajale (ĂŒtleme, SD3M-i treenimise kiirendamiseks ja optimeerimiseks), kuid ettevĂ”te pole veel selgitanud, mis see tĂ€pselt tĂ€hendab. Lisaks, see, et ettevĂ”te on kolm nĂ€dalat hoidnud vaiki (kui vaadata kĂ€esoleva artikli kirjutamise hetke), alates «kolmiku» avalikustamisest, kahandab arendaja mainet oluliselt enam kui loodud algoritmi genereeritud tĂŒdrukud.

Mis puutub kuulsa muruni, mis on mĂ”ne tunni jooksul muutunud meemiks , ja peaaegu kĂ”igil teistel sarnastel platvormidel Internetis, siis selgus, et sĂ”na âa girl lying on the grassâ sisestamine viib «kolmiku» vĂ€ljundis mitte lihtsalt hallutsinatsioonide, vaid ka Ă”udsete ja haige - meditsiinilises mĂ”ttes - kunstnike ja filmitegijate kujutiste ilmumiseni, kes spetsialiseeruvad body horror'ile (palume, kui teie mĂ”istus ja elu on teile kallid, hoiduge sellisest kaugel ja Ă€rge proovige neid fraase pildiga otsingusse trĂŒkkida, kui turvafilter on vĂ€lja lĂŒlitatud). Samuti saavutavad seisev - ja pisut vĂ€hem istuv - inimeste vaated «kolmikust» kindla nelja plussiga, samas kui portreed on mĂ”nikord tĂ€iesti veatud; vĂ€hemalt pole nad halvemad kui pĂ”hiversiooni SDXL 1.0 omad, takistus peitub pigem mingis sisemises tabu inimese keha horisontaalse asendi suhtes.
Vastavalt Emad Mostaque'i kommentaarile, Stability AI asutajale ja endisele (enne mĂ€rtsi 2024) juhile, kes lahkus ettevĂ”ttest, et , SD3M-iga toimuv bruto vĂ€givald, vahetult enne selle avamist piiratud mittekaubanduslikuks kasutamiseks (meenutame, et API suurema SD3 8B mudeli online genereerimiseks, , kuid selle kaalu on endiselt peidetud), tuleneb praeguse juhtkonna soovist tagada ohutus - , mis formuleeriti juba kĂ€esoleva aasta mĂ€rtsis kui . Just in the framework of this policy using the generative model SD3M, users are prohibited from "committing, promoting, facilitating, encouraging, planning, inciting, or contributing to further violence, terrorism, or creating content that incites hatred, which discriminates against or threatens a protected group of people (whether based on gender, ethnicity, sexual identity or orientation, religion, etc.)" â so no images of pandas in their natural state fighting rabid dragons! Only cats in funny hats, dogs in cute jackets, bottles with unknown contents, and fresh cookies right out of the oven!
Technically speaking, it seems that the dilution of the model involved simply excluding images of people lying down and other pictures that somehow implied indecent interpretations from the training dataset â and for this reason, the "three" simply "doesn't understand" the meaning of the word "lie down." Alternatively, the updated SD3 architecture has allowed for confident identification of weights on perceptrons that activate during the generation of "unsafe" images â and these weights were selectively zeroed right before the release, a side effect of which was the "forced hallucination." Probably, : the encoder correctly translates text into tokens, but in the "secured" latent space, these tokens no longer refer to anything specific â and therefore the resulting pixels are arranged on the image somewhat haphazardly.

Given the availability of a full but closed SD3 8B API for several months now and the enthusiastic assurances from media managers at Stability AI that the "compactified" 2B AI drawing enthusiasts welcomed the public release of the weights for SD3M on June 12 with great enthusiasm: . Sel hetkel on seda siiski vĂ”imalik saada, ehkki veidi keerulisema tee kaudu, kui on tavaline SDXL ja SD 1.5 kontrollpunktide puhul. Tegelikult on tavapĂ€rane tee Civitai veebisaidi poole pöörduda, kust enamus mudeleid laaditakse alla ilma registreerimiseta, kuid alates 17. juunist ja kuni kĂ€esoleva artikli tĂ”lkimiseni on selle saidi âkolmikuâ leht . Ja pĂ”hjus on ĂŒks: SD3M kaubanduslik litsents on kirjutatud nii segaselt, et isegi Civitai juristid vĂ”tsid pausi, et seda tĂ€helepanelikumalt uurida. Kui mĂ”ni entusiasmist treenib oma arvutis LoRA âkolmikuleâ ja paneb selle Civitai'sse ĂŒles, ja Stability AI otsustab, et tulemus on sobimatu ning tĂŒhistab sĂŒĂŒdlase litsentsi, - kuidas sellisel juhul hostimisveebile kĂ€ituda? Ta ei paigalda lihtsalt oma kontrollpunkte, abitsĂŒkleid ja mudeleid, vaid pakub ka kĂŒlastajatele vĂ”imalust nii pilte pilve genereerida kui ka samu LoRA-sid, tekstipĂ”hiseid inversioone jne treenida. Ăldiselt, seni kuni asi kohtus, on modelleid ja kolme neile kaasasolevat tekstiparandajat vĂ”imalik saada ainult .
Hakkame minema
Kuid on nĂŒanss: et laadimislinkidele juurde pÀÀseda, on vajalik veebisaidil autentimine ja seejĂ€rel nimetatud eelnevalt mainitud raske litsentsilepinguga nĂ”ustumise kinnitamine - siiski on see protseduur tasuta ja Venemaalt tĂ€iesti ligipÀÀsetav. Kokku on valimiseks neli variant mudelit (models) ja neli - tekstiparandajaid (encoders), lisaks kolm standardset töötsĂŒkki ComfyUI keskkonnas teostamiseks, :
mudelid:
- sd3_medium.safetensors
- sd3_medium_incl_clips.safetensors
- sd3_medium_incl_clips_t5xxlfp8.safetensors
- sd3_medium_incl_clips_t5xxlfp16.safetensors
kodeerijad:
- clip_g.safetensors
- clip_l.safetensors
- t5xxl_fp8_e4m3fn.safetensors
- t5xxl_fp16.safetensors
tsĂŒkloid:
- sd3_medium_example_workflow_basic.json
- sd3_medium_example_workflow_multi_prompt.json
- sd3_medium_example_workflow_upscaling.json
KĂ€esolevas âTöötubasâ piirdume pĂ”hiversiooni sd3_medium.safetensors (4,2 GB) kasutamisega, kolme kodeerijaga â clip_g.safetensors (1,3 GB), clip_l.safetensors (234 MB) ja t5xxl_fp8_e4m3fn.safetensors (4,7 GB), samuti tsĂŒkloogrammiga sd3_medium_example_workflow_multi_prompt.json. Fakt on see, et meie testmasinal on, meenutamiseks, graafikakaart GeForce GTX 1070, millel on 8 GB videomĂ€lu, ja sellesse mahtu ei pruugi mahtuda suuremad mudelid koos kĂ”igi integreeritud muundajatega. SD 1.5 ja SDXL pĂ”hipunktide puhul on kodeerijad vaikimisi integreeritud pĂ”hifaili, kuid antud juhul on neid muundajaid mitte kaks, vaid kolm, kokku ĂŒle 6 GB â koos ise mudeliga ĂŒletab see juba 10 GB; ja kui vĂ”tta 16-bitine versioon kodeerijast T5XXL, siis on vaja veelgi jĂ”ulisemat graafikakaarti. Kuid juhul, kui esmalt laaditakse videomĂ€lu tekstist tokeniteks muundajad ja seejĂ€rel töötleb mudel neid tokene, on tĂ€iesti piisav ka 6 GB graafikakaardist. Selle vaatenurgast modularne âkolmikâ on kahtlemata parem tĂŒĂŒpilisest SDXL pĂ”hipunktist, mis on 5-7 GB suurune.
SD3M on multimodaalsete difusioonitransformaatide () alusel töötav mudel â ja seega eristub see pĂ”himĂ”tteliselt varasemate Stability AI (ja mitte ainult tema) arenduste seast, mis pĂ”hinevad âTöötubaâ ei ole koht, kus sĂŒveneda sĂŒgavale nende lĂ€henemiste vaheliste erinevuste uurimisse pildi AI genereerimisel; öelda tuleb vaid, et , selle vĂ”ime töötada suurema arvu tokenitega (mis omakorda vĂ”imaldab operaatoril sĂ”nastada ĂŒsna ulatuslikke tekstilisi vihjed ning sĂŒsteemil â neist piisavalt tĂ€pselt kinni pidada), aga ka parema kvaliteedi lĂ”ppkokkuvĂ”ttes saadud piltide osas. TĂ€ismÔÔtuline SD3 8B suudab genereerida pilte 4 MP (2048Ă2048 punkti) lĂ”uenditel ja nendes kategooriates, nagu teksti rekonstrueerimine pildil, saadud pildi tĂ€psus tekstivihje suhtes ja ĂŒldine visuaalne esteetika. Teksti muundamine tokenite vektoriteks toimub siin kohe kolme kodeerijaga ( ja ĂŒks T5-XXL â âT5â, muide, on ) â ja, ĂŒleĂŒldiselt, nad ei pea töötama sama vihjega.

Aga piisavalt eessĂ”nu: lĂ€heme sellele, milleks "Töötuba" on pĂŒhendatud â piltide genereerimisele SD3M mudeli alusel. Kasutame selleks, nagu juba öeldud, ComfyUI töökeskkonda, mille saab alla laadida . TĂ”stame esile, et see variant on mĂ”eldud ainult NVIDIA graafikakaartide jaoks vĂ”i otse AMD vĂ”i Intel protsessorite kĂ€ivitamiseks (mis on loomulikult oluliselt aeglasem): AMD graafikakaardi omanikud rocm ja pytorch, mis on installitavad pip allalaadimismanajeri kaudu.
PĂ€rast töökeskkonna installimist tuleb varem alla laetud .safetensors failid paigutada: mudelid â ComfyUImodelscheckpoints katalooge, teksti tokenite konverterid â ComfyUImodelsclip. Ja â saame alustada!
Aeg kiirusel edasi liikuda
Tasub mainida, et AUTOMATIC1111, mis on hĂ€sti tuttav varasemate "Töötubade" lugejatele, mis kĂ€sitlesid AI-piltide genereerimist, on juuni lĂ”puks samuti , kuid ComfyUI tugi uuele mudelile on endiselt kĂ”ige ulatuslikum. Pole ĂŒllatav â kuni ĂŒsna hiljuti oli "makaronide koletise" autor, tuntud entusiastide seas nimega ComfyAnonimous, vĂ”i lihtsalt Comfy, , kus ta töötas muu hulgas ka sise-ettevĂ”tte töökeskkonna kallal, mida kasutavad arendajad ise. Nagu me peagi nĂ€ha saame, nĂ€itab ComfyUI uusim versioon tĂ”epoolest, et selle autori kĂ€es on teatud teadmised selle vastuolulise mudeli toimimise ja ĂŒlesehituse osas â teadmised, millega teiste kohalike teostuste loojad Stable Diffusion 3 Medium jaoks ei saa mĂ”istlikel pĂ”hjustel uhkustada.

ComfyUI installimine Windowsi kaasaskantavas (portable) versioonis on ÀÀrmiselt lihtne: pĂ€rast vastava ZIP-arhiivi allalaadimist Piisab selle unbundle'i tegemiseks lihtsalt sobivasse kataloogi; eelistatavalt, muidugi, SSD-l pĂ”hinevasse loogilisse jaotisesse, mitte HDD-d, â vahetus mĂ€luseadmest ja mĂ€lu vahel, arvestades tulevasi laadimis-tĂŒhjendamis tsĂŒkleid mudelite jaoks isegi ĂŒheainsa pildi genereerimiseks (keskkonda tuleb kĂ”igepealt laadida videomĂ€lu tekstide tokeniteks teisendajad, seejĂ€rel tĂŒhjendada videomĂ€lu ja laadida SD3M ise) peaks olema seda rohkem mĂ€rkimisvÀÀrne, mida vĂ€hem on antud arvutil videomĂ€lu. Muide, portatiivne installimine on hea ka oma tĂ€ieliku sĂ”ltumatuse poolest: miski â vĂ€lja arvatud vabade ruumide maht loogilisel diskil â ei takista kohalikult kĂ€ivitamast nii palju ComfyUI koopiaid, kui soovite, et katsetada erinevaid laiendusi, kartmata, et rikutakse juba hÀÀlestatud ja suurepĂ€raselt töötavat sĂŒsteemi.

Veenduge, et SD3M pĂ”himasina fail, kus ei ole tekstide tokeniteks kodeerijaid (fail stableDiffusion3SD3_sd3Medium.safetensors, 4,2 GB) on asetatud alamkatalooge checkpoints (meie testinstallatsiooni puhul on tĂ€ielik tee â C:Fun-n-GamesComfyUI-SD3ComfyUImodelscheckpoints), ja kĂ”ik kolm kodeerijate mudelit (failid stableDiffusion3SD3_textEncoderClipG.safetensors, stableDiffusion3SD3_textEncoderClipL.safetensors ja stableDiffusion3SD3_textEncoderT5E4m3fn.safetensors; 1,3 GB, 234 MB ja 4,7 GB vastavalt) â alamkatalooge clip (C:Fun-n-GamesComfyUI-SD3ComfyUImodelsclip). NĂŒĂŒd saab töökeskkonda kĂ€ivitada kahekordse klĂ”psuga failil run_nvidia_gpu.bat juurkataloogis (meie puhul C:Fun-n-GamesComfyUI-SD3). Serveri kĂ€ivitamise jĂ€rel avaneb Windowsi kĂ€surea aknas automaatselt uues vahekaardis, mis pĂ”hineb vaikeseadetel, brauseris aadressil 127.0.0.1/8188 ja seal on kergesti ligipÀÀsetav veebiliides. (las see jÀÀda ainult esimeses lĂ€henemises) «makaronide kummitusele».

PĂ”himĂ”tteliselt, kui teil on kĂ€sutuses uuem NVIDIA graafikakaart (RTX seeriast, mitte GTX, isegi kui sellel on vaid 6 GB videomĂ€lu), saate kohe laadida töökeskkonda tugitsĂŒkli, mille on loonud ComfyAnonimous, millest on juba varem rÀÀgitud â fail comfy_example_workflows_sd3_medium_example_workflow_multi_prompt.json, mis sisaldab mitmeid aknaid sisendi vihjete jaoks, ĂŒhe iga kolme kodeerija jaoks â ja töötada sellega. TĂ”si, kĂ”igepealt peate kuue faili nimed mudelite (nende laadimise sĂ”lmedes) viima kooskĂ”lla olemasolevatega. TugitsĂŒkli autor on ilmselt töötanud oma töökojas (Stability AI-s, nagu juba mainitud) kohalikeks saanud failidega, mille nimed olid veidi teistsugused, nii et kui vajutate nuppu âQueue Promptâ ComfyUI spartani liideses vahetult pĂ€rast tsĂŒkli laadimist, annab töökeskkond veateate.
Kolme vilja mustand AI genereerimiseks
Kuid seda on ĂŒsna lihtne parandada: palju rohkem masendab see, et olemasolev GTX 1070, mis on oma aja lĂ€bi elanud, töötleb SD3M-d kohutavalt aeglaselt â pildi genereerimise aeg on 27-30 sekundit iga iteratsiooni kohta, ja arvestades, et tugitsĂŒkli parameeter âStepsâ on seadistatud vÀÀrtusele â28â, kulub aega ĂŒlemÀÀra palju. SeetĂ”ttu teeme vĂ€ikese optimeerimise â kasutame Python-moodulit venv (), mis on loodud muu hulgas kiirendama generatiivsete AI mudelite tööd. Portatiivse ComfyUI versiooni komplekti see ei kuulu, , mis lĂ”puks seisnevad tĂ€ieliku Python keskkonna kĂ€ivitamises kohalikus arvutis â ja vajaliku mooduli aktiveerimises juba sellest keskkonnast.

Loodame, et meie âAteljeedâ jĂ€lgivad lugejad omavad juba aktiivset tööinstalleerimist AUTOMATIC1111 oma masinates. Sellisel juhul on kĂ”ik palju lihtsam: moodul venv on seal juba kĂ€ivitatud ja kĂ”ik, mis on vajalik, et aktiveerida see ComfyUI töökeskkonna kĂ€ivitamisel, on . Esiteks tuleks server lĂ”petada, liitudes selle aknaga ja vajutades «Ctrl» + «C», seejĂ€rel sisestage «y» kinnitamiseks; pĂ€rast seda kopeerige BAT-fail run_nvidia_gpu.bat uude, nĂ€iteks run_with_venv.bat nimelisse failisse. Algne kĂ€ivitusfail on ĂŒsna lakooniline â see kutsub lihtsalt esile kaasasoleva Python'i koopia parameetriga âwindows-standalone-build:
.python_embededpython.exe -s ComfyUImain.py âwindows-standalone-build
pause
See parameeter pole oma olemuselt liiga ĂŒhemĂ”tteline â see viitab teatud optimeeringutele, mis on tĂ”enĂ€oliselt suunatud uuematele NVIDIA graafikakaartidele ja seetĂ”ttu vĂ”ivad halvendada olukorda neil, kes on endiselt truud oma vÀÀrikatele GTX-idele. SeetĂ”ttu eemaldame kĂ€surealt âwindows-standalone-build ning loobume ka teisest stiilsest optimeerimisest â vaikimisi aktiveeritud «nutikast mĂ€luhaldurist», smart memory, mis , mitte seda eemaldades. See tĂ”epoolest kiirendab AI-piltide joonistamist, kuid samas muudab meie vaimselt aegunud arvuti ĂŒhesĂŒsteemseks â ei saa enam veebisirvida, mĂ€ngida ega isegi dokumentidena ja postiga töötada, samal ajal kui töökeskkond on aktiivne. Seega, neile, kes ei saa eraldi arvutit AI-kunsti jaoks, tundub optimaalseks selline BAT-fail ComfyUI kĂ€ivitamiseks (mitte ainult SD3M piltide genereerimise eesmĂ€rgil, muide â see sobib ka SDXL jaoks):
@echo off
call cd C:Fun-n-GamesGitstable-diffusion-webuivenvScripts
echo %
call activate.bat
echo venv activated
call cd C:Fun-n-GamesComfyUI-SD3
echo %
call .python_embededpython.exe -s ComfyUImain.py âdisable-smart-memory
pause
Siin eeldatakse, et ComfyUI kaasaskantav installatsioon on tehtud katalooge C:Fun-n-GamesComfyUI-SD3 ja AUTOMATIC1111 on varem paigaldatud C:Fun-n-GamesGitstable-diffusion-webui. Rohked «echo» on vajalikud lihtsalt visuaalse kontrolli jaoks, et vahetus direktorites on sujuv ja vajalikud kĂ€sud tĂ€idetakse â pĂ€rast tarkvara tĂ”rkeotsingu lĂ”ppu saab need BAT-failist eemaldada.

TaaskĂ€ivitame töökeskkonna, seekord kahekordse klĂ”psuga run_with_venv.bat failil. Kuna me lihtsalt sulgesime serveri ja veebiliides jĂ€i puutumatuks, peaks vastavas vahekaardis olema endiselt see sama alusprotsess ComfyUI, millega on modelle nimetatud. Pöörame tĂ€helepanu selle paremale poolele: seal asub sĂ”lm âPreview Imageâ, mis ei salvesta valmista pilti kĂ”vakettale, vaid lihtsalt demonstreerib seda. Kui iga kord kĂ€ivitada protsess ĂŒhe pildi genereerimiseks, hinnata seda visuaalselt, muuta parameetreid ja uuesti kĂ€ivitada â on see tĂ€iesti toimiv variant: meeldinud pildi saab alati kĂ€sitsi salvestada hiire parema nupuga klĂ”psates. Aga kui töötada keskkonnas jĂ€rjestikku mitme genereerimisega, on parem, kui nende tulemused automaatselt kogunevad pĂŒsivasse mĂ€llu (vaikimisi ComfyUIoutput kataloogis).

Seega on parem kohe muuta sĂ”lme âPreview Imageâ sĂ”lmeks âSave Imageâ. Selleks klĂ”psa vasaku hiire nupuga kahekordselt mĂ”nel vabal kohal protsessis â avaneb sĂ”lmede valimise aken koos otsingureaga. Sellele reale hakkame kirjutama âSaveâŠâ â ja peaaegu kohe nĂ€eme vajaliku nime. Edasi jÀÀb vaid sellele klĂ”psata ja ĂŒhendada Ă€sja ilmunud sĂ”lme sisend âIMAGEâ sĂ”lmega âVAE Decodeâ, kuhu algselt oli ĂŒhendatud âPreview Imageâ. Isegi âPreview Imageâ saab edaspidi eemaldada â lihtsalt valige see, klĂ”psates pealkirjal, ja vajutage klaviatuuril klahvi âDelâ.

Ja nĂŒĂŒd on just Ă”ige aeg kĂ€ivitada alusprotsess ComfyAnonimous autorilt (meie tagasihoidlikud korrektuurid) tĂ€itmiseks. Tulemus on jĂ€rgmine:

VĂ€ga muljetavaldav pilt, isegi meeleoluga â ja ei ĂŒtleks, et see on loodud sama mudeli abil, mille puhul on juhend tassitud, et joonistada maapinnal lamavaid inimesi. Samal ajal töötab sĂŒsteem ĂŒsna aktiivselt â umbes 5-6 sekundi jooksul pildi genereerimiseks, mille pindala on 1 Mpiks GTX 1070-l, vĂ”ib pidada korralikuks nĂ€itajaks. VĂ”rdlemiseks: sama arvuti sama ComfyUI-s sama BAT-failiga genereerib SDXL pilte sarnaste suurustega, kulutades umbes 6-7 sekundit iga iteratsiooni jaoks, seega on âkolmâ tĂ€iesti Ă”igustatud vĂ€hem nĂ”udlik arvuti riistvarale, millega AI genereerimine toimub.

Korrigeerime nĂŒĂŒd lĂ”uendi mÔÔtmed. Peagi nodi «EmptySD3LatentImage», mis need mÀÀrab, asub lĂ€hedal 'tĂŒhja' (mĂ”ttes, ei ole ĂŒhendatud milleski) abistamise nodi «Note», kus on oluline meeldetuletus: SD3M puhul peaks piltide kogupindala olema umbes 1 Mpx, â seega tuleks valida ristkĂŒliku lĂ”uendi kĂŒlgede suurused. Seame need siis vÀÀrtusteks 1344Ă768 â see on just umbes 1,03 Mpx ja sobib.
TĂ”mbame tĂ€helepanu: ĂŒlal asub nodi «Seed», kus on mÀÀratud iseasi seeme, sel juhul «945512652412924», ja on mĂ€rkitud, et see ei tohi pĂ€rast genereerimist muutuda (parameeter «fixed»).

Teostame sama tsĂŒkli varasema seemnega, kuid nĂŒĂŒd ristkĂŒliku lĂ”uendi jaoks. Koheselt on mĂ€rgata, et aega lĂ€heb kokkuvĂ”ttes vĂ€hem, kuigi joonistamise kiirus on jÀÀnud samaks â vĂ€hem kui 6 s iteratsiooni kohta. Ja see on loogiline: kuna tekstilised vihjed ei muutunud, ei ole neid kodereid uuesti laadida vaja. VĂ€ljundpilt on, nagu oodata vĂ”ib, veidi erinev esimesest, ruudukujulisest, kuid mitte pĂ”himĂ”tteliselt â ĂŒldine kompositsioon, nagu oodati, on sĂ€ilinud.

NĂŒĂŒd pöörame tĂ€helepanu nodidele «CLIPTextEncodeSD3» ja «CLIP Text Encode (Negative Prompt)». Esimene eristub selle poolest, et sisaldab kohe kolme sisendvĂ€lja; kui nende tekst eemaldada, on nĂ€htavad mĂ€rkused, mille jaoks kodeerijad need mĂ”eldud on, â ĂŒlevalt alla on need CLIP G, CLIP L ja T5XXL. Eelnevaid sarnaseid node ComfyUI-s ei olnud pĂ”hjusega. Toetav tsĂŒkkel sisaldab kahekordistuvaid lĂŒhikesi vihjeid kahe esimese tekstivĂ€lja (CLIP G ja CLIP L konverterite jaoks) ning palju mahukamat kolmanda jaoks â T5XXL. Selge on see, et nende vĂ€ljade sisu osas saab laialdaselt mĂ€ngida, ja tekstimuutuse mĂ”ju lĂ”plikule pildile uurimine on mitte triviaalne, kuid ĂŒlihuvitav ĂŒlesanne. Kuid mĂ”ne aja pĂ€rast selguvad pĂ”hjused, nii et me ei tegele selle kiirelt hetkel.
Kuid sĂ”lmes âCLIP Text Encode (Negative Prompt)â ei ole midagi erilist, - kuid hinnake, kui keeruline on teekond selle ja peamise sĂ”lme âKSamplerâ vastava sisenemise âconditioningâ vahel! See tee jaguneb kaheks haruks, kusjuures ĂŒks haru (ĂŒlemine antud juhul) nĂ€itab, et alates 10% genereerimise sammudest ja kuni selle lĂ”petamiseni ei vĂ”ta sĂŒsteem negatiivset sisendit arvesse (tee ĂŒlemise sĂ”lme âConditioningZeroOutâ kaudu tĂ€hendab tingimuse nullimist). Teine haru aga laseb negatiivsel sisendil (samuti tinglikult poole kaaluga) edasi töötlusse ilma muudatusteta - kuid ainult esimese 10% genereerimise kogu sammudest.
Udune kaugus
Veel kord: esimesed 10%, st 3 28-st mÀÀratud sammudest, negatiivne juhis edastatakse sĂ”lmele âKSamplerâ, mis tegeleb pildi loomisega latentruumis (piksliruumi, st inimesega arusaadavasse pildiformaati, mille vĂ€ljundi edastab jĂ€rgmine sĂ”lm, âVAE Decoderâ), normaalses jĂ€rjekorras: ĂŒlemine haru (tingimuse nullimisega) ei ole aktiivne, vaid töötab ainult alumine. JÀÀnud 90% sammudest (25 28-st meie puhul) negatiivne juhis ei toimi ĂŒldse: aktiivne on just ĂŒlemine haru, kus tingimused on nullitud, samas kui alumine liikumine blokeeritakse vastava sĂ”lme âConditioningSetTimestepRangeâ piirarvuga. NĂŒĂŒd on selge, miks mitmed arvustajad vĂ€idavad, et , - nende mĂ”ju (kui arvestada just seda, tugitegurit ja oletada, et veebigeneratsioonis mudeli SD3 Medium juures kehtivad sarnased reeglid) on minimaalne.

Ja siiski on see olemas: kui lihtsalt vĂ”tta ja otse ĂŒhendada node 'CLIP Text Encode (Negative Prompt)' vastava 'KSampler' sisendiga (vĂ”i mĂ€rkida kĂ”ik vahepealsed nodid selle tee tingimustega kui 'pĂ”hi', 'Bypass', mis toob sama efekti), siis lĂ”pp-pildi kvaliteet halveneb selgelt. Seda vĂ”ib muide pidada kaudseks tĂ”estuseks 'poolpĂ”letamise' SD3M kohta, kuna arendada negatiivse nĂ€punĂ€ite tugevust ja olulisust, rangelt öeldes, pidi arendajatele olema vĂ”imalik juba enne mudeli kaalude avalikustamist. Kaks kahest keeruliselt seatud tingimuste haru negatiivse nĂ€punĂ€ite rakendamiseks on omamoodi tilk ja sellega seoses Stability AI turundusosakonna poolt selle suhtes seatud ootustele, on tĂ€iesti Ă”igustatud.
Ahnuse mĂ”ningate ametlike juhendite puudumine SD3M kasutamiseks on viinud selleni, et internetis liiguvad kuulujutud, justkui seda mudelit Mis, muidugi, ei ole tĂ”si, kuid igal juhul tuleb neid nĂ€punĂ€iteid rakendada tĂ€pselt teistmoodi EelkĂ”ige vĂ€idavad entusiastid tĂ”siselt, et negatiivsete vĂ€ljendite vĂ€ljakutsumiseks on detailsete kirjelduste lisamine ĂŒha suurematele ebaviisakustele (jah- jah, vana hea 'nsfw, nude' ei piisa - peate tĂ”siselt oma kujutlusvĂ”imet pingutama) isegi kurikuulus tĂŒdruk, kes lamab murul. Kas see nii on vĂ”i ei - ei ole vĂ”imalik kontrollida pĂ”hjaliku kontrollimisega (ja see ei ole isegi kindel, et meie saidi ĂŒlaosas olev '18+' mĂ€rgistus kaitseb meid moraalitunde kaitsjate kaebuste eest, kui riskime avaldamisega, mis on kokku pandud entusiastide 'ime-nĂ€punĂ€itega' - olgu see inglise keeles). See naljakas olukord meenutab juhtumit , mille tĂ”ttu - just seetĂ”ttu, et need sisaldasid suhteliselt detaile, milliseid asju ja kuidas ei tohiks korralikud kristlased teha, - on meieni jĂ”udnud isegi killud kirjalikke tĂ”endeid uskumustest ja harjumustest enne kristlikku Vene.

NĂŒĂŒd tahaks loota, et on selgem, miks sĂŒveneda SD3M uurimisse sel hetkel ei tundu olevat kĂ”ige mĂ”istlikum ajaraisk. Seal on tĂ”epoolest sellest, millest rÀÀkida, ja mida uurida: ja ĂŒsna jĂ€igalt soovitatud genereerimise parameetrid sĂ”lmes âKSamplerâ (CFG â 4,5-5,0; sammude arv â umbes 28; paar sampler/scheduler â ainult dpmpp_2m/sgm_uniform, vastasel juhul kvaliteet lasub tĂ”siselt); ja ÀÀrmiselt suur subjektiivse kvaliteedi varieerumine rangelt ĂŒhesuguste algparameetrite puhul, kuid erinevate alamkĂ€skude puhul; ning haledast ârohu peal lamamise needusestâ vabanemine (milleks on juba ); ja samuti selguse saavutamine, millistele just parameetritele genereerimine iga kolme tekstist tokeniteks muundaja mĂ”ju avaldab â ja kuidas neid kasutades tĂ”eliselt suurepĂ€raste kunstiteoste loomist saavutada (kui see on âkolmegaâ ĂŒldse vĂ”imalik, muidugi).
Eriti arvestades, et Emad Mostaqi vallandamine mĂ€rtsis ja ComfyAnonimous'i juunis, , â ei ole ainukesed probleemid, mis Stability AI'l on. Reutersi andmetel, viidates The Information'ile, on see briti idufirma just Ă€sja (artikli kirjutamise hetkel) jĂ€rjekordselt , kelleks sai Prem Akkaraju, tuntud globaalsete IT-investeerijate rĂŒhma soovitatud kandidaat â ja see, omakorda, on valmis ettevĂ”ttesse mĂ€rkimisvÀÀrse summa sisenema (). Stability AI olukord Ă€riĂŒksusena on praegu ausalt öeldes ebastabiilne; paljud pettunud â ja sellises olukorras on keeruline oodata ettevĂ”ttelt lĂ€bimĂ”eldud tööd isegi nii ilmsete vigade ĂŒle.

MĂ”tlemata litsentsipoliitika hoiab, kahjuks, kogukonda tagasi SD3M iseseisvast tĂ€iustamisest, nagu seda tehti SD 1.5 ja SDXL puhul. Kuid vĂ€hemalt viimased kaks mudelit, koos nende tuletiste checkpoints ja tööriistade, nagu LoRA, jÀÀvad kindlasti lokaalselt kasutatavaks, isegi kui (ja kui) Stability AI lĂ”petab oma tee kui Ă€ri. Kohe pĂ€rast "kolmiku" kohutavat fiaskot hakkasid erialafoorumites rohkem ja rohkem kostma hÀÀli, mis toetasid mittekaubandusliku projekti loomist tekstide piltideks muutmiseks, mis pĂ”hineks rahastamisel â ja praeguseks on see liikumine hakanud kujunema nime alla . Valmisolek aktiivselt liituda on juba vĂ€lja öelnud Invoke (ĂŒks platvorme veebipĂ”hiseks AI-geneerimiseks, suunatud professionaalsetele stuudiotele), Comfy Org (meeskond, kes toetab ja arendab ComfyUI-d), Civitai (ei vaja tutvustamist) ja meeskond, kes seisab taga LAION-i (annotatsioonidega piltide andmebaas, millel enamik selliseid mudeleid treenitakse).
Nii et lĂ€hitulevikus on uued "Töötuba" vĂ€ljaanded, tĂ”enĂ€oliselt suunatud mudelitele, mille jaoks on kogukond juba loonud laia kogumi tĂ€iustusi ja lisatööriistu â "poolteist" ja "Oversize". VĂ”ib-olla tuleb SD3M triumf veel, â kuid tĂ€na on raske isegi ennustada, millal tĂ€pselt. Ja seni saavad huvilised alla laadida arhiivi kĂ€esolevas artiklis toodud SD3M generaatsioonidega (tsĂŒkkelogrammid on integreeritud otse PNG-failidesse; piisab, kui lohistada pilt ComfyUI töölauale Windowsi âFile Exploreristâ, et taastada kogu genereerimise jĂ€rjestus ja parameetrid) . VĂ”ib-olla suudab keegi meie lugejatest leida enne Redditi ja Hugging Face'i pidevaid kĂŒlastajaid optimaalse viisi teksti jaotamiseks kolme vĂ€ljundisse, nĂ€iteks?

Teemaga seotud materjalid:
.
.
.
.
.
Allikas: 3dnews.ru
