Naljakas, kuidas avatud mudelite väljalaskeajalugu tekstipäringute piltideks muutmisel, mida arendab ja treenib Stability AI, meenutab järjestikku tõusude ja mõõnade jada Microsofti operatsioonisüsteemide versioone. Pärast legendaarset, menukat XP-d, tuletame meelde, ilmus probleemne Vista; seejärel suurepärane 'seitsme' — ja sellele järgnes viljatuks osutunud Windows 8. Stable Diffusioni esialgu tagasihoidliku, ent entusiastide poolt järk-järgult edasi arendatud versiooni 1.5 järgnes avatud ebaõnnestumine SD 2.0 — ebaõnnestumine, kuna see sisaldas ebatüüpilist selliste mudelite jaoks OpenCLIP-koodijat, kohast . Sellise valiku käigus kõrvaldati mitte ainult sobimatud (NSFW) visuaalsed viidatud, vaid ka tuntud kunstnike, nagu kuulus Greg Rutkowski, maalid ja illustratsioonid. Just viimane pööras entusiaste üles: kui SD 1.5 versioonis töötasid lihtsalt stiilide näpunäited — „epic medieval fantasy landscape, in the style of Greg Rutkowski“ — ja tulemus oli muljetavaldav, siis SD 2.0 lõpetas kõige tuntumate illustraatorite nimede „tuvastamise“, kelle autoriõigused loodud teoste suhtes on endiselt kehtivad ja kes ei ole soovinud neid teoseid AI koolitamiseks ette anda. Soovitud kirjeldamiseks tuli kasutada rohkem sõnu ja liiga pikkade näpunäidetega ei suutnud mudel hästi toimetada.

Istusime — tõusime, istusime — tõusime
Muudetud kodeerijaga (teksti sisendi digitaalseteks tokeniteks muundav süsteem, millega mudel hiljem töötab) kadusid nimelised stiilid, mis vähendas entusiastide motivatsiooni edendada "teist" enda jõududega. Tõepoolest, tuli samal ajal tegeleda nii uue kodeerija omadustega sujuvana rakendatavate näpunäidete koostamisega kui ka mudeli koolitamisega tundma õppimiseks nende piltide ja teemade osas, millega loojad esialgse väljaõppe etapil kokku ei puutunud. Kuid siiski ei taganud "teise" genereeritud piltide kvaliteedierinevust "esimesest". Jah, standardse SD 1.5 suuruse 512×512 punktist tehti kvaliteetne hüpe suurusele 768×768, kuid selleks ajaks kasutas kogukond juba ulatuslikult suurendajaid, outpaintereid ja muud tööriistade komplekti lõpppildi suuruse suurendamiseks, seega möödus SD 2.0 suures osas märkamatult. SDXL (OpenAI välja töötatud ja kasutatav näiteks DALL-E projektis) — kood on samuti avatud, kuid treeninguks kasutatav andmebaas, , on patenteeritud. Lisaks on "Oversize" standardne kangas suurenenud 1024×1024-ni, lisaks on tulnud terve hulk täiendavaid täiustusi, — nii et entusiastid on rõõmuga hakanud seda täiustama. Ja hetkel on SDXL (ja hiljuti ilmunud vähem nõudlikud selle "rauda" tuletised nagu ja ) võib usaldusväärselt pidada kõige populaarsemaks avatud koodiga AI-piltide generaatoriks. Siiski, SD 1.5 tulihingelised toetajad vaidlevad selle üle, märkides, et sellised olulised tööriistad nagu ControlNet, SDXL-is .
Ja alates 12. juunist 2024, alates mudeli koodi "loodusesse vabastamisest", mis võimaldab kohalikke genereerimisi, peaks olema aeg SD 3 "avatud" versiooni jaoks — täpsemalt, (SD3M või SD3 2B) koos 2 miljardi tööparameetriga. Tinglikult öeldes, see number vastab kõigi mudeli perceptoride sisendite kogukaalu kogusele. Veel aprillis täiustas Stability AI ja pakkus äriliseks kasutamiseks välja 8-miljonilise (parameetrite arvu järgi) versiooni. , tuntud ka kui SD3 8B. SDXL 1.0-l, meenutame, on , kuid SD3M, arendajate väitel, on . Selle all mõeldi, et väiksemate videomälu nõudmiste korral kui «Oversize», peaks see isegi lihtsatele vihjetele reageerides genereerima pilte «uue taseme fotorealismiga». «Kolme» eeskujuks loetletud eeliste seas oli ka «pretsedenditult kvaliteetne tüüponduse genereerimine saadud piltidel olevast tekstist», «süvitsi minev arusaam vihjetest kolme kodeerija koostöös» ja «valmidus tõhusaks täiendõppeks isegi piiratud andmestike korral».

Oli ilmselge, et entusiastide kogukond, saades kätte kauaoodatud mänguasja, hakkab seda sama innukalt edasi arendama nagu kunagi «полуторка» ja «Оверсайз». Siiski läks kõik alguses valesti: SD3M suutis esimestel tundidel pärast mudeli failide avaldamist Hugging Face'is ja Civitais oma publikust, ja seda kahel korral. Esmakordselt – esmapilgul seletamatu kiindumus nõuetele, mis sisaldavad näiliselt kahjutut fraasi «лёжа на/в траве» (lying on/in the grass); teisel korral – uskumatult ebaselged sõnastused kasutajate kokkuleppes, milles ei suutnud kohe orienteeruda isegi professionaalsed juristid. Ja kuigi tavalise tehisintellekti entusiasti jaoks tundub viimane ebaoluline, mõjutab seaduslik küljed mudeli edasist arengut kõige vahetumalt – kuni selleni, et mingit arengut polegi võimalik järgida.
Eelmised avatud lähtekoodiga Stable Diffusion lood (täpsemalt, avatud närvivõrkude kaalude väärtused, mis on tasuta allalaadimiseks saadaval ja mida saab lokaalsetes tingimustes käitada), nagu SDXL, olid kaasas ühte tüüpilistest generatiivsete mudelite omadustest. selliste omadustega nagu «piiramatu, ülemaailmne, mitteainuõiguslik, tasuta, tasueta, tagasivõtmatu autoriõiguse litsents reproduction, valmistamiseks, avalikuks näitamiseks, avalikuks esitlemiseks, all-litsentseerimiseks ja täiendavate materjalide levitamiseks nii mudeli enda kui ka selle derivaatide osas». «Kolm» aga näeb ette kaks liiki litsentseerimist: — üsna lõdva sõnastusega nagu «Stability AI annab teile mitteainuõigusliku, ülemaailmse, mitteüleantava, mitteall-litsentseeritava, tagasivõetava, tasueta ja piiratud litsentsi intellektuaalomandile» — ja .
Rohud ei vii headeni
Mõne aja pärast jõudsid kogukonna liikmed üksmeelele, et . Ja põhjuslikult kuulutas see boikoti arendusettevõttele, kartes kulutada aega ja ressursse selgelt toores ja kehvalt lihvitud mudeli treenimisele — teades, et Stability AI võib igal hetkel oma meediaprofessionaalide kapriisi ajel varasemalt antud litsentsi tagasi võtta, mis oli antud konkreetsele entusiastile, kes sellist treenimist tegeleb. Litsentsileping on sõnastatud nii, et selle uurijatel, kel puudub juriidiline kogemus, jääb mulje, et litsentsi lõpetamise järgselt on SD3M endine saaja kohustatud kustutama kõik loodud tuletised litsentsitud intellektuaalsest omandist, sealhulgas nii treenitud mudelid (LoRA, tekstilised pöörded, täishäkid) kui ka nende tuletised (tsitaat: „Lepingu lõppemisel peate kustutama ja lõpetama igasuguse tarkvara või tuletiste kasutamise“) — st teiste inimeste töö viljad, kes on neid tuletatud mudeleid omaenda tööpunktiks kasutanud; ja seda kõike ilma kellegi tasustamata, puhtal entusiastlikul alusel.
Peagi pärast seda, kui protestihääl jõudis stratosfääri kõrgustele, hakkasid professionaalsed juristid teatama, ja et kasutuskeeld peab tegelikult olema seotud vaid teatud sulgeda koodiga abitooteid, milliseid Stability AI edastab ärikasutajale (ütleme, et SD3M-e treeningu kiirendamiseks ja optimeerimiseks), — kuid lõplikke selgitusi selle kohta ei ole ettevõte seni veel esitanud. Ja see, et ettevõte on juba kolm nädalat (kuni selle artikli kirjutamiseni) vaikinud, alandab arendaja mainet oluliselt rohkem kui rohi — seda, mida nende looming on genereerinud tüdrukutele.

Mis puutub kõnealusesse rohtaime, siis see on suutnud mõne tunni jooksul saada meemiks , ja pärast leidsime, et peaaegu kõigil rohkem või vähem erialadel veebis, näitab sellise fraasi nagu „a girl lying on the grass“ olemasolu ettepanekutes, et tulemusotsingutest ilmneb „kolmikutest“ mitte ainult hallutsinatsioone, vaid ka õudsete sündide maha koletiste — meditsiinilises tähenduses — kunstnike ja kinotööstuse esindajate haige fantaasia, kes on spetsialiseerunud body horror'ile (palume, kui mõistus ja elu on teile kallid, hoiduge sellest kaugel ja ärge isegi proovige seda fraasi pildivaatamise otsingukasti sisse kirjutada, kui ohutusfiltrid on välja lülitatud). Samal ajal õnnestuvad seisev — ja veidi vähem istuv — inimeste pildid „kolmikule“ julgelt neli plussiga, ja portreed mõnikord on isegi laitmatud; vähemalt mitte halvemad kui põhimudel SDXL 1.0, — probleem peitub just mingisugustes sisemistes tabudes inimekeha horisontaalses asendis.
Mille põhjal on Emad Mostaque (Emad Mostaque), Stability AI asutaja ja endine (kuni märtsini 2024) juht, kes lahkus ettevõttest, et , terava rünnak SD3M-le otse enne selle kaalude avamist piiratud mittetulunduslikuks kasutamiseks (API suurema SD3 8B mudeli jaoks veebigeneratsiooni jaoks, meenutame, , kuid selle kaalud jäävad ikka varjatuks) on olnud praeguse juhtkonna turvakaalutluste tagajärg — , mis formuleeriti juba käesoleva aasta märtsis kui . Just selle selle poliitika raames, kasutades generatiivset mudelit SD3M, ei lubata kasutajatel "teha, edendada, toetada, hõlbustada, julgustada, planeerida, õhutada või soodustada edasist vägivalda, terrorismi või vaenuõhutavat sisu, mis diskrimineerib või ähvardab kaitstud inimgruppe (olgu need siis soo, etnilise kuuluvuse, seksuaalse identiteedi või orientatsiooni, usu jms alusel)" — seega ei ole lubatud pildid pandadest, kes tülli kiskuvad metsikute draakonitega! Ainult kassid naljakates mütsides, koerad armsates jopeis, pudelid tundmatu sisuga ja värskelt ahjust välja tulnud küpsised!
Tehnilisest vaatepunktist võib mudeli tühistamine seisneda selles, et treeningkogumist on lihtsalt välistatud pildid inimestest, kes lamavad, ja muud pildid, mis kuidagi vihjavad ebasobivale tõlgendusele, — ning seetõttu "kolmas variant" lihtsalt ei "mõista" sõna "lamada" tähendust. Või siis võimaldas uuendatud arhitektuur SD3 piisava kindlusega tuvastada sünteesimisprotsessis aktiveeruvaid perseptrone, mille kaalud valiti kohe enne väljaandmist järsult nullima, mille kõrvaltoimeks oli "sunnitud hallutsineerimine". Tõenäoliselt, : kodeerija tõlgendab teksti korrektseteks tokeniteks, kuid "turvameetmega" latentses ruumis ei tähenda need tokenid enam midagi konkreetset, — seega paigutuvad tulemused pikslid pildil sisuliselt juhuslikult.

Arvestades, et SD3 8B täieliku, kuid suletud mudeli API on olnud saadaval juba mitu kuud ja Stability AI meediamanagerite kuumad väited, et "kompaktsifitseeritud" 2B , AI-kunsti entusiastid tervitasid SD3M kaalude avalikustamist 12. juunil äärmiselt positiivselt: . Praegu on selle hankimine siiski võimalik, kuigi veidi keerulisemalt kui tavaliselt SDXL ja SD 1.5 kontrollpunktide jaoks. Tavaline tee on pöördumine Civitai saidile, kust enamik mudeleid laaditakse alla ilma registreerimiseta, kuid alates 17. juunist ja kuni selle artikli toimetamise hetkeni on sellele "kolmiku" pühendatud leht . Ja põhjus on üks: SD3M kaubanduslik litsents on kirjutatud nii ebaselgelt, et isegi Civitai juristid on pidanud pausi, et seda põhjalikumalt uurida. Kui mõni entusiast treenib oma arvutis LoRA "kolmiku" jaoks ja laadib selle Civitai, ning Stability AI otsustab, et tulemus on kohatu, ja tühistab süüdlase litsentsi, siis kuidas sel juhul käitub hostimisplatvorm? Tõepoolest, nad mitte ainult ei pea endas checkpoint'e, abitsükleid ja mudeleid, vaid nad pakuvad ka külastajatele võimalust pilte pilve kaudu genereerida ja sama LoRA-te treenida, tekstilisi inversioone ja muud. Kokkuvõttes, seni kuni koht ja tegevus kestavad, võivad modelle ja kolme kaasasolevat tekstide tokeniseerijat saada ainult .
Alustame!
Tõsi, on üks nüanss: et pääseda laadimislinkidele, tuleb veebilehele sisse logida ja seejärel kinnitada eelnevalt mainitud ranget litsentsilepingut - siiski on see protseduur tasuta ja Venemaalt täiesti ligipääsetav. Kokku on valikus neli mudelit (models) ja neli tekstipäringu kodeerijat (encoders), lisaks veel kolm standardset tsüklit ComfyUI töökeskkonnas täitmiseks. :
mudelid:
- sd3_medium.safetensors
- sd3_medium_incl_clips.safetensors
- sd3_medium_incl_clips_t5xxlfp8.safetensors
- sd3_medium_incl_clips_t5xxlfp16.safetensors
kodeerijad:
- clip_g.safetensors
- clip_l.safetensors
- t5xxl_fp8_e4m3fn.safetensors
- t5xxl_fp16.safetensors
tsüklid:
- sd3_medium_example_workflow_basic.json
- sd3_medium_example_workflow_multi_prompt.json
- sd3_medium_example_workflow_upscaling.json
Käesoleva "Töötuba" raames piirdume põhiversiooni sd3_medium.safetensors (4,2 GB), kolme kodeerijaga — clip_g.safetensors (1,3 GB), clip_l.safetensors (234 MB) ja t5xxl_fp8_e4m3fn.safetensors (4,7 GB) ning tsüklogrammiga sd3_medium_example_workflow_multi_prompt.json. Meie testmasinal on, nagu meeldetuletuseks, graafikakaart GeForce GTX 1070, millel on 8 GB videomälu, ja see ei suuda mahutada suuremaid mudeleid koos kõigi integreeritud muundajatega. SD 1.5 ja SDXL-punktide puhul on kodeerijad vaikimisi peamiseles failis, kuid antud juhul on neid muundajaid isegi mitte kaks, vaid kolm, kokku rohkem kui 6 GB, — koos ise mudeliga on juba üle 10 GB; ja kui kasutada 16-bitist T5XXL kodeerijat, siis vajatakse veelgi võimsamat graafikakaarti. Aga kui kõigepealt laaditakse videomälu tekstimuundajad tokeniteks ja seejärel mudel, mis töötleb neid toekeid, piisab kenasti koguni 6 GB graafikakaardist. Selle vaatenurgast on modulaarne "kolm" kindlasti paremal positsioonil, võrreldes tüüpilise SDXL-punktsiooniga, mis vajab 5-7 GB.
SD3M on multimodaalsete difusiooni transformeerijate mudel () — ja seeläbi põhimõtteliselt erineb varasematest Stability AI arendustest (ning mitte ainult neist), mis toetuvad „Töötuba“ ei ole koht, kus süveneda nende lähenemiste vaheliste erinevuste tõttu AI-piltide genereerimisel; ütleme lihtsalt, et , selle võime töötada suurema arvu tokenitega (mis omakorda võimaldab operaatoril vormistada üsna ulatuslikke tekstipäringuid, samal ajal kui süsteem suudab neile piisavalt täpselt järgida), ning ka parema kvaliteedi lõppsaadud piltides. Täisversioon SD3 8B suudab genereerida pilte lõuendil 4 Mpiks (2048×2048 punkti), ning samuti sellistes kategooriates nagu teksti taastootmine pildis, genereeritud pildi vastavus tekstipäringule ja üldine visuaalne esteetika. Teksti teisendamine vektortokeniteks toimub siin kolme kodeerija abil ( ja T5-XXL — «T5», muide ) — ja, öeldes, ei pea nad töötama sama sisendiga.

Aga piisavalt eessõnu: keskendume sellele, milleks «Töötuba» on pühendatud — piltide genereerimisele SD3M mudeli alusel. Kasutame selleks, nagu juba mainitud, töökeskkonda ComfyUI, mille saab alla laadida . Tõstame esile, et see variant on mõeldud ainult NVIDIA graafikakaartidel või otse AMD või Intel CPU-del käitamiseks (mille puhul on see muidugi palju aeglasem): AMD graafikakaardi omanikud rocm ja pytorch, mida saab installida pip-i kaudu.
Pärast töökeskkonna installimist tuleks eelnevalt allalaaditud .safetensors failid paigutada: mudelid — kausta ComfyUImodelscheckpoints, teksti-tokenite konverterid — kausta ComfyUImodelsclip. Ja — saab alustada!
On aeg kiirendada
Tuleb mainida, et AUTOMATIC1111, mis on hästi tuttav varasemate «Töötubade» lugejatele tehisintellekti joonistamise teemal, sai juuni lõpuks samuti , kuid ComfyUI uusima mudeli tugi on endiselt kõige ulatuslikum. Pole üllatav — seni viimase ajani oli «makaronide koletise» autor, keda tuntakse entusiastide seas hüüdnimega ComfyAnonimous või lihtsalt Comfy, , kus ta töötas muu hulgas ettevõtte sisese töökeskkonna kallal, mida kasutavad ka arendajad ise. Nagu me peagi näeme, tõestab ComfyUI uusim versioon, et selle autol on teatud teadmisi selle vastuolulise mudeli toimimise ja ülesehituse kohta — teadmisi, millega teiste kohalike Stable Diffusion 3 Medium käitamiseks mõeldud tööriistade loojad arusaadavatel põhjustel kiidelda ei saa.

ComfyUI seadistamine Windowsi kaasaskantavas (portable) versioonis on äärmiselt lihtne: pärast vastava ZIP-arhiivi allalaadimist piisab lihtsalt lahti pakkida mis tahes sobivasse katalooge; soovitatavalt muidugi SSD-põhisesse loogilisse jaotusse, mitte HDD-sse. Andmevahetus salvesti ja mälu vahel arvestades eelseisvaid laadimis- ja väljaladimistsükleid mudelite jaoks, isegi üheainsa pildi genereerimiseks (keskkond peab esmalt paigutama video RAM-i tekstist tokeniteks muundurid, seejärel puhastama video mälu ja laadima ise SD3M) oodatakse seda veelgi enam, kui vähem on antud arvutil video mälu. Muide, kaasaskantav installatsioon on hea ka selle täieliku sõltumatuse pärast: mitte miski - välja arvatud vaba ruumi maht loogilisel kettal - ei takista kohalikult üles seadmast nii palju ComfyUI koopiaid, kui soovite, et katsetada erinevate laiendustega, kartmata rikutud juba häälestatud ja suurepäraselt töötavat süsteemi.

Veendudes, et peamine mudeli SD3M fail, millel pole teksti kodeerimise koode, on (fail stableDiffusion3SD3_sd3Medium.safetensors, 4.2 GB) paigutatud alamseltsi checkpoints (kui meie testimise installatsioon, siis täistee — C:Fun-n-GamesComfyUI-SD3ComfyUImodelscheckpoints), ja kõik kolm kodeerimismudelit (failid stableDiffusion3SD3_textEncoderClipG.safetensors, stableDiffusion3SD3_textEncoderClipL.safetensors ja stableDiffusion3SD3_textEncoderT5E4m3fn.safetensors; 1.3 GB, 234 MB ja 4.7 GB vastavalt) — on alamseltsi clip (C:Fun-n-GamesComfyUI-SD3ComfyUImodelsclip) paigutatud, saab töökeskkonda alustada topeltklõpsuga failil run_nvidia_gpu.bat juurkaustas (meie juhul C:Fun-n-GamesComfyUI-SD3). Pärast serveri käivitamist avaneb Windowsi käsureas automaatselt (nagu on ette nähtud BAT-faili seadetes) uus vahekaart, kus aadressil 127.0.0.1/8188 on veebiliides kergesti ligipääsetav. (kuigi vaid esimeses lähenemises) «makaronipriid».

Põhimõtteliselt, kui sul on kasutuses uuem NVIDIA graafikakaart (RTX seeria, mitte GTX, isegi kui see on vaid 6 GB videomälu), saad kohe laadida töökeskkonda ComfyAnonimouse poolt koostatud referentsi tsüklogrammi, millest juba varem räägiti — fail comfy_example_workflows_sd3_medium_example_workflow_multi_prompt.json koos mitme aknaga sisendi jaoks, üks iga kolme kodeerija jaoks — ja töötada selle kallal. Tõsi, alguses tuleb nelja mudeli faili nimed (nende laadimise sõlmedes) viia vastavusse olemasolevaga. Tsüklogrammi autor on ilmselt töötanud oma töökoha juures (Stability AI, nagu juba mainitud) kohalike failide abil, mille nimed olid veidi teised, nii et kui vajutada nuppu „Queue Prompt“ ComfyUI spartaanses liideses kohe pärast tsüklogrammi laadimist, annab töökeskkond vea(teate).
AI-generatsiooni kolmevälja
Kuid seda on tegelikult lihtne parandada: palju rohkem muret tekitab asjaolu, et meilolev GTX 1070 töötleb SD3M kohutavalt aeglaselt — pildi genereerimine kulgeb kiirusel 27-30 sekundit iga iteratsiooni kohta ja arvestades, et parameeter 'Steps' on määratud väärtusele '28', kulub aega ülemäära palju. Seetõttu teeme väikese optimeerimise — kasutame Python-moodulit venv (, 'virtualsed keskkonnad'), mis on loodud muu hulgas generatiivsete tehisintellekti mudelite töö kiirendamiseks. Kompaktversioon ComfyUI-ga ei sisaldu see, , mis lõppkokkuvõttes tähendavad täieliku Python-keskkonna seadistamist oma kohalikule arvutile — ja vajaliku mooduli aktiveerimist juba sellest keskkonnast.

Loodame, et meie 'Meistrimeeste' jälgijatel on juba oma masinates ACTIVE1111 tööinstalleeritud. Sellisel juhul on kõik palju lihtsam: moodul venv on seal juba seadistatud ja kõik, mida tuleb teha selle aktiveerimiseks ComfyUI töökeskkonna käivitamisel, on see . Alustamiseks tuleb serveri töö lõpetada, liikudes selle aknasse ja vajutades «Ctrl» + «C», seejärel sisestades «y» kinnitamiseks; pärast seda kopeerige BAT-fail run_nvidia_gpu.bat uude, näiteks run_with_venv.bat nimega. Originaalfail on üsna lühike — see kutsub lihtsalt esile kaasaskantava Python'i koopia parameetriga —windows-standalone-build:
.python_embededpython.exe -s ComfyUImain.py —windows-standalone-build
pause
See parameeter ei ole iseenesest liiga üheselt mõistetav — see viitab teatud optimeerimistele, mis on tõenäoliselt suunatud uuematele NVIDIA graafikakaartidele ning võivad seetõttu halvendada olukorda neil, kes jätkuvalt usaldavad oma häid GTX-e. Sel põhjusel eemaldame käsurealt —windows-standalone-build ning loobume ka teisest moes optimeerimisest — vaikimisi aktiivsest „nutikast mäluhaldurist“, smart memory, mis , ilma selle väljatoomata. See tõepoolest kiirendab AI-piltide joonistamist, kuid samas muudab meie moraalselt vananenud arvuti ühiseks süsteemiks — ei saa samal ajal internetis surfata, mängida ega isegi dokumentidega ja e-postiga töötada. Seega, kellel ei ole eraldiseisvat arvutit AI-kunsti jaoks, on optimaalne kasutada sellist BAT-faili ComfyUI käivitamiseks (mitte ainult SD3M piltide genereerimise eesmärgil — see sobib ka SDXL-i jaoks):
@echo off
call cd C:Fun-n-GamesGitstable-diffusion-webuivenvScripts
echo %cd%
call activate.bat
echo venv aktiveeritud
call cd C:Fun-n-GamesComfyUI-SD3
echo %cd%
call .python_embededpython.exe -s ComfyUImain.py —disable-smart-memory
pause
Siin eeldatakse, et ComfyUI portatiivne installatsioon asub kataloogis C:Fun-n-GamesComfyUI-SD3, ja AUTOMATIC1111 on varem installitud C:Fun-n-GamesGitstable-diffusion-webui . Paljud "echo" käsklused on lihtsalt visuaalse jälgimise jaoks, et näha, et kataloogide vahetus toimub sujuvalt ja vajalikud käsud täidetakse — pärast seda, kui kõik on lahti harutatud, saab need BAT-failist eemaldada.

Taaskäivitame töökeskkonna, seekord kahekordse klõpsuga run_with_venv.bat failile. Kuna me sulgesime serveri varem, kuid veebiliidese ei puutunud, peab vastavas vahekaardis endiselt olema see sama ComfyUI põhitsükkel koos korrigeeritud mudelite nimedega. Pöörame tähelepanu selle paremale küljele: seal asub 'Preview Image' sõlm, mis ei salvesta valmis pilti kettale, vaid ainult näitab seda. Kui käivitada iga kord tsükkel ühe pildi genereerimiseks, hinnata seda visuaalselt, muuta parameetreid ja uuesti käivitada — see on täiesti toimiv variant: meeldinud pildi saab alati käsitsi salvestada, klõpsates parema hiireklikiga sellel. Kuid kui töökeskkonnas genereeritakse järjestikku palju pilte, oleks parem, kui nende tulemused koguneksid automaatselt püsivasse mällu (vaikesuunas ComfyUIoutput kausta).

Seega on parem kohe muuta sõlmpunkt "Preview Image" sildiks "Save Image". Selleks klõpsa kahel korral vasaku hiireklahvi abil mõnel vabalt alal tsüklogrammis — avaneb sõlmede valimise aken, kus on otsinguriba. Selle riba sisse hakkame kirjutama "Save..." — ja peaaegu kohe näeme soovitud nime. Edasi jääb vaid klõpsata sellele ja ühendada ilmnenud sõlme sisend välja "IMAGE" sõlmest "VAE Decode", kuhu algselt oli ühendatud "Preview Image". Isegi "Preview Image" võib hiljem eemaldada — lihtsalt vali see, klõpsates pealkirjale, ja vajuta klaviatuuril klahvi "Del".

Ja nüüd — on just õige aeg käivitada ComfyAnonimousi loodud tugitsüklogramm (meie tagasihoidlike parandustega) täitmiseks. Tulemuseks on järgmine:

Eelolev pilt, millel on isegi omamoodi meeleolu — ja ei ütleks, et see on loodud sama mudeli abil, mis tõeliselt segadusse ajab juhise joonistada maas lebavaid inimesi. Samal ajal töötab süsteem üsna tarmukalt — umbes 5-6 sekundit ühe 1 MPx suuruse pildi iteratsiooni kohta GTX 1070 peal on väärtuslik tulemus. Võrdluseks: sama PC sama ComfyUI-ga sama BAT-failiga genereerib SDXL-i sama suurusega pilte, kulutades iga iteratsiooni jaoks umbes 6-7 sekundit, seega võib „kolmest” kindlasti pidada vähem nõudlikuks arvuti riistvarale, millega AI-generatsioon toimub.

Korrigeerime nüüd lõuendi mõõtmeid. Node'i „EmptySD3LatentImage”, mis neid määrab, lähedal asub „tühi” (mõttes, et ei ole millegagi ühendatud) abimoodul „Note”, kus on oluline meeldetuletus: pildi kogupindala SD3M korral peaks olema umbes 1 MPx, millest lähtuvalt tuleb valida ristkülikulise lõuendi külgede mõõtmed. Määrame need siis 1344×768, mis on just umbes 1,03 MPx.
Pane tähele: ülal asub sõlm "Seed", kus on määratud algväärtus, antud juhul "945512652412924", ja on märgitud, et see ei tohi pärast genereerimist muutuda (parameeter "fixed").

Käivitame sama tsükliga varasema algväärtusega, kuid nüüd ruudukujulisel lõuendil. Kohe on märgata, et kogu täitmiseks kulub vähem aega, kuigi joonistamise kiirus jäi samaks - vähem kui 6 s iteratsiooni kohta. Ja see on loogiline: kuna tekstilised vihjed ei muutunud, pole nende jaoks kodeerija(t) uuesti laadimine vajalik. Väljundpilt on loomulikult veidi erinev esimesest, ruutjast, kuid mitte põhimõtteliselt - üldine kompositsioon, nagu oodata oli, on säilinud.

Nüüd pöörame tähelepanu node'idele «CLIPTextEncodeSD3» ja «CLIP Text Encode (Negative Prompt)». Esimene paistab silma selle poolest, et sisaldab kolme sisendivälja; kui eemaldada neist tekst, näevad välja märkmed, mille jaoks need kodeerijad on mõeldud — ülevalt alla on need CLIP G, CLIP L ja T5XXL. Varasemalt selliseid node'sid ComfyUI's ei olnud, arusaadavatel põhjustel. Tugi tsükloogramm sisaldab dubleeritud lühikesi vihjeid kahe esimese tekstivälja jaoks ( kodeerijatele CLIP G ja CLIP L) ja oluliselt põhjalikumat kolmanda jaoks — T5XXL. On selge, et nende väljade sisu osas saab laialdaselt katsetada ja nende tekstide muutmise mõju lõpptulemile uurimine on keeruline, kuid äärmiselt huvitav ülesanne. Siiski, põhjustel, mis saavad selgeks veidi hiljem, ei kavatse me sellega hetkel põhjalikult tegelema hakata.
Node «CLIP Text Encode (Negative Prompt)» ei sisalda midagi erilist, kuid mõelge, kui keeruline on tee sellest vastava «conditioning» sisendi juurde põhinoode «KSampler»! See tee jaguneb kaheks; üks selle haru (ülemine sel juhul) näitab, et genereerimise esimestest 10% sammudest kuni selle lõpuni ei arvesta süsteem negatiivse viitega üldse (tee läbimine noode «ConditioningZeroOut» tähendab tingimuse nullimist). Teine haru aga laseb negatiivsel viitel (kuigi tingimuslikult poolekaaluline) minna edasisse töötlemisse m changes — kuid ainult esimesel 10% genereerimise üldisest sammude arvust.
Udune kaugus
Veel uuesti: esimesed 10%, st. 3 28-st määratud samal juhul, käigu genereerimise negatiivne vihje edastatakse sõlmele „KSampler”, mis on seotud pildi genereerimisega latentses ruumis (piksliruumi, st. inimesele arusaadavasse pildisse, mille tulemuse edastab järgmine sõlm, „VAE Decoder”), normaalselt: ülemine haru (tingimuse nullimisega) ei ole aktiivne, töötab ainult alumine. Ülejäänud 90% käikudest (25 28-st meie puhul) negatiivne vihje üldse ei toimi: aktiivne on just ülemine tingimuste edastamise haru — nende nullimisega, — ning liikumine alumises on blokeeritud vastava sõlme „ConditioningSetTimestepRange” piiranguliste parameetrite poolt. Nüüd on selge, miks mõned vaatlejad väidavad, et , — nende mõju (kui vaadelda just seda, tugiteemat, tsüklit ja eeldada, et SD3 Medium mudeli veebigeneratsioonis kehtivad sarnased reeglid) on minimaalne.

Ja ikkagi on see olemas: kui lihtsalt võtta ja otse ühendada sõlme "CLIP Text Encode (Negative Prompt)" väljund vastava "KSampler" sisendiga (või märkida kõik vahepealsed sõlmed tingimuste järgi teel kui "üleskutsutavad", "Bypass", mis toob kaasa sama efekti), siis lõpptulemuse pildi kvaliteet halveneb märgatavalt. Seda võib muide käsitleda kaudse tõendina SD3M "ebaküpse" seisundi kohta, kuna negatiivse vihje tugevuse ja tähtsuse reguleerimine oleks arendajatele pidanud olema võimalik juba enne mudeli kaalude avaldamist avalikkusele. Kaks haru nutikalt seatud tingimuste rakendamise negatiivsele vihjele — omamoodi patch, ja selles osas Stability AI turundusosakonna enda loodud ootustele, näeb välja täiesti põhjendatud.
Ükski lühike ametlik juhend SD3M kasutamiseks ei ole ära toodud, mistõttu ringi liiguvad kuulujutud, et seda mudelit . Mis see ei ole täiesti õige, aga igal juhul tuleb neid näpunäiteid rakendada täpselt teisiti, . Eriti entusiastid kinnitavad tõsiselt, et detailsete kirjelduste lisamine negatiivsele väljadele, sealhulgas võimalikult paljude ebaviisakuste lisamine (jah, jah, vana hea "nsfw, nude" ei piisa - peate tõsiselt pingutama oma kujutlusvõimet), isegi kuulsa tüdruku puhul, kes lamab murul. Kas see on tõsi või mitte - ei saa selgeks teha ilma sügava kontrollita (ja pole kindel, et isegi "18+" märgistus meie saidi ülaosas kaitseb väljaannet häiritud moraalivalvurete hagide eest, kui me riskime avaldada entusiastide koostatud "ime-näpunäite", - hoolimata sellest, et see on inglise keeles). See naljakas olukord meenutab juhtumit , tänu millele - just seetõttu, et need sisaldasid piisavalt detailseid kirjeldusi sellest, mida ja kuidas ei tohiks headuslikud kristlased teha, - on meid saavutanud vähemalt killustatud kirjalikud tõendid eelristlikest uskumustest ja kommetest Venemaal.

Loodetavasti on nüüd selgem, miks süvenemine SD3M-ile antud etapis ei tundu olevat kõige mõistlikum aja ja energia raiskamine. Seal on tõepoolest palju arutatavat ja uurimist: sealhulgas üsna rangelt soovitatud genereerimise parameetrid sõlmes "KSampler" (CFG – 4,5-5,0; sammu arv – umbes 28; paar sampler/scheduler – ainult dpmpp_2m/sgm_uniform, vastasel juhul langeb väljundi kvaliteet märgatavalt); samuti äärmiselt suur subjektiivse kvaliteedi varieeruvus rangelt ühtsete algparameetrite juures, kuid erinevate alguste korral; ja kuulus "rohul lamamise needus" eemaldamine (mille jaoks juba ); ja, tegelikult, välja selgitamine, millised genereerimise parameetrid mõjutavad iga kolme teksti tokeniteks muutmise muunduriga - ja kuidas neid kasutades tõelisi kunstiteoseid saavutada (kui see "kolmega" on üldse võimalik).
Eriti nüüd, kui Emaad Mostaki vallandamine märtsis ja ComfyAnonimous juunis, , — ei ole ainsad probleemid, millega Stability AI silmitsi seisab. Reutersi teatel, mis viitab The Informationile, on see Briti idufirma just äsja (artikli kirjutamise ajal) taas , kelleks sai Prem Akkaraju, tuntud globaalse IT-investeerijate grupi valik — ning see omakorda on valmis ettevõttesse investeerima märkimisväärse rahasumma (). Stability AI positsioon äriüksusena on täna avatud ebastabiilsusele; paljud pettunud — ja sellises olukorras on raske oodata ettevõttelt möödarääkimisi isegi nii ilmsete vigade osas.

Kahjuks halvasti läbimõeldud litsentsipoliitika hoiab kogukonna tagasi SD3M iseseisvast arendamisest, nagu see toimus SD 1.5 ja SDXL puhul. Igatahes jäävad tuletatud checkpoint'id ja sellised tööriistad nagu LoRA viimaste kahe mudeli jaoks kindlalt kohalikele töödele kättesaadavaks, isegi kui (ja kui) Stability AI lõpetab oma tegevuse kommertsinstitutsioonina. Pärast "kolmiku" kohutavat ebaõnnestumist hakkasid erialafoorumites veebis üha sagedamini kõlama hääled, mis toetavad mittekommertsliku projekti loomist, et arendada generatiivset mudelit tekstide piltideks muutmiseks rahastamise kaudu — ja hetkel see liikumine hakkab vormuma nime all . Sellele on juba valmis aktiivselt liituma öelnud Invoke (üks veebipõhiseid AI-generatsiooni platvorme, mis on suunatud professionaalsetele stuudiotele), Comfy Org (meeskond, mis tegeleb ComfyUI toetamise ja arendamisega), Civitai (ei vaja tutvustamist) ning meeskond, kes seisab LAIONi (annotatsioonidega piltide baasi, millel enamik selliseid mudelitest treenitakse) taga.
Seega, lähitulevikus keskenduvad uued "Töökoja" väljaanded tõenäoliselt töötamisele mudelitega, mille jaoks on kogukond juba loonud laia valiku täiustusi ja lisatööriistu — "poolteise" ja "Üks suurus". Võib-olla saab SD3M suurus järgmise ajastu, kuid täna on isegi raske arvata, millal see juhtuda võib. Seni saavad huvilised laadida alla arhiivi, kus on artiklis toodud SD3M genereeringud (tsüklogrammid on integreeritud otse PNG-failidesse; piisab, kui lohistada pilt Windowsi "Failihaldurist" ComfyUI tööruumi, et taastada kogu genereerimise järjekord ja parameetrid) . Võib-olla suudab mõni meie lugejatest leida optimaalse viisi teksti jaotamiseks kolme vihjevälja, enne kui Redditi ja Hugging Face'i tavakülastajad selle avastavad?

Seotud materjalid:
.
.
.
.
.
Allikas: 3dnews.ru
