Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Është e çuditshme si historia e lëshimeve të modeleve të hapura për kthimin e porosive tekstuale në imazhe, të zhvilluara dhe stërvitur nga kompania Stability AI, ngjason me një radhitje të ngjashme me ngjitjet dhe rëniet e versioneve të radhës të OS Microsoft. Pas legjendare të suksesit të XP, kujtojmë, erdhi Vista e problematik; pastaj shkëlqyeshëm «shtatë» — dhe pas saj Windows 8 pa rezultat. Për Stable Diffusion, versioni 1.5, fillimisht i pamundur, u përmirësua gradualisht nga entuziastët; ndodhi që pasoi versioni SD 2.0, i cili ishte në fakt i dështuar — i dështuar, me të vërtetë, sepse përfshinte koduesin OpenCLIP, i paktë për modele të tilla. i trajnuar mbi imazhe shumë ambiguamente të përzgjidhura nga nga dataset-i publik LAION-5B. Gjatë këtij procesi, jo vetëm që u përjashtuan referencat vizuale të papërshtatshme (NSFW), por gjithashtu edhe pikturat dhe ilustrimet e autorëve të njohur si ai i famshëm Greg Rutkowski. Ky fakt i fundit e shpërtheu përfundimisht entuziazmin: nëse për SD 1.5, madje në variantin e tij origjinal, pa përdorimin e çekpointeve të stërvitur, punonin mirë porositë e thjeshta me stile — «epic mediaval fantasy landscape, in the style of Greg Rutkowski» — dhe rezultati ishte impresionues, SD 2.0 kishte ndaluar të «njohë» emrat e ilustrueseve më të njohur, të cilët kishin ende të drejtat autorale mbi krijimet e tyre dhe që nuk e kishin dhënë lejen për t'i përdorur ato për stërvitjen e AI. Duhej të përdorej më shumë fjalë për të përshkruar dëshirat, dhe me porosi shumë të gjata modeli kishte vështirësi.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

#U ulëm — u ngritëm, u ulëm — u ngritëm

Duke ndryshimeve me koduesin (konvertuesin e teksteve në nëntorë digjitale, me të cilin modeli punon pas kësaj), pamundësia për të përdorur stile të emëruara e hoqi motivin e entuziastëve për të përmirësuar "dytën" me forcat e tyre. Faktikisht, duhej të kuptohej se si të përshtatej teknika e krijimit të sugjerimeve me koduesin e ri, dhe gjithashtu të mësohej modeli për të njohur imazhet dhe temat që krijuesit nuk i kishin njohur gjatë fazës fillestare të trajnimit — dhe një dallim cilësor nga "gjysmë" nuk garantonte se imazhet e gjeneruara nga "dyta" do të ishin më të mira. Po, ka pasur një përmirësim të rëndësishëm nga madhësia standarde e SD 1.5 prej 512×512 pikselësh në 768×768, por në atë kohë, komuniteti tashmë po përdorte shërbime të rritjes së shkallës, painterë dhe mjete të tjera për të rritur madhësinë e imazheve përfundimtare, kështu që SD 2.0 kaloi, në thelb, pa u vënë re. SDXL u kthye në standardin e saj (i zhvilluar nga OpenAI dhe i aplikuar, për shembull, në projektin DALL-E) koduesin CLIP — kodi i tij gjithashtu është i hapur, por baza e të dhënave në të cilën është trajnuar, në ndryshim nga OpenCLIP, është pronësore. Për më tepër, madhësia standarde e kanvasit u rrit për "Oversize" në 1024×1024, plus u paraqit një sërë përmirësimesh të reja — kështu që entuziastët e morën me kënaqësi përpjekjen për ta përmirësuar. Dhe deri më tani, SDXL (siç janë krijesat më pak kërkuese ndaj "harduerit" që dolën kohët e fundit si SDXL Turbo dhe SDXL Lightning) mund të konsiderohet me besim si gjeneratori më popullor i imazheve me inteligjencë artificiale me kod të hapur. Megjithatë, besnikët e SD 1.5 e kundërshtojnë këtë me argumente, duke treguar se instrumente kaq të rëndësishme si ControlNet, në SDXL ende nuk janë transferuar siç duhet.

Dhe nga 12 qershori 2024, që nga lëshimi në "ujërat e egra" të kodit të modelit që lejon gjenerimin lokal, ka ardhur koha për versionin "e hapur" të SD 3 — nëse jemi më të saktë, Stable Diffusion 3 Medium (SD3M ose SD3 2B) me 2 miliard parametra funksionimi. Siç e përmendëm, ky numër përputhet me numrin e përgjithshëm të peshave në hyrjet e të gjithë perceptronëve të modelit. Më herët, në prill, Stability AI e përmirësoi dhe ofroi për përdorim komercial modelin 8 milionësh (për numrin e parametrave) Stable Diffusion 3 Large, gjithashtu SD3 8B. Ndërsa SDXL 1.0, le t'i përmendim, është 3.5 miliard parametra, megjithatë SD3M, sipas zhvilluesve, është "modeli më i sofistikuar për gjenerimin e imazheve nga të gjitha që kemi krijuar deri tani". Kuptimi ishte se, me nevojat më të vogla se "Oversize" për memorie video, madje edhe si përgjigje ndaj sugjerimeve të thjeshta, ajo duhet të ofronte imazhe "me një nivel të ri të fotorealizmit". Disa nga përfitimet e "trejës" ishin gjithashtu "cilësi të papara të tipografisë së tekstit të marrë në imazhet e gjeneruara", "kuptim të thellë të sugjerimeve përmes bashkimit të fuqive të tre koduesve" dhe "gatishmëri për përsosje efektive edhe mbi grupe të kufizuara të të dhënave".

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Duket se, padyshim, se komuniteti i entuziastëve, pasi mori në dispozicion një lodër të re, të pritur me padurim, do ta çonte atë përpara me të njëjtin përkushtim si "polutorokaja" dhe "Oversize" në të kaluarën. Megjithatë, që në fillim, gjithçka shkoi ndryshe: SD3M në orët e para pas publikimit të skedarëve të modelit në Hugging Face dhe Civitai audiencën e saj, madje dy herë. Herën e parë — për një idiosinkrazi të paeksplikuar ndaj sugjerimeve që përmbanin fraza të dukshme si «duke shtrirë në/mbi bar» (lying on/in the grass); hera e dytë — për formulimet tepër të paqarta në marrëveshjen e përdorimit, në të cilat nuk mund të kuptonin as profesionistët e ligjit me një shikim. Dhe ndonëse nga këndvështrimi i një entuziasti të zakonshëm të artit AI kjo duket e parëndësishme, në zhvillimin e mëtejshëm të modelit, vetë aspekti ligjor do të ndikojë në mënyrën më të drejtpërdrejtë — deri në atë pikë sa që nuk mund të ndodhin as zhvillime të ardhshme. të publikojë audiencën e saj, dhe madje dy herë. Herën e parë - me një idiokraci të panjohur në dukje ndaj sugjerimeve, duke përfshirë frazën e dukshme "duke bërë shtrirë në / në bar" (lying on / in the grass); herën e dytë - me formulime jashtëzakonisht të paqarta në marrëveshjen e përdorimit, për të cilat nuk ishin në gjendje të kuptonin në fillim as profesionistët e juridikës. Dhe ndonëse nga pikëpamja e një entuziasti të zakonshëm të arteve të AI, kjo e fundit duket e parëndësishme, në zhvillimin e mëtejshëm të modelit, pikërisht aspekti ligjor do të reflektojë në mënyrën më të drejtpërdrejt në proces - deri në atë pikë sa mund të mos ketë as zhvillim fare.

Krijimet e mëparshme të Stable Diffusion me kod të hapur (më saktë, me vlera hapur të peshave të rrjeteve nervorë, të disponueshëm për shkarkim falas dhe pasuar nga ekzekutimi lokal), si SDXL, shoqëroheshin nga një nga karakteristikat tipike për modelet gjeneruese. Licenca CreativeML Open RAIL++ me karakteristika si "licencë e përjetshme, globale, jo ekskluzive, falas, pa pagesë, të paprishshme, me të drejtë autor për qëllim riprodhimi, përgatitjes, shfaqjes publike, interpretimit publik, nënlicencimit dhe shpërndarjes së materialeve shtesë si modelin e vet, ashtu edhe ato të derivuara nga ajo". "Trojka" parashikon dy lloje licencash: për përdorim jo-komercial — me formulime të mjaftueshme dekurajuese si "Stability AI ju ofron një licencë jo ekskluzive, globale, të paprishshme, të pavendosur për nënlicencë, të tërheqshme, pa pagesë dhe të kufizuar për pronësinë intelektuale" — dhe një ndjeshëm më të rëndë komerciale..

#Bar ay nuk do t'ju sjellë mirë.

Pas një kohe të shkurtër, komuniteti arriti në përfundimin se Stable Diffusion 3 nuk është Open SourceDhe në thelb shpalli një bojkot ndaj kompanisë zhvillimore, duke mos dashur të harxhojë kohë dhe energji për trajnimin e një modeli të qartë të papërfunduar dhe të degjeneruar — me vetëdijen se Stability AI në çdo moment mund të tërheqë licencën e dhënë më parë për ndonjë entuziast, i cili kryen një trajnim të tillë. Kontrata e licencës është formuluar në një mënyrë që ata që e studiojnë pa pasur njohuri ligjore krijojnë përshtypjen se pas tërheqjes së lejes për përdorimin komercial të SD3M, ish-pranuesi i saj do të detyrohet të fshijë të gjitha produktet e krijuara prej tij nga pronësia intelektuale e licencuar, duke përfshirë si modelet e trajnuara (LoRA, invertime tekstesh, pikë kontrolli) ashtu edhe produktet e tyre të nxjerra (citim: "Upon termination of this Agreement, you shall delete and cease use of any Software Products or Derivative Works") — dmth., produktet e punës së njerëzve të tjerë, të cilët kanë përdorur këto modele të produkuara si një pikënisje për punën e tyre; dhe kjo është bërë pa pagesë nga askush, e kryer në një entuziazëm të pastër.

Së shpejti pas arratisjes së këtij revolti që arriti në lartësi stratosferike, filluan të shfaqen raportet nga avokatë profesionistë, se situata nuk është aq e keqe, dhe që tërheqja me ndalesën e përdorimit të mëtejshëm në fakt duhet të lidhet vetëm me disa produkte ndihmëse me kod të mbyllur, të cilat Stability AI do t'i kalojë përdoruesit komercial (për shembull, për të përshpejtuar dhe optimizuar sërish trajnimin e SD3M), — por deri tani kompania vetë nuk ka dhënë sqarime të fundit në lidhje me këtë. Dhe vetë fakti i asaj heshtjeje ngacmuese që zgjat tashmë për tre javë (në momentin e shkruarjes së këtij artikulli) që nga shfaqja e "trokës" në qasje të hapur dëmton reputacionin e zhvilluesit shumë më tepër se ç'ndihmojnë vajzat e gjeneruara nga krijimi i tij.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Sa i përket barit famëkeq që u bë meme në vetëm disa orë, fillimisht në Hugging Face,, dhe më pas gati në të gjitha faqet më pak ose më shumë relevante në internet, doli se prania e frazës si «a girl lying on the grass» çon në shfaqjen e «trejave» jo vetëm në forma hallucinuese, por krijimeve të frikshme të fantazisë së sëmurë — në kuptimin mjekësor — të artistëve dhe filmmakerëve që specializohen në body horror (ju lutemi, nëse mendja dhe jeta juaj janë të rëndësishme, mbani distancë nga këto dhe as mos u përpiqni të shkruani këtë frazë në dritaren e kërkimit të imazheve pa filtrin e sigurisë të fikur). Në të njëjtën kohë, imazhet e njerëzve që qëndrojnë — dhe pak më pak ata që qëndrojnë ulur — i japin «trejave» një katërsh të sigurt me plus, ndërsa portretet nganjëherë dalin edhe të përsosura; të paktën, jo më keq se modeli bazë SDXL 1.0, — problma qëndron në një tabù të brendshëm mbi pozitat horizontale të trupit human.

Sipas komentit të Emad Mostaque, themeluesit dhe ish-kreut (deri në mars 2024) të Stability AI, i cili u largua nga kompaninë për të «të merret me projekte të decentralizuara në fushën e inteligjencës artificiale», dhuna brutale mbi SD3M pikërisht para hapjes së saj për përdorim të kufizuar jo-komercial (API i modelit më të madh SD3 8B për gjenerim në internet, kujtojmë, është e disponueshme nëpërmjet faqeve partnere që nga prilli., por pesha e saj mbetet e fshehur) ishte një pasojë e përpjekjeve të aktualeve drejtues për sigurinë — «në përputhje me detyrimet rregullative», të formuluara që në mars të këtij viti si Politika e Përdorimit të Pranueshëm. Në kuadër të kësaj politike, duke përdorur modelin gjenerues SD3M, përdoruesve nuk u lejohet «të kryejnë, promovojnë, lehtësojnë, inkurajojnë, planifikojnë, nxisin ose ndihmojnë në dhunë, terrorizëm ose krijim të përmbajtjes që shkakton urrejtje, e cila diskriminon ose i kërcënon grupet e mbrojtura të njerëzve ( qoftë për shkak të gjinisë, përkatësisë etnike, identitetit seksual ose orientimit, religjioneve etj.)», — prandaj nuk do të keni asnjë imazh të pandave që luftojnë me dragonj të egër! Të rregullta vetëm kotele në kapelet qesharake, qen në xhaketat e bukura, shishe me përmbajtje të panjohura dhe biskota të freskëta, sapo dalin nga furra!

Përsa i përket aspekteve teknike, është e mundur që modifikimi i modelit të ketë ndodhur duke përjashtuar nga seti i të dhënave të trajnimit imazhe me njerëz në shkallë dhe figura të tjera që, në njëfarë mënyre, implikonin një interpretim të papërshtatshëm, - dhe për këtë arsye, "tre" aktualisht "nuk kupton" kuptimin e fjalës "të shtrihet". Ose, ndoshta, arkitektura e përmirësuar SD3 ka mundësuar të identifikojë mjaft besueshëm peshat në perceptronët që aktivizohen gjatë gjenerimit të imazheve "të pasigurta", - dhe këto pesha janë anuluar në mënyrë selektive para lëshimit, duke rezultuar në "hallucinacione të detyruara". Mbase, kjo tashmë mund të krahasohet me lobotominë: koduesi konverton saktësisht tekstin në tokene, por në hapësirën latente "të siguruar" këto tokene nuk tregojnë për asgjë specifike, - dhe për këtë arsye pikselat rezultuese pozicionohen në imazh thjesht rastësisht.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Duke pasur parasysh disponueshmërinë e API të modelit SD3 8B, i plotë por i mbyllur, për disa muaj dhe siguritë e zjarrta nga menaxherët e mediave të Stability AI që "kompaktifikoi" 2B do të rezultojë pothuajse i njëjtë në cilësinë e perceptimit të tekstit dhe gjenerimit të imazheve, entuziastët e pikturës AI e mirëpritën shpërndarjen publike të modelit SD3M më 12 qershor me entuziazëm të madh: në 24 orët e para, modeli u shkarkua 2.7 milion herë. Aktualisht, ende mund ta merrni atë, megjithëse pak më përmes një rruge të mbyllur, sesa është zakonshme për checkpoint-et SDXL dhe SD 1.5. Rruga e zakonshme është të shkoni në faqen Civitai, nga e cila shumica e modeleve shkarkohen pa regjistrim, por që nga 17 qershori dhe deri në momentin kur ky artikull u dërgua për botim, faqja e dedikuar për "tre" në këtë uebsajt është nën një bllokim të përkohshëm. Dhe arsyeja është një: licenca tregtare për SD3M është shkruar në një gjuhë kaq të paqartë, saqë edhe avokatët e Civitai morën një pauzë për të studiuar atë më në thellësi. Sepse nëse ndonjë entuziast stërvit një LoRA për "tre" në kompjuterin e tij dhe e ngarkon atë në Civitai, ndërsa Stability AI vendos që rezultati ka dalë i papërshtatshëm dhe të tërheqë licencën nga autori, - si do të veprojë në këtë rast faqja hostuese? Ajo, përveçse vendos checkpoint-et, programet ndihmës dhe modelet e saj, gjithashtu ofron vizitorëve mundësinë për gjenerim të imazheve në re, stërvitje të të njëjtave LoRA, kthime tekstuale etj. Në përgjithësi, derisa të jetë gjyqi dhe puna, skedarët e vetë modelit dhe tre konvertorët e tij të tekst në tokene mund të merren vetëm nga faqja e tij Stability AI në portalin Hugging Face.

#Le të fillojmë

Është e vërtetë, ka një nuancë: për të marrë qasje në lidhjet e ngarkimit, duhet të identifikoheni në faqe dhe pastaj të konfirmoni pranimin e marrëveshjes së lisencës, e cila është përmendur pak më parë, - megjithatë, ky proces është falas dhe është plotësisht i aksesueshëm nga Rusia. Në total ofrohen katër modele (models) dhe po ashtu katër kodues (encoders), plus tre ciklograma referuese për zbatim në mjedisin ComfyUI. për të cilin kemi folur disa herë:

modelet:

  • sd3_medium.safetensors
  • sd3_medium_incl_clips.safetensors
  • sd3_medium_incl_clips_t5xxlfp8.safetensors
  • sd3_medium_incl_clips_t5xxlfp16.safetensors

koduesit:

  • clip_g.safetensors
  • clip_l.safetensors
  • t5xxl_fp8_e4m3fn.safetensors
  • t5xxl_fp16.safetensors

ciklogramet:

  • sd3_medium_example_workflow_basic.json
  • sd3_medium_example_workflow_multi_prompt.json
  • sd3_medium_example_workflow_upscaling.json

Ne në kuadër të kësaj 'Punëtori' do të mejmë me modelin bazë sd3_medium.safetensors (4.2 GB), tre koduesit - clip_g.safetensors (1.3 GB), clip_l.safetensors (234 MB) dhe t5xxl_fp8_e4m3fn.safetensors (4.7 GB), si dhe ciklogramën sd3_medium_example_workflow_multi_prompt.json. Arsyeja është se në makinën tonë testuese është instaluar, siç e përmendëm, karta grafike GeForce GTX 1070 me 8 GB VRAM, ndërsa në këtë hapësirë nuk mund të vendosen modele më të mëdha me të gjithë koduesit e integruar njëkohësisht. Çekpointet që bazohen në SD 1.5 dhe SDXL kanë integruar koduesit në skedarin kryesor, por në këtë rast ka tre kodues, duke e çuar totalin në më shumë se 6 GB, - së bashku me modelin, ndonjëherë shkon përtej 10 GB; dhe nëse merrni versionin 16-bit të koduesit T5XXL, do të nevojitet një kartë grafike edhe më e fuqishme. Në variantin kur fillimisht ngarkohen koduesit në VRAM dhe më pas model që punon me këto kodet, mund të menaxhohet mjaft mirë edhe me një adapter grafik 6-GB. Nga ky këndvështrim, moduli i 'tri mave' padyshim që fiton ndaj një 'çekpointi' tipik SDXL prej 5-7 GB.

SD3M është një model i bazuar në transformatorë shumëmodalë të difuzionit (Multimodal Diffusion Transformer, MMDiT) - dhe kështu dallon në mënyrë thelbësore nga zhvillimet më të hershme të Stability AI (dhe jo vetëm të saj), të cilat mbështeten në arkitekturën U-Net, të propozuar që në vitin 2015. 'Punëtoria' - nuk është vend për studimin e thelluar të diferencës mes këtyre qasjeve në gjenerimin e imazheve me IA; le të themi vetëm se MMDiT ofron një performancë të rritur të modelit, mundësia e saj për të punuar me më shumë tokenë (kjo, për një krah tjetër, lejon operatorin të formulojë njoftime tekstuale mjaft të gjata, dhe sistemin - të ndjekë ato mjaft saktë), si dhe cilësia më e mirë e imazheve të marra në fund. SD3 8B me përmasë të plotë është në gjendje të gjenerojë imazhe në kanavacë me 4 MP (2048×2048 piksel), si dhe kalon DALL-E 3, Midjourney v6 dhe Ideogram v1 në aspekte si riprodhimi i tekstit në imazh, saktësia në përputhjen e imazhit të marrë me sugjerimin tekstual dhe estetikën vizuale të përgjithshme. Transformimi i tekstit në vektorë tokenësh kryhet këtu menjëherë nga tre kodues (dy modele CLIP dhe një T5-XXL - 'T5', për më tepër, Teksti-Në-Tekst Transfer Transformer) — dhe, të them të vërtetën, ata nuk janë të detyruar të punojnë me të njëjtën sugjerim.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Por mjaft me hyrjet: le të kalojmë në atë që i kushtohet "Workshop", — gjenerimit të imazheve mbi bazën e modelit SD3M. Do ta përdorim këtë, siç u tha më parë, ambientin e punës ComfyUI, të cilin mund ta shkarkoni nga lidhja direkte në GitHub. Theksojmë se kjo version është vetëm për ekzekutimin në kartat grafike NVIDIA ose drejtpërdrejt në CPU AMD ose Intel (ndërsa do të jetë, natyrisht, shumë më i ngadaltë): pronarët e kartave grafike AMD u ofrohen zgjidhje në formën e paketave rocm dhe pytorch, të cilat mund të instalohet përmes menaxherit të shkarkimeve pip.

Pas përfundimit të instalimit të ambientit të punës, duhet të vendosni skedarët .safetensors që i keni shkarkuar më parë: modelet — në katalogun ComfyUImodelscheckpoints, konvertuesit e tekstit në tokë — në ComfyUImodelsclip. Dhe — mund të filloni!

#Koha për të shpejtuar

Është e rëndësishme të përmendet se AUTOMATIC1111, që është e njohur për lexuesit e "Workshop" të mëparshëm për temën e pikturimit me AI, deri në fund të qershorit gjithashtu ka marrë mundësinë për të ekzekutuar SD3M, megjithatë në ComfyUI mbështetje për modelin e ri deri tani mbetet më e plotë. Nuk është për t'u habitur — sepse deri për një kohë të fundit autori i "monstrës makaronike", i njohur në komunitetin e entuziastëve me pseudonimin ComfyAnonimous, ose thjesht Comfy, ka qenë punonjës në Stability AI, ku punonte, përfshirë mbi ambientin e brendshëm të punës, të cilin e përdorin vetë zhvilluesit. Siç do të shohim pak më vonë, versioni më i ri i ComfyUI vërtet dëshmon se autori i saj ka informacione të caktuara në lidhje me se si funksionon dhe punon ky model kontrovers, - informacione që krijuesit e ambienteve të tjera për ekzekutimin lokal të Stable Diffusion 3 Medium për arsye të kuptueshme nuk mund të mburren.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Të instalohet ComfyUI në versionin portable për Windows është shumë e thjeshtë: pas shkarkimit të arkivës përkatëse ZIP nga faqja zyrtare e projektit bëhet e mjaftueshme ta shpakoni në një katalog të përshtatshëm; sigurisht, e preferueshme është në një pjesë logjike të bazuar në SSD, dhe jo në HDD, – shkëmbimi midis memorjes dhe harduerit, duke marrë parasysh ciklet e ngarkesës dhe shkarkesës së modeleve, madje edhe për të gjeneruar një vetëm një imazh (mjedisi do të duhet fillimisht të vendosë në videovRAM konvertuesit e tekstit në tokë, pastaj të pastrojë memorinë video dhe të ngarkojë vetë SD3M) pritet akoma më e madhe, sa më pak memorie video të ketë në dispozicion ky kompjuter. Për më tepër, instalimi portativ është i shkëlqyer gjithashtu për shkak të pavarësisë së tij totale: asgjë – përveç hapësirës së lirë në diskun logjik – nuk pengon të zhvilloni lokalisht sa më shumë kopje të ComfyUI, duke eksperimentuar pa frikë se do të dëmtoni sistemin e qëlluar dhe të funksionojë mirë.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Pas sigurimit që skedari i modelit kryesor SD3M, pa koduesit e integruar të tekstit në tokë (skedari stableDiffusion3SD3_sd3Medium.safetensors, 4,2 GB) është vendosur në nën-katalogun checkpoints (në rastin tonë të instalimit të testit, rruga e plotë është C:Fun-n-GamesComfyUI-SD3ComfyUImodelscheckpoints), dhe të tre modellet e koduesve (skedarët stableDiffusion3SD3_textEncoderClipG.safetensors, stableDiffusion3SD3_textEncoderClipL.safetensors dhe stableDiffusion3SD3_textEncoderT5E4m3fn.safetensors; 1,3 GB, 234 MB dhe 4,7 GB përkatësisht) janë në nën-katalogun clip (C:Fun-n-GamesComfyUI-SD3ComfyUImodelsclip), mund të nisni ambientin e punës me një dy klikim mbi skedarin run_nvidia_gpu.bat në папкёn rrënjёsore (në rastin tonë C:Fun-n-GamesComfyUI-SD3). Pasi të filloni serverin, në dritaren e komandave Windows që shfaqet, një tab e re do të hapet automatikisht në shfletuesin parazgjedhor (kjo nënkupton Cilësimet e skedarit BAT), ku në adresën 127.0.0.1/8188 do të jetë e arritshme ndërfaqja web. të njohur tashmë nga ne më parë (sikurse vetëm në afërsisht të parë) «monstra e makaronave».

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Në parim, nëse keni në dispozicion një kartë grafike më moderne NVIDIA (nga brezi RTX, dhe jo GTX, madje edhe me vetëm 6 GB video RAM), mund të ngarkoni menjëherë në mjedisin e punës një ciklogramë referimi nga vetë ComfyAnonimous, për të cilën është folur më parë — skedari comfy_example_workflows_sd3_medium_example_workflow_multi_prompt.json me dritare të shumta për hyrjen e sugjerimeve, nga një dritare për secilën nga tre kodifikuesit, — dhe të punoni me të. Megjithatë, së pari do të duhet të përputhni emrat e katër skedarëve të modeleve (në nodet e ngarkimit të tyre) me ato që keni. Autori i ciklogramës referuese, duket se ka punuar në vendin e tij të punës (në Stability AI, siç është përmendur tashmë) me skedarët që i ka pasur lokal, të cilët do të kenë pasur emra pak më ndryshe, prandaj, nëse klikoni butonin "Queue Prompt" në ndërfaqen spartane të ComfyUI menjëherë pas ngarkimit të ciklogramës, mjedisi i punës do të japë një mesazh gabimi.

#Trekëndëshi për gjenerimin AI

Megjithatë, kjo është mjaft e lehtë për t'u rregulluar: atëherë, më shumë na shqetëson fakti që GTX 1070 që kemi në dispozicion përpunon SD3M me një shpejtësi tmerrësisht të ngadaltë — gjenerimi i imazhit ndodh me një shpejtësi prej 27-30 sekondash për çdo iteracion, dhe, duke marrë parasysh se parametri "Steps" në ciklogramën referuese është vendosur në "28", kalon shumë kohë pa arsye. Prandaj, do të kryejmë një optimizim të vogël — do të përdorim modulin Python venv (mjedise virtuale, "ambientet virtuale"), i cili ka për qëllim, ndër të tjera, të përshpejtojë punën e modeleve të AI-gjeneruese. Ai nuk përfshihet në paketimin e versionit portativ të ComfyUI, Megjithatë, ka shumë mënyra për ta instaluar, i cili përfundon me implementimin e një ambienti të plotë Python në PC-në lokale — dhe aktivizimin e modulit të nevojshëm nga ky ambient.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Le të shpresojmë se lexuesit që ndjekin "Punishtet" tona tashmë kanë një instalim aktiv të AUTOMATIC1111 në makinat e tyre. Në këtë rast, gjithçka është shumë më e thjeshtë: moduli venv është tashmë i instaluar, dhe gjithçka që kërkohet të bëni për ta aktivizuar atë në fillim të mjedisit të punës ComfyUI, është të kryeni thirrjen siç duhet. Fillimisht duhet të mbyllni serverin, duke kaluar në dritaren e tij dhe duke shtypur "Ctrl" + "C", pastaj duke futur "y" për të konfirmuar; më pas — kopjoni skedarin BAT run_nvidia_gpu.bat në një të ri, me emrin, për shembull, run_with_venv.bat. Skedari origjinal i nisjes është shumë i thjeshtë — ai thjesht thërret një kopje portative të instaluar të Python me parametrin —windows-standalone-build:

.python_embededpython.exe -s ComfyUImain.py —windows-standalone-build

pauzë

Kyti i vetë nuk është shumë e qartë - ajo nënkupton disa optimizime, të cilat, shumë gjasa, janë të designeduar për karta grafike më të reja NVIDIA dhe prandaj mund ta vështirësojnë jetën për ata që ende vazhdojnë të besojnë në GTX-in e tyre të merituar. Për këtë arsye, do të hiqnim —windows-standalone-build nga komandat, dhe njëkohësisht do të heqim edhe një optimizim tjetër të ri - "menaxherin e mençur të memories", smart memory, i cili përpiqet të mbajë sa më shumë informacion në videoRAM, pa e shkarkuar atë. Kjo vërtet e përshpejton krijimin e imazheve nga AI, por, në të njëjtën kohë, e kthen kompjuterin tonë moralisht të vjetruar në një sistem njëpërdorimor - nuk kemi mundësi të bëjmë as surfing në internet, as të luajmë, as madje të punojmë me dokumentet dhe postën në PC paralelisht me aktivitete të mjedisit të punës. Pra, për ata që nuk kanë një kompjuter të dedikuar për artin AI, një skedar BAT për të nisur ComfyUI (jo vetëm me qëllim të gjenerimit të imazheve me SD3M, në fakt, - është gjithashtu i përshtatshëm për SDXL):

@echo off

call cd C:Fun-n-GamesGitstable-diffusion-webuivenvScripts

echo %cd%

call activate.bat

echo venv activated

call cd C:Fun-n-GamesComfyUI-SD3

echo %cd%

call .python_embededpython.exe -s ComfyUImain.py —disable-smart-memory

pauzë

Këtu supozohet se instalimi portativ i ComfyUI është bërë në katalogun C:Fun-n-GamesComfyUI-SD3, dhe AUTOMATIC1111 është instaluar më parë në C:Fun-n-GamesGitstable-diffusion-webui. Numri i madh i "echo" është thjesht për kontrollin vizual të asaj që ndërrimi i dosjeve po kalon normalisht dhe komandat e nevojshme ekzekutohen - pasi gjithçka të jetë rregulluar, mund t'i heqim ato nga skedari BAT.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Rifillim mjedisin e punës, këtë herë duke klikuar dy herë mbi run_with_venv.bat. Pasi që më parë thjesht mbyllëm serverin, ndërsa ndërfaqja e uebit nuk u prek, në seksionin përkatës duhet të ketë ende atë diagramin e bazës ComfyUI me emrat e modeleve të korrigjuar. Të fokusojmë vëmendjen në pjesën e djathtë: aty ndodhet noda "Preview Image", e cila nuk ruan imazhin e gatshëm në disk, por thjesht e demonstron atë. Nëse filloni çdo herë diagramin për të gjeneruar një imazh të vetëm, ta vlerësoni vizualisht, të ndryshoni ndonjë parametrin, dhe përsëri të filloni - ky është një opsion i punës: imazhin që pëlqeni gjithmonë mund ta ruani manualisht duke klikuar me të djathtën mbi të. Por, nëse bëni shumë gjenerime në mjedisin e punës njëra pas tjetrës, është më mirë që rezultatet e tyre të akumulohen automatikisht në memorie të përhershme (në katalogun ComfyUIoutput sipas parazgjedhjes).

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Prandaj është më mirë që menjëherë të ndryshoni nodën "Preview Image" në "Save Image". Për këtë, klikoni dy herë me butonin e majtë në ndonjë zonë të lirë të diagramit - do të hapet një dritare për zgjedhjen e nodave me rreshtin e kërkimit. Në këtë rresht do të fillojmë të shkruajmë "Save..." - dhe pothuajse menjëherë do të shohim emrin e kërkuar. Më pas, mbetet vetëm të klikoni mbi të dhe të lidhni hyrjen e nodës që u shfaq me daljen "IMAGE" të nodës "VAE Decode", ku fillimisht ishte lidhur "Preview Image". Noda "Preview Image" mund të hiqet më pas - thjesht e përzgjidhni duke klikuar mbi titullin dhe të shtypni çelësin "Del" në tastierë.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Dhe tani - është koha e duhur për të ekzekutuar diagramin bazik të autorit ComfyAnonimous (me ndryshimet tona modeste). Kjo është ajo që del:

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Një imazh tepër mbresëlënës, madje edhe me një atmosferë, - dhe nuk do ta thoshit se është krijuar me të njëjtin model, i cili në mënyrë të plotë shkatërron udhëzimin për të vizatuar njerëzit që shtrihen në bar. Në të njëjtën kohë, sistemi funksionon mjaft mirë - rreth 5-6 sekonda për iteracion për një imazh me sipërfaqe 1 Mpiksel në GTX 1070 mund të konsiderohet një tregues i kënaqshëm. Për të krahasuar: ai PC me atë ComfyUI dhe me të njëjtin skedë BAT gjeneron imazhe SDXL të ngjashme në përmasa, duke shpenzuar rreth 6-7 sekonda për çdo iteracion, kështu që "tre" mund të konsiderohet se është më pak kërkues për pajisjet e PC-së ku po kryhet gjenerimi AI.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Tani tani të rregullojmë dimensionet e kanvasit. Jo shumë larg nga nodi 'EmptySD3LatentImage', i cili i përcakton ato, ndodhet një nodë ndihmuese 'Note' (e lidhur ashtu siç duhet), ku përmban një kujtesë të rëndësishme: sipërfaqja totale e imazhit në rastin e SD3M duhet të jetë rreth 1 MPiksel, - nga e cila duhet të përcaktohen dimensionet e anëve të kanvasit drejtkëndor. Të caktojmë atë si 1344×768 - që del rreth 1,03 MPiksel.

Vëmendje: më sipër ndodhet nodi 'Seed', ku është caktuar vetë ndihma, në këtë rast '945512652412924', dhe është specifikuar se ajo nuk duhet të ndryshojë pas gjenerimit (parametri 'fixed').

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Do të ekzekutojmë të njëjtën ciklogramë me ndihmën e mëparshme, por tashmë për kanvasin drejtkëndor. Menjëherë bëhet e dukshme se koha e përgjithshme e ekzekutimit është më e shkurtër, edhe pse shpejtësia e përpunimit ka mbetur e njëjtë - më pak se 6 sekonda për iteracion. Dhe kjo ka kuptim: pasi nxitësit tekstualë nuk u ndryshuan, nuk është e nevojshme të ngarkohet sërish kodifikuesi për ta. Imazhi në daljen e tij, është e qartë, është disi ndryshe nga i pari, katror, por jo në mënyrë thelbësore - kompozita e përgjithshme, siç pritej, mbeti e njëjtë.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Tani do të vëmë re në nodet 'CLIPTextEncodeSD3' dhe 'CLIP Text Encode (Negative Prompt)'. E para dallohet për shkak se përmban menjëherë tre fusha inputi; nëse hiqet teksti nga ato, do të shihen shënimet për cilët kodifikues janë të destinuar, - nga lartë në poshtë janë CLIP G, CLIP L dhe T5XXL. Në ComfyUI, për arsye të qarta, nuk kishte nodë të tilla më parë. Ciklograma mbështetëse përmban sugjerime të shkurtëra për dy fushat e para të tekstit (për konvertuesit CLIP G dhe CLIP L) dhe një sugjerim shumë më të gjerë për të tretën - T5XXL. Natyrisht, përmbajtja e këtyre fushave mund të luhet në një gamë të gjerë, dhe studimi se në çfarë mase ndryshimi i tekstit në to ndikon në imazhin përfundimtar është një detyrë e papërbërë, por jashtëzakonisht interesante. Megjithatë, për arsye që do të bëhen të qarta më vonë, nuk do të merremi me të drejtpërdrejt.

Në nodën «CLIP Text Encode (Negative Prompt)», për kundërshtim, nuk ka asgjë të veçantë, — por vlerësoni sa e vështirë është rruga nga ajo deri te hyrja përkatëse «conditioning» në nodën kryesore «KSampler»! Kjo rrugë shkarstepet, për më tepër një nga degët e saj (këtu e sipër) tregon se duke nisur nga 10% e hapave të gjenerimit dhe deri në përfundimin e saj, sistemi nuk do të marrë parasysh asnjëherë sugjerimin negativ (kalimi i rrugës përmes nodës «ConditioningZeroOut» pikërisht tregon anulimin e kushteve). Ndërsa degëza tjetër e kalon sugjerimin negativ (po ashtu në mënyrë kushtore me peshë gjysmë) për përpunim të mëtejshëm pa ndryshime — por vetëm në dhjetë përqindëshin e parë të numrit të përgjithshëm të hapave të gjenerimit.

#Të paqëndrueshme larg

Një herë tjetër: dhjetë përqind të parë, dmth. 3 nga 28 të caktuar në këtë rast, hapave të gjenerimit, sugjerimi negativ dërgohet në nodën «KSampler», e cila është e angazhuar në formimin e imazhit në hapësirën latent (në hapësirën e pikselëve, dmth. në një imazh të perceptueshëm nga njeriu, rezultati i saj përkthehet nga nodë tjetër, «VAE Decoder»), në mënyrë normale: degëza e sipërme (me anulimin e kushteve) nuk është aktive, funksionon vetëm e poshtme. Ndërsa 90% e mbetur të hapave (25 nga 28 në rastin tonë) sugjerimi negativ nuk funksionon fare: degëza e sipërme e transmetimit të kushteve është aktive — me anulimin e tyre, — dhe lëvizja përmes të poshtmes është bllokuar nga parametri kufitar i aktivizimit të nodës përkatëse «ConditioningSetTimestepRange». Tani kuptohet pse disa analistë deklarojnë se sugjerimet negative për SD3M mund të mos përdoren fare, — efekti i tyre (nëse shqyrtojmë pikërisht këtë, nodën e referencës, dhe supozojmë se në faqet me gjenerim online sipas modelit SD3 Medium zbatohen rregulla të ngjashme) është minimal.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Dhe megjithatë, ai ekziston: nëse thjesht merrni dhe lidhni drejtpërdrejt daljen e nodit "CLIP Text Encode (Negative Prompt)" me hyrjen përkatëse "KSampler" (ose shënoni të gjitha nodet përmes përjashtimit si "bypass", që do të sjellë të njëjtin efekt), cilësia e imazhit përfundimtar do të përkeqësohet ndjeshëm. Kjo, për të thënë të vërtetën, mund të konsiderohet si një provë e tërthortë e "papjekurisë" së SD3M, pasi rregullimi i forcës dhe rëndësisë së sugjerimit negativ, në terma të saktë, duhet të ishte brenda mundësive të zhvilluesve përpara se të publikonin peshat e modelit në akses të hapur. Dy degë të kushteve të veçanta për aplikimin e sugjerimit negativ — një lloj patch-i, dhe në këtë kuptim këmbënguljen e entuziastëve se "treja" hapur nuk arrin te pritjet e nxehta që reklamoi departamenti i marketingut të Stability AI për të, duken plotësisht të arsyeshme.

Mungesa e së paku një udhëzimi të shkurtër zyrtar për përdorimin e SD3M ka çuar në atë që në internet tashmë qarkullojnë thashetheme se kjo model nuk është trajnuar fare për përdorimin e sugjerimeve negative. Çfarë, natyrisht, nuk është kështu, por në çdo rast, përdorimi i këtyre sugjerimeve duhet të bëhet ndryshe nga çfarë e kanë zakonisht operatorët e SD 1.5 dhe SDXL. Në veçanti, entuziastët me seriozitet të plotë pohojnë se shtimi i përshkrimeve të detajuara në fushën negative të sa më shumë pamjesh të pahijshme (po, po, e vjetra "nsfw, nude" nuk mjafton — do të duhet me të vërtetë të aktivizoni imagjinatën) sjell një përmirësim të dukshëm të pamjes madje edhe të famshmes vajzë duke u shtrirë në bar. Nëse është kështu apo jo — nuk mund të zbulohet pa një kontroll të kujdesshëm (dhe nuk është fakt se madje edhe shënimi "18+" në krye të faqes sonë do ta mbrojë publikimin nga paditë e mbështetësve të moralit, nëse guxojmë të publikojmë "mrekullinë e sugjerimit" të përbërë nga entuziastët — pavarësisht se është në anglisht). Ky situatë e çuditshme i ngjan një rasti me mësimet e hershme mesjetare kundër paganizmit, për shkak të të cilave — pikërisht sepse përmbanin përshkrime mjaft të detajuara për atë që dhe si nuk duhej të bënin të krishterët e mirë, — na kanë mbetur të paktën fragmente të shkruara që dëshmojnë besimet dhe zakonet e Rusisë para krishterimit.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Tani, shpresojmë, është bërë më e qartë pse thellimi në studimin e SD3M në këtë fazë nuk duket si një shpenzim i arsyeshëm energjie dhe kohe. Ka me të vërtetë shumë për të diskutuar dhe eksploruar: dhe parametrat e fortë të rekomanduar për gjenerimin në nodën "KSampler" (CFG — 4.5-5.0; numri i hapave — rreth 28; për çiftin sampler/scheduler — përjashtimisht dpmpp_2m/sgm_uniform, ndryshe cilësia e prodhimeve bie ndjeshëm); dhe varianca e madhësisë subjektive të cilësisë së gjenerimeve me parametrat fillestarë të njëjtë, por me ngacmime të ndryshme; dhe eliminimi i të famshmit "mallkimi i shtratit në/bar" (për të cilën tashmë ofrohen zgjidhje shumë të pazakonta); dhe, në thelb, zbardhja e cilëve ishin parametrat e gjenerimit që ndikojnë çdo një nga tre transformuesit e tekstit në tokene — dhe si, duke operuar me to, të arrini të merrni vepra të vërteta të Artit të IImagjinatës (nëse kjo është e mundur për "trojkën" në parim, natyrisht).

Për më tepër, shkarkimi i Emad Mostak në mars dhe ComfyAnonimous në qershor, dhe jo vetëm ata, — nuk janë vetëm shqetësitë që kanë ndodhur Stability AI. Siç raporton Reuters, duke iu referuar The Information, ky start-up britanik ka shkruar vetëm pak kohë më parë (në momentin e hartimit të këtij artikulli) për herë të dytë ndryshoi shefin ekzekutiv nga Prem Akkaraju, përfaqësues i njohur i një grupi global investitorësh IT — dhe kjo, nga ana tjetër, është e gatshme të investojë një shumë të konsiderueshme të paraveështë fjala për 80 milion dollarë amerikanë). Pozita e Stability AI si një strukturë biznesi sot është hapur thellësisht e paqëndrueshme; shumë entuziastë të zhgënjyer parashikojnë një fund të shpejtë për të — dhe në këtë situatë është e vështirë të pritet një punë e menduar nga kompania, madje edhe për gabime kaq të qarta.

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Politika e licencimit të pabesueshme e ndalon, fatkeqësisht, komunitetin nga përmirësimi i SD3M, ashtu siç ndodhi me SD 1.5 dhe SDXL. Të paktën, piketat e deriva dhe mjetet si LoRA për dy modelet e fundit do të mbeten të disponueshme për ekzekutim lokal, madje kur (dhe nëse) Stability AI e mbyll rrugën e saj si një strukturë tregtare. Menjëherë pas dështimit të jashtëzakonshëm të "trojkës", në forumet profesionale në internet filluan të dëgjohen gjithnjë e më shpesh zëra në mbështetje të krijimit të një projekti jofitimprurës për zhvillimin e një modeli gjenerativ për transformimin e tekstit në imazhe në bazë të financimit kolektiv — dhe deri tani, ky lëvizje po merr formë nën emrin Open Model Initiative. Disa segmente, si Invoke (një nga platformat për gjenerimin e IA online, e orientuar për studio profesionale), Comfy Org (ekipi që merret me mbështetje dhe zhvillim të ComfyUI), Civitai (nuk ka nevojë për prezantim) dhe ekipi që është pas LAION (bazës së imazheve të annotuara, mbi të cilat trajnohen kryesisht këto lloje modelesh) kanë shpallur gatishmërinë për t'u bashkuar aktivisht me të.

Ndaj, në horizontin e afërt, lëshimet e reja të "Masterkës" do të orientohen, për sa duket, në punën me ato modele për të cilat komuniteti ka arritur të krijojë një gamë të gjerë përmirësimesh dhe instrumentesh shtesë, - në "polutorkë" dhe "Oversize". Ndoshta, koha e triumfit për SD3M do të vijë akoma, - por sot është e vështirë të supozohet se kur do të ndodhë kjo. Deri atëherë, ata që janë të interesuar mund të shkarkojnë arkivin me gjenerimet e përmendura në këtë artikull të SD3M (ciklogramet janë të integruara direkt në skedarët PNG; mjafton të tërheqësh imazhin në fushën e punës ComfyUI nga "Explorer" i Windows për të riprodhuar të gjithë rendin dhe parametrat e gjenerimit) këtu. Ndoshta, dikush nga lexuesit tanë do të mund të zbulojë më parë se sa përdoruesit e zakonshëm të Reddit dhe Hugging Face mënyrën optimale për të shpërndarë tekstin në tre fushat e sugjerimit, për shembull?

Artikulli i ri: Praktikë për pikturën me AI, pjesa e nëntë: SD3M — "tre" për "tre"

Materialet në temë:

Stability AI ndërruan drejtimin dhe tërhoqën 80 milion dollarë investime.

U prezantua gjeneratori i imazheve AI Stable Diffusion Medium, që kërkon vetëm një kartelë grafike me 5 GB memorie.

Stability AI është e mbuluar me borxhe dhe tani po kërkon blerës.

Startup-i AI Stability AI do të reduktojë 10% të stafit për shkak të rritjes së konkurrencës.

Është njoftuar Stable Diffusion 3.0 — AI për të pikturuar ka ndryshuar arkitekturën dhe ka mësuar të shkruajë.

Burimi: 3dnews.ru

Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS 🔥 Bleni hostim të besueshëm për faqe me mbrojtje nga DDoS, serverë VPS VDS | ProHoster