ĂshtĂ« interesante si historia e lançimeve tĂ« modeleve tĂ« hapura pĂ«r konvertimin e sugjerimeve tekstuale nĂ« imazhe, tĂ« zhvilluara dhe stĂ«rvitura nga kompania Stability AI, ngjan me njĂ« seri ngritjesh dhe rĂ«niesh tĂ« vazhdueshme tĂ« versioneve tĂ« sistemit operativ Microsoft. Pas suksesit legjendar tĂ« XP, kujtojmĂ«, erdhi Vista problematike; mĂ« pas shkĂ«lqyeshĂ«m "shtatĂ«ja" â e pasuar nga Windows 8 e padobishme. Pas versionit fillestar 1.5 tĂ« Stable Diffusion, qĂ« ishte me tĂ« vĂ«rtetĂ« modeste, por u zhvillua nga entuziastĂ«t, pasoi SD 2.0 e qartĂ« qĂ« e dĂ«shtoi â dĂ«shtim, nĂ« fakt, sepse pĂ«rfshinte njĂ« kodifikues OpenCLIP tĂ« pazakontĂ« pĂ«r modelet e kĂ«tij tipi, nga . GjatĂ« kĂ«tij pĂ«rzgjedhjeje, jo vetĂ«m qĂ« u pĂ«rjashtuan referencat vizuale tĂ« papĂ«rshtatshme (NSFW), por edhe pikturat dhe ilustra tĂ« realizuar nga artisitĂ« e njohur si Greg Rutkowski. PikĂ«risht kjo e fundit zemĂ«roi pĂ«rfundimisht entuziastĂ«t: nĂ«se pĂ«r SD 1.5, madje edhe nĂ« variantin e saj origjinal, pa pĂ«rdorur pika kontrolli tĂ« veçanta tĂ« trajnuara mirĂ«, sugjerimet e thjeshta me stile â "epic medieval fantasy landscape, in the style of Greg Rutkowski" â rezultati ishte impresionues, ndĂ«rsa SD 2.0 ndaloi tĂ« "n recognizonte" emrat e ilustrueseve mĂ« tĂ« njohur, tĂ« cilĂ«t ruajnĂ« ende tĂ« drejtat e autorit mbi veprat e krijuara dhe qĂ« nuk e kishin ndihmuar me kĂ«to vepra pĂ«r trajnimin e AI. Duhej tĂ« pĂ«rdoren mĂ« shumĂ« fjalĂ« pĂ«r tĂ« pĂ«rshkruar atĂ« qĂ« dĂ«shironim, ndĂ«rsa me sugjerime shumĂ« tĂ« gjata, modeli nuk pĂ«rfundonte mire.

U ulĂ«m â u ngritĂ«m, u ulĂ«m â u ngritĂ«m
NĂ« kombinim me koduesin e ndryshuar (transformatori i sugjerimeve tĂ« tekstit nĂ« tokene numerike, me tĂ« cilat modeli punon pas pĂ«rputhjes) pamundĂ«sia pĂ«r tĂ« aplikuar stilet e emĂ«rtuara thjesht i ndaloi entuziastĂ«t nga motivimi pĂ«r tĂ« pĂ«rmirĂ«suar "dyshakun" vetĂ«. VĂ«rtet: kĂ«tu duhej tĂ« arrihej njĂ«kohĂ«sisht me ndihmĂ«n e asaj qĂ« duhej rregulluar pĂ«r tĂ« pĂ«rshtatur teknikĂ«n e punimit tĂ« sugjerimeve me koduesin e ri dhe pĂ«r tĂ« trajnuar modelin pĂ«r tĂ« njohur ato imazhe dhe tema, me tĂ« cilat krijuesit nuk e kishin njohur gjatĂ« trajtimit fillestar - dhe diferenca cilĂ«sore me "gjysmĂ«â nuk e garantonte akoma qĂ« imazhet e krijuara nga "dyshaku" ishin mĂ« tĂ« mira. Po, nga madhĂ«sia standarde prej 512Ă512 piksel pĂ«r SD 1.5 ka ndodhur njĂ« kĂ«rcim cilĂ«sor nĂ« 768Ă768, por deri atĂ«herĂ«, komuniteti kishte filluar tĂ« pĂ«rdorĂ« upscalers, outpainters dhe mjete tĂ« tjera pĂ«r tĂ« rritur madhĂ«sinĂ« pĂ«rfundimtare tĂ« imazhit, kĂ«shtu qĂ« SD 2.0 kaloi, mĂ« shumĂ« se gjithçka, pa u vĂ«nĂ« re. SDXL (i zhvilluar nga OpenAI dhe i pĂ«rdorur, nĂ« veçanti, nga projekti DALL-E) - kodi i tij Ă«shtĂ« gjithashtu i hapur, por tĂ« dhĂ«nat mbi tĂ« cilat Ă«shtĂ« trajnuar, , janĂ« pronĂ«sore. SĂ« bashku me kĂ«tĂ«, madhĂ«sia standarde e kanavacĂ«s u rrit pĂ«r "Oversize" nĂ« 1024Ă1024, plus u shfaq njĂ« numĂ«r i plotĂ« pĂ«rmirĂ«simesh tĂ« tjera - kĂ«shtu qĂ« entuziastĂ«t morĂ«n me kĂ«naqĂ«si nĂ« dorĂ« punimin e tij. Dhe deri tani, SDXL (gjithashtu variante tĂ« tij qĂ« nuk janĂ« aq kĂ«rkuese pĂ«r "harduerin" si dhe ) mund tĂ« konsiderohet me siguri si gjeneratori mĂ« i njohur i imazheve me inteligjencĂ« artificiale me kod tĂ« hapur. MegjithatĂ«, ndjekĂ«sit e pasionuar tĂ« SD 1.5 e diskutojnĂ« kĂ«tĂ« me argumente, duke theksuar se mjete kaq tĂ« rĂ«ndĂ«sishme si ControlNet nĂ« SDXL .
Dhe ja që nga 12 qershori 2024, që nga momenti i "publikimit në natyrë" të kodit të modelit, që i lejon gjenerimet lokale, duhej të vinte koha për versionin "e hapur" SD 3 - nëse jemi më të saktë, (SD3M ose SD3 2B) me 2 miliard parametra. Në mënyrë teorike, për t'u kujtuar, ky numër përputhet me numrin e përgjithshëm të peshave në hyrjet e të gjithë perceptronëve të modelit. Më herët, në prill, Stability AI e kishte përfunduar dhe ofruar për përdorim tregtar një variant 8-milionësh (në numrin e parametrave) , i njohur si SD3 8B. Në SDXL 1.0, për ta rikujtuar, është , megjithatë SD3M, sipas zhvilluesve, është . Këtu nënkuptohej se, me kërkesa për memorie video që ishin më të ulta se «Oversize», duhej të jepte imazhe «me një nivel të ri fotorealizmi», madje edhe në përgjigje të sugjerimeve jo të komplikuara. Në mesin e avantazheve të «tre-it» u përmend gjithashtu «cilësia paprecedente e tipografisë së tekstit të gjeneruar në imazhe», «kuptimi i thelluar i sugjerimeve përmes bashkëpunimit të tre koduesve» dhe «gatishmëria për trajnim të efektshëm edhe në grupe të kufizuara të të dhënave».

Siç duket, ishte e pritur qĂ« komuniteti i entuziastĂ«ve, duke marrĂ« nĂ« duar kĂ«tĂ« lojĂ« tĂ« pritur, do tĂ« pĂ«rpiqej ta zhvillonte atĂ« me tĂ« njĂ«jtin zell si «polutorka» dhe «Oversize» njĂ«herĂ« e njĂ« kohĂ«. MegjithatĂ« qĂ« nĂ« fillim, gjithçka shkoi ndryshe: SD3M, nĂ« orĂ«t e para pas publikimit tĂ« skedarĂ«ve tĂ« modelit nĂ« Hugging Face dhe Civitai, pĂ«r audiencĂ«n e saj, madje dy herĂ«. HerĂ«n e parĂ« â me njĂ« idiokrinji tĂ« paqartĂ« nĂ« dukje ndaj sugjerimeve, qĂ« pĂ«rfshinin frazĂ«n e dukshme «tĂ« shtrirĂ« nĂ« grasë» (lying on/in the grass); e dyta â me formulime tepĂ«r tĂ« paqarta nĂ« marrĂ«veshjen e pĂ«rdorimit, tĂ« cilat nuk arritĂ«n t'i kuptonin as avokatĂ«t profesionistĂ«. Dhe megjithĂ«se nga perspektiva e njĂ« entuziasti tĂ« zakonshĂ«m tĂ« artit TI, e fundit duket e parĂ«ndĂ«sishme, zhvillimi i mĂ«tejshĂ«m i modelit do tĂ« reflektojĂ« pĂ«rmes asaj qĂ« ndodh me aspektin ligjor â deri nĂ« pikĂ«n qĂ« nuk do tĂ« ketĂ« zhvillim tĂ« mundshĂ«m fare.
Krijimet e mĂ«parshme tĂ« Stable Diffusion me kod tĂ« hapur (nĂ« fakt, me vlera tĂ« hapura tĂ« pesha tĂ« rrjetit nervor, qĂ« ishin nĂ« dispozicion pĂ«r shkarkimin falas dhe ekzekutimin pasues lokal), si SDXL, janĂ« shoqĂ«ruar me njĂ« nga tiparet tipike pĂ«r modelet gjeneruese me tĂ« karakteristika si «licenca e pakufizuar, globale, jo-ekskluzive, falas, jo-shkĂ«putĂ«se, e patjetĂ«rsueshme pĂ«r qĂ«llimin e riprodhimit, pĂ«rgatitjes, shfaqjes publike, interpretimit publik, sublicencimit dhe shpĂ«rndarjes sĂ« materialeve shtesĂ« si duhur i modelit vetĂ« ashtu edhe e deri tĂ« derivateve tĂ« tij». «Trojca» parashikon dy lloje licencash: â me formulime jashtĂ«zakonisht lehtĂ«suese si «Stability AI ju ofron njĂ« licencĂ« jo-ekskluzive, globale, tĂ« pa-transferueshme, pa mundĂ«si sublicencimi, tĂ« revokueshme, falas dhe tĂ« kufizuar mbi pronĂ«sinĂ« intelektuale» â dhe .
Barin nuk e çon në mirë
Pas njĂ« kohe shumĂ« tĂ« shkurtĂ«r, komuniteti u pajtua se . NĂ« thelb shpalli bojkottin e kompanisĂ« zhvillimore, duke mos dĂ«shiruar tĂ« humbasin kohĂ«n dhe energjinĂ« nĂ« trajnimin e njĂ« modeli tĂ« qartĂ« tĂ« papĂ«rpunuar dhe tĂ« deformuar â me vetĂ«dijen se Stability AI nĂ« çdo moment mund tĂ« revokojĂ« licencĂ«n e dhĂ«nĂ« mĂ« parĂ« njĂ« entuziasti tĂ« caktuar qĂ« po kryen njĂ« trajnim tĂ« tillĂ«. MarrĂ«veshja e licencĂ«s Ă«shtĂ« formuluar nĂ« njĂ« mĂ«nyrĂ« qĂ« personat jo-juridikĂ« qĂ« e studiojnĂ« atĂ« krijojnĂ« pĂ«rshtypjen se pas revokimit tĂ« lejĂ«s pĂ«r pĂ«rdorim komercial tĂ« SD3M, i mĂ«parshmi pronar i tij do tĂ« ishte i detyruar tĂ« fshijĂ« tĂ« gjitha produktet qĂ« ka krijuar si derivate tĂ« pronĂ«sisĂ« intelektuale qĂ« i Ă«shtĂ« dhĂ«nĂ« licenca, duke pĂ«rfshirĂ« si modelet e trajnuara (LoRA, inversitete tekstuale, tĂ« gjithĂ« checkpointet), ashtu edhe derivatet e tyre (citim: «Pas pĂ«rfundimit tĂ« kĂ«saj MarrĂ«veshjeje, ju do tĂ« fshini dhe do tĂ« ndaloni pĂ«rdorimin e çdo Produkti Softuerik ose Veprash Derivative») â pra, produktet e punĂ«s sĂ« tashme tĂ« njerĂ«zve tĂ« tjerĂ« qĂ« kanĂ« pĂ«rdorur kĂ«to modele derivate si njĂ« pikĂ« fillimi pĂ«r punĂ«n e tyre; dhe sidomos pĂ«r punĂ«n e kryer qĂ« nuk Ă«shtĂ« paguar nga askush, e realizuar nĂ« puritate entuziazmi.
Shumë shpejt pas arritjes së një valë zemërimi për këtë, filluan të shfaqen mesazhe nga avokatë profesionistë, çfarë do të thotë se një rishikim me ndalim të mëtejshëm përdorimi duhet të lidhet vetëm me disa produkte mbështetëse me kod të mbyllur, që Stability AI do të kalojë te përdoruesi komercial (për shembull, për të shpejtuar dhe optimizuar atë të njëjtin trajnimin e SD3M), - por deri tani kompania vetë nuk ka ofruar shpjegime për këtë çështje. Dhe fakti i këtij heshtjeje shtypëse për tre javët e fundit (në momentin e shkrimit të këtij artikulli) që nga shfaqja e "trejës" në qasje të hapur dëmton reputacionin e zhvilluesit shumë më tepër se një bar - që krijohet nga krijimi i tij për vajzat.

Sa i përket barit të famshëm, që përfundoi dosido për disa orë si meme , dhe pastaj në pothuajse të gjitha platformat më ose më pak të profilizuara në rrjet, del se prania në sugjerimin e frazës si "një vajzë që shtrijë mbi bar" çon në shfaqjen në daljen e "trejës" jo vetëm të halucinacioneve, por edhe të krijimeve tmerruese nga fantazia e sëmurë - në kuptimin mjekësor - të artistëve dhe film-makerëve që specializohen në body horror (ju lutemi, nëse ju intereson arsyetimi dhe jeta juaj, mbani larg nga këto dhe mos përpiquni as ta shkruani këtë frazë në dritaren e kërkimit për imazhe me filtrin e sigurisë të çaktivizuar). Në këtë rast, imazhet e njerëzve që qëndrojnë - dhe pak më pak qëndrojnë - i japin "trejës" një katër të bindur me plus, ndërsa portretet ndonjëherë dalin të përsosura; të paktën, jo më keq se modeli bazë SDXL 1.0, - problem është se ndonjë tabu e brendshme lidhur me pozitat horizontale të trupit njerëzor.
Duke u bazuar në komentet e Emad Mostaque, themeluesit dhe ish-kreut (deri në mars 2024) të Stability AI, i cili ka dalë nga kompania për të , dhuna e rëndë ndaj SD3M pikërisht para hapjes së saj për përdorim të kufizuar jo-komerciale (API e modelit më të madh SD3 8B për gjenerimin online, kujtojmë, , por pesha e saj akoma mbetet e fshehur) ishte pasojë e dëshirës së drejtuesve aktualë për sigurinë - , që u formulua që në marsin e këtij viti si .Në kuadër të kësaj politike, përdorimi i modelit gjenerativ SD3M nuk lejohet "të kryejnë, promovojnë, ndihmojnë, lehtësojnë, inkurajojnë, planifikojnë, nxisin ose ndihmojnë në përhapjen e dhunës, terrorizmit ose krijimin e përmbajtjes që nxit urrejtje, që diskriminon ose kërcënon një grup të mbrojtur njerëzish (pavarësisht nga gjinia, etniciteti, identiteti ose orientimi seksual, feja apo tjerë).", - prandaj asnjë imazh panda me atë që ka nënë prej tij, duke u përballur me dragonjë të egër! Vetëm mace në kapela qesharake, qentë në xhupat e bukur, shishe me pije misterioze dhe biskota të freskëta, direkt nga furra!
Nëse flasim teknikisht, mundësia e zbrazjes së modelit ishte se seti i të dhënave të trajnimiti thjesht përjashtoi imazhe me njerëzit të shtrirë dhe imazhe të tjera që nënkuptonin ndonjë interpretim të papërshtatshëm, - dhe prandaj tani "tresha" thjesht "nuk e kupton" kuptimin e fjalës "të shtrirë". Ose ndoshta arkitektura e përmirësuar SD3 e lejon identifikimin e peshave në perceptronët që aktivizohen gjatë gjenerimit të imazheve "të pasigurta", - dhe këto pesha janë shfuqizuar përzgjedhshëm drejt lançimit, duke rezultuar në "halucinimin e detyruar". Në të vërtetë, : koduesi përktheu saktë tekstin në tokene, por në hapësirën latente "të mbrojtur" këto tokene nuk i japin asgjë specifike, - dhe prandaj pixelat rezultat në imazh ndodhen në mënyrë rastësore.

Duke marrĂ« parasysh disponueshmĂ«rinĂ« e API-tĂ« tĂ« njĂ« model tĂ« plotĂ«, por tĂ« mbyllur SD3 8B pĂ«r disa muaj dhe garancitĂ« e ngrohta tĂ« menaxherĂ«ve tĂ« mediave Stability AI se "kompaktizuar" 2B , entuziastĂ«t e vizatimeve me AI takuan lançimin e aksesit tĂ« peshave SD3M mĂ« 12 qershor me shumĂ« entuziazĂ«m: . Aktualisht, mund ta merrni atĂ« ende, edhe pse me njĂ« rrugĂ« pak mĂ« tĂ« gjatĂ« se ajo qĂ« jemi mĂ«suar pĂ«r checkpoint-at SDXL dhe SD 1.5. NĂ« thelb, rruga e zakonshme Ă«shtĂ« tĂ« drejtoheni nĂ« faqen e Civitai, nga e cila shumica e modeleve shkarkohen pa u regjistruar, por qĂ« nga 17 qershori dhe deri nĂ« momentin e dorĂ«zimit tĂ« kĂ«tij artikulli pĂ«r pĂ«rgatitje, faqja e kĂ«tij site-i e dedikuar pĂ«r "trio" . Arsyeja Ă«shtĂ« njĂ«: licenca komerciale pĂ«r SD3M Ă«shtĂ« shkruar nĂ« njĂ« gjuhĂ« kaq tĂ« paqartĂ«, saqĂ« madje avokatĂ«t e Civitai morĂ«n njĂ« pushim pĂ«r ta studiuar mĂ« nĂ« detaje. Sepse nĂ«se njĂ« entuziast strehon nĂ« PC-nĂ« e tij LoRA pĂ«r "trio" dhe e ngarkon atĂ« nĂ« Civitai, dhe Stability AI papritmas vendos qĂ« rezultati Ă«shtĂ« i papranueshĂ«m, dhe tĂ«rheq licencĂ«n nga pĂ«rgjegjĂ«si, â çfarĂ« duhet tĂ« bĂ«jĂ« nĂ« kĂ«tĂ« rast faqja-hoste? Ajo nuk vetĂ«m qĂ« publikojnĂ« checkpoint-at, ciclo-gramat ndihmĂ«se dhe modelet, por gjithashtu ofron vizitorĂ«ve mundĂ«sinĂ« e gjenerimit tĂ« pĂ«rshtatshĂ«m tĂ« imazheve nĂ« re dhe strehimin e tĂ« njĂ«jtave LoRA, inversionesh tekstuale, etj. NĂ« pĂ«rfundim, derisa tĂ« vazhdojĂ« procedura gjyqĂ«sore, skedarĂ«t e modelit dhe tre transformuesit e tij nĂ« paketĂ« mund tĂ« merren vetĂ«m .
Le të fillojmë
E vĂ«rteta Ă«shtĂ«, ka njĂ« nuancĂ«: pĂ«r tĂ« pasur akses nĂ« lidhjet e shkarkimit, Ă«shtĂ« e nevojshme tĂ« autentifikoheni nĂ« faqe dhe pastaj tĂ« konfirmoni pranuar marrĂ«veshjen e licencĂ«s sĂ« pĂ«rmendur mĂ« parĂ« â megjithatĂ«, kjo procedurĂ« Ă«shtĂ« falas dhe mjaft e arritshme nga Rusia. NĂ« total ofrohen katĂ«r variante modelet dhe po ashtu katĂ«r transformues pĂ«r shenjĂ«n tekstuale nĂ« tokene, plus tre ciclo-grama modelesh pĂ«r ekzekutimin nĂ« ambientin ComfyUI, :
modelet:
- sd3_medium.safetensors
- sd3_medium_incl_clips.safetensors
- sd3_medium_incl_clips_t5xxlfp8.safetensors
- sd3_medium_incl_clips_t5xxlfp16.safetensors
kodifikuesit:
- clip_g.safetensors
- clip_l.safetensors
- t5xxl_fp8_e4m3fn.safetensors
- t5xxl_fp16.safetensors
ciclotekstet:
- sd3_medium_example_workflow_basic.json
- sd3_medium_example_workflow_multi_prompt.json
- sd3_medium_example_workflow_upscaling.json
NĂ« kuadĂ«r tĂ« kĂ«tij "Workshop-i", do tĂ« kufizohemi nĂ« modelin bazik sd3_medium.safetensors (4.2 GB), tre koduesit â clip_g.safetensors (1.3 GB), clip_l.safetensors (234 MB) dhe t5xxl_fp8_e4m3fn.safetensors (4.7 GB), si dhe ciklogramin sd3_medium_example_workflow_multi_prompt.json. E gjithĂ« kjo ndodh sepse nĂ« makinĂ«n tonĂ« tĂ« testimit kemi tĂ« instaluar, pĂ«r tĂ« kujtuar, kartĂ«n grafike GeForce GTX 1070 me 8 GB RAM video, dhe ky kapacitet nuk i mbush dot modelet mĂ« tĂ« mĂ«dha me tĂ« gjitha transformuesit e integruar. PĂ«r checkpoint-Ă«t e bazuar nĂ« SD 1.5 dhe SDXL, koduesit janĂ« pĂ«rfshirĂ« automatikisht nĂ« skedarin kryesor, por nĂ« kĂ«tĂ« rast, kĂ«ta transformues nuk janĂ« dy, por tre, nĂ« total mbi 6 GB, â duke e sjellĂ« gjithashtu modelin mĂ« shumĂ« se 10 GB; dhe nĂ«se marrim versionin 16-bit tĂ« koduesit T5XXL, atĂ«herĂ« do tĂ« nevojitet njĂ« kartĂ« grafike edhe mĂ« e fuqishme. NĂ« variantin kur fillimisht transformuesit e tekstit nĂ« tokenĂ« ngarkohen nĂ« memorie video, dhe pastaj modeli qĂ« punon me kĂ«ta tokenĂ«, do tĂ« mund tĂ« pĂ«rdorim edhe njĂ« adaptues grafik 6 GB. Nga kjo perspektivĂ«, moduli "tre" pa dyshim fiton ndaj njĂ« checkpoint-i tipik SDXL prej 5-7 GB.
SD3M Ă«shtĂ« njĂ« model i bazuar nĂ« transformatorĂ«t multimodalĂ« tĂ« difuzionit () â dhe kĂ«shtu ndryshe nga zhvillimet mĂ« tĂ« hershme tĂ« Stability AI (e madje jo vetĂ«m tĂ« saj), tĂ« cilat mbĂ«shteten nĂ« "Workshop-i" nuk Ă«shtĂ« njĂ« vend pĂ«r tĂ« studiuar nĂ« thellĂ«si ndryshimin mes kĂ«tyre qasjeve pĂ«r gjenerimin e imazheve nga AI; le tĂ« themi vetĂ«m se , aftĂ«sinĂ« e tij pĂ«r tĂ« punuar me mĂ« shumĂ« tokenĂ« (çka, nĂ« anĂ«n tjetĂ«r, i lejon operatorit tĂ« formulojĂ« sugjerime tekstuale shumĂ« tĂ« gjera, dhe sistemit â tĂ« ndjekĂ« mjaft saktĂ« ato), si dhe cilĂ«sinĂ« mĂ« tĂ« mirĂ« tĂ« imazheve qĂ« pĂ«rftohen. SD3 8B e plotĂ« Ă«shtĂ« nĂ« gjendje tĂ« gjenerojĂ« imazhe nĂ« kanavacĂ« prej 4 MP (2048Ă2048 piksel), dhe gjithashtu nĂ« pĂ«rparĂ«sitĂ« si rikonstruktimi i tekstit nĂ« imazh, saktĂ«sia e pĂ«rputhjes sĂ« imazhit tĂ« fituar me sugjerimin tekstual dhe estetika vizuale totale. Transformimi i tekstit nĂ« vektorĂ« tokenĂ«sh kryhet kĂ«tu menjĂ«herĂ« nga tre koduesit ( dhe njĂ« T5-XXL â "T5", pĂ«r mĂ« tepĂ«r, nga ) â dhe, nĂ« tĂ« vĂ«rtetĂ«, ata nuk janĂ« tĂ« detyruar tĂ« punojnĂ« me tĂ« njĂ«jtĂ«n nxitje.

Por mjaft me parathĂ«nie: le tĂ« merremi me atĂ« qĂ« i kushtohet "Workshop", â gjenerimin e imazheve mbi modelin SD3M. Do tĂ« pĂ«rdorim, siç u tha mĂ« parĂ«, ambientin punues ComfyUI, tĂ« cilin mund ta shkarkoni . TheksojmĂ« se kjo skemĂ« â Ă«shtĂ« vetĂ«m pĂ«r ekzekutim nĂ« grafikat NVIDIA ose direkt nĂ« CPU AMD apo Intel (çka do tĂ« jetĂ«, natyrisht, ndjeshĂ«m mĂ« e ngadalshme): pronarĂ«t e kartave grafike AMD rocm dhe pytorch, tĂ« cilat mund tĂ« instalohen nĂ«pĂ«rmjet menaxherit tĂ« shkarkimeve pip.
Pas pĂ«rfundimit tĂ« instalimit tĂ« ambientit punues, duhet tĂ« vendosni skedarĂ«t .safetensors qĂ« keni shkarkuar mĂ« parĂ«: modelet â nĂ« dosjen ComfyUImodelscheckpoints, konvertuesit e teksteve nĂ« tokĂ« â nĂ« ComfyUImodelsclip. Dhe â mund tĂ« filloni!
ĂshtĂ« koha pĂ«r t'u pĂ«rshpejtuar
Vlen tĂ« pĂ«rmendet se AUTOMATIC1111, i njohur pĂ«r lexuesit e "Workshop" tĂ« mĂ«parshĂ«m mbi temĂ«n e vizatimit me AI, gjithashtu nĂ« fund tĂ« qershorit , megjithatĂ« nĂ« ComfyUI mbĂ«shtetja pĂ«r modelin e ri mbetet mĂ« e plotĂ«. Nuk Ă«shtĂ« e çuditshme â sepse deri para pak kohĂ«sh autori i "monstrĂ«s sĂ« makarona", i njohur nĂ« komunitet si ComfyAnonimous, ose thjesht Comfy, , ku punoi, nĂ« veçanti, mbi ambientin e brendshĂ«m tĂ« punĂ«s, tĂ« cilin e pĂ«rdorin vetĂ« zhvilluesit. Siç do tĂ« shohim pak mĂ« vonĂ«, versioni mĂ« i ri i ComfyUI vĂ«rtet tregon se autori i tij ka disa informacion mĂ« tĂ« brendshĂ«m mbi atĂ« se si Ă«shtĂ« strukturuar dhe funksionon ky model i kontrovers, â informacione qĂ« krijuesit e ambienteve tĂ« tjera pĂ«r ekzekutimin lokal tĂ« Stable Diffusion 3 Medium nuk mund t'i mburrin pĂ«r arsyet e kuptueshme.

Instalimi i ComfyUI në versionin portable për Windows është më se e lehtë: pas shkarkimit të arkivës përkatëse ZIP mjaft është të deshifrohet në çdo dosje të përshtatshme; është e preferueshme, sigurisht, në një ndarje logjike që bazohet në SSD dhe jo në HDD, sepse shkëmbimi midis disku dhe memories, duke marrë parasysh ciklet e ngarkimit-dërrmimit të modeleve, edhe për krijimin e një imazhi të vetëm (ambiente duhet së pari të ngarkojë në videoRAM konvertuesit e tekstit në tokene, pastaj të pastrojë videon dhe të ngarkojë vetë SD3M) pritet të jetë më shumë se e konsiderueshme, aq më pak që kompjuteri ka videoRAM. Për më tepër, instalimi portativ është i mirë për shkak të pavarësisë së tij të plotë: asgjë - përveç hapësirës së lirë në diskin logjik - nuk e pengon të zhvillosh lokal sa më shumë kopje të ComfyUI, për të eksperimentuar me zgjerime të ndryshme, pa u frikësuar se do të prishësh një sistem që është rregulluar dhe funksionon shumë mirë.

Duke u siguruar që skedari kryesor i modelit SD3M pa koduesit e integruar të tekstit në tokene (skedari stableDiffusion3SD3_sd3Medium.safetensors, 4.2 GB) ndodhet në dosjen e altër checkpoints (në rastin e instalimit tonë testues, rruga e plotë është C:Fun-n-GamesComfyUI-SD3ComfyUImodelscheckpoints), dhe të tre modelet e koduesve (skedarët stableDiffusion3SD3_textEncoderClipG.safetensors, stableDiffusion3SD3_textEncoderClipL.safetensors dhe stableDiffusion3SD3_textEncoderT5E4m3fn.safetensors; 1.3 GB, 234 MB dhe 4.7 GB përkatësisht) ndodhen në dosjen clip (C:Fun-n-GamesComfyUI-SD3ComfyUImodelsclip), mund të hapni ambientin e punës duke bërë një klik të dyfishtë në skedarin run_nvidia_gpu.bat në dosjen kryesore (në rastin tonë C:Fun-n-GamesComfyUI-SD3). Pas fillimit të serverit, në dritaren e komandave Windows do të hapet automatikisht (kjo nënkuptojnë cilësimet e skedarit BAT) një tab e re në shfletuesin e paracaktuar, në të cilin në adresën 127.0.0.1/8188 do të jetë në dispozicion ndërfaqja në web. (le të jetë vetëm për herën e parë) "monstruozi makaron".

NĂ« thelb, nĂ«se dispononi njĂ« kartĂ« grafike mĂ« moderne NVIDIA (brezi RTX, jo GTX, madje edhe me vetĂ«m 6 GB video RAM), mund tĂ« ngarkoni menjĂ«herĂ« nĂ« mjedisin e punĂ«s diagramin e referencĂ«s tĂ« autorit ComfyAnonimous, i cili u pĂ«rmend mĂ« parĂ« â skedari comfy_example_workflows_sd3_medium_example_workflow_multi_prompt.json me shumĂ« dritare pĂ«r inputin e sugjerimeve, njĂ« pĂ«r çdo njohĂ«s nga tre tĂ« tillĂ« â dhe tĂ« punoni me tĂ«. MegjithatĂ«, sĂ« pari do tĂ« duhet tĂ« vendosni katĂ«r emrat e skedarĂ«ve tĂ« modeleve (nĂ« nyjat e ngarkimit tĂ« tyre) nĂ« pĂ«rputhje me ato qĂ« keni. Autori i diagramit tĂ« referencĂ«s, duket se operonte nĂ« vendin e tij tĂ« punĂ«s (nĂ« Stability AI, siç u pĂ«rmend mĂ« parĂ«) me skedarĂ«t lokal qĂ« e kishin emrin disi tjetĂ«r, kĂ«shtu qĂ«, nĂ«se shtypni butonin "Queue Prompt" nĂ« ndĂ«rfaqen spartane tĂ« ComfyUI menjĂ«herĂ« pas ngarkimit tĂ« diagramit, mjedisi i punĂ«s do tĂ« japĂ« njĂ« mesazh gabimi.
Trepallë për gjenerim të AI
MegjithatĂ«, kjo Ă«shtĂ« lehtĂ« e rregullueshme: ajo qĂ« mĂ« shqetĂ«son shumĂ« mĂ« tepĂ«r Ă«shtĂ« fakti se karta GTX 1070 e bĂ«rĂ« mĂ« parĂ« nĂ« dispozicion, pĂ«rpunon SD3M me njĂ« shpejtĂ«si pĂ«rbindĂ«shi â gjenerimi i imazhit ndodh me njĂ« shpejtĂ«si prej 27-30 sekondash pĂ«r çdo iteracion, dhe, nĂ«se marrim parasysh se parametri "Steps" nĂ« diagramin e referencĂ«s Ă«shtĂ« vendosur nĂ« vlerĂ«n "28", koha shpenzohet nĂ« mĂ«nyrĂ« tĂ« paarsyeshme shumĂ«. Prandaj, do tĂ« bĂ«jmĂ« njĂ« optimizim tĂ« vogĂ«l â do tĂ« pĂ«rdorim modulin Python venv (, i cili ka si qĂ«llim, nĂ« veçanti, tĂ« pĂ«rshpejtojĂ« punĂ«n e modeleve gjeneruese tĂ« AI. Ai nuk Ă«shtĂ« i pĂ«rfshirĂ« nĂ« paketimin e versionit portable tĂ« ComfyUI, , tĂ« cilat pĂ«rfundimisht reduktohen nĂ« vendosjen e njĂ« mjedisi tĂ« plotĂ« Python nĂ« PC-nĂ« lokale â dhe aktivizimin e modulit tĂ« nevojshĂ«m nga ky mjedis.

ShpresojmĂ« qĂ« lexuesit tanĂ« qĂ« ndjekin "Punishtet" tanĂ« tashmĂ« kanĂ« njĂ« instalim aktiv tĂ« AUTOMATIC1111 nĂ« makinat e tyre. NĂ« kĂ«tĂ« rast, gjithçka Ă«shtĂ« shumĂ« mĂ« e lehtĂ«: moduli venv Ă«shtĂ« tashmĂ« i vendosur, dhe gjithçka qĂ« kĂ«rkohet pĂ«r ta aktivizuar atĂ« gjatĂ« nisjes sĂ« mjedisit tĂ« punĂ«s ComfyUI Ă«shtĂ« . Filloni duhet tĂ« mbyllni serverin, duke kaluar nĂ« dritaren e tij dhe duke shtypur «Ctrl» + «C», pastaj duke futur «y» pĂ«r tĂ« konfirmuar; mĂ« pas, kopjoni skedarin BAT run_nvidia_gpu.bat nĂ« njĂ« tĂ« ri, me emrin, pĂ«r shembull, run_with_venv.bat. Skedari origjinal i nisjes Ă«shtĂ« mjaft i shkurtĂ«r â ai thjesht thĂ«rret njĂ« kopje portative tĂ« instaluar Python me parametrin âwindows-standalone-build:
.python_embededpython.exe -s ComfyUImain.py âwindows-standalone-build
pause
Ky parametr nĂ« vetvete nuk Ă«shtĂ« shumĂ« i qartĂ« â ai nĂ«nkupton disa optimizime, tĂ« cilat, me shumĂ« mundĂ«si, janĂ« tĂ« dizajnuara pikĂ«risht pĂ«r kartat grafike NVIDIA mĂ« tĂ« reja dhe pĂ«r kĂ«tĂ« arsye mund tĂ« pĂ«rkeqĂ«sojnĂ« pĂ«rvojĂ«n e atyre qĂ« ende mbrojnĂ« GTX-in e tyre tĂ« njohur. PĂ«r kĂ«tĂ« arsye, do tĂ« heqim âwindows-standalone-build nga komanda, dhe njĂ«kohĂ«sisht do tĂ« heqim edhe optimizimin tjetĂ«r tĂ« modĂ«s sĂ« re â menaxherin e kujtesĂ«s inteligjente, smart memory, i cili , pa e shkarkuar atĂ«. Kjo vĂ«rtet pĂ«rshpejton krijimin e imazheve nga AI, megjithatĂ«, pĂ«rveç kĂ«saj, e kthen kompjuterin tonĂ« moralisht tĂ« vjetruar nĂ« njĂ« sistem njĂ«lloj â nuk mund tĂ« bĂ«ni as surfim nĂ« internet, as tĂ« luani, as madje tĂ« punoni me dokumentet dhe e-mailin nĂ« PC paralelisht me aktivitetin e mjedisit tĂ« punĂ«s. Pra, pĂ«r ata qĂ« nuk kanĂ« njĂ« kompjuter tĂ« dedikuar pĂ«r artin e AI, njĂ« skedar BAT i tillĂ« pĂ«r tĂ« nisur ComfyUI (jo vetĂ«m pĂ«r tĂ« krijuar imazhe me SD3M, pĂ«r tĂ« thĂ«nĂ« tĂ« vĂ«rtetĂ«n, - pĂ«r SDXL ai Ă«shtĂ« gjithashtu plotĂ«sisht i pĂ«rshtatshĂ«m):
@echo off
call cd C:Fun-n-GamesGitstable-diffusion-webuivenvScripts
echo %
call activate.bat
echo venv activated
call cd C:Fun-n-GamesComfyUI-SD3
echo %
call .python_embededpython.exe -s ComfyUImain.py âdisable-smart-memory
pause
KĂ«tu supozohet se instalimi portativ i ComfyUI Ă«shtĂ« bĂ«rĂ« nĂ« katalogun C:Fun-n-GamesComfyUI-SD3, dhe AUTOMATIC1111 ishte instaluar mĂ« parĂ« nĂ« C:Fun-n-GamesGitstable-diffusion-webui. ShumĂ« «echo» janĂ« tĂ« nevojshme thjesht pĂ«r kontrollin vizual tĂ« asaj qĂ« ndĂ«rrimi i katalogĂ«ve kalon normalisht dhe komandat pĂ«rkatĂ«se ekzekutojnĂ«, â pasi tĂ« gjitha tĂ« jetĂ« rregulluar, ato mund tĂ« hiqen nga skedari BAT.

Risim sĂ«rish ambientin e punĂ«s, kĂ«tĂ« herĂ« duke klikuar dy herĂ« mbi run_with_venv.bat. Duke qenĂ« se ne mĂ« parĂ« mbyllĂ«m thjesht serverin, ndĂ«rsa ndĂ«rfaqja web nuk u pre, nĂ« skedĂ«n pĂ«rkatĂ«se duhet tĂ« ketĂ« akoma atĂ« diagramin bazĂ« ComfyUI me emrat e modeleve tĂ« rregulluar. Le tĂ« kushtojmĂ« vĂ«mendje pjesĂ«s sĂ« saj tĂ« djathtĂ«: aty Ă«shtĂ« node "Preview Image", e cila nuk e ruan imazhin e gatshĂ«m nĂ« disk, por vetĂ«m e demonstruar atĂ«. NĂ«se çfarĂ«do herĂ« ekzekutohet diagrami pĂ«r tĂ« gjeneruar njĂ« imazh tĂ« vetĂ«m, e vlerĂ«sojmĂ« vizualisht, bĂ«jmĂ« disa ndryshime nĂ« parametra, dhe e ekzekutojmĂ« pĂ«rsĂ«ri â kjo Ă«shtĂ« njĂ« kĂ«ndvim mjaft e punueshme: imazhin qĂ« na pĂ«lqen gjithmonĂ« mund ta ruajmĂ« manualisht duke klikuar me butonin e djathtĂ« tĂ« miut mbi tĂ«. Por nĂ«se kryhen shumĂ« gjenerime njĂ« pas tjetri nĂ« ambientin e punĂ«s, Ă«shtĂ« mĂ« mirĂ« qĂ« rezultatet e tyre tĂ« grumbullohen automatikisht nĂ« memorien e pĂ«rhershme (nĂ« katalogun ComfyUIoutput si parazgjedhje).

Prandaj Ă«shtĂ« mĂ« mirĂ« ta ndryshojmĂ« menjĂ«herĂ« node-in "Preview Image" me "Save Image". PĂ«r kĂ«tĂ«, klikojmĂ« dy herĂ« me butonin e majtĂ« tĂ« miut nĂ« njĂ« zonĂ« tĂ« lirĂ« tĂ« diagramit â do tĂ« hapet njĂ« dritare pĂ«rzgjedhjeje node me njĂ« shirit kĂ«rkimi. NĂ« kĂ«tĂ« shirit, do tĂ« fillojmĂ« tĂ« shkruajmĂ« "SaveâŠ" â dhe praktikisht menjĂ«herĂ« do tĂ« shohim emrin e kĂ«rkuar. MĂ« pas, do tĂ« mbetet thjesht tĂ« klikojmĂ« mbi tĂ« dhe tĂ« lidhim hyrjen e node-s sĂ« shfaqur nĂ« dalje "IMAGE" tĂ« node-s "VAE Decode", ku fillimisht ishte lidhur "Preview Image". Node-in "Preview Image" mund ta heqim mĂ« pas â thjesht e pĂ«rzgjedhim atĂ«, duke klikuar mbi titullin, dhe shtypim çelĂ«sin "Del" nĂ« tastierĂ«.

Dhe tani â Ă«shtĂ« koha e duhur pĂ«r tĂ« ekzekutuar diagramin bazĂ« nga ComfyAnonimous (me korrigjimet tona modeste). Rezultati Ă«shtĂ« ky:

NjĂ« imazh shumĂ« mbreslĂ«nĂ«s, madje me njĂ« humor, â dhe nuk do tĂ« thoshit se Ă«shtĂ« krijuar me ndihmĂ«n e tĂ« njĂ«jtĂ«s model qĂ« plotĂ«sisht shemb instrukcionin pĂ«r tĂ« pikturuar njerĂ«zit qĂ« flenĂ« nĂ« bar. NĂ« tĂ« njĂ«jtĂ«n kohĂ«, sistemi funksionon mjaft shpejt â rreth 5-6 sekonda pĂ«r iteracion pĂ«r njĂ« imazh me sipĂ«rfaqe 1 MPix nĂ« GTX 1070 Ă«shtĂ« njĂ« tregues i mirĂ«. PĂ«r krahasim: po i njĂ«jti PC nĂ« tĂ« njĂ«jtĂ«n ComfyUI me tĂ« njĂ«jtin skedar BAT pĂ«rcjell imazhe SDXL tĂ« pĂ«rmasave tĂ« ngjashme, duke shpenzuar rreth 6-7 sekonda pĂ«r çdo iteracion, prandaj "tre" mund tĂ« konsiderohet mjaft mĂ« pak kĂ«rkues ndaj pajisjeve kompjuterike ku po zhvillohet gjenerimi i AI.

TĂ« rregullojmĂ« tani dimensionet e kanavacĂ«s. AfĂ«r nodit "EmptySD3LatentImage", i cili i pĂ«rcakton ato, ndodhet njĂ« nodĂ« "e zbrazĂ«t" (nĂ« kuptimin, e pa lidhur nĂ« asnjĂ« anĂ« me asgjĂ«) e quajtur "Note", ku ndodhet njĂ« kujtesĂ« e rĂ«ndĂ«sishme: sipĂ«rfaqja totale e imazhit nĂ« rastin e SD3M duhet tĂ« jetĂ« rreth 1 Mpx, - mbi tĂ« cilĂ«n duhet tĂ« pĂ«rshtaten dimensionet e anĂ«ve tĂ« kanavacĂ«s katrore. Le ta pĂ«rcaktojmĂ« atĂ« si 1344Ă768 - qĂ« Ă«shtĂ« rreth 1,03 Mpx dhe do tĂ« dalĂ«.
Vërejmë: më lart ndodhet nodi "Seed", ku është vendosur vetë embrioni, në këtë rast "945512652412924", dhe është shënuar se nuk duhet të ndryshojë pas gjenerimit (parametri "fixed").

Të realizojmë të njëjtën ciklogram me embrionin e mëparshëm, por tashmë për kanavacën katrore. Menjëherë bie në sy se koha e realizimit është më e vogël, megjithatë shpejtësia e vizatimit ka mbetur e njëjtë - më pak se 6 s për iteracion. Dhe kjo është logjike: pasi që udhëzimet tekstuale nuk ndryshuan, nuk është e nevojshme të ngarkohet përsëri koduesi (ose koduesit) për to. Imazhi që marrim, është e qartë, është paksa ndryshe nga i pari, katror, por jo në mënyrë thelbësore - kompozita e përgjithshme, siç pritej, është ruajtur.

Tani vĂ«mĂ« re nodet "CLIPTextEncodeSD3" dhe "CLIP Text Encode (Negative Prompt)". E para veçohet pĂ«r faktin se pĂ«rmban menjĂ«herĂ« tre fusha inputi; nĂ«se hiqni tekstin nga ato, shenjat do tĂ« bĂ«hen tĂ« dukshme, pĂ«r cilat kodues janĂ« tĂ« destinuara, - nga lart poshtĂ«, janĂ« CLIP G, CLIP L dhe T5XXL. Ka qenĂ« e qartĂ« pĂ«r arsyet se pĂ«rpara nuk kishte nodĂ« tĂ« tilla nĂ« ComfyUI. Ciklograma mbĂ«shtetĂ«se pĂ«rmban udhĂ«zime tĂ« pĂ«rsĂ«ritura tĂ« shkurtra pĂ«r dy fushat e para tekstuale (pĂ«r konvertuesit CLIP G dhe CLIP L) dhe njĂ« shumĂ« mĂ« tĂ« zgjeruar pĂ«r tĂ« tretĂ«n - T5XXL. ĂshtĂ« e qartĂ«, qĂ« pĂ«rmbajtja e kĂ«tyre fushave mund tĂ« luajĂ« nĂ« limite tĂ« gjera, dhe vetĂ« studimi se nĂ« çfarĂ« mase ndryshimi i tekstit nĂ« to ndikon nĂ« imazhin pĂ«rfundimtar, Ă«shtĂ« njĂ« detyrĂ« sfiduese, por mjaft interesante. MegjithatĂ«, pĂ«r arsye qĂ« do tĂ« bĂ«hen tĂ« qarta mĂ« vonĂ«, ne nuk do tĂ« merremi me tĂ« pĂ«r momentin.
Ndaj në nodën «CLIP Text Encode (Negative Prompt)», përkundrazi, nuk ka asgjë të veçantë, - por vlerësoni se sa i vështirë është rruga nga ajo deri në hyrjen përkatëse «conditioning» të nodës kryesore «KSampler»! Kjo rrugë ndahet në dy degë, ku njëra prej tyre (e sipërme në këtë rast) tregon se duke filluar nga 10% e hapa të gjenerimit dhe deri në përfundimin e tij, sistemi nuk do të marrë parasysh fare nxitjen negative (kalimi nëpër nodën «ConditioningZeroOut» pikërisht do të thotë zerozimin e kushteve). Ndërsa dega tjetër kalon nxitjen negative (po ashtu në mënyrë kushtore me pesha të gjysmë) për në përpunim pa ndryshime - por vetëm në 10% të parë nga numri total i hapave të gjenerimit.
Të paqarta largësitë
Përsëri: 10% e para, dmth 3 nga 28 të caktuar në këtë rast, nxitja negative kalon në nodën «KSampler», e cila merret me formimin e imazhit në hapësirën latent (në hapësirën e pikselëve, dmth në një imazh të kuptueshëm për njeriun, rezultati i saj kalon nëpër nodën «VAE Decoder»), në mënyrë normale: dega e sipërme (me zerozimin e kushteve) nuk është aktive, vetëm dega e poshtme punon. 90% e mbetur e hapave (25 nga 28 në rastin tonë) nxitja negative nuk funksionon fare: dega e sipërme e transmetimit të kushteve është aktive - me zerozimin e tyre, - ndërsa lëvizja nëpër degën e poshtme është bllokuar nga parametri kufi i aktivizimit të nodës përkatëse «ConditioningSetTimestepRange». Tani kuptohet se përse një grup recensentësh pretendon se , - efekti i tyre (nëse marrim parasysh pikërisht këtë, referencën, ciklografik dhe supozoni se në faqet me gjenerim në linjë sipas modelit SD3 Medium zbatohet e njëjta rregull) është minimal.

Dhe megjithatĂ«, ai ekziston: nĂ«se thjesht merrni dhe lidhni drejtpĂ«rdrejt daljen e nodĂ«s "CLIP Text Encode (Negative Prompt)" me hyrjen pĂ«rkatĂ«se tĂ« "KSampler" (ose shĂ«noni tĂ« gjitha nodĂ«t ndihmĂ«se me kushte nĂ« kĂ«tĂ« rrugĂ« si "tĂ« kalueshme", "Bypass", gjĂ« qĂ« do tĂ« shpjerĂ« nĂ« tĂ« njĂ«jtin efekt), cilĂ«sia e imazhit pĂ«rfundimtar do tĂ« pĂ«rkeqĂ«sohej ndjeshĂ«m. Kjo, pĂ«r mĂ« tepĂ«r, mund tĂ« konsiderohet si njĂ« provĂ« indirekte e "papjekurisĂ«" sĂ« SD3M, pasi rregullimi i forcĂ«s dhe rĂ«ndĂ«sisĂ« sĂ« sugjerimit negativ, nĂ« mĂ«nyrĂ« strikte, do tĂ« duhej tĂ« ishte nĂ« kapacitetin e zhvilluesve qĂ« para se tĂ« publikoheshin pesha e modelit nĂ« qasje tĂ« hapur. Dy degĂ« tĂ« kushteve tĂ« vendosura pĂ«r pĂ«rdorimin e sugjerimit negativ â njĂ« lloj patch, dhe nĂ« kĂ«tĂ« kuptim te pritjet e frymĂ«zuara nga departamenti i marketingut tĂ« Stability AI nĂ« lidhje me tĂ«, duken mjaft tĂ« arsyeshme.
Mungesa, edhe e njĂ« udhĂ«zimi tĂ« shkurtĂ«r zyrtar pĂ«r pĂ«rdorimin e SD3M ka bĂ«rĂ« qĂ« tashmĂ« tĂ« qarkullojnĂ« thashetheme nĂ« internet se kjo model Kjo, sigurisht, nuk Ă«shtĂ« e vĂ«rtetĂ«, por nĂ« çdo rast, pĂ«rdorimi i kĂ«tyre sugjerimeve duhet bĂ«rĂ« ndryshe . NĂ« veçanti, entuziastĂ«t me shumĂ« seriozitet pretendojnĂ« se shtimi nĂ« fushĂ«n negative tĂ« pĂ«rshkrimeve tĂ« detajuara tĂ« sa mĂ« shumĂ« papĂ«rgjegjshmĂ«rive (po, po, e vjetra "nsfw, nude" nuk Ă«shtĂ« e mjaftueshme â do tĂ« duhet tĂ« pĂ«rdorim pak imagjinatĂ«) edhe tĂ« vajzĂ«s famĂ«keqe qĂ« po e pĂ«rjetĂ«son duke shtrirĂ« nĂ« bar. NĂ«se Ă«shtĂ« kĂ«shtu apo jo â nuk ka mĂ«nyrĂ« pĂ«r ta zbuluar pa njĂ« verifikim tĂ« detajuar (sidoqoftĂ«, nuk Ă«shtĂ« e sigurt se madje edhe etiketimi "18+" nĂ« kokĂ«n e faqes sonĂ« do ta mbrojĂ« botimin nga paditĂ« e vigjilencĂ«s sĂ« moralit, nĂ«se ne rrezikojmĂ« tĂ« publikojmĂ« "mrekullinĂ« e sugjerimit" tĂ« munduar nga entuziastĂ«t â pĂ«r aq sa Ă«shtĂ« nĂ« anglisht). Kjo situatĂ« argĂ«tuese i ngjan njĂ« kazusi me , pĂ«r shkak tĂ« tĂ« cilave â pikĂ«risht sepse ato pĂ«rmbanin pĂ«rshkrime mjaft tĂ« detajuara se çfarĂ« dhe si nuk duhet bĂ«rĂ« nga tĂ« krishterĂ«t e ndershĂ«m â na janĂ« ruajtur tĂ« paktĂ«n dĂ«shmi tĂ« fragmentuara tĂ« besimeve dhe zakoneve tĂ« RusisĂ« para-kristiane.

Tani, shpresojmĂ«, tani Ă«shtĂ« mĂ« e qartĂ« pse thellimi mĂ« tej nĂ« studimin e SD3M nĂ« kĂ«tĂ« fazĂ« duket se nuk Ă«shtĂ« njĂ« shpenzim i mençur i forcave dhe kohĂ«s. Atje vĂ«rtet ka shumĂ« pĂ«r tĂ« diskutuar dhe pĂ«r tĂ« eksploruar: dhe parametrat mjaft tĂ« rreptĂ« tĂ« rekomanduar pĂ«r gjenerimin nĂ« nodin 'KSampler' (CFG â 4.5-5.0; numri i hapave â rreth 28; çifti sampler/scheduler â pĂ«rjashtimisht dpmpp_2m/sgm_uniform, pĂ«rndryshe cilĂ«sia e shpĂ«rndarjes bie ndjeshĂ«m); dhe variabiliteti ekstrem i cilĂ«sisĂ« subjektive tĂ« gjenerimeve me tĂ« njĂ«jtat parametra fillestarĂ«, por me variacione tĂ« ndryshme; dhe çlirimi nga e famshmja 'mallkimi i shtrirjes nĂ«/bar' (pĂ«r tĂ« cilin tashmĂ« ); dhe, nĂ« thelb, zbulimi se cilat parametra tĂ« gjenerimit ndikojnĂ« nĂ« çdo njĂ«rin nga tre konvertuesit e tekstit nĂ« tokene â dhe si, duke i menaxhuar ata, tĂ« arrihet krijimi i vĂ«rtetĂ« tĂ« kryeveprave tĂ« IArtit Vizual (nĂ«se njĂ« gjĂ« e tillĂ« Ă«shtĂ« e mundur me 'treĂ«n' nĂ« parim, sigurisht).
Po aq mĂ« shumĂ« qĂ« shkarkimi i Emad MoustakĂ«s nĂ« mars dhe ComfyAnonimous nĂ« qershor, , â nuk janĂ« tĂ« vetmet vĂ«shtirĂ«si qĂ« e godasin Stability AI. Siç raporton Reuters nĂ« lidhje me The Information, ky startup britanik sapo e ka ndryshuar sĂ«rish drejtorin ekzekutiv fjalĂ« Ă«shtĂ« pĂ«r 80 milion dollarĂ«â dhe nĂ« njĂ« situatĂ« tĂ« tillĂ«, Ă«shtĂ« e vĂ«shtirĂ« tĂ« pritet njĂ« punĂ« e kuptuar nga kompania edhe mbi gabimet kaq tĂ« dukshme. â dhe nĂ« njĂ« situatĂ« tĂ« tillĂ« Ă«shtĂ« e vĂ«shtirĂ« tĂ« pritet njĂ« punĂ« e thelluar nga kompania madje edhe mbi gabime kaq evidente.

Politika e paishtjellshme e licencave, fatkeqësisht, mban komunitetin larg përmirësimit të veprimit SD3M, siç ndodhi me SD 1.5 dhe SDXL. Të paktën, piketat dhe mjetet si LoRA për dy modelet e fundit do të mbeten të disponueshme për ekzekutimin lokal, edhe kur (dhe nëse) Stability AI përfundon rrugën e saj si një strukturë tregtare. Menjëherë pas dështimit të madh të "trio-së", zërat për krijimin e një projekti jo-fitimprurës për zhvillimin e një modeli gjenerues për transformimin e tekstit në imazhe në bazë të financimit nga turma filluan të dëgjoheshin gjithnjë e më shpesh në forume përkatëse, dhe deri tani ky lëvizje po merr formën e saj nën emrin . Ata që kanë shprehur gatishmërinë për t'u angazhuar janë Invoke (një nga platforma për gjenerimin online të AI, e orientuar nga studiot profesionale), Comfy Org (ekipi që merret me mbështetje dhe zhvillim të ComfyUI), Civitai (nuk ka nevojë për prezantim) dhe ekipi që qëndron pas LAION (bazës së të dhënave të imazheve të annotuara, mbi të cilën kryesisht trajnohen këto lloje modelet).
Pra, nĂ« horizontin e afĂ«rt, publikimet e reja tĂ« "Atelier" do tĂ« orientohen, shumĂ« gjasa, nĂ« punĂ«n me modelet pĂ«r tĂ« cilat komuniteti tashmĂ« ka krijuar njĂ« set tĂ« gjerĂ« pĂ«rmirĂ«simesh dhe mjeteve shtesĂ«, â pĂ«r "polutorkĂ«n" dhe "Oversize". Ndoshta, koha e triumfit tĂ« SD3M do tĂ« vijĂ« ende, â por sot Ă«shtĂ« e vĂ«shtirĂ« tĂ« supozohet se kur mund tĂ« ndodhĂ« kjo. NdĂ«rkohĂ«, ata qĂ« janĂ« tĂ« interesuar mund tĂ« shkarkojnĂ« arkivĂ«n me gjenerimet e pĂ«rmendura nĂ« kĂ«tĂ« artikull tĂ« SD3M (ciklografitĂ« janĂ« tĂ« integruara direkt nĂ« skedarĂ«t PNG; mjafton tĂ« tĂ«rhiqni imazhin nĂ« fushĂ«n e punĂ«s sĂ« ComfyUI nga "Shfletuesi" i Windows pĂ«r tĂ« riprodhuar tĂ« gjithĂ« rendin dhe parametrat e gjenerimit) . Ndoshta, ndonjĂ« nga lexuesit tanĂ« do tĂ« jetĂ« nĂ« gjendje ta zbulojĂ« mĂ« herĂ«t se pĂ«rmbushĂ«sit nĂ« Reddit dhe Hugging Face mĂ«nyrĂ«n optimale pĂ«r tĂ« shpĂ«rndarĂ« tekstin nĂ« tre fusha tĂ« sugjerimit, pĂ«r shembull?

Materialet lidhur me temën:
.
.
.
.
.
Burimi: 3dnews.ru
