Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

ËshtĂ« interesante si historia e lançimeve tĂ« modeleve tĂ« hapura pĂ«r konvertimin e sugjerimeve tekstuale nĂ« imazhe, tĂ« zhvilluara dhe stĂ«rvitura nga kompania Stability AI, ngjan me njĂ« seri ngritjesh dhe rĂ«niesh tĂ« vazhdueshme tĂ« versioneve tĂ« sistemit operativ Microsoft. Pas suksesit legjendar tĂ« XP, kujtojmĂ«, erdhi Vista problematike; mĂ« pas shkĂ«lqyeshĂ«m "shtatĂ«ja" — e pasuar nga Windows 8 e padobishme. Pas versionit fillestar 1.5 tĂ« Stable Diffusion, qĂ« ishte me tĂ« vĂ«rtetĂ« modeste, por u zhvillua nga entuziastĂ«t, pasoi SD 2.0 e qartĂ« qĂ« e dĂ«shtoi — dĂ«shtim, nĂ« fakt, sepse pĂ«rfshinte njĂ« kodifikues OpenCLIP tĂ« pazakontĂ« pĂ«r modelet e kĂ«tij tipi, i stĂ«rvitur mbi imazhe tĂ« pĂ«rzgjedhura mjaft ambiguishĂ«m nga nga seti i hapur tĂ« dhĂ«nash LAION-5B. GjatĂ« kĂ«tij pĂ«rzgjedhjeje, jo vetĂ«m qĂ« u pĂ«rjashtuan referencat vizuale tĂ« papĂ«rshtatshme (NSFW), por edhe pikturat dhe ilustra tĂ« realizuar nga artisitĂ« e njohur si Greg Rutkowski. PikĂ«risht kjo e fundit zemĂ«roi pĂ«rfundimisht entuziastĂ«t: nĂ«se pĂ«r SD 1.5, madje edhe nĂ« variantin e saj origjinal, pa pĂ«rdorur pika kontrolli tĂ« veçanta tĂ« trajnuara mirĂ«, sugjerimet e thjeshta me stile — "epic medieval fantasy landscape, in the style of Greg Rutkowski" — rezultati ishte impresionues, ndĂ«rsa SD 2.0 ndaloi tĂ« "n recognizonte" emrat e ilustrueseve mĂ« tĂ« njohur, tĂ« cilĂ«t ruajnĂ« ende tĂ« drejtat e autorit mbi veprat e krijuara dhe qĂ« nuk e kishin ndihmuar me kĂ«to vepra pĂ«r trajnimin e AI. Duhej tĂ« pĂ«rdoren mĂ« shumĂ« fjalĂ« pĂ«r tĂ« pĂ«rshkruar atĂ« qĂ« dĂ«shironim, ndĂ«rsa me sugjerime shumĂ« tĂ« gjata, modeli nuk pĂ«rfundonte mire.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

⇡#U ulĂ«m — u ngritĂ«m, u ulĂ«m — u ngritĂ«m

NĂ« kombinim me koduesin e ndryshuar (transformatori i sugjerimeve tĂ« tekstit nĂ« tokene numerike, me tĂ« cilat modeli punon pas pĂ«rputhjes) pamundĂ«sia pĂ«r tĂ« aplikuar stilet e emĂ«rtuara thjesht i ndaloi entuziastĂ«t nga motivimi pĂ«r tĂ« pĂ«rmirĂ«suar "dyshakun" vetĂ«. VĂ«rtet: kĂ«tu duhej tĂ« arrihej njĂ«kohĂ«sisht me ndihmĂ«n e asaj qĂ« duhej rregulluar pĂ«r tĂ« pĂ«rshtatur teknikĂ«n e punimit tĂ« sugjerimeve me koduesin e ri dhe pĂ«r tĂ« trajnuar modelin pĂ«r tĂ« njohur ato imazhe dhe tema, me tĂ« cilat krijuesit nuk e kishin njohur gjatĂ« trajtimit fillestar - dhe diferenca cilĂ«sore me "gjysmĂ«â€œ nuk e garantonte akoma qĂ« imazhet e krijuara nga "dyshaku" ishin mĂ« tĂ« mira. Po, nga madhĂ«sia standarde prej 512×512 piksel pĂ«r SD 1.5 ka ndodhur njĂ« kĂ«rcim cilĂ«sor nĂ« 768×768, por deri atĂ«herĂ«, komuniteti kishte filluar tĂ« pĂ«rdorĂ« upscalers, outpainters dhe mjete tĂ« tjera pĂ«r tĂ« rritur madhĂ«sinĂ« pĂ«rfundimtare tĂ« imazhit, kĂ«shtu qĂ« SD 2.0 kaloi, mĂ« shumĂ« se gjithçka, pa u vĂ«nĂ« re. SDXL u kthye nĂ« standardin (i zhvilluar nga OpenAI dhe i pĂ«rdorur, nĂ« veçanti, nga projekti DALL-E) koduesin CLIP - kodi i tij Ă«shtĂ« gjithashtu i hapur, por tĂ« dhĂ«nat mbi tĂ« cilat Ă«shtĂ« trajnuar, nĂ« ndryshim nga OpenCLIP, janĂ« pronĂ«sore. SĂ« bashku me kĂ«tĂ«, madhĂ«sia standarde e kanavacĂ«s u rrit pĂ«r "Oversize" nĂ« 1024×1024, plus u shfaq njĂ« numĂ«r i plotĂ« pĂ«rmirĂ«simesh tĂ« tjera - kĂ«shtu qĂ« entuziastĂ«t morĂ«n me kĂ«naqĂ«si nĂ« dorĂ« punimin e tij. Dhe deri tani, SDXL (gjithashtu variante tĂ« tij qĂ« nuk janĂ« aq kĂ«rkuese pĂ«r "harduerin" si SDXL Turbo dhe SDXL Lightning) mund tĂ« konsiderohet me siguri si gjeneratori mĂ« i njohur i imazheve me inteligjencĂ« artificiale me kod tĂ« hapur. MegjithatĂ«, ndjekĂ«sit e pasionuar tĂ« SD 1.5 e diskutojnĂ« kĂ«tĂ« me argumente, duke theksuar se mjete kaq tĂ« rĂ«ndĂ«sishme si ControlNet nĂ« SDXL nuk janĂ« transferuar ende me dinjitet.

Dhe ja që nga 12 qershori 2024, që nga momenti i "publikimit në natyrë" të kodit të modelit, që i lejon gjenerimet lokale, duhej të vinte koha për versionin "e hapur" SD 3 - nëse jemi më të saktë, Stable Diffusion 3 Medium (SD3M ose SD3 2B) me 2 miliard parametra. Në mënyrë teorike, për t'u kujtuar, ky numër përputhet me numrin e përgjithshëm të peshave në hyrjet e të gjithë perceptronëve të modelit. Më herët, në prill, Stability AI e kishte përfunduar dhe ofruar për përdorim tregtar një variant 8-milionësh (në numrin e parametrave) Stable Diffusion 3 Large, i njohur si SD3 8B. Në SDXL 1.0, për ta rikujtuar, është 3.5 miliard parametra, megjithatë SD3M, sipas zhvilluesve, është «modeli më i sofistikuar për gjenerimin e imazheve nga të gjithë ata që kemi krijuar deri tani». Këtu nënkuptohej se, me kërkesa për memorie video që ishin më të ulta se «Oversize», duhej të jepte imazhe «me një nivel të ri fotorealizmi», madje edhe në përgjigje të sugjerimeve jo të komplikuara. Në mesin e avantazheve të «tre-it» u përmend gjithashtu «cilësia paprecedente e tipografisë së tekstit të gjeneruar në imazhe», «kuptimi i thelluar i sugjerimeve përmes bashkëpunimit të tre koduesve» dhe «gatishmëria për trajnim të efektshëm edhe në grupe të kufizuara të të dhënave».

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Siç duket, ishte e pritur qĂ« komuniteti i entuziastĂ«ve, duke marrĂ« nĂ« duar kĂ«tĂ« lojĂ« tĂ« pritur, do tĂ« pĂ«rpiqej ta zhvillonte atĂ« me tĂ« njĂ«jtin zell si «polutorka» dhe «Oversize» njĂ«herĂ« e njĂ« kohĂ«. MegjithatĂ« qĂ« nĂ« fillim, gjithçka shkoi ndryshe: SD3M, nĂ« orĂ«t e para pas publikimit tĂ« skedarĂ«ve tĂ« modelit nĂ« Hugging Face dhe Civitai, u tregua se ishte thellĂ«sisht zhgĂ«njyese pĂ«r audiencĂ«n e saj, madje dy herĂ«. HerĂ«n e parĂ« — me njĂ« idiokrinji tĂ« paqartĂ« nĂ« dukje ndaj sugjerimeve, qĂ« pĂ«rfshinin frazĂ«n e dukshme «tĂ« shtrirĂ« nĂ« grasë» (lying on/in the grass); e dyta — me formulime tepĂ«r tĂ« paqarta nĂ« marrĂ«veshjen e pĂ«rdorimit, tĂ« cilat nuk arritĂ«n t'i kuptonin as avokatĂ«t profesionistĂ«. Dhe megjithĂ«se nga perspektiva e njĂ« entuziasti tĂ« zakonshĂ«m tĂ« artit TI, e fundit duket e parĂ«ndĂ«sishme, zhvillimi i mĂ«tejshĂ«m i modelit do tĂ« reflektojĂ« pĂ«rmes asaj qĂ« ndodh me aspektin ligjor — deri nĂ« pikĂ«n qĂ« nuk do tĂ« ketĂ« zhvillim tĂ« mundshĂ«m fare.

Krijimet e mĂ«parshme tĂ« Stable Diffusion me kod tĂ« hapur (nĂ« fakt, me vlera tĂ« hapura tĂ« pesha tĂ« rrjetit nervor, qĂ« ishin nĂ« dispozicion pĂ«r shkarkimin falas dhe ekzekutimin pasues lokal), si SDXL, janĂ« shoqĂ«ruar me njĂ« nga tiparet tipike pĂ«r modelet gjeneruese Licenca CreativeML Open RAIL++-M me tĂ« karakteristika si «licenca e pakufizuar, globale, jo-ekskluzive, falas, jo-shkĂ«putĂ«se, e patjetĂ«rsueshme pĂ«r qĂ«llimin e riprodhimit, pĂ«rgatitjes, shfaqjes publike, interpretimit publik, sublicencimit dhe shpĂ«rndarjes sĂ« materialeve shtesĂ« si duhur i modelit vetĂ« ashtu edhe e deri tĂ« derivateve tĂ« tij». «Trojca» parashikon dy lloje licencash: pĂ«r pĂ«rdorim jo-komercial — me formulime jashtĂ«zakonisht lehtĂ«suese si «Stability AI ju ofron njĂ« licencĂ« jo-ekskluzive, globale, tĂ« pa-transferueshme, pa mundĂ«si sublicencimi, tĂ« revokueshme, falas dhe tĂ« kufizuar mbi pronĂ«sinĂ« intelektuale» — dhe njĂ« licencĂ« tregtare shumĂ« mĂ« tĂ« rĂ«ndĂ«.

⇡#Barin nuk e çon nĂ« mirĂ«

Pas njĂ« kohe shumĂ« tĂ« shkurtĂ«r, komuniteti u pajtua se Stable Diffusion 3 nuk Ă«shtĂ« Open Source. NĂ« thelb shpalli bojkottin e kompanisĂ« zhvillimore, duke mos dĂ«shiruar tĂ« humbasin kohĂ«n dhe energjinĂ« nĂ« trajnimin e njĂ« modeli tĂ« qartĂ« tĂ« papĂ«rpunuar dhe tĂ« deformuar — me vetĂ«dijen se Stability AI nĂ« çdo moment mund tĂ« revokojĂ« licencĂ«n e dhĂ«nĂ« mĂ« parĂ« njĂ« entuziasti tĂ« caktuar qĂ« po kryen njĂ« trajnim tĂ« tillĂ«. MarrĂ«veshja e licencĂ«s Ă«shtĂ« formuluar nĂ« njĂ« mĂ«nyrĂ« qĂ« personat jo-juridikĂ« qĂ« e studiojnĂ« atĂ« krijojnĂ« pĂ«rshtypjen se pas revokimit tĂ« lejĂ«s pĂ«r pĂ«rdorim komercial tĂ« SD3M, i mĂ«parshmi pronar i tij do tĂ« ishte i detyruar tĂ« fshijĂ« tĂ« gjitha produktet qĂ« ka krijuar si derivate tĂ« pronĂ«sisĂ« intelektuale qĂ« i Ă«shtĂ« dhĂ«nĂ« licenca, duke pĂ«rfshirĂ« si modelet e trajnuara (LoRA, inversitete tekstuale, tĂ« gjithĂ« checkpointet), ashtu edhe derivatet e tyre (citim: «Pas pĂ«rfundimit tĂ« kĂ«saj MarrĂ«veshjeje, ju do tĂ« fshini dhe do tĂ« ndaloni pĂ«rdorimin e çdo Produkti Softuerik ose Veprash Derivative») — pra, produktet e punĂ«s sĂ« tashme tĂ« njerĂ«zve tĂ« tjerĂ« qĂ« kanĂ« pĂ«rdorur kĂ«to modele derivate si njĂ« pikĂ« fillimi pĂ«r punĂ«n e tyre; dhe sidomos pĂ«r punĂ«n e kryer qĂ« nuk Ă«shtĂ« paguar nga askush, e realizuar nĂ« puritate entuziazmi.

Shumë shpejt pas arritjes së një valë zemërimi për këtë, filluan të shfaqen mesazhe nga avokatë profesionistë, se nuk është gjithçka kaq keq çfarë do të thotë se një rishikim me ndalim të mëtejshëm përdorimi duhet të lidhet vetëm me disa produkte mbështetëse me kod të mbyllur, që Stability AI do të kalojë te përdoruesi komercial (për shembull, për të shpejtuar dhe optimizuar atë të njëjtin trajnimin e SD3M), - por deri tani kompania vetë nuk ka ofruar shpjegime për këtë çështje. Dhe fakti i këtij heshtjeje shtypëse për tre javët e fundit (në momentin e shkrimit të këtij artikulli) që nga shfaqja e "trejës" në qasje të hapur dëmton reputacionin e zhvilluesit shumë më tepër se një bar - që krijohet nga krijimi i tij për vajzat.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Sa i përket barit të famshëm, që përfundoi dosido për disa orë si meme fillimisht në Hugging Face, dhe pastaj në pothuajse të gjitha platformat më ose më pak të profilizuara në rrjet, del se prania në sugjerimin e frazës si "një vajzë që shtrijë mbi bar" çon në shfaqjen në daljen e "trejës" jo vetëm të halucinacioneve, por edhe të krijimeve tmerruese nga fantazia e sëmurë - në kuptimin mjekësor - të artistëve dhe film-makerëve që specializohen në body horror (ju lutemi, nëse ju intereson arsyetimi dhe jeta juaj, mbani larg nga këto dhe mos përpiquni as ta shkruani këtë frazë në dritaren e kërkimit për imazhe me filtrin e sigurisë të çaktivizuar). Në këtë rast, imazhet e njerëzve që qëndrojnë - dhe pak më pak qëndrojnë - i japin "trejës" një katër të bindur me plus, ndërsa portretet ndonjëherë dalin të përsosura; të paktën, jo më keq se modeli bazë SDXL 1.0, - problem është se ndonjë tabu e brendshme lidhur me pozitat horizontale të trupit njerëzor.

Duke u bazuar në komentet e Emad Mostaque, themeluesit dhe ish-kreut (deri në mars 2024) të Stability AI, i cili ka dalë nga kompania për të "u angazhuar në projekte të decentralizuara në fushën e inteligjencës artificiale", dhuna e rëndë ndaj SD3M pikërisht para hapjes së saj për përdorim të kufizuar jo-komerciale (API e modelit më të madh SD3 8B për gjenerimin online, kujtojmë, ka qenë e disponueshme përmes faqeve partnere që nga prilli, por pesha e saj akoma mbetet e fshehur) ishte pasojë e dëshirës së drejtuesve aktualë për sigurinë - "për shkak të detyrimeve rregullatore", që u formulua që në marsin e këtij viti si Politika e Përdorimit të Pranueshëm.Në kuadër të kësaj politike, përdorimi i modelit gjenerativ SD3M nuk lejohet "të kryejnë, promovojnë, ndihmojnë, lehtësojnë, inkurajojnë, planifikojnë, nxisin ose ndihmojnë në përhapjen e dhunës, terrorizmit ose krijimin e përmbajtjes që nxit urrejtje, që diskriminon ose kërcënon një grup të mbrojtur njerëzish (pavarësisht nga gjinia, etniciteti, identiteti ose orientimi seksual, feja apo tjerë).", - prandaj asnjë imazh panda me atë që ka nënë prej tij, duke u përballur me dragonjë të egër! Vetëm mace në kapela qesharake, qentë në xhupat e bukur, shishe me pije misterioze dhe biskota të freskëta, direkt nga furra!

Nëse flasim teknikisht, mundësia e zbrazjes së modelit ishte se seti i të dhënave të trajnimiti thjesht përjashtoi imazhe me njerëzit të shtrirë dhe imazhe të tjera që nënkuptonin ndonjë interpretim të papërshtatshëm, - dhe prandaj tani "tresha" thjesht "nuk e kupton" kuptimin e fjalës "të shtrirë". Ose ndoshta arkitektura e përmirësuar SD3 e lejon identifikimin e peshave në perceptronët që aktivizohen gjatë gjenerimit të imazheve "të pasigurta", - dhe këto pesha janë shfuqizuar përzgjedhshëm drejt lançimit, duke rezultuar në "halucinimin e detyruar". Në të vërtetë, kjo tashmë mund të krahasohet me lobotominë: koduesi përktheu saktë tekstin në tokene, por në hapësirën latente "të mbrojtur" këto tokene nuk i japin asgjë specifike, - dhe prandaj pixelat rezultat në imazh ndodhen në mënyrë rastësore.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Duke marrĂ« parasysh disponueshmĂ«rinĂ« e API-tĂ« tĂ« njĂ« model tĂ« plotĂ«, por tĂ« mbyllur SD3 8B pĂ«r disa muaj dhe garancitĂ« e ngrohta tĂ« menaxherĂ«ve tĂ« mediave Stability AI se "kompaktizuar" 2B do tĂ« rezultojĂ« praktikisht e njĂ«jtĂ« sa i pĂ«rket pĂ«rceptimit tĂ« tekstit dhe gjenerimit tĂ« imazheve, entuziastĂ«t e vizatimeve me AI takuan lançimin e aksesit tĂ« peshave SD3M mĂ« 12 qershor me shumĂ« entuziazĂ«m: nĂ« 24 orĂ«t e para modeli Ă«shtĂ« shkarkuar 2.7 milion herĂ«. Aktualisht, mund ta merrni atĂ« ende, edhe pse me njĂ« rrugĂ« pak mĂ« tĂ« gjatĂ« se ajo qĂ« jemi mĂ«suar pĂ«r checkpoint-at SDXL dhe SD 1.5. NĂ« thelb, rruga e zakonshme Ă«shtĂ« tĂ« drejtoheni nĂ« faqen e Civitai, nga e cila shumica e modeleve shkarkohen pa u regjistruar, por qĂ« nga 17 qershori dhe deri nĂ« momentin e dorĂ«zimit tĂ« kĂ«tij artikulli pĂ«r pĂ«rgatitje, faqja e kĂ«tij site-i e dedikuar pĂ«r "trio" ndodhet nĂ« njĂ« ndalim tĂ« pĂ«rkohshĂ«m. Arsyeja Ă«shtĂ« njĂ«: licenca komerciale pĂ«r SD3M Ă«shtĂ« shkruar nĂ« njĂ« gjuhĂ« kaq tĂ« paqartĂ«, saqĂ« madje avokatĂ«t e Civitai morĂ«n njĂ« pushim pĂ«r ta studiuar mĂ« nĂ« detaje. Sepse nĂ«se njĂ« entuziast strehon nĂ« PC-nĂ« e tij LoRA pĂ«r "trio" dhe e ngarkon atĂ« nĂ« Civitai, dhe Stability AI papritmas vendos qĂ« rezultati Ă«shtĂ« i papranueshĂ«m, dhe tĂ«rheq licencĂ«n nga pĂ«rgjegjĂ«si, — çfarĂ« duhet tĂ« bĂ«jĂ« nĂ« kĂ«tĂ« rast faqja-hoste? Ajo nuk vetĂ«m qĂ« publikojnĂ« checkpoint-at, ciclo-gramat ndihmĂ«se dhe modelet, por gjithashtu ofron vizitorĂ«ve mundĂ«sinĂ« e gjenerimit tĂ« pĂ«rshtatshĂ«m tĂ« imazheve nĂ« re dhe strehimin e tĂ« njĂ«jtave LoRA, inversionesh tekstuale, etj. NĂ« pĂ«rfundim, derisa tĂ« vazhdojĂ« procedura gjyqĂ«sore, skedarĂ«t e modelit dhe tre transformuesit e tij nĂ« paketĂ« mund tĂ« merren vetĂ«m nga faqja e vet Stability AI nĂ« portalin Hugging Face.

⇡#Le tĂ« fillojmĂ«

E vĂ«rteta Ă«shtĂ«, ka njĂ« nuancĂ«: pĂ«r tĂ« pasur akses nĂ« lidhjet e shkarkimit, Ă«shtĂ« e nevojshme tĂ« autentifikoheni nĂ« faqe dhe pastaj tĂ« konfirmoni pranuar marrĂ«veshjen e licencĂ«s sĂ« pĂ«rmendur mĂ« parĂ« — megjithatĂ«, kjo procedurĂ« Ă«shtĂ« falas dhe mjaft e arritshme nga Rusia. NĂ« total ofrohen katĂ«r variante modelet dhe po ashtu katĂ«r transformues pĂ«r shenjĂ«n tekstuale nĂ« tokene, plus tre ciclo-grama modelesh pĂ«r ekzekutimin nĂ« ambientin ComfyUI, pĂ«r tĂ« cilin kemi biseduar mĂ« parĂ«:

modelet:

  • sd3_medium.safetensors
  • sd3_medium_incl_clips.safetensors
  • sd3_medium_incl_clips_t5xxlfp8.safetensors
  • sd3_medium_incl_clips_t5xxlfp16.safetensors

kodifikuesit:

  • clip_g.safetensors
  • clip_l.safetensors
  • t5xxl_fp8_e4m3fn.safetensors
  • t5xxl_fp16.safetensors

ciclotekstet:

  • sd3_medium_example_workflow_basic.json
  • sd3_medium_example_workflow_multi_prompt.json
  • sd3_medium_example_workflow_upscaling.json

NĂ« kuadĂ«r tĂ« kĂ«tij "Workshop-i", do tĂ« kufizohemi nĂ« modelin bazik sd3_medium.safetensors (4.2 GB), tre koduesit — clip_g.safetensors (1.3 GB), clip_l.safetensors (234 MB) dhe t5xxl_fp8_e4m3fn.safetensors (4.7 GB), si dhe ciklogramin sd3_medium_example_workflow_multi_prompt.json. E gjithĂ« kjo ndodh sepse nĂ« makinĂ«n tonĂ« tĂ« testimit kemi tĂ« instaluar, pĂ«r tĂ« kujtuar, kartĂ«n grafike GeForce GTX 1070 me 8 GB RAM video, dhe ky kapacitet nuk i mbush dot modelet mĂ« tĂ« mĂ«dha me tĂ« gjitha transformuesit e integruar. PĂ«r checkpoint-Ă«t e bazuar nĂ« SD 1.5 dhe SDXL, koduesit janĂ« pĂ«rfshirĂ« automatikisht nĂ« skedarin kryesor, por nĂ« kĂ«tĂ« rast, kĂ«ta transformues nuk janĂ« dy, por tre, nĂ« total mbi 6 GB, — duke e sjellĂ« gjithashtu modelin mĂ« shumĂ« se 10 GB; dhe nĂ«se marrim versionin 16-bit tĂ« koduesit T5XXL, atĂ«herĂ« do tĂ« nevojitet njĂ« kartĂ« grafike edhe mĂ« e fuqishme. NĂ« variantin kur fillimisht transformuesit e tekstit nĂ« tokenĂ« ngarkohen nĂ« memorie video, dhe pastaj modeli qĂ« punon me kĂ«ta tokenĂ«, do tĂ« mund tĂ« pĂ«rdorim edhe njĂ« adaptues grafik 6 GB. Nga kjo perspektivĂ«, moduli "tre" pa dyshim fiton ndaj njĂ« checkpoint-i tipik SDXL prej 5-7 GB.

SD3M Ă«shtĂ« njĂ« model i bazuar nĂ« transformatorĂ«t multimodalĂ« tĂ« difuzionit (Multimodal Diffusion Transformer, MMDiT) — dhe kĂ«shtu ndryshe nga zhvillimet mĂ« tĂ« hershme tĂ« Stability AI (e madje jo vetĂ«m tĂ« saj), tĂ« cilat mbĂ«shteten nĂ« arkitekturĂ«n U-Net, e propozuar qĂ« nĂ« vitin 2015. "Workshop-i" nuk Ă«shtĂ« njĂ« vend pĂ«r tĂ« studiuar nĂ« thellĂ«si ndryshimin mes kĂ«tyre qasjeve pĂ«r gjenerimin e imazheve nga AI; le tĂ« themi vetĂ«m se MMDiT ofron njĂ« performancĂ« tĂ« rritur tĂ« modelit, aftĂ«sinĂ« e tij pĂ«r tĂ« punuar me mĂ« shumĂ« tokenĂ« (çka, nĂ« anĂ«n tjetĂ«r, i lejon operatorit tĂ« formulojĂ« sugjerime tekstuale shumĂ« tĂ« gjera, dhe sistemit — tĂ« ndjekĂ« mjaft saktĂ« ato), si dhe cilĂ«sinĂ« mĂ« tĂ« mirĂ« tĂ« imazheve qĂ« pĂ«rftohen. SD3 8B e plotĂ« Ă«shtĂ« nĂ« gjendje tĂ« gjenerojĂ« imazhe nĂ« kanavacĂ« prej 4 MP (2048×2048 piksel), dhe gjithashtu pĂ«rparon DALL-E 3, Midjourney v6 dhe Ideogram v1 nĂ« pĂ«rparĂ«sitĂ« si rikonstruktimi i tekstit nĂ« imazh, saktĂ«sia e pĂ«rputhjes sĂ« imazhit tĂ« fituar me sugjerimin tekstual dhe estetika vizuale totale. Transformimi i tekstit nĂ« vektorĂ« tokenĂ«sh kryhet kĂ«tu menjĂ«herĂ« nga tre koduesit (dy modele CLIP dhe njĂ« T5-XXL — "T5", pĂ«r mĂ« tepĂ«r, nga Text-To-Text Transfer Transformer) — dhe, nĂ« tĂ« vĂ«rtetĂ«, ata nuk janĂ« tĂ« detyruar tĂ« punojnĂ« me tĂ« njĂ«jtĂ«n nxitje.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Por mjaft me parathĂ«nie: le tĂ« merremi me atĂ« qĂ« i kushtohet "Workshop", — gjenerimin e imazheve mbi modelin SD3M. Do tĂ« pĂ«rdorim, siç u tha mĂ« parĂ«, ambientin punues ComfyUI, tĂ« cilin mund ta shkarkoni nĂ« lidhje tĂ« drejtpĂ«rdrejtĂ« nga GitHub. TheksojmĂ« se kjo skemĂ« — Ă«shtĂ« vetĂ«m pĂ«r ekzekutim nĂ« grafikat NVIDIA ose direkt nĂ« CPU AMD apo Intel (çka do tĂ« jetĂ«, natyrisht, ndjeshĂ«m mĂ« e ngadalshme): pronarĂ«t e kartave grafike AMD kanĂ« njĂ« zgjidhje me paketa rocm dhe pytorch, tĂ« cilat mund tĂ« instalohen nĂ«pĂ«rmjet menaxherit tĂ« shkarkimeve pip.

Pas pĂ«rfundimit tĂ« instalimit tĂ« ambientit punues, duhet tĂ« vendosni skedarĂ«t .safetensors qĂ« keni shkarkuar mĂ« parĂ«: modelet — nĂ« dosjen ComfyUImodelscheckpoints, konvertuesit e teksteve nĂ« tokĂ« — nĂ« ComfyUImodelsclip. Dhe — mund tĂ« filloni!

⇡#ËshtĂ« koha pĂ«r t'u pĂ«rshpejtuar

Vlen tĂ« pĂ«rmendet se AUTOMATIC1111, i njohur pĂ«r lexuesit e "Workshop" tĂ« mĂ«parshĂ«m mbi temĂ«n e vizatimit me AI, gjithashtu nĂ« fund tĂ« qershorit mori mundĂ«sinĂ« tĂ« ekzekutojĂ« SD3M, megjithatĂ« nĂ« ComfyUI mbĂ«shtetja pĂ«r modelin e ri mbetet mĂ« e plotĂ«. Nuk Ă«shtĂ« e çuditshme — sepse deri para pak kohĂ«sh autori i "monstrĂ«s sĂ« makarona", i njohur nĂ« komunitet si ComfyAnonimous, ose thjesht Comfy, ishte njĂ« punonjĂ«s i Stability AI, ku punoi, nĂ« veçanti, mbi ambientin e brendshĂ«m tĂ« punĂ«s, tĂ« cilin e pĂ«rdorin vetĂ« zhvilluesit. Siç do tĂ« shohim pak mĂ« vonĂ«, versioni mĂ« i ri i ComfyUI vĂ«rtet tregon se autori i tij ka disa informacion mĂ« tĂ« brendshĂ«m mbi atĂ« se si Ă«shtĂ« strukturuar dhe funksionon ky model i kontrovers, — informacione qĂ« krijuesit e ambienteve tĂ« tjera pĂ«r ekzekutimin lokal tĂ« Stable Diffusion 3 Medium nuk mund t'i mburrin pĂ«r arsyet e kuptueshme.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Instalimi i ComfyUI në versionin portable për Windows është më se e lehtë: pas shkarkimit të arkivës përkatëse ZIP nga faqja zyrtare e projektit mjaft është të deshifrohet në çdo dosje të përshtatshme; është e preferueshme, sigurisht, në një ndarje logjike që bazohet në SSD dhe jo në HDD, sepse shkëmbimi midis disku dhe memories, duke marrë parasysh ciklet e ngarkimit-dërrmimit të modeleve, edhe për krijimin e një imazhi të vetëm (ambiente duhet së pari të ngarkojë në videoRAM konvertuesit e tekstit në tokene, pastaj të pastrojë videon dhe të ngarkojë vetë SD3M) pritet të jetë më shumë se e konsiderueshme, aq më pak që kompjuteri ka videoRAM. Për më tepër, instalimi portativ është i mirë për shkak të pavarësisë së tij të plotë: asgjë - përveç hapësirës së lirë në diskin logjik - nuk e pengon të zhvillosh lokal sa më shumë kopje të ComfyUI, për të eksperimentuar me zgjerime të ndryshme, pa u frikësuar se do të prishësh një sistem që është rregulluar dhe funksionon shumë mirë.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Duke u siguruar që skedari kryesor i modelit SD3M pa koduesit e integruar të tekstit në tokene (skedari stableDiffusion3SD3_sd3Medium.safetensors, 4.2 GB) ndodhet në dosjen e altër checkpoints (në rastin e instalimit tonë testues, rruga e plotë është C:Fun-n-GamesComfyUI-SD3ComfyUImodelscheckpoints), dhe të tre modelet e koduesve (skedarët stableDiffusion3SD3_textEncoderClipG.safetensors, stableDiffusion3SD3_textEncoderClipL.safetensors dhe stableDiffusion3SD3_textEncoderT5E4m3fn.safetensors; 1.3 GB, 234 MB dhe 4.7 GB përkatësisht) ndodhen në dosjen clip (C:Fun-n-GamesComfyUI-SD3ComfyUImodelsclip), mund të hapni ambientin e punës duke bërë një klik të dyfishtë në skedarin run_nvidia_gpu.bat në dosjen kryesore (në rastin tonë C:Fun-n-GamesComfyUI-SD3). Pas fillimit të serverit, në dritaren e komandave Windows do të hapet automatikisht (kjo nënkuptojnë cilësimet e skedarit BAT) një tab e re në shfletuesin e paracaktuar, në të cilin në adresën 127.0.0.1/8188 do të jetë në dispozicion ndërfaqja në web. të dominuara tashmë nga ne më parë (le të jetë vetëm për herën e parë) "monstruozi makaron".

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

NĂ« thelb, nĂ«se dispononi njĂ« kartĂ« grafike mĂ« moderne NVIDIA (brezi RTX, jo GTX, madje edhe me vetĂ«m 6 GB video RAM), mund tĂ« ngarkoni menjĂ«herĂ« nĂ« mjedisin e punĂ«s diagramin e referencĂ«s tĂ« autorit ComfyAnonimous, i cili u pĂ«rmend mĂ« parĂ« — skedari comfy_example_workflows_sd3_medium_example_workflow_multi_prompt.json me shumĂ« dritare pĂ«r inputin e sugjerimeve, njĂ« pĂ«r çdo njohĂ«s nga tre tĂ« tillĂ« — dhe tĂ« punoni me tĂ«. MegjithatĂ«, sĂ« pari do tĂ« duhet tĂ« vendosni katĂ«r emrat e skedarĂ«ve tĂ« modeleve (nĂ« nyjat e ngarkimit tĂ« tyre) nĂ« pĂ«rputhje me ato qĂ« keni. Autori i diagramit tĂ« referencĂ«s, duket se operonte nĂ« vendin e tij tĂ« punĂ«s (nĂ« Stability AI, siç u pĂ«rmend mĂ« parĂ«) me skedarĂ«t lokal qĂ« e kishin emrin disi tjetĂ«r, kĂ«shtu qĂ«, nĂ«se shtypni butonin "Queue Prompt" nĂ« ndĂ«rfaqen spartane tĂ« ComfyUI menjĂ«herĂ« pas ngarkimit tĂ« diagramit, mjedisi i punĂ«s do tĂ« japĂ« njĂ« mesazh gabimi.

⇡#TrepallĂ« pĂ«r gjenerim tĂ« AI

MegjithatĂ«, kjo Ă«shtĂ« lehtĂ« e rregullueshme: ajo qĂ« mĂ« shqetĂ«son shumĂ« mĂ« tepĂ«r Ă«shtĂ« fakti se karta GTX 1070 e bĂ«rĂ« mĂ« parĂ« nĂ« dispozicion, pĂ«rpunon SD3M me njĂ« shpejtĂ«si pĂ«rbindĂ«shi — gjenerimi i imazhit ndodh me njĂ« shpejtĂ«si prej 27-30 sekondash pĂ«r çdo iteracion, dhe, nĂ«se marrim parasysh se parametri "Steps" nĂ« diagramin e referencĂ«s Ă«shtĂ« vendosur nĂ« vlerĂ«n "28", koha shpenzohet nĂ« mĂ«nyrĂ« tĂ« paarsyeshme shumĂ«. Prandaj, do tĂ« bĂ«jmĂ« njĂ« optimizim tĂ« vogĂ«l — do tĂ« pĂ«rdorim modulin Python venv (mjediset virtuale, i cili ka si qĂ«llim, nĂ« veçanti, tĂ« pĂ«rshpejtojĂ« punĂ«n e modeleve gjeneruese tĂ« AI. Ai nuk Ă«shtĂ« i pĂ«rfshirĂ« nĂ« paketimin e versionit portable tĂ« ComfyUI, por ka shumĂ« mĂ«nyra pĂ«r ta instaluar, tĂ« cilat pĂ«rfundimisht reduktohen nĂ« vendosjen e njĂ« mjedisi tĂ« plotĂ« Python nĂ« PC-nĂ« lokale — dhe aktivizimin e modulit tĂ« nevojshĂ«m nga ky mjedis.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

ShpresojmĂ« qĂ« lexuesit tanĂ« qĂ« ndjekin "Punishtet" tanĂ« tashmĂ« kanĂ« njĂ« instalim aktiv tĂ« AUTOMATIC1111 nĂ« makinat e tyre. NĂ« kĂ«tĂ« rast, gjithçka Ă«shtĂ« shumĂ« mĂ« e lehtĂ«: moduli venv Ă«shtĂ« tashmĂ« i vendosur, dhe gjithçka qĂ« kĂ«rkohet pĂ«r ta aktivizuar atĂ« gjatĂ« nisjes sĂ« mjedisit tĂ« punĂ«s ComfyUI Ă«shtĂ« tĂ« kryhet siç duhet thirrja. Filloni duhet tĂ« mbyllni serverin, duke kaluar nĂ« dritaren e tij dhe duke shtypur «Ctrl» + «C», pastaj duke futur «y» pĂ«r tĂ« konfirmuar; mĂ« pas, kopjoni skedarin BAT run_nvidia_gpu.bat nĂ« njĂ« tĂ« ri, me emrin, pĂ«r shembull, run_with_venv.bat. Skedari origjinal i nisjes Ă«shtĂ« mjaft i shkurtĂ«r — ai thjesht thĂ«rret njĂ« kopje portative tĂ« instaluar Python me parametrin —windows-standalone-build:

.python_embededpython.exe -s ComfyUImain.py —windows-standalone-build

pause

Ky parametr nĂ« vetvete nuk Ă«shtĂ« shumĂ« i qartĂ« — ai nĂ«nkupton disa optimizime, tĂ« cilat, me shumĂ« mundĂ«si, janĂ« tĂ« dizajnuara pikĂ«risht pĂ«r kartat grafike NVIDIA mĂ« tĂ« reja dhe pĂ«r kĂ«tĂ« arsye mund tĂ« pĂ«rkeqĂ«sojnĂ« pĂ«rvojĂ«n e atyre qĂ« ende mbrojnĂ« GTX-in e tyre tĂ« njohur. PĂ«r kĂ«tĂ« arsye, do tĂ« heqim —windows-standalone-build nga komanda, dhe njĂ«kohĂ«sisht do tĂ« heqim edhe optimizimin tjetĂ«r tĂ« modĂ«s sĂ« re — menaxherin e kujtesĂ«s inteligjente, smart memory, i cili pĂ«rpiqet tĂ« mbajĂ« sa mĂ« shumĂ« informacion nĂ« video RAM, pa e shkarkuar atĂ«. Kjo vĂ«rtet pĂ«rshpejton krijimin e imazheve nga AI, megjithatĂ«, pĂ«rveç kĂ«saj, e kthen kompjuterin tonĂ« moralisht tĂ« vjetruar nĂ« njĂ« sistem njĂ«lloj — nuk mund tĂ« bĂ«ni as surfim nĂ« internet, as tĂ« luani, as madje tĂ« punoni me dokumentet dhe e-mailin nĂ« PC paralelisht me aktivitetin e mjedisit tĂ« punĂ«s. Pra, pĂ«r ata qĂ« nuk kanĂ« njĂ« kompjuter tĂ« dedikuar pĂ«r artin e AI, njĂ« skedar BAT i tillĂ« pĂ«r tĂ« nisur ComfyUI (jo vetĂ«m pĂ«r tĂ« krijuar imazhe me SD3M, pĂ«r tĂ« thĂ«nĂ« tĂ« vĂ«rtetĂ«n, - pĂ«r SDXL ai Ă«shtĂ« gjithashtu plotĂ«sisht i pĂ«rshtatshĂ«m):

@echo off

call cd C:Fun-n-GamesGitstable-diffusion-webuivenvScripts

echo %

call activate.bat

echo venv activated

call cd C:Fun-n-GamesComfyUI-SD3

echo %

call .python_embededpython.exe -s ComfyUImain.py —disable-smart-memory

pause

KĂ«tu supozohet se instalimi portativ i ComfyUI Ă«shtĂ« bĂ«rĂ« nĂ« katalogun C:Fun-n-GamesComfyUI-SD3, dhe AUTOMATIC1111 ishte instaluar mĂ« parĂ« nĂ« C:Fun-n-GamesGitstable-diffusion-webui. ShumĂ« «echo» janĂ« tĂ« nevojshme thjesht pĂ«r kontrollin vizual tĂ« asaj qĂ« ndĂ«rrimi i katalogĂ«ve kalon normalisht dhe komandat pĂ«rkatĂ«se ekzekutojnĂ«, — pasi tĂ« gjitha tĂ« jetĂ« rregulluar, ato mund tĂ« hiqen nga skedari BAT.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Risim sĂ«rish ambientin e punĂ«s, kĂ«tĂ« herĂ« duke klikuar dy herĂ« mbi run_with_venv.bat. Duke qenĂ« se ne mĂ« parĂ« mbyllĂ«m thjesht serverin, ndĂ«rsa ndĂ«rfaqja web nuk u pre, nĂ« skedĂ«n pĂ«rkatĂ«se duhet tĂ« ketĂ« akoma atĂ« diagramin bazĂ« ComfyUI me emrat e modeleve tĂ« rregulluar. Le tĂ« kushtojmĂ« vĂ«mendje pjesĂ«s sĂ« saj tĂ« djathtĂ«: aty Ă«shtĂ« node "Preview Image", e cila nuk e ruan imazhin e gatshĂ«m nĂ« disk, por vetĂ«m e demonstruar atĂ«. NĂ«se çfarĂ«do herĂ« ekzekutohet diagrami pĂ«r tĂ« gjeneruar njĂ« imazh tĂ« vetĂ«m, e vlerĂ«sojmĂ« vizualisht, bĂ«jmĂ« disa ndryshime nĂ« parametra, dhe e ekzekutojmĂ« pĂ«rsĂ«ri — kjo Ă«shtĂ« njĂ« kĂ«ndvim mjaft e punueshme: imazhin qĂ« na pĂ«lqen gjithmonĂ« mund ta ruajmĂ« manualisht duke klikuar me butonin e djathtĂ« tĂ« miut mbi tĂ«. Por nĂ«se kryhen shumĂ« gjenerime njĂ« pas tjetri nĂ« ambientin e punĂ«s, Ă«shtĂ« mĂ« mirĂ« qĂ« rezultatet e tyre tĂ« grumbullohen automatikisht nĂ« memorien e pĂ«rhershme (nĂ« katalogun ComfyUIoutput si parazgjedhje).

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Prandaj Ă«shtĂ« mĂ« mirĂ« ta ndryshojmĂ« menjĂ«herĂ« node-in "Preview Image" me "Save Image". PĂ«r kĂ«tĂ«, klikojmĂ« dy herĂ« me butonin e majtĂ« tĂ« miut nĂ« njĂ« zonĂ« tĂ« lirĂ« tĂ« diagramit — do tĂ« hapet njĂ« dritare pĂ«rzgjedhjeje node me njĂ« shirit kĂ«rkimi. NĂ« kĂ«tĂ« shirit, do tĂ« fillojmĂ« tĂ« shkruajmĂ« "Save
" — dhe praktikisht menjĂ«herĂ« do tĂ« shohim emrin e kĂ«rkuar. MĂ« pas, do tĂ« mbetet thjesht tĂ« klikojmĂ« mbi tĂ« dhe tĂ« lidhim hyrjen e node-s sĂ« shfaqur nĂ« dalje "IMAGE" tĂ« node-s "VAE Decode", ku fillimisht ishte lidhur "Preview Image". Node-in "Preview Image" mund ta heqim mĂ« pas — thjesht e pĂ«rzgjedhim atĂ«, duke klikuar mbi titullin, dhe shtypim çelĂ«sin "Del" nĂ« tastierĂ«.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Dhe tani — Ă«shtĂ« koha e duhur pĂ«r tĂ« ekzekutuar diagramin bazĂ« nga ComfyAnonimous (me korrigjimet tona modeste). Rezultati Ă«shtĂ« ky:

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

NjĂ« imazh shumĂ« mbreslĂ«nĂ«s, madje me njĂ« humor, — dhe nuk do tĂ« thoshit se Ă«shtĂ« krijuar me ndihmĂ«n e tĂ« njĂ«jtĂ«s model qĂ« plotĂ«sisht shemb instrukcionin pĂ«r tĂ« pikturuar njerĂ«zit qĂ« flenĂ« nĂ« bar. NĂ« tĂ« njĂ«jtĂ«n kohĂ«, sistemi funksionon mjaft shpejt — rreth 5-6 sekonda pĂ«r iteracion pĂ«r njĂ« imazh me sipĂ«rfaqe 1 MPix nĂ« GTX 1070 Ă«shtĂ« njĂ« tregues i mirĂ«. PĂ«r krahasim: po i njĂ«jti PC nĂ« tĂ« njĂ«jtĂ«n ComfyUI me tĂ« njĂ«jtin skedar BAT pĂ«rcjell imazhe SDXL tĂ« pĂ«rmasave tĂ« ngjashme, duke shpenzuar rreth 6-7 sekonda pĂ«r çdo iteracion, prandaj "tre" mund tĂ« konsiderohet mjaft mĂ« pak kĂ«rkues ndaj pajisjeve kompjuterike ku po zhvillohet gjenerimi i AI.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

TĂ« rregullojmĂ« tani dimensionet e kanavacĂ«s. AfĂ«r nodit "EmptySD3LatentImage", i cili i pĂ«rcakton ato, ndodhet njĂ« nodĂ« "e zbrazĂ«t" (nĂ« kuptimin, e pa lidhur nĂ« asnjĂ« anĂ« me asgjĂ«) e quajtur "Note", ku ndodhet njĂ« kujtesĂ« e rĂ«ndĂ«sishme: sipĂ«rfaqja totale e imazhit nĂ« rastin e SD3M duhet tĂ« jetĂ« rreth 1 Mpx, - mbi tĂ« cilĂ«n duhet tĂ« pĂ«rshtaten dimensionet e anĂ«ve tĂ« kanavacĂ«s katrore. Le ta pĂ«rcaktojmĂ« atĂ« si 1344×768 - qĂ« Ă«shtĂ« rreth 1,03 Mpx dhe do tĂ« dalĂ«.

Vërejmë: më lart ndodhet nodi "Seed", ku është vendosur vetë embrioni, në këtë rast "945512652412924", dhe është shënuar se nuk duhet të ndryshojë pas gjenerimit (parametri "fixed").

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Të realizojmë të njëjtën ciklogram me embrionin e mëparshëm, por tashmë për kanavacën katrore. Menjëherë bie në sy se koha e realizimit është më e vogël, megjithatë shpejtësia e vizatimit ka mbetur e njëjtë - më pak se 6 s për iteracion. Dhe kjo është logjike: pasi që udhëzimet tekstuale nuk ndryshuan, nuk është e nevojshme të ngarkohet përsëri koduesi (ose koduesit) për to. Imazhi që marrim, është e qartë, është paksa ndryshe nga i pari, katror, por jo në mënyrë thelbësore - kompozita e përgjithshme, siç pritej, është ruajtur.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Tani vĂ«mĂ« re nodet "CLIPTextEncodeSD3" dhe "CLIP Text Encode (Negative Prompt)". E para veçohet pĂ«r faktin se pĂ«rmban menjĂ«herĂ« tre fusha inputi; nĂ«se hiqni tekstin nga ato, shenjat do tĂ« bĂ«hen tĂ« dukshme, pĂ«r cilat kodues janĂ« tĂ« destinuara, - nga lart poshtĂ«, janĂ« CLIP G, CLIP L dhe T5XXL. Ka qenĂ« e qartĂ« pĂ«r arsyet se pĂ«rpara nuk kishte nodĂ« tĂ« tilla nĂ« ComfyUI. Ciklograma mbĂ«shtetĂ«se pĂ«rmban udhĂ«zime tĂ« pĂ«rsĂ«ritura tĂ« shkurtra pĂ«r dy fushat e para tekstuale (pĂ«r konvertuesit CLIP G dhe CLIP L) dhe njĂ« shumĂ« mĂ« tĂ« zgjeruar pĂ«r tĂ« tretĂ«n - T5XXL. ËshtĂ« e qartĂ«, qĂ« pĂ«rmbajtja e kĂ«tyre fushave mund tĂ« luajĂ« nĂ« limite tĂ« gjera, dhe vetĂ« studimi se nĂ« çfarĂ« mase ndryshimi i tekstit nĂ« to ndikon nĂ« imazhin pĂ«rfundimtar, Ă«shtĂ« njĂ« detyrĂ« sfiduese, por mjaft interesante. MegjithatĂ«, pĂ«r arsye qĂ« do tĂ« bĂ«hen tĂ« qarta mĂ« vonĂ«, ne nuk do tĂ« merremi me tĂ« pĂ«r momentin.

Ndaj në nodën «CLIP Text Encode (Negative Prompt)», përkundrazi, nuk ka asgjë të veçantë, - por vlerësoni se sa i vështirë është rruga nga ajo deri në hyrjen përkatëse «conditioning» të nodës kryesore «KSampler»! Kjo rrugë ndahet në dy degë, ku njëra prej tyre (e sipërme në këtë rast) tregon se duke filluar nga 10% e hapa të gjenerimit dhe deri në përfundimin e tij, sistemi nuk do të marrë parasysh fare nxitjen negative (kalimi nëpër nodën «ConditioningZeroOut» pikërisht do të thotë zerozimin e kushteve). Ndërsa dega tjetër kalon nxitjen negative (po ashtu në mënyrë kushtore me pesha të gjysmë) për në përpunim pa ndryshime - por vetëm në 10% të parë nga numri total i hapave të gjenerimit.

⇡#TĂ« paqarta largĂ«sitĂ«

Përsëri: 10% e para, dmth 3 nga 28 të caktuar në këtë rast, nxitja negative kalon në nodën «KSampler», e cila merret me formimin e imazhit në hapësirën latent (në hapësirën e pikselëve, dmth në një imazh të kuptueshëm për njeriun, rezultati i saj kalon nëpër nodën «VAE Decoder»), në mënyrë normale: dega e sipërme (me zerozimin e kushteve) nuk është aktive, vetëm dega e poshtme punon. 90% e mbetur e hapave (25 nga 28 në rastin tonë) nxitja negative nuk funksionon fare: dega e sipërme e transmetimit të kushteve është aktive - me zerozimin e tyre, - ndërsa lëvizja nëpër degën e poshtme është bllokuar nga parametri kufi i aktivizimit të nodës përkatëse «ConditioningSetTimestepRange». Tani kuptohet se përse një grup recensentësh pretendon se nxitjet negative për SD3M në parim nuk mund të përdoren, - efekti i tyre (nëse marrim parasysh pikërisht këtë, referencën, ciklografik dhe supozoni se në faqet me gjenerim në linjë sipas modelit SD3 Medium zbatohet e njëjta rregull) është minimal.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Dhe megjithatĂ«, ai ekziston: nĂ«se thjesht merrni dhe lidhni drejtpĂ«rdrejt daljen e nodĂ«s "CLIP Text Encode (Negative Prompt)" me hyrjen pĂ«rkatĂ«se tĂ« "KSampler" (ose shĂ«noni tĂ« gjitha nodĂ«t ndihmĂ«se me kushte nĂ« kĂ«tĂ« rrugĂ« si "tĂ« kalueshme", "Bypass", gjĂ« qĂ« do tĂ« shpjerĂ« nĂ« tĂ« njĂ«jtin efekt), cilĂ«sia e imazhit pĂ«rfundimtar do tĂ« pĂ«rkeqĂ«sohej ndjeshĂ«m. Kjo, pĂ«r mĂ« tepĂ«r, mund tĂ« konsiderohet si njĂ« provĂ« indirekte e "papjekurisĂ«" sĂ« SD3M, pasi rregullimi i forcĂ«s dhe rĂ«ndĂ«sisĂ« sĂ« sugjerimit negativ, nĂ« mĂ«nyrĂ« strikte, do tĂ« duhej tĂ« ishte nĂ« kapacitetin e zhvilluesve qĂ« para se tĂ« publikoheshin pesha e modelit nĂ« qasje tĂ« hapur. Dy degĂ« tĂ« kushteve tĂ« vendosura pĂ«r pĂ«rdorimin e sugjerimit negativ — njĂ« lloj patch, dhe nĂ« kĂ«tĂ« kuptim ankesat e entuziastĂ«ve pĂ«r faktin se "trija" hapur nuk arrin te pritjet e frymĂ«zuara nga departamenti i marketingut tĂ« Stability AI nĂ« lidhje me tĂ«, duken mjaft tĂ« arsyeshme.

Mungesa, edhe e njĂ« udhĂ«zimi tĂ« shkurtĂ«r zyrtar pĂ«r pĂ«rdorimin e SD3M ka bĂ«rĂ« qĂ« tashmĂ« tĂ« qarkullojnĂ« thashetheme nĂ« internet se kjo model nuk Ă«shtĂ« trajnuar fare pĂ«r pĂ«rdorimin e sugjerimeve negative.Kjo, sigurisht, nuk Ă«shtĂ« e vĂ«rtetĂ«, por nĂ« çdo rast, pĂ«rdorimi i kĂ«tyre sugjerimeve duhet bĂ«rĂ« ndryshe nga sa Ă«shtĂ« zakon pĂ«r operatorĂ«t e SD 1.5 dhe SDXL.. NĂ« veçanti, entuziastĂ«t me shumĂ« seriozitet pretendojnĂ« se shtimi nĂ« fushĂ«n negative tĂ« pĂ«rshkrimeve tĂ« detajuara tĂ« sa mĂ« shumĂ« papĂ«rgjegjshmĂ«rive (po, po, e vjetra "nsfw, nude" nuk Ă«shtĂ« e mjaftueshme — do tĂ« duhet tĂ« pĂ«rdorim pak imagjinatĂ«) çon nĂ« njĂ« pĂ«rmirĂ«sim tĂ« dukshĂ«m tĂ« pamjes edhe tĂ« vajzĂ«s famĂ«keqe qĂ« po e pĂ«rjetĂ«son duke shtrirĂ« nĂ« bar. NĂ«se Ă«shtĂ« kĂ«shtu apo jo — nuk ka mĂ«nyrĂ« pĂ«r ta zbuluar pa njĂ« verifikim tĂ« detajuar (sidoqoftĂ«, nuk Ă«shtĂ« e sigurt se madje edhe etiketimi "18+" nĂ« kokĂ«n e faqes sonĂ« do ta mbrojĂ« botimin nga paditĂ« e vigjilencĂ«s sĂ« moralit, nĂ«se ne rrezikojmĂ« tĂ« publikojmĂ« "mrekullinĂ« e sugjerimit" tĂ« munduar nga entuziastĂ«t — pĂ«r aq sa Ă«shtĂ« nĂ« anglisht). Kjo situatĂ« argĂ«tuese i ngjan njĂ« kazusi me mĂ«simet e hershme tĂ« mesjetĂ«s kundĂ«r paganizmit, pĂ«r shkak tĂ« tĂ« cilave — pikĂ«risht sepse ato pĂ«rmbanin pĂ«rshkrime mjaft tĂ« detajuara se çfarĂ« dhe si nuk duhet bĂ«rĂ« nga tĂ« krishterĂ«t e ndershĂ«m — na janĂ« ruajtur tĂ« paktĂ«n dĂ«shmi tĂ« fragmentuara tĂ« besimeve dhe zakoneve tĂ« RusisĂ« para-kristiane.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Tani, shpresojmĂ«, tani Ă«shtĂ« mĂ« e qartĂ« pse thellimi mĂ« tej nĂ« studimin e SD3M nĂ« kĂ«tĂ« fazĂ« duket se nuk Ă«shtĂ« njĂ« shpenzim i mençur i forcave dhe kohĂ«s. Atje vĂ«rtet ka shumĂ« pĂ«r tĂ« diskutuar dhe pĂ«r tĂ« eksploruar: dhe parametrat mjaft tĂ« rreptĂ« tĂ« rekomanduar pĂ«r gjenerimin nĂ« nodin 'KSampler' (CFG — 4.5-5.0; numri i hapave — rreth 28; çifti sampler/scheduler — pĂ«rjashtimisht dpmpp_2m/sgm_uniform, pĂ«rndryshe cilĂ«sia e shpĂ«rndarjes bie ndjeshĂ«m); dhe variabiliteti ekstrem i cilĂ«sisĂ« subjektive tĂ« gjenerimeve me tĂ« njĂ«jtat parametra fillestarĂ«, por me variacione tĂ« ndryshme; dhe çlirimi nga e famshmja 'mallkimi i shtrirjes nĂ«/bar' (pĂ«r tĂ« cilin tashmĂ« propozojnĂ« zgjidhje tĂ« paarritshme); dhe, nĂ« thelb, zbulimi se cilat parametra tĂ« gjenerimit ndikojnĂ« nĂ« çdo njĂ«rin nga tre konvertuesit e tekstit nĂ« tokene — dhe si, duke i menaxhuar ata, tĂ« arrihet krijimi i vĂ«rtetĂ« tĂ« kryeveprave tĂ« IArtit Vizual (nĂ«se njĂ« gjĂ« e tillĂ« Ă«shtĂ« e mundur me 'treĂ«n' nĂ« parim, sigurisht).

Po aq mĂ« shumĂ« qĂ« shkarkimi i Emad MoustakĂ«s nĂ« mars dhe ComfyAnonimous nĂ« qershor, as qĂ« nuk janĂ« vetĂ«m ata, — nuk janĂ« tĂ« vetmet vĂ«shtirĂ«si qĂ« e godasin Stability AI. Siç raporton Reuters nĂ« lidhje me The Information, ky startup britanik sapo e ka ndryshuar sĂ«rish drejtorin ekzekutiv mĂ« i cili Ă«shtĂ« Prem Akkaraju (Prem Akkaraju), njĂ« pĂ«rfaqĂ«sues i njohur i grupit tĂ« njohur global tĂ« investitorĂ«ve IT — dhe ky, nga ana e tij, Ă«shtĂ« i gatshĂ«m tĂ« investojĂ« njĂ« shumĂ« tĂ« konsiderueshme nĂ« kompaninĂ« ( fjalĂ« Ă«shtĂ« pĂ«r 80 milion dollarĂ«). Situata e Stability AI si njĂ« strukturĂ« biznesi sot Ă«shtĂ« e hapur nĂ« mĂ«nyrĂ« tĂ« pasigurt; shumĂ« entuziastĂ« tĂ« zhgĂ«njyer parashikojnĂ« fundin e shpejtĂ« tĂ« saj— dhe nĂ« njĂ« situatĂ« tĂ« tillĂ«, Ă«shtĂ« e vĂ«shtirĂ« tĂ« pritet njĂ« punĂ« e kuptuar nga kompania edhe mbi gabimet kaq tĂ« dukshme. entuziastĂ«t parashikojnĂ« fundin e saj tĂ« shpejtĂ« — dhe nĂ« njĂ« situatĂ« tĂ« tillĂ« Ă«shtĂ« e vĂ«shtirĂ« tĂ« pritet njĂ« punĂ« e thelluar nga kompania madje edhe mbi gabime kaq evidente.

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Politika e paishtjellshme e licencave, fatkeqësisht, mban komunitetin larg përmirësimit të veprimit SD3M, siç ndodhi me SD 1.5 dhe SDXL. Të paktën, piketat dhe mjetet si LoRA për dy modelet e fundit do të mbeten të disponueshme për ekzekutimin lokal, edhe kur (dhe nëse) Stability AI përfundon rrugën e saj si një strukturë tregtare. Menjëherë pas dështimit të madh të "trio-së", zërat për krijimin e një projekti jo-fitimprurës për zhvillimin e një modeli gjenerues për transformimin e tekstit në imazhe në bazë të financimit nga turma filluan të dëgjoheshin gjithnjë e më shpesh në forume përkatëse, dhe deri tani ky lëvizje po merr formën e saj nën emrin Open Model Initiative. Ata që kanë shprehur gatishmërinë për t'u angazhuar janë Invoke (një nga platforma për gjenerimin online të AI, e orientuar nga studiot profesionale), Comfy Org (ekipi që merret me mbështetje dhe zhvillim të ComfyUI), Civitai (nuk ka nevojë për prezantim) dhe ekipi që qëndron pas LAION (bazës së të dhënave të imazheve të annotuara, mbi të cilën kryesisht trajnohen këto lloje modelet).

Pra, nĂ« horizontin e afĂ«rt, publikimet e reja tĂ« "Atelier" do tĂ« orientohen, shumĂ« gjasa, nĂ« punĂ«n me modelet pĂ«r tĂ« cilat komuniteti tashmĂ« ka krijuar njĂ« set tĂ« gjerĂ« pĂ«rmirĂ«simesh dhe mjeteve shtesĂ«, — pĂ«r "polutorkĂ«n" dhe "Oversize". Ndoshta, koha e triumfit tĂ« SD3M do tĂ« vijĂ« ende, — por sot Ă«shtĂ« e vĂ«shtirĂ« tĂ« supozohet se kur mund tĂ« ndodhĂ« kjo. NdĂ«rkohĂ«, ata qĂ« janĂ« tĂ« interesuar mund tĂ« shkarkojnĂ« arkivĂ«n me gjenerimet e pĂ«rmendura nĂ« kĂ«tĂ« artikull tĂ« SD3M (ciklografitĂ« janĂ« tĂ« integruara direkt nĂ« skedarĂ«t PNG; mjafton tĂ« tĂ«rhiqni imazhin nĂ« fushĂ«n e punĂ«s sĂ« ComfyUI nga "Shfletuesi" i Windows pĂ«r tĂ« riprodhuar tĂ« gjithĂ« rendin dhe parametrat e gjenerimit) kĂ«tu. Ndoshta, ndonjĂ« nga lexuesit tanĂ« do tĂ« jetĂ« nĂ« gjendje ta zbulojĂ« mĂ« herĂ«t se pĂ«rmbushĂ«sit nĂ« Reddit dhe Hugging Face mĂ«nyrĂ«n optimale pĂ«r tĂ« shpĂ«rndarĂ« tekstin nĂ« tre fusha tĂ« sugjerimit, pĂ«r shembull?

Artikulli i ri: PraktikĂ« mbi pikturimin me AI, pjesa e nĂ«ntĂ«: SD3M — "trepĂ« e tretĂ«".

Materialet lidhur me temën:

Stability AI ka ndryshuar drejtimin dhe ka tërhequr 80 milion dollarë investime.

Prezantuar gjeneratori i imazheve AI Stable Diffusion Medium, që ka nevojë thjesht për një kartë grafike me 5 GB memorie.

Stability AI është zhytur në borxhe dhe tani po kërkon blerës.

Startup-i AI Stability AI do të shkurtojë 10% të personelit për shkak të intensifikimit të konkurrencës.

Stable Diffusion 3.0 është shpallur - AI për të vizatuar ka ndryshuar arkitekturën dhe ka mësuar të shkruajë.

Burimi: 3dnews.ru

Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS đŸ”„ Blini hosting tĂ« besueshĂ«m pĂ«r faqe interneti me mbrojtje nga DDoS, serverĂ« VPS VDS | ProHoster