Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd

Het bedrijf Stability AI heeft de tweede editie van het machine learning-systeem Stable Diffusion gepubliceerd, dat in staat is om afbeeldingen te synthetiseren en te wijzigen op basis van een gegeven sjabloon of tekstbeschrijving in natuurlijke taal. De code voor de tools voor het trainen van het neurale netwerk en het genereren van afbeeldingen is geschreven in de programmeertaal Python met gebruik van het PyTorch-framework en is gepubliceerd onder de MIT-licentie. De al getrainde modellen zijn beschikbaar onder de permissieve Creative ML OpenRAIL-M-licentie, die gebruik voor commerciële doeleinden toestaat. Daarnaast is er een online demonstrator voor het genereren van afbeeldingen beschikbaar.

Belangrijke verbeteringen in de nieuwe editie van Stable Diffusion:

  • Er is een nieuw model ontwikkeld voor het synthetiseren van afbeeldingen op basis van tekstbeschrijvingen — SD2.0-v, dat het genereren van afbeeldingen met een resolutie van 768×768 ondersteunt. Dit nieuwe model is getraind met behulp van de LAION-5B-collectie, die 5,85 miljard afbeeldingen met tekstbeschrijvingen bevat. Het model gebruikt dezelfde set parameters als het Stable Diffusion 1.5-model, maar verschilt door de overstap naar de fundamenteel andere encoder OpenCLIP-ViT/H, wat heeft geleid tot een aanzienlijke verbetering van de kwaliteit van de resulterende afbeeldingen.
    Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd
  • Een vereenvoudigde versie, SD2.0-base, is ontwikkeld, die is getraind op afbeeldingen van 256×256 met behulp van een klassieke ruisvoorspellingsmodel en die het genereren van afbeeldingen met een resolutie van 512×512 ondersteunt.
    Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd
  • Er is een mogelijkheid geboden om de superresolutietechnologie (Super Resolution) te gebruiken voor het verhogen van de resolutie van de originele afbeelding zonder kwaliteitsverlies, door gebruik te maken van algoritmen voor ruimtelijke schaling en detailherstel. Het aangeboden beeldverwerkingsmodel (SD20-upscaler) ondersteunt een viermaal verhoogde schaal, waardoor afbeeldingen met een resolutie van 2048×2048 kunnen worden gegenereerd.
    Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd
  • Een model, SD2.0-depth2img, is voorgesteld, dat diepte en ruimtelijke relatie van objecten in overweging neemt. Voor monokale diepte-inschatting wordt het MiDaS-systeem gebruikt. Het model maakt het mogelijk om nieuwe afbeeldingen te synthetiseren door een andere afbeelding als sjabloon te gebruiken, die sterk kan afwijken van het origineel, maar de algemene compositie en diepte behoudt. Bijvoorbeeld kan de houding van een persoon op een foto worden gebruikt om een ander personage in dezelfde houding te vormen.
    Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd
    Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd
    Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd
  • Het model voor beeldmodificatie is bijgewerkt — SD 2.0-inpainting, waarmee delen van een afbeelding kunnen worden vervangen en gewijzigd met behulp van tekstprompts.
    Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd
  • Modellen zijn geoptimaliseerd voor gebruik op standaard systemen met één GPU.

Het Stable Diffusion 2.0 beeldsynthesesysteem is geïntroduceerd


Bron: opennet.ru
Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers 🔥 Koop betrouwbare webhosting met bescherming tegen DDoS, VPS VDS servers | ProHoster