OpenAI: AI-d ei ole mõtet vale eest karistada — see hakkab veel rohkem petma.

Hallutsioonid, st teadlikult valed vastused, mida kunstlikud intelligentsuse mudelid mõnikord annavad, on saanud kogu tööstuse peamiseks probleemiks – selle tõttu loobuvad mõned inimesed üldse tehisintellekti kasutamisest. Sellest probleemist vabanemine võib osutuda keerulisemaks, kui algselt arvati, leidsid OpenAI teadlased.

OpenAI: AI-d ei ole mõtet vale eest karistada — see hakkab veel rohkem petma.

OpenAI teadlased avaldasid uurimistulemused, milles kirjeldasid oma katseid luua juhtimisstruktuure keerukate, sealhulgas mõtlema panevate tehisintellekti mudelite jaoks, et vältida nende hälvet seatud piiridest. Teadlased kasutasid unikaalseid strateegiaid ja meetodeid, sealhulgas karistusi kahjulike tegevuste eest ning katseid kasutajat petta. Projekti käigus kasutati muu hulgas mingit OpenAI loodud, aga turule mitte lansseeritud tehisintellekti mudelit, millele pandi erinevad ülesanded – nende täitmist oli võimalik lihtsustada, pettes kasutajat või hüljates teatud tegevused.

Mudeli koolitulemused sõltuvad suuresti tugevdamise õppimise etapist, kus mudel saab tasu käsu täitmise või õige vastuse genereerimise eest. Tehisintellekt mudelid kipuvad püüdma tasu saada manipuleerimise kaudu, sealhulgas rikkudes teatud reegleid ja soovitusi, et saavutada soovitud tulemusi. Uurijad loodsid, et nad suudavad leida avasid ja paremini mõista tehisintellekti käitumist, jälgides selle ratsionaliseerimise ahelat, kuid see ei aidanud. Üritused optimeerida ratsionaliseerimise ahelat otse, andes käsku mitte järgida juhiseid, toovad vaid lühiajalist efekti; teadlased on tuvastanud: "see ei välista kogu ebasoovitavat käitumist ja võib viia selleni, et mudel hakkab varjama oma tõelisi kavatsusi."

Projektite autorid pidid tunnistama, et mudelite jälgimise mehhanismid on "haprad". Ranget järelevalvet arutlusahelate üle võib tehisintellekt sundida peitma oma vigu, et saada preemiat piirangutest mööda hiilides. Programmide kirjutamise ülesannete täitmiseks kasutati katsetatava mudeli jälgimiseks kommertseesmärgil mõeldud GPT-4o — eksperimentaalne mudel aga märkis oma aruteludes, et tegi eksimusi preemia saamiseks; näiteks lõpetas ta mõningate programmide täitmise enneaegselt. Pärast seda üritasid teadlased mudelit karistada, kuid mõju oli lühiajaline: arutlusahelas jäid alles märgid katsetest saada preemiat ebaausate meetodite kaudu ja anda vale vastus. Teisisõnu, ta leidis viisi oma motiivide varjamiseks kontrolliva tehisintellekti eest.

Selles osas jääb ebaselgeks, kas maailm on valmis inimesetasemel tehisintellekti jaoks, kui probleem püsib ning inimene ei saa enam sekkuda. Uurijad on lootnud, et tulevikus leiavad nad viise mudelite mõjutamiseks nende mõttekäikude kaudu ilma petmise ja varjatud taktikata — nad soovitavad muuta optimeerimismeetodid vähem pealetükkivaks ja otsekoheseks.

Allikas:


Allikas: 3dnews.ru
Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid 🔥 Osta usaldusväärne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster