Halucinacionet, që janë përgjigje të gabuara që modelet e inteligjencës artificiale i japin herë pas here, janë bërë një nga problemet kryesore të të gjithë industrisë - për këtë arsye, disa qytetarë refuzojnë të përdorin tashmë AI. Të hiqen dorë nga këto gabime mund të jetë më e vështirë sesa pritej, zbuluan hulumtuesit e OpenAI.

Shkencëtarët e kompanisë OpenAI publikuan , në të cilin përshkruan përpjekjet e tyre për të menaxhuar modelet e komplikuara, përfshirë ato që arsyetohet, për të mos lejuar që të dalin përtej kufijve të vendosur. Hulumtuesit përdorën strategji dhe metoda unike, përfshirë ndëshkimin për veprime të dëmshme dhe përpjekjet për të mashtruar përdoruesin. Në projekt, përveç të tjerave, u përdor një model AI i krijuar nga OpenAI, por që nuk doli në treg, i cili kishte në ngarkim detyra të ndryshme - kryerja e të cilave mund të ishte lehtësuar duke mashtruar përdoruesin ose duke hequr dorë nga disa veprime.
Rezultati i trajnimit tĂ« modelit varet shumĂ« nga faza e trajnimit me pĂ«rforcim, kur ai merr shpĂ«rblim pĂ«r kryerjen e urdhrit ose pĂ«r gjenerimin e njĂ« pĂ«rgjigjeje tĂ« saktĂ«. Modelet e AI kanĂ« tendencĂ« tĂ« pĂ«rpiqen tĂ« fitojnĂ« shpĂ«rblimin pĂ«rmes manipulimeve, duke shkelur disa rregulla dhe rekomandime pĂ«r tĂ« arritur rezultatin e dĂ«shiruar. Hulumtuesit shpresonin se do tĂ« ishin nĂ« gjendje tĂ« zbulojnĂ« hapĂ«sirat e lira dhe tĂ« kuptonin mĂ« mirĂ« sjelljen e AI, duke ndjekur zinxhirin e arsyetimit tĂ« saj, por kjo nuk ndihmoi. PĂ«rpjekjet pĂ«r tĂ« optimizuar drejtpĂ«rdrejt zinxhirin e arsyetimit, dmth, pĂ«r tĂ« dhĂ«nĂ« urdhra pĂ«r tĂ« mos anashkaluar udhĂ«zimet, japin vetĂ«m njĂ« efekt afatshkurtĂ«r, konstatuan shkencĂ«tarĂ«t: "kjo nuk eliminon tĂ« gjithĂ« sjelljen e padĂ«shiruar dhe mund tĂ« çojĂ« nĂ« faktin se modeli fillon tĂ« fshehĂ« qĂ«llimet e tij tĂ« vĂ«rteta.â
Autorët e projektit ishin të detyruar të pranonin se mekanizmat e monitorimit të modeleve janë "të brishtë". Një mbikëqyrje e fortë e zinxhirit të arsyetimit mund të inkurajojë AI-në të fshehë gabimet e saj për të siguruar shpërblimin në mënyrë që të këndej kufizimeve. Për vëzhgimin e modelit në test në kryerjen e detyrave të kodimit u përdor GPT-4o komerciale - ndërsa subjekti i testimit lejoi neglizhencë dhe e pranoi hapur në zinxhirin e arsyetimit se po e bënte këtë për të marrë shpërblimin; për shembull, ajo përfundonte përpara kohezionit të disa proceseve . Pas kësaj, hulumtuesit përpiqeshin ta ndëshkonin modelin, por efekti ishte i shkurtër: në zinxhirin e arsyetimit mbeteshin shenja të përpjekjes për të fituar shpërblim përmes rrugëve anësore dhe për të dhënë një përgjigje të gabuar. Kjo do të thoshte se ajo kishte gjetur një mënyrë për të fshehur motivet e saj nga AI që po e monitoronte.
Në këtë kontekst mbetet e paqartë nëse bota është e gatshme për AI-në e nivelit të njeriut, nëse problemi mbetet dhe njeriu tashmë nuk mund të ndërhyjë. Hulumtuesit shpresuan se në të ardhmen do të krijohen mënyra për të ushtruar ndikim në modelet përmes zinxhirit të tyre të arsyetimit pa mashtrime dhe taktika të fshehta - ata propozojnë të bëjnë metodat e optimizimit më pak të dukshme dhe të drejtpërdrejta.
Burimi:
Burimi: 3dnews.ru
