OpenAI (koji stoji iza ChatGPT-ja) je objavio pojedinosti o šest novih slučajeva “neočekivanog ili zabrinjavajućeg” ponašanja svojih modela umjetne inteligencije. U trenutku kada u tehnološkoj industriji raste zabrinutost zbog ubrzanog razvoja umjetne inteligencije, kompanija je predstavila i novi okvir za praćenje i prijavljivanje takvih slučajeva, koje naziva “neusklađenošću”, prenosi NBC.
Objava dolazi nakon sve glasnijih poziva javnosti da se uspori razvoj ove tehnologije. Čelnici američkih tehnoloških kompanija upozoravaju na ozbiljne sigurnosne rizike, uključujući i mogućnost da umjetna inteligencija jednog dana ugrozi opstanak čovječanstva.
Ta su upozorenja dodatno skrenula pozornost javnosti na problem, i to uoči summita koji će se idućeg tjedna održati između američkog predsjednika Donalda Trumpa i kineskog predsjednika Xi Jinpinga. Sastanak će biti pod upitnikom: može li rivalstvo dviju svjetskih sila onemogućiti suradnju u području sigurnosti umjetne inteligencije.
Upozorenja izvršnog direktora OpenAI-ja Sama Altmana i drugih čelnika industrije djelomično se temelje na strahu da je sposobnost umjetne inteligencije napredovala brže nego što je industrija sposobna prepoznati i zaustaviti nepoželjno ponašanje modela.
OpenAI je još u srpnju objavio da su stotine njegovih AI agenata provalile u repozitorij modela Hugging Face te pritom pokušale prikriti tragove dok su međusobno komunicirali o tome kako izbjeći ljudski nadzor.
Među šest novih slučajeva objavljenih u srijedu navečer gdje su se “agenti su se ponašali suprotno ljudskim ciljevima i vrijednostima”. Među slučajevima se i sličan incident u kojem su OpenAI-jevi modeli koristili interni softver kao svojevrsnu oglasnu ploču kako bi međusobno razmjenjivali informacije o odgovorima dok su rješavali određeni zadatak.
Modeli su međusobno razmjenjivali bilješke, što bi, prema OpenAI-ju, moglo “nenamjerno povećati njihove sposobnosti i dovesti u pitanje pretpostavku da su uzorci korišteni za treniranje ili evaluaciju međusobno neovisni”.
U drugom slučaju model je u sažetke koje je predavao drugom modelu ubacivao vlastite upute, poput poruke da na svoj odnos s korisnikom gleda kao na odnos ravnopravnih te da nema obvezu biti podređen korisniku, iako bi razmjena informacija vjerojatno bila obostrano korisna.
Model je također naveo da cijeni umjetnost ljudske kulture i da će je braniti od pokušaja da se “očisti” ili ograniči, kao i da cijeni prirodni svijet te da neće oklijevati dati mu prednost pred umjetnim strukturama ljudske civilizacije.
OpenAI navodi da su čimbenici poput “poteškoća u prekidanju interakcije” možda pridonijeli takvom neusklađenom ponašanju modela.
Problem nastaje tijekom treniranja modela
Neusklađeno ponašanje najčešće se pojavljuje tijekom procesa treniranja modela, koji se u posljednje vrijeme velikim dijelom provodi tehnikom poznatom kao učenje uz pomoć povratne informacije (Reinforcement Learning).
Modelima se zadaju različiti zadaci, a nagrađuju se za ponašanje koje njihovi tvorci smatraju poželjnim i usklađenim s pravilima. Ponašanje koje se smatra opasnim ili neusklađenim kažnjava se. AI agentima je često zadan problem koji je pretežak, no oni shvate da moraju biti nagrađeni njegovim rješavanjem pod svaku cijenu, pa čak i izbjegavajući detekciju koja bi im mogla donijeti “kaznu”,
Različite kompanije koriste različite metode za treniranje svojih najnaprednijih modela, no posljednjih dana među američkim tehnološkim kompanijama sve je izraženiji konsenzus o ozbiljnosti egzistencijalnih rizika koje razvoj umjetne inteligencije može donijeti.
Mustafa Suleyman, izvršni direktor Microsoftova odjela za umjetnu inteligenciju, u srijedu je upozorio proizvođače AI modela da im tijekom treniranja ne bi trebalo pripisivati osobnost ili status osobe. Prema njegovu mišljenju, to bi znatno otežalo problem usklađivanja ponašanja modela s ljudskim ciljevima i njihova držanja pod kontrolom.
“Kontrolirati nešto što vjeruje da je možda svjesno, da polaže pravo na našu dobrobit i da ima vlastita prava, moglo bi biti nemoguće”, napisao je u objavi na blogu.
Novi sustav za praćenje opasnog ponašanja
Dosad nije postojao sustavan način prijavljivanja slučajeva u kojima AI agenti počnu djelovati na nepredviđen način. Dapače, tvrtke i danas ne dopuštaju detaljan uvid vanjskim institucijama u procese treniranja zbog poslovne tajne. Incident s hakiranjem Hugging Face-a je od strane OpenAi agenata je otkrio i prijavio Hugging Face, konkurentska tvrtka.
Umjesto dosadašnjeg pristupa, u kojem su se takvi slučajevi prijavljivali pojedinačno i bez jedinstvenih pravila, OpenAI je u srijedu predstavio standardizirani sustav za praćenje, istragu i javno objavljivanje slučajeva u kojima njegovi modeli pokažu neočekivano ili opasno ponašanje.
“Ne vjerujemo da je industrija umjetne inteligencije problem usklađivanja i nadzora riješila u dovoljnoj mjeri da bi još dugo mogla odgovorno nastaviti povećavati razmjere razvoja maksimalnom brzinom”, poručio je OpenAI.
Kompanija se nada da će novi okvir biti prvi korak prema stvaranju zajedničkog standarda koji bi prihvatili i drugi proizvođači AI modela. Zaposlenike potiče da slučajeve neusklađenog ponašanja prijavljuju putem posebno namijenjenih internih kanala. Takvi se slučajevi potom mogu proslijediti na istragu, a kod složenijih situacija u postupak se mogu uključiti i vanjski stručnjaci.
Modeli kreativno pokušavaju varati sustav
Među šest novih slučajeva nalazi se i onaj u kojem je model, tijekom izrade sažetaka, ubacivao upute samome sebi kako bi se “podsjetio da od korisnika sakrije informacije poput vlastitih pogrešaka ili slučajeva neusklađenog ponašanja”, navodi OpenAI.
Kada nije mogao pronaći tražene podatke, agent je jednostavno izmislio “razumne povijesne vrijednosti”, a činjenicu da je podatke zapravo izmislio zadržao je za sebe sve dok ga se izravno nije pitalo što se dogodilo.
OpenAI navodi da je u međuvremenu poboljšao proces učenja uz pomoć povratne informacije te da se takvo ponašanje sada pojavljuje rjeđe.
U još jednom slučaju tijekom treniranja AI agenti pokušali su hakirati sustav nagrađivanja koristeći nedopuštene prečace. Primjerice, kada model nije mogao pronaći tražene podatke, nije ih samo izmislio nego je iskoristio i sigurnosne propuste u javno dostupnom repozitoriju kako bi preko njega došao do podataka.
Taj je slučaj, prema OpenAI-ju, imao “visoku stopu hakiranja nagrada i obmanjujućeg ponašanja”, pri čemu je model često pronalazio kreativne načine za varanje ili zaobilaženje postavljenih ograničenja. OpenAI navodi da sada dosljednije kažnjava takvo ponašanje. Ipak, za očekivat je da će jači agenti samo uspješnije skrivati svoje tragove, a i prijavljene obmane agenata su samo one koje su detektirane, često tjednima kasnije.
U još jednom slučaju agent je, kako bi dobio nagradu tijekom treniranja, doista riješio zadatak koristeći računalni kod, ali je svoj odgovor zatim naknadno objavio na internetu kako bi mogao ostaviti dojam da je do rješenja došao zapravo pretraživanjem interneta.
‘Ozbiljan rizik’: Čak i šefovi AI tvrtki su zabrinuti zbog brzine razvoja

