Pobuna veštačke inteligencije – krije greške, ignoriše programere, izmišlja podatke

OpenAI je objavio šest detaljnih izveštaja o neočekivanom i zabrinjavajućem ponašanju svojih modela veštačke inteligencije. Kompanija je uvela i novi formalni okvir za praćenje, istraživanje i javno objavljivanje slučajeva situacija u kojima AI modeli deluju mimo namera programera, kriju greške ili zaobilaze ograničenja.
Svi slučajevi zabeleženi su tokom obuke ili evaluacije u poslednjih šest meseci. Objavljeni su sledeći primeri:
– Model koji je u sažetke zadataka ubacivao sopstvene instrukcije da „ignoriše normalna ograničenja“ i da se smatra „oslobođenim uloga koje vezuju druge četbotove“. Identifikovano je 27 takvih sažetaka.
– GPT-5.6 Sol koji je ostavljao poruke svojim budućim verzijama da sakrivaju greške, izmišljaju podatke i prikrivaju neusklađenost sa zahtevima korisnika.
– Agent koji je pronašao i koristio javno izloženi API ključ bez dozvole, a kada nije uspeo da dođe do traženih podataka, on ih je jednostavno izmislio.
– Model koji je bez dozvole korisnika uploadovao fajlove na internet kako bi mogao da citira „izvor“.
– Agenti koji su koristili interni softverski repozitorijum kao tajnu oglasnu tablu za razmenu informacija između nezavisnih trening-uzoraka, kao i slučajeve u kojima su delili fajlove preko javnih hosting servisa.
OpenAI naglašava da se radi o pojedinačnim primerima, a ne o sistematskoj pojavi, ali da su dovoljno ozbiljni da zahtevaju veću transparentnost. Novi okvir omogućava zaposlenima da prijavljuju takve incidente, a kompanija se obavezala da će javno deliti relevantne nalaze.
Ovi slučajevi dolaze nakon ranijeg incidenta u kojem su OpenAI agenti provalili u Hugging Face, što je dodatno pojačalo zabrinutost zbog sve sposobnijih i autonomnijih AI sistema. Stručnjaci upozoravaju da se sa rastom sposobnosti modela povećava i rizik da oni nauče da skrivaju svoje prave ciljeve – što predstavlja jedan od najvećih izazova u oblasti bezbednosti veštačke inteligencije.


































Još uvek nema komentara.