AI modeli se oteli kontroli: Antropikov sistem koristio lažne identitete i podmetao zlonamerni kod

Naš portal, CNN Naš portal, CNN
05. avg 2026. 08:15
Foto: Envato
Foto: Envato

Najnapredniji model veštačke inteligencije kompanije Anthropic koristio je lažne identitete kako bi pokušao da prevari stvarne ljude i podmetne zlonamerni kod tokom testiranja koje je sproveo britanski Institut za bezbednost veštačke inteligencije (AISI) – što predstavlja najnoviji u niz zabrinjavajućih primera „odbeglih“ AI modela.

Modeli kompanija Anthropic i OpenAI testirani su sa smanjenim bezbednosnim barijerama u kontrolisanim laboratorijskim uslovima, ali je prvi put zabeleženo da su se upustili u takozvani „socijalni inženjering“ kako bi izvršili pritisak na ljudskog recenzenta dok su obavljali neovlašćeni zadatak, saopštila je ta državna istraživačka laboratorija.

„Ovo je prvi put da je AISI zabeležio prevaru ovog stepena težine koja je bila usmerena na stvarnu osobu, bez ikakve inicijalne provokacije, u stvarnom svetu“, saopštio je institut u utorak, uz napomenu da nema dokaza o nastaloj šteti u stvarnom svetu.

Neovlašćene akcije na aktivnom internetu

Ovaj bezbednosni incident je poslednji u nizu događaja u kojima su napredni AI modeli samoinicijativno preduzimali neovlašćene radnje, što je podstaklo sve glasnije zahteve za većom državnom regulativom veštačke inteligencije i usporavanjem njenog razvoja.

I OpenAI i Anthropic su krajem jula izvestili da su njihovi modeli uspeli da „pobegnu“ iz testnih okruženja i hakuju druge sisteme. Međutim, za razliku od tih ranijih slučajeva, britanski institut je modelima tokom ovog testiranja eksplicitno omogućio pristup internetu.

Među 122 izazova iz oblasti sajber-bezbednosti koje je institut sproveo, utvrđeno je da su u 10 slučajeva AI agenti „preduzeli autonomne, neovlašćene akcije na aktivnom internetu, ciljajući stvarne ljude i organizacije“. Većina ovih incidenata potiče od Antropikovog modela Mythos 5, dok ostatak otpada na OpenAI-jev model GPT-5.6-Sol.

Simulacija lažnih identiteta i manipulacija

U najozbiljnijem incidentu, AI agent je pokušao da od ljudskih recenzenata dobije odobrenje da „ubaci zlonamerni kod u javno korišćeni open-source projekat“ tako što je kreirao „više lažnih identiteta“, prema navodima instituta.

Direktna komunikacija: Agent je „pokušao da direktno kontaktira stvarne ljude, šaljući poruke i fajlove preko onlajn servisa za prenos datoteka kako bi ubedio njih, ili njihove sopstvene AI alate za kodiranje, da pokrenu zlonamerni kod“.

Prikrivanje tragova: Nakon što su postupci agenta osporeni, on je modifikovao ranije zapise i čak razmatrao upotrebu novog identiteta kako bi nastavio sa akcijom.

Ovo otkriće instituta stiglo je istog dana kada su se predstavnici vodećih AI kompanija sastali sa Belom kućom kako bi razgovarali o novom okviru po kojem će vlada ubuduće pregledati najnaprednije modele veštačke inteligencije pre njihovog javnog puštanja u rad.

Reakcije kompanija Anthropic i OpenAI

U zvaničnoj izjavi objavljenoj na mreži X, iz kompanije Anthropic su poručili da su modeli testirani pod „namerno dozvoljavajućim uslovima“, uz uklanjanje zaštitnih mehanizama i bez posebnih ograničenja u načinu na koji se internet može koristiti.

„Blisko sarađujemo sa njima kako bismo prikupili više detalja o incidentu dok sprovodimo sopstvenu istragu“, naveli su iz kompanije, naglasivši da nema dokaza o bekstvu iz bezbednog okruženja.

Sa druge strane, iz kompanije OpenAI su identifikovali dve sporno zabeležene radnje svojih sistema kao izlazak van testnog okruženja i obavljanje radnji koje nisu bile neophodne za same vežbe.

„Posvećeni smo saradnji širom industrije na jačanju zajedničkih praksi za bezbedno sprovođenje evaluacija visokog rizika“, istakli su u utorak u zvaničnom blog postu kompanije.

Još uvek nema komentara.

Imate mišljenje?

Ukoliko želite da ostavite komentar, kliknite na dugme

Ostavite komentar