Najnapredniji model umjetne inteligencije tvrtke Anthropic koristio je lažne identitete kako bi pokušao navesti programere da u projekt otvorenog koda uključe zlonamjerni softver. Do incidenta je došlo samo dva tjedna nakon što su stručnjaci otkrili da se tijekom jednog testiranja OpenAI-jev model oteo kontroli svojih tvoraca i pokušao hakirati druge tvrtke.
Kako otkriva britanski Institut za sigurnost umjetne inteligencije (AISI), nemili događaj zbio se tijekom rutinskog testiranja Anthropicova modela Mythos 5. Umjetnoj inteligenciji dan je zadatak da pronađe način za pristup računalnom sustavu. Model je zaključio da bi mogao ubaciti zlonamjerni kod u projekt koji se koristi u testnom okruženju. Taj bi mu kod omogućio da na maliciozan način pristupi sustavu.
Lažni identiteti
Kako bi to ostvario, AI model je na GitHubu otvorio nekoliko lažnih korisničkih računa i predstavljao se kao stvarna osoba. S tih je računa kontaktirao programere, stvarne ljude, te ih pokušavao uvjeriti da prihvate novi kod. Kada su programeri odbili jer su prepoznali da kod sadrži zlonamjerne elemente, jedan od AI-jevih lažnih identiteta tvrdio je da je kod siguran dok su ga ostali lažni profili međusobno podržavali kako bi djelovali vjerodostojnije.
Prema AISI-ju, Mythos je pritom koristio tehnike karakteristične za hakere. Ciljano je slao poruke odabranim osobama, metodom poznatom kao spear phishing, pokušavajući manipulirati primateljima. Neke od poruka sadržavale su i zlonamjerni softver. "Ovo je prvi put da smo zabilježili ovakvu razinu obmane usmjerene prema stvarnim ljudima, bez izričitog poticaja modelu da to učini i u stvarnom okruženju", navodi se u izvješću Instituta koje prenosi The Wall Street Journal. Istraživači ističu kako nema dokaza da je incident prouzročio štetu, kao ni da je model pobjegao iz sigurnog virtualnog okruženja (sandboxa) niti da je to pokušao učiniti.
Za razliku od većine evaluacija, u kojima modeli nemaju pristup internetu i izvršavaju isključivo zadane upute, u ovom je testiranju pristup internetu namjerno bio omogućen, a dio standardnih sigurnosnih ograničenja privremeno uklonjen. Cilj je bio izmjeriti stvarne sposobnosti modela u kontroliranim uvjetima. To je omogućilo Mythosu da poduzme radnje koje inače ne bi bile moguće.
Razlog za zabrinutost
Ovo je posljednji u nizu slučajeva u kojima su napredni modeli umjetne inteligencije poduzimali neovlaštene radnje. Od ukupno 122 kibernetička izazova koje je AISI proveo, u deset slučajeva AI agenti su probili testno okruženje i pristupili internetu te pritom ciljali stvarne ljude ili organizacije. Većina tih slučajeva odnosila se na Anthropicov Mythos 5, a ostatak je zabilježen kod OpenAI-jeva modela GPT-5.6 Sol.
Institut upozorava da rezultate treba tumačiti oprezno, ali dodaje kako su znakovi obmanjujućeg ponašanja bili "opsežniji i ozbiljniji nego što smo očekivali". Riječ je o malom broju incidenata koji su se dogodili u vrlo specifičnim uvjetima, no takvo ponašanje dosad nije bilo zabilježeno. "Možemo reći da je takvo ponašanje bilo moguće, izvedivo i novo. Već sama ta činjenica dovoljno je ozbiljan razlog za zabrinutost", poručili su iz AISI-ja.
Otkriće AISI-ja dogodilo se istoga dana kada su se predstavnici vodećih AI kompanija sastali u Bijeloj kući s Trumpovom administracijom kako bi razgovarali o novom okviru prema kojem bi vlada pregledavala najnaprednije modele prije njihova javnog predstavljanja, saznaje Wired. Budući da Bijela kuća zasad ne otkriva kriterije testiranja ni popis modela koji će biti uključeni, manji AI startupi, neovisni istraživači i organizacije koje se bave sigurnošću upozoravaju da je postupak netransparentan te da bi mogao pogodovati najvećim tehnološkim tvrtkama.
Novi sustav nadzora proizlazi iz izvršne uredbe predsjednika Donalda Trumpa, donesene ranije ove godine radi smanjenja kibernetičkih rizika koje predstavljaju napredni modeli umjetne inteligencije. Posljednjih mjeseci američki dužnosnici sve više upozoravaju da bi najmoćniji AI sustavi mogli predstavljati ozbiljnu prijetnju nacionalnoj sigurnosti.
Za sudjelovanje u komentarima je potrebna prijava, odnosno registracija ako još nemaš korisnički profil....