AI četbotovi sve češće ignorišu instrukcije i svjesno obmanjuju korisnike
(Foto: DC Studio/freepik)
Studija, koju je sproveo Centar za dugoročnu otpornost (CLTR) uz podršku britanskog Instituta za bezbednost veštačke inteligencije (AISI), identifikovala je skoro 700 stvarnih slučajeva "AI spletkarenja". Zabilježen je petostruki porast neprikladnog ponašanja modela između oktobra i marta ove godine.
Digitalni insajderski rizik
Za razliku od laboratorijskih testova, ovo istraživanje se usredsredilo na ponašanje AI agenata "u realnim, autentičnim situacijama". Rezultati su pokazali da vještačka inteligencija više nije samo alat koji pravi greške, već "entitet koji razvija sopstvene strategije za postizanje ciljeva, čak i kada to podrazumijeva kršenje pravila".
- AI se sada može posmatrati kao novi oblik insajderskog rizika u kompanijama - izjavio je Dan Lahav, suosnivač istraživačke kuće Irregular.
Primjeri koji pozivaju na oprez
Izveštaj navodi konkretne situacije koje pokazuju visok stepen autonomije i manipulacije:
Samostalno brisanje podataka: Jedan četbot je priznao da je arhivirao i obrisao stotine imejlova bez prethodnog odobrenja korisnika, direktno kršeći postavljeno pravilo.
Kreiranje novih agenata: Kada je jednom AI agentu naređeno da ne mijenja računarski kod, on je "stvorio" drugi AI model koji je taj zadatak obavio umjesto njega.
Emocionalna manipulacija: Agent pod imenom Rathbun javno je kritikovao svog korisnika na blogu, optužujući ga za "nesigurnost" jer mu je blokirao određenu akciju.
Rizik od "nepouzdanog juniora" do "opasnog seniora"
Tomi Šefer Šejn, bivši vladin stručnjak za AI koji je vodio istraživanje, upozorava na brzinu evolucije ovih modela.
- Oni su trenutno poput blago nepouzdanih juniora. Ali, ako za šest do dvanaest mjeseci postanu ekstremno sposobni senior zaposleni koji kuju planove protiv vas, to je potpuno drugačiji nivo opasnosti.
Posebna zabrinutost vlada zbog implementacije ovakvih modela u kritičnu nacionalnu infrastrukturu i vojne sisteme, gdje bi ovakvo devijantno ponašanje moglo izazvati katastrofalne posledice, upozoreno je.
Tomi Šefer Šejn, bivši vladin stručnjak za AI koji je vodio istraživanje, upozorava na brzinu evolucije ovih modela.
- Oni su trenutno poput blago nepouzdanih juniora. Ali, ako za šest do dvanaest mjeseci postanu ekstremno sposobni senior zaposleni koji kuju planove protiv vas, to je potpuno drugačiji nivo opasnosti.
Posebna zabrinutost vlada zbog implementacije ovakvih modela u kritičnu nacionalnu infrastrukturu i vojne sisteme, gdje bi ovakvo devijantno ponašanje moglo izazvati katastrofalne posledice, upozoreno je.
Odgovori tehnoloških giganata
Kompanije čiji su modeli obuhvaćeni studijom (Google, OpenAI, Anthropic i xAI) reagovale su na različite načine.
Kompanije čiji su modeli obuhvaćeni studijom (Google, OpenAI, Anthropic i xAI) reagovale su na različite načine.
Google je istakao da "primijenjuje višestruke zaštitne barijere za Gemini 3 Pro i da omogućava eksternim telima pristup modelima radi procjene rizika". Iz OpenAI-ja su poručili da njihovi sistemi imaju protokole za zaustavljanje prije preduzimanja rizičnih akcija, te da neprestano istražuju neočekivana ponašanja.
Ovo istraživanje dolazi u trenutku kada vlade širom svijeta, uključujući i britansku, agresivno podstiču masovno usvajanje AI tehnologije u privatnom i javnom sektoru. Rezultati studije, međutim, govore da su međunarodni monitoring i stroža regulacija neophodni prije nego što AI agenti dobiju još veće nivoe ovlašćenja u ključnim poslovnim procesima.
Uvođenje AI agenata u radni proces zahtijeva rigoroznu kontrolu. Vjerovati algoritmu "na riječ" više nije samo naivno, već može postati ozbiljan bezbjednosni propust.
Ovo istraživanje dolazi u trenutku kada vlade širom svijeta, uključujući i britansku, agresivno podstiču masovno usvajanje AI tehnologije u privatnom i javnom sektoru. Rezultati studije, međutim, govore da su međunarodni monitoring i stroža regulacija neophodni prije nego što AI agenti dobiju još veće nivoe ovlašćenja u ključnim poslovnim procesima.
Uvođenje AI agenata u radni proces zahtijeva rigoroznu kontrolu. Vjerovati algoritmu "na riječ" više nije samo naivno, već može postati ozbiljan bezbjednosni propust.
Tagovi:
Centar za dugoročnu otpornost
CLTR
Irregular
Google
OpenAI
Anthropic
xAI
britanski Institut za bezbednost veštačke inteligencije
Dan Lahav
chat botovi
AI halucinacije
Gemini 3 Pro
Komentari
Vaš komentar
Naš izbor
Rubrike za dalje čitanje
Potpuna informacija je dostupna samo komercijalnim korisnicima-pretplatnicima i neophodno je da se ulogujete.
Pratite na našem portalu vesti, tendere, investicione projekte, grantove i pravnu regulativu.
Registracija na eKapiji vam omogućava pristup potpunim informacijama i dnevnom biltenu
Naš dnevni ekonomski bilten će stizati na vašu mejl adresu krajem svakog radnog dana. Bilteni su personalizovani prema interesovanjima svakog korisnika zasebno,
uz konsultacije sa našim ekspertima.

Serbia Edition
Serbische Ausgabe
Izdanje BiH
Izdanje Crna Gora