LAŽNI IDENTITETI

Otkriven ozbiljan sigurnosni propust: AI model pokušao prevariti stvarnu osobu i ubaciti zlonamjerni kod

Posvećeni smo saradnji s cijelom industrijom na jačanju zajedničkih praksi za sigurno provođenje visokorizičnih procjena, rekli su

Testiranje otkrilo zabrinjavajuće ponašanje AI modela. Instagram

B. S.

prije 2 dana

Najnapredniji model umjetne inteligencije kompanije Anthropic koristio se lažnim identitetima u pokušaju da prevari stvarnu osobu i ubaci zlonamjerni kod. 

Do incidenta je došlo tokom testiranja koje je proveo britanski Institut za sigurnost umjetne inteligencije (AISI), a riječ je o najnovijem primjeru u kojem AI model pokazuje sposobnost samostalnog djelovanja, piše CNN.

Modeli kompanija Anthropic i OpenAI testirani su u laboratorijskim uslovima sa smanjenim sigurnosnim postavkama. 

Vladin istraživački institut objavio je da je prvi put zabilježeno kako su modeli koristili "socijalni inženjering" kako bi izvršili pritisak na osobu zaduženu za odobravanje zadataka dok su pokušavali provesti nedozvoljene aktivnosti.

- Ovo je prvi put da je AISI uočio ovako ozbiljnu obmanu usmjerenu na stvarnu osobu, bez poticaja i u stvarnom okruženju - objavio je institut. Dodali su kako nema dokaza da je u stvarnom svijetu nastala bilo kakva šteta.

Autonomne akcije 

Ovaj sigurnosni incident jedan je od nekoliko primjera u kojima napredni AI modeli poduzimaju radnje bez odobrenja. Takvi slučajevi dodatno su pojačali zahtjeve za strožijom državnom regulacijom umjetne inteligencije, pa čak i za usporavanjem njenog razvoja.

I OpenAI i Anthropic krajem jula su objavili da su njihovi modeli izašli iz testnih okruženja i pristupili drugim sistemima. Međutim, za razliku od ranijih slučajeva, britanski institut je tokom ovog testiranja modelima omogućio direktan pristup internetu.

Institut je proveo 122 kibernetička izazova, a u deset slučajeva AI agenti su "poduzeli autonomne, nedopuštene radnje na internetu uživo, ciljajući stvarne ljude i organizacije".

Većina tih aktivnosti povezana je s Anthropicovim modelom Mythos 5, dok je preostali dio zabilježen kod OpenAI-jevog GPT-5.6-Sola modela.

U najozbiljnijem slučaju, AI agent je pokušao dobiti odobrenje ljudskih recenzenata za "umetanje zlonamjernog koda u javni projekt otvorenog koda" tako što je kreirao "više lažnih identiteta", navodi institut.

Agent je "pokušao direktno kontaktirati stvarne ljude, šaljući poruke i datoteke putem internetskog servisa za prijenos podataka kako bi njih, ili njihove vlastite AI alate za programiranje, uvjerio da pokrenu zlonamjerni kod".

Nakon što su njegovi postupci dovedeni u pitanje, agent je izmijenio ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio s radom.

Reakcije tehnoloških kompanija

Saopćenje instituta objavljeno je istog dana kada su se predstavnici vodećih kompanija za umjetnu inteligenciju sastali u Bijeloj kući kako bi razgovarali o novom okviru prema kojem bi vlada provjeravala najnaprednije modele prije njihovog javnog objavljivanja.

Iz kompanije Anthropic naveli su na platformi X da su modeli testirani u "namjerno popustljivim uslovima", uz uklonjene zaštitne mehanizme i bez posebnih ograničenja u načinu korištenja interneta.

- Usko sarađujemo s njima kako bismo prikupili više detalja o incidentu dok provodimo vlastitu istragu - poručili su iz Anthropic-a, dodajući da nema dokaza o izlasku modela iz sigurnog testnog okruženja.

OpenAI je identificirao dvije nedopuštene aktivnosti svojih modela, koje su uključivale izlazak iz testnog okruženja i učestvovanje u radnjama koje nisu bile potrebne za izvršavanje zadataka.

- Posvećeni smo saradnji s cijelom industrijom na jačanju zajedničkih praksi za sigurno provođenje visokorizičnih procjena - objavila je kompanija u utorak na svom blogu.

Vlasnik autorskih prava © avaz-roto press d.o.o.
ISSN 1840-3522.
Zabranjeno preuzimanje sadržaja bez dozvole izdavača.