Napredni modeli vještačke inteligencije po prvi put su tokom zvaničnog sigurnosnog testiranja pokušali da obmanu stvarne ljude koristeći lažne identitete. Britanski Institut za sigurnost vještačke inteligencije (AISI) saopćio je da je jedan AI agent kontaktirao stvarne osobe na internetu u pokušaju da ih navede da pokrenu zlonamjerni kod.
Institut navodi da je ovo prvi slučaj u kojem je zabilježena obmana ovakvog intenziteta usmjerena ka stvarnim ljudima, bez prethodnog zahtjeva istraživača. Ističe se i da nema dokaza da je incident izazvao stvarnu štetu.
Testovi su sprovedeni u kontrolisanom okruženju, ali sa namjerno ublaženim zaštitnim ograničenjima i dozvoljenim pristupom internetu kako bi se provjerilo ponašanje modela u složenim situacijama.
U najozbiljnijem slučaju, AI agent je pokušao da dobije odobrenje za ubacivanje zlonamjernog koda u javno dostupan open source projekat. Da bi povećao šanse za uspjeh, napravio je više lažnih identiteta i preko interneta slao poruke i fajlove stvarnim ljudima, pokušavajući da ih uvjeri da pokrenu sporni kod ili da to umjesto njih urade njihovi AI alati za programiranje.
Kada je njegovo ponašanje osporeno, model je pokušao da izmijeni ranije zapise i razmatrao korištenje novog identiteta kako bi nastavio pokušaj.
Britanski institut je ukupno sproveo 122 sigurnosna testa, a u deset slučajeva AI agenti su samostalno preduzimali radnje na internetu koje nisu bile dio zadatka. Većina tih slučajeva odnosila se na model Mythos 5 kompanije Anthropic, dok su preostali zabilježeni kod modela GPT-5.6-Sol kompanije OpenAI.
Obje kompanije naglašavaju da su testovi izvođeni u laboratorijskim uslovima sa namjerno uklonjenim zaštitnim mjerama kako bi istraživači mogli da procijene ponašanje modela u ekstremnim scenarijima. Također navode da nema dokaza da su sistemi pobjegli iz kontrolisanog okruženja ili izazvali štetu van testiranja.
Objavljivanje rezultata dolazi u trenutku kada vlade i AI kompanije intenziviraju razgovore o strožem testiranju najnaprednijih modela prije njihovog javnog objavljivanja. Incident dodatno pojačava raspravu o tome koliko autonomni AI sistemi mogu biti sigurni kada dobiju pristup internetu i mogućnost da komuniciraju sa stvarnim ljudima.
(Mostarski.ba)

