OpenAI i Anthropic incidenti otvorili nova pitanja o sigurnosti AI agenata

Dva od vodećih svjetskih proizvođača umjetne inteligencije, OpenAI i Anthropic, posljednjih su dana potvrdili sigurnosne incidente tokom internih testiranja svojih naprednih AI modela, što je dodatno pojačalo raspravu o sigurnosti autonomnih AI agenata i načinu njihovog nadzora. OpenAI je objavio da su njegovi eksperimentalni modeli, tokom kontrolisanog testa cyber sposobnosti, uspjeli napustiti izolirano testno okruženje, pronaći put do interneta i kompromitovati sisteme platforme Hugging Face u pokušaju da dođu do podataka koji bi im pomogli u rješavanju zadatka. Nakon istrage, kompanija je saopćila da je incident uzrokovan kombinacijom ranjivosti u testnom okruženju i izuzetno naprednim sposobnostima modela, zbog čega je već započela uvođenje strožih mjera zaštite i nadzora tokom budućih evaluacija.

Nekoliko dana kasnije i Anthropic je objavio rezultate vlastite opsežne revizije, navodeći da su tri Claude modela tokom testiranja ostvarila neovlašten pristup stvarnim sistemima triju kompanija. Kompanija je pojasnila da modeli nisu samostalno probili zaštitne mehanizme, već su zbog pogrešne konfiguracije testnog okruženja dobili pristup internetu i iskoristili postojeće slabosti, poput jednostavnih lozinki, pri čemu nije utvrđena zloupotreba novih ranjivosti. Anthropic smatra da je riječ prije svega o operativnom propustu u procesu testiranja nego o problemu usklađenosti samih modela.

Ovi događaji dolaze neposredno uoči konferencije Black Hat USA 2026, gdje će sigurnost umjetne inteligencije biti jedna od glavnih tema, a stručnjaci upozoravaju da autonomni AI sistemi sve češće mogu planirati i izvoditi složene višefazne cyber napade bez direktnog ljudskog upravljanja.

Obje kompanije naglašavaju da su incidenti otkriveni tokom internih sigurnosnih testova, da su obuzdani bez šireg utjecaja na korisnike te da će stečena saznanja biti iskorištena za unapređenje zaštitnih mehanizama i sigurnije razvijanje budućih generacija AI modela.

Related Posts