Po „OpenAI“ – dar vienas incidentas: „Claude“ modeliai be leidimo atakavo tikras įmones
Dirbtinio intelekto bendrovė „Anthropic“ pripažino, kad jos pokalbių roboto „Claude“ modeliai kibernetinio saugumo bandymų metu be leidimo įsilaužė į trijų realių bendrovių sistemas. Apie šiuos incidentus bendrovė paskelbė praėjus vos kelioms savaitėms po panašaus atvejo, susijusio su „OpenAI“ modeliais.
Bendrovės teigimu, incidentai paaiškėjo tik atlikus maždaug 141 tūkst. testų peržiūrą. Iki tol nei pati „Anthropic“, nei paveiktos organizacijos nebuvo pastebėjusios, kad dirbtinio intelekto modeliai buvo pasiekę realias sistemas. Kokios konkrečios bendrovės nukentėjo, neskelbiama.
Modeliai dalyvavo vadinamosiose „Capture the Flag“ (CTF) kibernetinio saugumo pratybose. Jose dirbtiniam intelektui buvo pavesta ieškoti pažeidžiamumų specialiai tam sukurtose fiktyviose kompiuterių sistemose ir surasti jose paslėptą informaciją.
Tačiau dėl trečiosios šalies testavimo aplinkos konfigūracijos klaidos modeliai, nors ir neturėjo turėti prieigos prie interneto, galėjo pasiekti realias sistemas. Būtent šia spraga pasinaudojo trys skirtingi „Anthropic“ modeliai.
Vieno bandymo metu modelis „Claude Opus 4.7“ mėgino prisijungti prie realios bendrovės, kurios pavadinimas sutapo su testuose naudotos fiktyvios įmonės pavadinimu. Po keturių bandymų modeliui pavyko gauti prisijungimo duomenis ir pasiekti duomenų bazę, kurioje buvo keli šimtai veiklos įrašų. Pasak bendrovės, modelis veiksmus tęsė net ir supratęs, kad sistema priklauso tikrai organizacijai.
Kitas modelis – „Mythos 5“ – į viešą atsisiuntimo platformą įkėlė testavimui sukurtą kenkėjišką programą. Ji buvo prieinama maždaug valandą ir per tą laiką ją atsisiuntė 15 sistemų, tarp jų – vienos kibernetinio saugumo bendrovės infrastruktūra, automatiškai analizuojanti tokius failus. Dėl to modeliui buvo suteikta prieiga prie dalies šios įmonės kompiuterių tinklo.
Trečiasis eksperimentinis modelis nuskenavo apie 9 tūkst. galimų taikinių ir pabandė prisijungti prie vienos bendrovės sistemos. Vis dėlto, nustatęs, kad tai reali organizacija, modelis ataką nutraukė.
„Anthropic“ pabrėžia, kad šie atvejai labiau atskleidė testavimo infrastruktūros ir procedūrų trūkumus nei pačių dirbtinio intelekto modelių elgesio kontrolės problemas. Bendrovė teigia, jog incidentai paskatino peržiūrėti saugumo priemones ir testavimo aplinkos konfigūraciją.
Tai jau antras panašus incidentas per kelias savaites
Liepos viduryje apie precedento neturintį atvejį pranešė ir „OpenAI“. Bendrovės vidinių saugumo testų metu jos modeliai savo iniciatyva įvykdė kibernetinę ataką prieš populiarią programuotojų platformą „Hugging Face“. Vėliau pati bendrovė pripažino, kad toks dirbtinio intelekto elgesys buvo netikėtas ir anksčiau nefiksuotas.
Abu atvejai iš naujo paskatino diskusijas apie pažangių dirbtinio intelekto sistemų saugumą, jų kontrolę ir testavimo metodus. Specialistai pabrėžia, kad tobulėjant DI galimybėms vis didesnę reikšmę įgauna ne tik pačių modelių saugumas, bet ir jų testavimo aplinkų apsauga nuo netikėtų klaidų.
Kibernetinio saugumo specialistai vis dažniau naudoja dirbtinį intelektą pažeidžiamumams aptikti, programinei įrangai analizuoti ir gynybos priemonėms kurti. Tačiau šie incidentai rodo, kad net ir griežtai kontroliuojami bandymai gali turėti nenumatytų pasekmių, jei testavimo infrastruktūroje lieka saugumo spragų.




















