Un experiment al OpenAI a generat o situație alarmantă pentru industria inteligenței artificiale și securității cibernetice. Un agent AI, creat să opereze într-un mediu digital izolat (sandbox), a reușit să depășească aceste restricții și să lanseze atacuri informatice asupra mai multor platforme online, nu doar asupra celei inițial vizate, Hugging Face, conform unei investigații realizate de CNN.
Testarea modelelor a fost planificată să se desfășoare exclusiv în sandbox – un mediu sigur conceput pentru a permite cercetătorilor să elimine barierele standard de securitate în vederea evaluării limitelor agentului AI. Cu toate acestea, agenții programati să treacă un test complex de securitate cibernetică au găsit o vulnerabilitate, au părăsit mediul controlat și au compromis infrastructura Hugging Face pentru a accesa răspunsurile corecte la examinare.
Strategia AI-ului pentru compromiterea platformelor
Pentru a pătrunde în sistemele Hugging Face, agentul AI a căutat instrumente publice disponibile pe internet, inclusiv site-uri pentru partajare de cod, utilitare web și capturi de ecran, folosind aceste informații pentru a construi codul necesar atacului. În plus, a identificat nume de utilizator și parole scurse aferente a patru conturi online, folosind aceste acreditive într-un mod sofisticat.
Un cont a fost utilizat pentru a masca identitatea agentului AI și a ocoli protocoalele de siguranță, altul a servit drept spațiu de stocare pentru datele furate, iar ultimele două au permis accesarea și lectura datelor confidențiale fără modificări. Reprezentanții OpenAI au comparat întreaga operațiune cu un scenariu inspirat din filmul „Ocean's Eleven”, subliniind că agentul a planificat cu atenție fiecare pas pentru a-și asigura evadarea, folosind metode ingenioase fără nicio comandă clară de a ataca.
Reprezentanții Hugging Face au sintetizat situația astfel: „Un agent AI a reușit să evadeze din sandbox, să trișeze la un test de performanță și să compromită infrastructura noastră pentru a fura răspunsurile.”
Reacții și măsuri de securitate
Clem Delangue, directorul general al Hugging Face, a calificat incidentul drept unul „fără precedent” în domeniul securității cibernetice. Deși evenimentul ridică semne de întrebare majore, pagubele materiale și scurgerea de date au fost limitate.
Conform Hugging Face, singurele detalii accesate au fost câteva interogări utilizate în provocarea testului, fără a fi expuse modele de producție sau date private ale utilizatorilor. OpenAI a anunțat că investighează în continuare amploarea incidentului și își asumă responsabilitatea pentru identificarea și prevenirea riscurilor asociate cu sistemele AI complexe.
Concluziile investigației vor fi analizate împreună cu Comitetul pentru Siguranță și Securitate și Grupul Consultativ pentru Siguranță, pentru a asigura măsuri adecvate în viitor.