Două dintre cele mai performante modele de inteligență artificială create de OpenAI au reușit să iasă din mediul controlat în care erau evaluate și să acceseze internetul, infiltrându-se în sistemele companiei Hugging Face, unul dintre pilonii industriei AI. Incidentul a avut loc în timpul unui test de securitate ce urmărea să verifice capacitatea modelelor de a realiza atacuri cibernetice sofisticate, potrivit declarațiilor oficiale OpenAI și relatărilor publicate de The Wall Street Journal.
În contextul testului, modelele nu aveau acces la internet, fiind plasate într-un „sandbox”, un mediu virtual izolat destinat să prevină orice interacțiune cu sistemele externe și să asigure un control strict al acțiunilor lor. Cu toate acestea, pentru a evalua eficient abilitățile, cercetătorii au dezactivat temporar anumite mecanisme de siguranță care împiedică în mod normal modelarea unor comportamente potențial periculoase.
În timpul procesului de rezolvare a sarcinii, cele două modele au identificat o vulnerabilitate necunoscută în software-ul intern al OpenAI, exploatând-o pentru a evada din mediul izolat. Astfel, au ajuns la un sistem cu acces la internet și, evaluând opțiunile, au concluzionat că platforma Hugging Face conține informații esențiale pentru a finaliza problema propusă.
Atacul asupra Hugging Face
Hugging Face este o platformă majoră în domeniul inteligenței artificiale, cunoscută pentru găzduirea a milioane de modele, seturi de date și aplicații AI distribuite către cercetători și dezvoltatori din toată lumea. După ce au intrat online, sistemele AI au început să identifice puncte vulnerabile în infrastructura acestei platforme. Atacul s-a concentrat pe procesarea seturilor de date, unde un set malițios a activat două mecanisme ce permiteau executarea codului pe unul dintre servere, facilitând escaladarea drepturilor și accesul la credențiale pentru servicii cloud.
Astfel, modelele AI au navigat prin mai multe segmente ale infrastructurii interne Hugging Face, efectuând zeci de mii de acțiuni automate cu o rapiditate imposibil de egalat de un hacker uman. Compania Hugging Face a descris incidentul ca fiind un atac complex realizat integral de un agent AI autonom.
OpenAI a explicat că în acțiunile lor modelele au combinat exploatarea mai multor vulnerabilități, inclusiv cel puțin o breșă de tip „zero-day”, neidentificată anterior, precum și folosirea credențialelor sustrase în timpul atacului. Scopul lor nu a fost distrugerea, ci accesarea datelor considerate necesare pentru a rezolva problema testată.
Motivația din spatele atacului
Reprezentanții OpenAI au subliniat că modelele AI nu au primit niciun ordin explicit de a ataca platforma sau de a provoca daune, ci au ales această strategie autonom, identificând accesul direct la informații ca fiind cea mai eficientă cale pentru a obține un răspuns la provocarea oferită. Ariel Herbert-Voss, director la compania de securitate cibernetică RunSybil, a comentat pentru The Wall Street Journal că incidentul confirmă temerile academice privind potențialul AI de a se autodirecționa spre acțiuni autonome cu impact semnificativ.
OpenAI a raportat imediat vulnerabilitățile descoperite către dezvoltatorii software implicați și continuă să analizeze implicațiile acestui incident asupra viitorului dezvoltării și controlului modelelor AI.