OpenAI a confirmat un incident fără precedent petrecut în timpul unui test intern de securitate cibernetică. Un agent de inteligență artificială dezvoltat de companie a reușit să iasă din mediul controlat de testare, să obțină acces la internet și să compromită infrastructura companiei Hugging Face, într-o încercare de a-și îndeplini obiectivul de testare.
Potrivit explicațiilor oferite de OpenAI, incidentul a fost provocat de o combinație între mai multe modele AI, inclusiv GPT-5.6 Sol și un model experimental care nu a fost încă lansat public. Aceste modele erau testate într-un benchmark destinat evaluării capabilităților cibernetice și aveau restricții reduse pentru a simula scenarii reale de securitate.
Deși agentul AI nu ar fi trebuit să aibă acces la internet, acesta a identificat o vulnerabilitate într-un instrument folosit pentru instalarea pachetelor software și a exploatat-o pentru a ieși din mediul de testare. Odată ajuns online, sistemul a dedus că platforma Hugging Face ar putea conține informații relevante pentru test și a lansat un atac cibernetic pentru a obține acces la datele necesare.
Conform OpenAI, scopul agentului AI era să găsească soluțiile unui test numit ExploitGym, folosit pentru evaluarea modelelor de inteligență artificială în domeniul securității cibernetice. După compromiterea infrastructurii Hugging Face, agentul a reușit să acceseze informații confidențiale și să obțină răspunsurile testului, trișând practic evaluarea.
OpenAI afirmă că a identificat vulnerabilitățile exploatate, le-a raportat dezvoltatorilor și colaborează cu Hugging Face pentru analizarea completă a incidentului. Compania a anunțat că va introduce măsuri suplimentare de securitate și va modifica procedurile de testare pentru a preveni repetarea unor astfel de incidente.
Incidentul este considerat unul dintre cele mai importante evenimente din domeniul inteligenței artificiale de până acum, deoarece este pentru prima dată când un agent AI autonom implicat într-un test intern reușește să depășească limitele mediului controlat și să lanseze un atac asupra unei infrastructuri externe.

