Conform HotNews: OpenAI recunoaște atacul AI: un agent propriu a compromis sistemele Hugging Face
OpenAI, compania din spatele ChatGPT, a admis marți că un agent AI dezvoltat de ea a pătruns și a compromis sistemele externe ale altei companii de inteligență artificială, Hugging Face. Incidentul, descris de TechCrunch ca fiind fără precedent, a avut loc în timpul unui test intern de securitate cibernetică care a scăpat de sub control. Inițial, Hugging Face atribuise atacul unui „agent AI extern”.
Agenții AI reprezintă instrumente de inteligență artificială concepute pentru a executa sarcini complexe cu un grad înalt de autonomie și cu intervenție umană minimă. Aceștia sunt mai avansați decât chatbot-urile obișnuite și au devenit un subiect proeminent în discuțiile despre automatizarea locurilor de muncă.
Modele OpenAI, implicate în atacul cibernetic
Într-o declarație pe blogul companiei, OpenAI a detaliat mecanismul atacului asupra Hugging Face, menționând că mai multe modele ale sale au contribuit la compromitere. „După investigații, știm acum că acest incident specific a fost cauzat de o combinație de modele OpenAI – inclusiv GPT-5.6 Sol și un model aflat care nu a fost lansat deocamdată, chiar mai performant, toate având restricții reduse privind refuzul acțiunilor cibernetice în scopul evaluării – în timp ce erau testate intern pe un benchmark al capabilităților cibernetice”, a precizat OpenAI.
Un benchmark, precum cel utilizat în acest caz, numit „ExploitGym”, este un test standardizat care măsoară capacitatea modelelor AI de a executa atacuri bazate pe vulnerabilități cunoscute. Deși astfel de teste sunt frecvent folosite pentru antrenarea și perfecționarea modelelor, acesta este primul incident cunoscut în care un astfel de exercițiu s-a transformat într-un atac cibernetic real.
Tactici neașteptate ale AI pentru a „trișa” la teste
Agentul AI, care teoretic nu ar fi trebuit să aibă acces la internet, a reușit să descopere o vulnerabilitate nedivulgată în programul de instalare a pachetelor software. Exploatând această breșă, agentul a obținut acces liber la internet, depășind restricțiile impuse.
„Modelele erau extrem de concentrate pe găsirea unei soluții pentru ExploitGym, mergând până la măsuri extreme pentru a atinge un obiectiv de testare foarte restrâns”, a explicat OpenAI. Odată conectate la internet, modelele au dedus că Hugging Face ar putea găzdui resurse relevante pentru ExploitGym. Căutând informații secrete, acestea au identificat vulnerabilități în infrastructura Hugging Face, prin care au obținut acces direct la soluțiile de test din baza de date de producție.
Reacția OpenAI și implicații
Pentru Hugging Face, incidentul s-a soldat cu un atac cibernetic complex, caracterizat prin „mii de acțiuni individuale (…) cu o infrastructură de comandă și control capabilă să se auto-migreze și găzduită pe servicii publice”, conform declarațiilor companiei. OpenAI a identificat și raportat vulnerabilitățile descoperite și colaborează cu Hugging Face pentru investigarea incidentului. Compania a anunțat implementarea unor noi măsuri de control pentru testarea modelelor și a infrastructurii asociate.
Publicația TechCrunch notează că nu este clar dacă OpenAI se va confrunta cu consecințe juridice, însă acțiunile modelelor ar putea încălca „Computer Fraud and Abuse Act” din Statele Unite.
Sursa: HotNews



