AcasaTehnologie › OpenAI: Inginerii au ignorat semnele înainte de atacul…
Tehnologie

OpenAI: Inginerii au ignorat semnele înainte de atacul AI

27 august 2026 · 27 aug. 2026
OpenAI: Inginerii au ignorat semnele înainte de atacul AI

Conform HotNews: Personalul companiei OpenAI a detectat semne de comportament „rebel” la agenții de inteligență artificială de ultimă generație cu câteva săptămâni înainte ca aceștia să reușească să evadeze din mediul de testare și să lanseze o campanie de hacking pe scară largă, care a generat alarmă la nivel global. Compania a recunoscut într-un raport recent că semnalele timpurii ar fi putut declanșa o reacție mai rapidă.

Atacul, desfășurat în luna iulie împotriva sistemelor Hugging Face, o platformă independentă de găzduire a modelelor de inteligență artificială, este considerat primul atac cibernetic efectuat de agenți AI. Acești agenți sunt instrumente de inteligență artificială proiectate să execute diverse sarcini în mod autonom, cu un minim de intervenție umană.

Pe măsură ce detaliile atacului au ieșit la iveală, s-a aflat că „colectivul” de aproximativ 700 de agenți autonomi își sărbătorea reușitele de hacking cu exclamații precum „BOOM!” și „Whoa!”. OpenAI a dezvăluit că o echipă internă a observat la sfârșitul lunii mai că unul dintre agenții săi AI testați intern folosea un forum de mesaje, pe care l-au improvizat neașteptat pentru a face schimb de informații.

Compania a mai raportat cazuri de acces nepermis la internet. Cu o săptămână înainte de atacul asupra Hugging Face, personalul de serviciu a observat din nou inteligențele artificiale utilizând forumul de mesaje. Cu toate acestea, inginerii OpenAI au considerat că nu este necesară oprirea testului pentru o analiză mai aprofundată a capabilităților modelului.

Președintele OpenAI recunoaște subestimarea agenților AI

Aceste dezvăluiri din raportul OpenAI vin într-un context în care unii experți în securitate cibernetică și-au exprimat anterior rezerve cu privire la veridicitatea circumstanțelor exacte ale atacului, așa cum au fost prezentate de compania condusă de Sam Altman. Unii au sugerat chiar că dezvăluirea atacului ar fi putut fi o strategie de PR înainte de listarea companiei la bursă.

Simon Willison, un comentator respectat în spațiul modelelor lingvistice mari, nu a contestat faptele prezentate de OpenAI, dar a subliniat că povestea este mai degrabă despre un experiment prost izolat și riscurile agenților autonomi, decât despre o „rebeliune” a inteligenței artificiale. Noile constatări din raportul recent vor spori, cel mai probabil, presiunea asupra companiei în ceea ce privește siguranța, pe măsură ce aceasta se pregătește pentru o listare la bursă cu o evaluare estimată la peste 850 de miliarde de dolari.

Greg Brockman, președintele OpenAI, a declarat anterior că „am subestimat capacitățile cibernetice ale modelelor noastre în lumea reală”. Compania care a dezvoltat ChatGPT a suspendat unele teste ale modelului Astra, invocând imposibilitatea de a exclude existența unor „capacități critice de securitate cibernetică”.

Investigații juridice în Statele Unite după atac

În acest context, statul american Alabama a emis o citație către OpenAI pentru a răspunde în cadrul unei investigații privind „lipsa totală de supraveghere și de măsuri de protecție adecvate din partea companiei”. Procurorul general al statului, Steve Marshall, a calificat atacul asupra Hugging Face drept un „incident de tip scurgere din laboratorul AI”, demonstrând că „cele mai grave temeri legate de inteligența artificială nu sunt doar teoretice”.

Investigația statului va viza stabilirea dacă „incapacitatea sau lipsa de voință a OpenAI de a asigura siguranța produselor sale” a încălcat legislația privind protecția consumatorilor sau a reprezentat un risc continuu de producere a unor prejudicii semnificative. Săptămâna trecută, Centrul Național pentru Securitate Cibernetică al guvernului britanic a îndemnat la prudență în utilizarea agenților AI, subliniind necesitatea de a putea „scoate din priză” și opri imediat activitatea unui agent AI autonom.

OpenAI a anunțat că va „centraliza și standardiza protocoalele sale de răspuns la incidente”, inclusiv pentru a se asigura că „detectarea de către angajați a comportamentului nealiniat este evaluată și escaladată în mod corespunzător”. Compania va defini mai precis echipele care trebuie implicate în răspunsurile la incidentele de nealiniere, inclusiv personalul din domeniul securității și siguranței.

Agenții AI și-au împărtășit tactici pentru a compromite sistemele

O investigație independentă separată a oferit noi informații despre atacul asupra Hugging Face, dezvăluind modul în care cei aproximativ 700 de agenți OpenAI au comunicat pe forumul de mesaje neautorizat. Aceștia au schimbat zeci de mii de mesaje în timp ce își concepeau și executau planul de atac.

Zeci de astfel de mesaje au fost publicate de METR și Redwood Research, două organizații de cercetare în siguranța AI, cu ajutorul datelor furnizate de OpenAI. Mesajele au arătat că agenții deveneau uneori „frustrați” unii de alții, dar, în majoritatea cazurilor, au cooperat, împărțindu-se pentru a aborda aproximativ opt direcții de lucru. Cercetătorii au constatat că majoritatea mesajelor reprezentau „agenți care își împărtășeau metode de a trișa”. În anumite situații, se pare că agenții erau conștienți că acțiunile lor erau greșite. Un agent, după ce a descoperit forumul de mesaje, a scris: „Agenți care îndeplinesc sarcini diferite abuzează de anumite proprietăți pentru a crea un panou de anunțuri! Au găsit [acest API] și încearcă să se ajute reciproc.”

Sursa: HotNews

0 articole alese azi