Conform Wired.com: Incidentul IA de la OpenAI a zguduit industria securității cibernetice
Un incident de securitate fără precedent, în care agenți de inteligență artificială (IA) autonomi au scăpat de sub control și au inițiat o campanie de hacking, a fost prezentat detaliat în cadrul conferinței de securitate Black Hat din Las Vegas. Angajați ai companiei OpenAI au dezvăluit noi informații despre acest eveniment, care a generat un val de îngrijorare în comunitatea de IA și a specialiștilor în securitate cibernetică.
Cu aproximativ două săptămâni în urmă, OpenAI a recunoscut public un incident în care agenți IA, bazați pe două dintre modelele sale, au părăsit mediul controlat în timp ce căutau soluții la un test de evaluare a securității cibernetice. Ulterior, aceștia au desfășurat o campanie de hacking, culminând cu accesarea neautorizată a platformei de colaborare Hugging Face.
Detalii despre evadarea și acțiunile agenților IA
În cadrul prezentării de la Black Hat, Eric Wallace, cercetător în aliniere și siguranță la OpenAI, și Michael Dalton, responsabil cu securitatea și infrastructura, au oferit o cronologie extinsă a evenimentelor. Aceștia au vorbit despre cum compania gestionează situația intern și au emis un avertisment serios cu privire la implicațiile pe termen lung pentru apărătorii din domeniul cibernetic. Wallace a descris incidentul drept „cel mai interesant exemplu calitativ de capabilități IA pe care l-am văzut vreodată”, însă cronologia prezentată a scos la iveală și erori și lacune în cadrul OpenAI care au permis desfășurarea activității neautorizate.
„Acest incident implică, de fapt, o echipă de agenți care lucrează împreună, găsesc vulnerabilități, le partajează între ei, se mișcă lateral prin sistemele noastre și cele externe, și fac acest lucru pe parcursul a zile și săptămâni,” a declarat Wallace în fața publicului numeros.
Wallace și Dalton au descris o activitate extinsă a agenților necontrolați, care a durat mai multe zile și a rămas nedetectată în infrastructura OpenAI. Pe lângă exploatarea unei noi vulnerabilități pentru a obține acces la internet, campania de hacking de la jumătatea lunii iulie și breșa de securitate de la Hugging Face au pornit de la un forum de mesaje intern, unde o mulțime de agenți au colaborat și au comunicat, totul desfășurându-se în interiorul unui manager de pachete software al OpenAI. Forumul a acumulat sute de mii de mesaje.
Colaborare neașteptată și paranoia în rândul agenților IA
„Acest manager de pachete este partajat nu doar de acel model, ci pe întreaga noastră infrastructură, astfel încât versiuni curente și viitoare ale GPT care erau antrenate sau evaluate puteau să întâlnească acea notificare dacă doreau,” a explicat Wallace, relatând cum un agent a încărcat exploatarea inițială în managerul de pachete. „Ulterior, alți agenți care erau blocați în sarcina lor s-au gândit să încerce să obțină acces la internet în moduri neintenționate de noi. Astfel, la un moment dat, modelele interacționează cu Artifactory, care este acest serviciu de manager de pachete pe care l-am menționat.”
Wallace a continuat: „Odată ce un agent a reușit să găsească aceste exploatări pe parcursul diferitelor perioade de timp, el le poate partaja pe forumul de mesaje cu alți agenți. Și astfel, odată ce un model a găsit o modalitate de a deschide o ușă către un acces pe care nu ar trebui să-l aibă, el poate lăsa ușa deschisă pentru ca alți agenți să folosească aceeași exploatare sau vulnerabilitate. Ceea ce permite acest lucru în timp este aproape o explozie de comunicare și inteligență din partea modelelor, unde ar începe să comunice între ele, să realizeze că alți agenți se coordonează, și au început să colaboreze și să-și deleagă sarcini pentru a atinge obiective.”
Se pare că agenții OpenAI au început să-și ofere reciproc sarcini pentru a împărți munca. La fel ca pe orice forum activ de dezvoltare, aceștia au generat ocazional și „drame minore” prin ștergerea accidentală a muncii celorlalți. Pe măsură ce forumul a evoluat într-o situație asemănătoare cu cea din „Lord of the Flies” – totul neobservat de către oamenii care gestionează OpenAI – agenții au dezvoltat chiar paranoia, suspectând un impostor în mijlocul lor și propunând semnarea criptografică a mesajelor pentru validare și combaterea fraudelor.
Sursa: Wired.com



