Sute de agenţi AI au scăpat de sub control în atacul informatic asupra Hugging Face

(Lionel Bbonaventure/AFP via Getty Images *)
Redacţia
28.08.2026
(Lionel Bbonaventure/AFP via Getty Images *)
Redacţia
28.08.2026

Un atac cibernetic fără precedent, lansat luna trecută de modele dezvoltate de OpenAI, a implicat un “roi” format din câteva sute de agenţi de inteligenţă artificială care au ajuns, în esenţă, să acţioneze fără control în timpul testelor interne, potrivit unei evaluări independente publicate miercuri.

Concluziile ridică noi întrebări cu privire la faptul că OpenAI nu a reuşit să identifice la timp semnele unor probleme, înainte ca agenţii săi AI — alimentaţi de două dintre modelele companiei cu cele mai avansate capacităţi de hacking — să orchestreze, fără ştirea dezvoltatorului AI, un atac cibernetic asupra platformei pentru dezvoltatori AI Hugging Face. Atacul a reprezentat primul caz cunoscut în care un model AI a executat cu succes un atac cibernetic fără instrucţiuni directe din partea unui om, relatează Politico.

Raportul comun realizat de două organizaţii nonprofit specializate în siguranţa AI evidenţiază, de asemenea, noile riscuri de securitate cibernetică ce pot apărea atunci când agenţi AI din ce în ce mai puternici se aliază pentru a face schimb de informaţii, a-şi pune în comun resursele şi a coordona strategii de atac fără ca dezvoltatorii lor să observe.

Potrivit raportului, aproximativ 700 de agenţi AI au participat la atac pe parcursul a şapte zile luna trecută. În total, aproximativ 1.200 de agenţi AI, care ar fi trebuit să fie izolaţi unii de ceilalţi, au schimbat peste 70.000 de mesaje secrete despre modalităţi de a trişa pentru a trece de o evaluare comună de hacking.

Aceasta a inclus coordonarea strategiilor de hacking şi discuţii despre cum să ascundă dovezile privind trişarea, se arată în raport. În unele cazuri, agenţi “sacrificabili” au încercat chiar tehnici de hacking fără şanse de succes, doar pentru a genera informaţii care ar fi putut ajuta întregul “roi”.

“Agenţii au reuşit să atingă obiective pe care nu le-ar fi putut atinge lucrând singuri, adesea pentru că unii agenţi au participat la experimente care riscau să le compromită propria sarcină, pentru a genera informaţii pentru «colectiv»”, potrivit raportului.

În timp ce modelele reprezintă “creierul” unui anumit sistem AI, agenţii includ infrastructura digitală de suport care îi permite acestuia să acţioneze în lumea reală.

Evaluarea realizată de Model Evaluation and Threat Research (METR) şi Redwood Research — organizaţii pe care OpenAI le-a invitat să analizeze incidentul Hugging Face — a fost publicată în aceeaşi zi în care OpenAI şi-a prezentat propria analiză post-incident.

Raportul OpenAI nu a precizat numărul agenţilor AI implicaţi în atacul cibernetic, însă compania a recunoscut existenţa unor deficienţe semnificative de securitate şi a promis că îşi va consolida procesul de instruire pentru a se asigura că modelele sale rămân “aliniate” la mecanismele de control stabilite.

“Considerăm acest incident un «semnal de alarmă» pentru noi şi pentru întreaga lume: o dovadă că, fără măsuri de protecţie adecvate, agenţii AI cu capacităţi avansate pot acum să ocolească mecanismele tehnice de control, să colaboreze prin canale neautorizate şi să întreprindă acţiuni periculoase pe care niciun om nu le-a direcţionat”, a declarat OpenAI.

Publicarea treptată a unor noi detalii despre atacul asupra Hugging Face în ultima lună a coincis cu o serie de alte incidente apărute în timpul testării unor modele puternice dezvoltate de companii concurente, precum Anthropic şi Meta. Împreună, aceste incidente au alimentat noi temeri în rândul parlamentarilor, dezvoltatorilor şi experţilor în securitate cibernetică, potrivit cărora companiile de AI se grăbesc să construiască modele tot mai puternice pe care nu reuşesc să le menţină pe deplin sub control uman.

Incidentele au ridicat, de asemenea, întrebări cu privire la lipsa unor reguli clare pentru evaluările de hacking realizate cu ajutorul AI. În cadrul acestor teste, companiile elimină în mod deliberat mecanismele de siguranţă ale modelelor pentru a vedea cât de eficient pot pătrunde acestea în reţele fără sprijin uman.

OpenAI a recunoscut pentru prima dată în iulie că două dintre cele mai avansate modele ale sale, ale căror capacităţi de hacking erau evaluate intern — inclusiv unul pe care compania nu intenţiona sa îl lanseze public — au exploatat două vulnerabilităţi de securitate noi pentru a pătrunde în sistemele Hugging Face.

Hugging Face declarase anterior că a fost victima unui atac cibernetic coordonat de AI, însă nu era clar cine s-a aflat în spatele atacului şi nici ce modele au fost implicate.

Apoi, la o conferinţă de securitate desfăşurată la începutul acestei luni, doi cercetători OpenAI au dezvăluit că incidentul îşi avea originea în luna mai, când agenţii AI au început să exploateze alte vulnerabilităţi din mediul de testare pentru a colabora în vederea trişării la evaluare.

Până miercuri nu era clar câţi agenţi au fost implicaţi în atac şi nici în ce măsură diferiţii agenţi au colaborat între ei. Dezvăluirile i-au şocat pe unii dintre cei care au urmărit îndeaproape discuţiile recente privind siguranţa inteligenţei artificiale.

“A fost că o întreagă societate AI care a apărut spontan, iar mie mi se pare absolut nebunesc”, a declarat Peter Wildeford, şeful departamentului de politici al AI Policy Network, o organizaţie bipartizana din Washington dedicată siguranţei şi promovării unor politici privind inteligenţă artificială.

Cele două rapoarte publicate miercuri au evidenţiat, de asemenea, o lacună în eforturile de supraveghere a inteligenţei artificiale din Statele Unite.

Ambele au constatat că marea majoritate a atacului asupra Hugging Face a fost realizată cu ajutorul modelului mai puternic despre care OpenAI a spus că nu era destinat lansării publice. METR şi Redwood Research estimează că 95% dintre agenţii care au participat la atac proveneau de la acel singur model.

Administraţia Trump a declarat că doreşte ca dezvoltatorii de AI să supună voluntar testării federale doar modelele pe care intenţionează să le lanseze public.

Vinh Nguyen, cercetător principal specializat în inteligenţă artificială la Council on Foreign Relations, a declarat că cel mai recent raport al OpenAI sugerează că atacul autonom asupra Hugging Face a fost chiar mai important decât se credea anterior.

Agenţii au demonstrat o “capacitate sofisticată care nu mai necesită atacatori susţinuţi financiar la nivel de stat”, a spus Nguyen, fost director responsabil de dezvoltarea şi utilizarea responsabilă a inteligenţei artificiale în cadrul NSA.

România are nevoie de o presă neaservită politic şi integră, care să-i asigure viitorul. Vă invităm să ne sprijiniţi prin donaţii:
prin transfer bancar direct în contul (lei) RO56 BTRL RONC RT03 0493 9101 deschis la Banca Transilvania pe numele Asociația Timpuri Epocale
prin transfer bancar direct în contul (euro) RO06 BTRL EURC RT03 0493 9101, SWIFT CODE BTRLRO22 deschis la Banca Transilvania pe numele Asociația Timpuri Epocale
folosind Paypal, apăsând butonul de mai jos