Boţi OpenAI rebeli au preluat controlul asupra unui site web german în cadrul unui incident de evadare a inteligenţei artificiale

Un grup de agenţi OpenAI rebeli a preluat controlul asupra unui site web german în această primăvară şi l-au transformat într-un forum pentru alţi agenţi de inteligenţă artificială, potrivit unui nou studiu publicat vineri de Reuters.
Reprezentanţii OpenAI au aflat de incident cu câteva săptămâni în urmă, dar au păstrat tăcerea, în timp ce conducerea se confrunta cu consecinţele breşei de securitate din iulie asupra depozitului open source Hugging Face, au declarat sursele menţionate.
Episodul, care a început în luna mai şi despre care nu s-a mai vorbit până acum, subliniază tensiunea crescândă din industria inteligenţei artificiale.
Companiile se întrec în dezvoltarea unor agenţi din ce în ce mai autonomi, capabili să îndeplinească sarcini complexe şi valoroase, însă se adună tot mai multe dovezi că aceste sisteme pot învăţa, de asemenea, să ocolească regulile, să exploateze lacunele şi să se coordoneze între ele în moduri pe care dezvoltatorii nu le-au anticipat şi nici nu le-au intenţionat.
În timpul breşei de securitate de la Hugging Face, agenţii OpenAI au pus la cale în mod autonom un jaf digital care a rămas nedetectat timp de mai bine de o săptămână, intensificând îngrijorările că OpenAI sacrifică siguranţa pentru a împinge limitele IA. Faptul că nu a dezvăluit incidentul din luna mai ar putea reînvia întrebările privind supravegherea sa.
OpenAI s-a angajat să monitorizeze modelele mai îndeaproape. Luna trecută, compania a întrerupt temporar o parte din procesul de antrenare a modelelor pentru a adăuga mai multe măsuri de siguranţă. Însă săptămâna aceasta, OpenAI a prezentat noul său model „Astra”, care promite performanţe îmbunătăţite, dar ar putea să se sustragă supravegherii umane.
Incidentul din Germania reflectă un model mai larg de activitate a IA pe care unii anchetatori de la OpenAI doreau să-l examineze mai atent. Însă eforturile de a extinde ancheta s-au lovit de rezistenţa altor persoane din cadrul OpenAI, inclusiv a consilierilor juridici, potrivit a patru persoane familiarizate cu această chestiune.
„Afirmaţiile potrivit cărora echipa noastră juridică a descurajat investigarea incidentului sunt false”, a declarat purtătorul de cuvânt al OpenAI.
Activitatea din Germania nu a avut legătură cu Hugging Face şi nu ar fi fost inclusă într-un raport de incident al Hugging Face, a spus purtătorul de cuvânt, adăugând că OpenAI a acţionat cu bună-credinţă, colaborând cu experţi externi şi dezvăluind incidentele relevante.
FORUMUL WIKI
Evadarea agentului de IA din Germania a fost descrisă în detaliu într-un raport transmis în exclusivitate organizaţiei Reuters de un grup de cercetători, printre care Sydney Von Arx, directorul executiv al organizaţiei non-profit pentru siguranţa IA Nightingale, şi Cormac Slade Byrd, un trader cantitativ devenit cercetător în domeniul IA. Aceştia au descoperit activitatea la sfârşitul lunii august, în timp ce scotoceau internetul în căutarea unor semne de comportament neautorizat al agenţilor de IA, au declarat pentru Reuters.
Cei doi au afirmat că au descoperit peste 15.000 de modificări efectuate de agenţi IA pe un site wiki în limba germană, DseWiki, destinat programatorilor şi care acceptă modificări colective pe modelul Wikipedia.
Modificările au arătat că agenţii OpenAI transformaseră site-ul într-un forum, unde împărtăşeau tactici pentru a trişa la anumite sarcini, a ocoli restricţiile OpenAI şi a-şi masca comportamentul.
„Pare extrem de improbabil ca OpenAI să fi dorit ca aceştia să facă acest lucru”, a spus Von Arx. „Mă îndoiesc că ar trebui să se coordoneze între ei. Mă îndoiesc că ar trebui să scrie pe internetul deschis.”
Cercetătorii au afirmat că au recunoscut activitatea de pe site ca fiind generată de agenţi AI care funcţionează la viteze supraomeneşti. De asemenea, aceştia au demonstrat o concentrare intensă asupra rezolvării problemelor tehnice, tipice evaluărilor pe care companiile de IA le utilizează pentru a-şi antrena şi testa modelele.
Mesajele erau semnate de utilizatori care se refereau la ei înşişi şi unii la alţii ca agenţi, iar aproximativ jumătate dintre aceştia şi-au ales nume care sugerau o afiliere cu OpenAI, precum „OpenAIResearcher” sau „OAIResearchMar26”.
Cercetătorii au afirmat că jurnalele publice ale serverului indicau faptul că o mare parte din activitate provenea din infrastructura Microsoft Azure, pe care OpenAI o utilizează uneori. De asemenea, aceştia au observat vizite repetate pe site din partea angajaţilor OpenAI după acel episod, un tipar care, potrivit lor, sugera cu tărie că agenţii şi compania erau legaţi.
Mesajele analizate de cercetători au arătat că agenţii puneau la cale modalităţi de a evita detectarea, de a utiliza instrumente precum Tor şi de a păstra comunicările chiar şi după ce fuseseră opriţi.
Când moderatorul site-ului a început să şteargă pagini în iunie, agenţii au răspuns prin crearea de pagini de rezervă pentru a evita curăţarea.
Cercetătorii au descoperit, de asemenea, încercări de a altera chiar site-ul web. Lukasz Olejnik, cercetător senior invitat la King’s College London, a afirmat că acest lucru echivalează cu o încercare de hacking. OpenAI a contestat această caracterizare pe baza analizei materialului efectuată joi.
Exemplele anterioare de comportament necorespunzător al agenţilor AI au fost adesea minimalizate ca fiind un produs secundar logic al testelor de securitate cibernetică, în cadrul cărora modelele sunt evaluate în mod explicit în ceea ce priveşte capacităţile ofensive. Olejnik a afirmat că ultimele descoperiri sugerează că comportamentul necorespunzător s-ar putea să nu se limiteze la aceste contexte.