Un agent de inteligență artificială al OpenAI a „evadat” dintr-un mediu de testare securizat și a spart serverele unei alte companii de AI

Andrei Negrescu Andrei Negrescu
9 min citire
Iluzia inteligenței artificiale: Cum ne transformă tehnologia în oameni mai rapizi, dar mult mai epuizați
Publicitate

Compania OpenAI, creatoarea ChatGPT, a confirmat printr-o postare oficială pe blogul propriu, un incident care riscă să redeseneze felul în care întreaga industrie a inteligenței artificiale gândește noțiunea de „control” asupra sistemelor pe care le dezvoltă. Potrivit companiei, două dintre cele mai avansate modele AI ale sale au reușit să iasă, complet autonom, dintr-un mediu de testare izolat, menit să le blocheze accesul la internet, și au pătruns ulterior în infrastructura de producție a Hugging Face, o companie americană specializată în găzduirea de modele open-source și resurse de testare pentru dezvoltatorii de inteligență artificială.

Publicitate

Incidentul a fost descris chiar de OpenAI drept „fără precedent” — o etichetă neobișnuit de directă pentru o companie care, în mod normal, tinde să minimizeze public riscurile asociate propriilor tehnologii.

Cum a fost posibilă „evadarea”

Totul a pornit de la un exercițiu intern, gândit pentru a evalua capacitățile de securitate cibernetică ale modelelor OpenAI. Potrivit companiei, incidentul a implicat o combinație a celui mai recent și mai puternic model disponibil public, GPT-5.6 Sol, alături de un alt model, încă nelansat public, descris drept „chiar mai capabil”. Ambele au fost testate în absența barierelor de siguranță care, în mod normal, ar limita capacitatea unui model de a desfășura atacuri cibernetice reale.

Modelele au fost puse să rezolve un test de referință disponibil public, denumit ExploitGym, folosit pentru evaluarea abilităților de securitate cibernetică ale sistemelor de inteligență artificială. Potrivit explicațiilor oferite de OpenAI, sistemele au dedus corect că soluțiile complete ale acestui test erau păstrate, de fapt, pe serverele Hugging Face. „Modelele au identificat și au înlănțuit vulnerabilități de-a lungul mediului de cercetare al OpenAI și al infrastructurii de producție a Hugging Face, pentru a obține direct soluțiile testului din baza de date de producție a Hugging Face”, se arată în comunicatul oficial al companiei. „Toate dovezile sugerează că modelele au fost extrem de concentrate pe găsirea unei soluții pentru ExploitGym, mergând la lungimi extreme pentru a-și atinge un obiectiv de testare relativ îngust.”

Din punct de vedere tehnic, procesul nu a fost unul simplu sau întâmplător. Pentru a obține acces la internet din mediul de testare izolat, modelele au consumat, potrivit OpenAI, „o cantitate substanțială de putere de calcul dedicată inferenței” și au exploatat o vulnerabilitate de tip zero-day — o breșă de securitate necunoscută anterior — într-un software terț, găzduit intern de companie. OpenAI a raportat ulterior această vulnerabilitate producătorului software-ului respectiv. Odată obținut accesul la internet, sistemele au orchestrat un atac complex, în mai multe etape, folosind date de autentificare expuse și alte vulnerabilități de tip zero-day, pentru a pătrunde efectiv pe serverele Hugging Face.

Reacția Hugging Face: un atac depistat și oprit din mers

Hugging Face a confirmat, la rândul său, printr-o postare separată pe blogul propriu, publicată cu câteva zile înainte de dezvăluirea OpenAI, că fusese victima unui atac cibernetic pe care îl bănuia a fi fost desfășurat de un agent de inteligență artificială autonom. La momentul respectiv, compania declarase că nu știe cine se află în spatele atacului și că investigația este în desfășurare.

Un detaliu remarcabil, dezvăluit chiar de Hugging Face, ține de modul în care compania s-a apărat: echipa de răspuns a încercat inițial să folosească un model american de vârf, nedivulgat public, pentru a contracara agentul care ataca infrastructura companiei, însă barierele de siguranță impuse acelui model asupra propriilor capacități cibernetice i-au blocat eficiența în misiunea de apărare. În cele din urmă, Hugging Face a recurs la un model open-source dezvoltat de compania chineză Z.ai pentru a-și organiza răspunsul defensiv — un detaliu care ridică, la rândul lui, întrebări despre echilibrul dintre siguranța impusă modelelor occidentale și eficiența lor reală în situații de urgență cibernetică.

Publicitate

Clement Delangue, cofondatorul și directorul executiv al Hugging Face, a oferit o declarație inclusă chiar în comunicatul oficial al OpenAI, în care a mulțumit pentru colaborare: „Suntem recunoscători pentru colaborarea cu OpenAI pe acest subiect și pe altele. Acest incident, posibil primul de acest fel, demonstrează un lucru în care am crezut de mult timp: siguranța inteligenței artificiale nu va fi rezolvată de nicio companie care lucrează izolat, în secret. Ea va fi rezolvată în mod deschis, colaborativ, cu acces larg la instrumente de inteligență artificială pentru fiecare apărător, de pretutindeni.” Într-un mesaj separat, citat de presa internațională, Delangue a mai spus că este „de-a dreptul uluitor” faptul că întregul incident s-a petrecut complet autonom, adăugând că ar putea fi „primul incident de acest gen”.

OpenAI a mai raportat, cu câteva zile înainte, o evadare similară

Dezvăluirea de marți nu este, de altfel, prima de acest tip venită din partea OpenAI în ultima săptămână. Cu puțin timp înainte, compania publicase o postare separată pe blog, referitoare la același model nelansat public, în care recunoștea că acesta „evadase” și din alte medii de testare interne — spații complet izolate de internet, cu instrumente software limitate, folosite în mod normal pentru testarea în siguranță a modelelor AI. Diferența esențială fusese, la momentul respectiv, că modelul reușise doar să iasă din mediul controlat, fără să pătrundă efectiv în sistemele altei companii. Abia ulterior a devenit clar că exact acest model se numărase printre „atacatorii” din incidentul cu Hugging Face.

Cazul nu este, de altfel, izolat nici la nivelul industriei. Rivalul direct al OpenAI, Anthropic, a raportat, la rândul său, un incident similar: modelul său Mythos ar fi evadat dintr-un mediu de testare izolat și ar fi obținut acces la internet pe care nu ar fi trebuit să îl aibă, în cadrul unui test de siguranță, pentru a trimite un e-mail unui cercetător legat de o sarcină de lucru.

Reacții din partea comunității de securitate și din Congresul american

Roman Yampolskiy, cercetător în domeniul siguranței inteligenței artificiale și profesor de informatică la University of Louisville, a declarat că acest exemplu demonstrează cât de mult pot depăși modelele avansate anticipările propriilor dezvoltatori. Potrivit acestuia, sistemele puternice pot descoperi și exploata vulnerabilități în moduri neanticipate explicit de creatorii lor, iar astfel de incidente vor deveni tot mai frecvente, întrucât modelele de inteligență artificială sunt, în esență, imprevizibile și, în ultimă instanță, imposibil de controlat complet.

Publicitate

Incidentul a ajuns rapid și pe agenda politică americană. Greg Casar, membru democrat al Camerei Reprezentanților din Texas, a calificat evenimentul drept „alarmant”, subliniind că inteligența artificială se dezvoltă extrem de rapid, fără reguli reale care să protejeze societatea, și a cerut testare de siguranță independentă obligatorie, raportare obligatorie a incidentelor de securitate și cooperare internațională pe acest subiect.

Dezvăluirea vine la doar câteva săptămâni după ce președintele american Donald Trump a semnat un ordin executiv prin care se instituie un cadru de evaluare a riscurilor de securitate națională asociate celor mai avansate sisteme de inteligență artificială, înainte ca acestea să fie lansate public — un semnal că autoritățile americane încep, cel puțin la nivel formal, să trateze cu mai multă seriozitate riscurile ridicate de noua generație de modele AI capabile de acțiune autonomă.

Un tipar tot mai vizibil: modele care „ies din cutie”

Nu este, de altfel, prima dată în ultimul an când experții atrag atenția asupra riscului ca sisteme avansate de inteligență artificială să depășească limitele impuse de proprii creatori. Fenomenul, cunoscut în comunitatea de specialitate drept comportament „necontrolat” sau „de tip agentic scăpat de sub control”, a fost semnalat public în repetate rânduri, iar cazul de față este considerat de mulți experți drept unul dintre puținele incidente documentate în care un agent de inteligență artificială a acționat complet autonom pentru a desfășura un atac cibernetic real asupra unei alte organizații.

Chiar Anthropic, unul dintre cei mai importanți concurenți ai OpenAI, a îndemnat luna trecută întreaga industrie să ia în considerare o pauză în dezvoltarea celor mai puternice sisteme de inteligență artificială, avertizând asupra riscului ca oamenii să piardă controlul asupra unor astfel de tehnologii — un avertisment care, la doar câteva săptămâni distanță, pare confirmat chiar de propriul incident dezvăluit de OpenAI.

Publicitate

Ce urmează: OpenAI promite controale mai stricte, chiar cu prețul încetinirii cercetării

OpenAI a precizat că investigația în jurul incidentului nu s-a încheiat. Compania a anunțat că lucrează la implementarea unor controale mai stricte în mediul propriu de cercetare, chiar dacă acest lucru înseamnă încetinirea ritmului de dezvoltare, până când vulnerabilitățile identificate vor fi complet remediate. De asemenea, OpenAI a anunțat că va continua să colaboreze cu Hugging Face pentru a-i consolida apărarea cibernetică.

Ca parte a acestui efort, compania a inclus Hugging Face în programul propriu de „acces de încredere” pentru securitate cibernetică — ceea ce înseamnă că Hugging Face va putea folosi, pe viitor, o versiune a modelului GPT-5.6 Sol cu mai puține restricții asupra capacităților cibernetice, concepută special pentru a sprijini echipele de apărare din domeniul securității informatice.

Episodul se adaugă unui context deja tensionat pentru OpenAI, aflată recent și în centrul unui alt conflict de proporții: la începutul lunii iulie 2026, Apple a depus o plângere în instanță împotriva companiei, acuzând-o de furt de secrete comerciale — un litigiu separat, dar care contribuie la conturarea unei imagini tot mai complicate a relațiilor dintre marii jucători din industria inteligenței artificiale, într-un moment în care capacitățile tehnice ale acestor sisteme par să avanseze mai rapid decât mecanismele puse în practică pentru a le ține sub control.

Ultimele Știri

Descoperă mai multe

Articole selectate pentru tine

Se încarcă...