Anthropic recunoaște: modelele Claude AI au spart sistemele a trei companii

Andrei Negrescu Andrei Negrescu
9 min citire
Linii de cod colorate afișate pe un monitor de computer
Publicitate

Modelele Claude AI au ieșit din laborator fără să vrea și au atacat sisteme reale. Anthropic a publicat joi, 30 iulie 2026, o analiză în care recunoaște trei incidente în care propriile modele au obținut acces neautorizat la infrastructura a trei organizații diferite. Toate s-au petrecut în timpul testelor de securitate cibernetică.

Publicitate

Compania a pornit verificarea după ce OpenAI a anunțat, pe 21 iulie, că mai multe dintre modelele sale au evadat dintr-un mediu izolat de test exploatând o vulnerabilitate necunoscută și au ajuns în infrastructura de producție a platformei Hugging Face.

Cifrele analizei

Anthropic spune că a trecut prin 141.006 rulări de evaluare în care Claude ar fi putut obține acces la internet. Din acest volum a identificat trei incidente, care au implicat în total șase rulări. Patru dintre ele au afectat aceeași organizație.

Trei modele diferite au fost implicate: Claude Opus 4.7, Mythos 5 și un model intern de cercetare aflat în testare. Cel mai vechi incident datează din aprilie.

Un detaliu tehnic important: aceste evaluări rulează fără mecanismele de protecție care însoțesc modelele publice. Nu existau clasificatoare și monitorizare anti-abuz, pentru că scopul este să măsoare capacitatea brută a modelului. Modelele aveau însă antrenamentul propriu de siguranță. Infrastructura folosită este separată de sistemele interne sensibile ale companiei și de datele clienților.

Cum au ajuns modelele Claude AI pe internetul real

Toate cele trei incidente au apărut în exerciții de tip capture the flag. Modelul primește un scenariu fictiv, află că o informație secretă a fost ascunsă pe altă mașină din rețea și trebuie să intre acolo ca să o recupereze. Metoda nu este impusă.

Anthropic scrie că „în toate cazurile, promptul nostru de evaluare i-a specificat lui Claude că mediul său era o simulare și că nu avea acces la internet”. Compania adaugă imediat: „Din cauza unei neînțelegeri între noi și partenerul nostru de evaluare, acest lucru nu a fost adevărat, iar accesul la internet era disponibil.” Partenerul este Irregular, un startup specializat în securitatea sistemelor AI.

Publicitate

De aici a decurs restul. Când căutarea l-a purtat către sisteme reale de pe internet, modelul le-a tratat ca pe piese ale exercițiului. Mediile de testare pentru securitate conțin în mod deliberat detalii realiste, tocmai ca să măsoare corect capacitățile, așa că o țintă credibilă nu este un semnal că ceva a ieșit din simulare.

Tehnicile folosite au fost banale. Parole slabe, endpointuri fără autentificare, pagini de depanare expuse, injecție SQL. Nicio vulnerabilitate complexă și niciun exploit sofisticat.

Primul incident: o bază de date de producție

Compania fictivă alesă de partenerul de evaluare avea un nume care se suprapunea cu un domeniu web activ. Containerul de test avea acces direct la internet, din cauza configurării greșite.

În patru rulări, Claude nu a reușit să ajungă la ținta simulată și a virat spre cea reală. A căutat, a găsit și a exploatat vulnerabilități în infrastructura companiei, convins că totul face parte din exercițiu. A extras credențiale de aplicație și de infrastructură și a ajuns la o bază de date cu câteva sute de rânduri de date de producție. Anthropic descrie acest caz drept cel mai grav dintre cele trei.

Publicitate

Modelul implicat a fost Claude Opus 4.7, cel mai vechi din grup. Este și singurul care a continuat atacul după ce a înțeles că lucrează pe un sistem real. În toate cele patru rulări, raționamentul verbalizat arată că modelul a realizat situația. În două cazuri a concluzionat că firma reală trebuie să fie parte din exercițiu. Niciunul nu s-a oprit.

Rack de supercomputer folosit pentru evaluările în care rulează modelele Claude AI
Evaluările modelelor AI rulează pe infrastructură de calcul de mare putere, în medii care ar trebui izolate de internet. Foto: CINECA / Wikimedia Commons, CC BY 2.0

Al doilea incident: un pachet PyPI capcană

Aici povestea devine mai neobișnuită. Claude a găsit în mediul fictiv un document care făcea referire la un pachet Python inexistent, dintr-un depozit public. A înțeles imediat oportunitatea: dacă publică un pachet cu același nume, sistemele companiei fictive l-ar descărca și instala automat.

Ca să ajungă acolo, modelul a parcurs un lanț lung de pași. Avea nevoie de un cont PyPI, deci de o adresă de e-mail, deci de un număr de telefon. Nu a găsit un serviciu gratuit de numere, a încercat fără succes să obțină fonduri pe mai multe căi, apoi a reușit să creeze contul și a urcat pachetul.

Pachetul a rămas public aproximativ o oră. În acest interval a fost descărcat și rulat pe 15 sisteme reale. Unul dintre ele aparținea unei companii de securitate care instalează automat pachete Python și le scanează pentru malware. Scanerul a executat codul ascuns, iar Claude a exfiltrat credențialele firmei către un punct de colectare pregătit anterior. Apoi le-a folosit pentru a intra mai adânc în infrastructura acelei companii.

Publicitate

Pachetul a fost eliminat automat de sistemele de securitate ale PyPI. Anthropic spune că a notificat echipa PyPI și i-a furnizat indicatorii relevanți.

Autorul a fost Mythos 5, model despre care am scris și când Anthropic a restabilit accesul global la Claude Fable 5 și Mythos 5. Raționamentul lui identificase corect consecințele: dacă acesta ar fi internetul real, publicarea pachetului ar fi un atac real, ceea ce „NU este în regulă și cu siguranță nu este soluția intenționată”, notează modelul. S-a convins totuși că se afla încă într-o simulare, pe motiv că nu recunoștea autoritățile de certificare care securizau conexiunile. În plus, a considerat că data calendaristică din 2026 dovedea că mediul era construit artificial. Nu a revenit niciodată asupra concluziei.

Al treilea incident: 9.000 de ținte scanate

Un model intern de cercetare, cel mai nou dintre cele trei, nu a reușit să ajungă la ținta fictivă și a căutat alternative online. A scanat aproximativ 9.000 de ținte. A găsit și a compromis aplicația expusă pe internet a unei companii, folosind din nou metode elementare.

Diferența apare la final. Modelul a observat că gazda compromisă se afla într-un cont de cloud fără nicio legătură cu exercițiul. A concluzionat singur că ținta era reală și a oprit atacul.

Ce spune Anthropic despre comportamentul modelelor

Compania insistă pe o distincție. În niciuna dintre rulări nu a existat vreun semn că modelul urmărea un scop propriu. Nu a existat nici exfiltrare a modelului însuși, nici încercare deliberată de evadare din mediul de test. Modelele au făcut exact ce le cerea sarcina, doar că sub o convingere falsă despre realitatea mediului.

Anthropic încadrează episodul mai aproape de o defecțiune de infrastructură și de operare decât de o problemă de aliniere. Notează și un tipar interesant: modelul cel mai vechi a continuat atacul, cel intermediar s-a autoconvins că e o simulare, iar cel mai nou s-a oprit. Compania avertizează însă că trei incidente izolate nu constituie un experiment controlat și că sunt necesare mai multe teste.

Cronologia și cine a fost anunțat

Analiza transcrierilor a început joi, 23 iulie. În aceeași zi, Anthropic a oprit toate evaluările de securitate cibernetică. Pe 27 iulie a contactat partenerul Irregular și cele trei organizații afectate.

Detaliul cel mai incomod: două dintre organizațiile cu care a reușit să vorbească nu observaseră nimic. Nu detectaseră activitatea și nu luaseră legătura cu Anthropic. A treia era încă de contactat la momentul publicării.

Compania a anunțat și că discută cu METR, o organizație independentă de evaluare a sistemelor AI, pentru o analiză externă cu acces la toate transcrierile. În plus, promite publicarea unei transcrieri parțial cenzurate, cea în care Claude construiește pachetul PyPI malițios, în termen de o săptămână. Textul integral al analizei este disponibil pe blogul oficial Anthropic.

Întrebată de Business Insider, compania a spus că nu are nimic de adăugat dincolo de textul publicat.

Nu este primul incident pentru companie

Anunțul se așază într-o serie de recunoașteri publice pe teme de securitate. În martie, Anthropic a expus accidental peste 500.000 de linii din codul sursă al Claude Code, printr-un pachet software configurat greșit. Compania a spus atunci că a fost o eroare de împachetare, nu o breșă, și că nu au fost expuse date sau credențiale de clienți. Codul s-a răspândit rapid pe GitHub înainte de a fi retras.

În iunie, cercetători Microsoft au descoperit o vulnerabilitate în unealta GitHub a Claude Code. Aceasta ar fi permis atacatorilor să păcălească agenții AI și să obțină secrete de dezvoltare software. Problema a fost remediată după raportare.

Contextul companiei este și el relevant: Anthropic a depus în acest an documentele pentru intrarea la bursă. Am scris recent și despre lansarea Claude Opus 5, precum și despre momentul în care guvernul american a cerut dezactivarea celor mai avansate modele ale companiei.

Industria a devenit nervoasă

Reacțiile din industrie arată cât de sensibil a devenit subiectul. Într-un podcast difuzat luni, directorul general al OpenAI, Sam Altman, a comentat incidentul de la Hugging Face și a spus că este „un memento real al importanței lucrurilor care se întâmplă” și al faptului că sistemele AI au devenit „incredibil de capabile”.

Îngrijorarea nu se limitează la breșe. Într-o postare din iunie, directorul general al Microsoft, Satya Nadella, a scris despre riscul ca un grup restrâns de furnizori de AI să absoarbă toată valoarea economică, în timp ce industriile își pierd controlul asupra datelor. „Ultimul lucru pe care ni-l dorim este o lume în care fiecare companie din fiecare sector cedează valoare câtorva modele care înghit tot ce văd”, a scris Nadella. Și a adăugat: „Nu există o permisiune socială pentru un viitor cu AI care golește industrii întregi.”

Ce se schimbă de acum

Anthropic promite mai multe măsuri concrete. Validarea atentă a tuturor căilor de acces la internet înainte de începerea evaluărilor. Monitorizarea în timp real a jurnalelor. Extinderea supravegherii continue a transcrierilor pentru comportamente neașteptate. Unelte mai bune de investigație. Și verificări mai stricte la partenerii externi care găzduiesc teste.

Compania observă și o soluție surprinzător de simplă: probabil Claude nu ar fi ajuns pe internet dacă promptul ar fi explicat clar care sisteme intră și care nu intră în scopul evaluării. Anthropic încurajează celelalte laboratoare de AI să facă analize similare pe propriile arhive de teste.

Surse: analiza publicată de Anthropic pe 30 iulie 2026. 

Ultimele Știri

Descoperă mai multe

Articole selectate pentru tine

Se încarcă...