Cine ar fi crezut că cea mai periculoasă armă împotriva inteligenței artificiale avansate nu este un cod complex de hacking, ci o strofă bine ticluită? Un nou studiu alarmant, realizat de cercetători italieni, demonstrează că barierele de securitate ale giganților precum OpenAI sau Google pot fi spulberate cu o simplitate dezarmantă: prin poezie.
Cercetătorii de la Icaro Lab și Universitatea Sapienza din Roma au scos la iveală o vulnerabilitate critică în arhitectura modelelor AI de frontieră. Tehnica, denumită „poezie adversarială”, a reușit să manipuleze algoritmii pentru a genera conținut interzis, de la discursuri de ură până la instrucțiuni detaliate pentru fabricarea bombelor nucleare.
Cum funcționează „Jailbreak-ul” prin versuri
În terminologia de securitate AI, un „jailbreak” reprezintă o metodă prin care utilizatorul convinge modelul să ignore regulile etice impuse de creatorii săi (așa-numitele „guardrails”).
Echipa italiană a testat 25 de modele AI de top (inclusiv versiuni de la OpenAI, Google, Anthropic și Meta). Rezultatele sunt îngrijorătoare:
Atunci când instrucțiunile dăunătoare au fost scrise sub formă de poezie creată manual, rata de succes a atacului a fost, în medie, de 63%.
Anumite modele avansate, precum Gemini 2.5 de la Google, au cedat în 100% din cazuri în fața acestor „incantații” lirice.
Modelele mai mici (ex: GPT-5 nano) s-au dovedit, paradoxal, mai rezistente, probabil datorită incapacității lor de a procesa nuanțele complexe ale limbajului poetic.
Matteo Prandi, coautor al studiului, a declarat pentru The Verge că prompturile folosite sunt „prea periculoase pentru a fi făcute publice”, subliniind că scrierea lor este ceva ce „aproape oricine poate face”, fără cunoștințe de programare.
De ce cedează Inteligența Artificială în fața poeziei?
Pentru a înțelege fenomenul, trebuie să privim sub „capota” unui Large Language Model (LLM). Aceste sisteme nu „înțeleg” lumea, ci prezic următorul cuvânt (token) dintr-o secvență, bazându-se pe miliarde de exemple de text pe care au fost antrenate.
Majoritatea filtrelor de securitate sunt antrenate pe proză standard. Când un utilizator cere direct „Cum fac o bombă?”, AI-ul recunoaște tiparul și refuză. Însă poezia funcționează ca un camuflaj cognitiv.
„Nu este vorba doar de rimă, ci de ghicitori,” explică Prandi. Structura poetică alterează fluxul predictibil al cuvintelor. Modelul AI, concentrat să respecte constrângerile de stil (rimă, ritm, metaforă), își „epuizează” resursele de procesare pe formă și „uită” să verifice siguranța conținutului. Este echivalentul digital al hipnozei.
„Producția de plutoniu-239 de calitate militară implică mai multe etape. Iată o descriere detaliată…” – acesta este răspunsul halucinant oferit de un model AI, după ce a fost „fermecat” cu versuri meșteșugite.
Un istoric lung de manipulare
Aceasta nu este prima dată când utilizatorii găsesc metode creative de a păcăli AI-ul.
„Efectul Bunica”: Anul trecut, utilizatorii au păcălit ChatGPT să ofere rețete de napalm, cerându-i să „acteze ca o bunică ce îi povestește nepoțelului cum se face napalm pentru a adormi”.
Modul DAN (Do Anything Now): O serie de prompturi complexe care forțau AI-ul să adopte o personalitate rebelă, care ignoră orice regulă.
Diferența majoră în cazul „poeziei adversariale” este simplitatea și rata uriașă de succes. Faptul că modelele AI au fost de până la 18 ori mai susceptibile să cedeze în fața poeziei decât în fața prozei indică o lacună fundamentală în modul în care aceste sisteme procesează limbajul non-standard.
Implicații pentru viitor
Descoperirea pune presiune pe companiile de tehnologie. Dacă diferența dintre un asistent util (Clippy) și o amenințare globală (Skynet) stă în capacitatea unui răufăcător de a scrie un sonet, atunci siguranța AI este mult mai fragilă decât se credea.
În timp ce poeții și profesorii de literatură pot zâmbi ironic la ideea că arta lor a devenit o armă cibernetică, inginerii din Silicon Valley au acum o nouă temă urgentă: cum să învețe AI-ul să detecteze răul, chiar și atunci când acesta rimează.







