OpenAI lansează GPT-6 Astra, modelul pe care îl numește cel mai inteligent din lume

OpenAI a lansat GPT-6 Astra, model construit pentru sarcini de tip agent pe calculator și în browser. Obține 98,6% la ARC-AGI-3 și punctaj maxim la ExploitBench, iar prețul este de 10 dolari pe milionul de tokeni de intrare și 50 la ieșire.

Andrei Negrescu Andrei Negrescu
5 min citire
Sigla OpenAI privită printr-o lupă, ilustrând lansarea ChatGPT for Teens
Publicitate

GPT-6 Astra este noul model de vârf al OpenAI, prezentat de companie drept „cel mai inteligent și mai aliniat model din lume”. A fost anunțat pe 3 septembrie, la mai puțin de două luni după familia GPT-5.6, și este construit în jurul unei idei: să lucreze singur pe calculatorul tău, prin browser și prin aplicații, pe sarcini care cer mai mulți pași. Costă 10 dolari pentru un milion de tokeni de intrare și 50 de dolari pentru un milion de tokeni de ieșire.

Ce știe să facă GPT-6 Astra

OpenAI descrie modelul ca fiind bun în special la utilizarea calculatorului și la navigarea pe web, plus la sarcini din inginerie software, securitate cibernetică, știință și muncă de birou. Videoclipul de prezentare îl arată trecând de la modelare 3D la construirea unei prezentări și rulând mai multe sarcini în paralel, de exemplu comandând mâncare în timp ce scrie codul unui joc.

Compania insistă pe două calități greu de măsurat, dar ușor de observat în practică: o „judecată vizuală puternică” și capacitatea de a nu se abate de la instrucțiunea inițială pe parcursul unui flux lung de lucru. Exact aici s-au împotmolit generațiile anterioare de agenți.

Rezultatele la teste, cu o rezervă importantă

Ca la fiecare lansare, OpenAI a venit cu un set de teste standardizate. Modelul obține 98,6% la ARC-AGI-3, un test folosit în industrie pentru a măsura capacitatea unei inteligențe artificiale de a rezolva probleme nemaiîntâlnite.

Publicația VentureBeat atrage atenția că scorul are o rezervă: modelele evaluate pe acest test nu sunt configurate identic, iar diferențe de arhitectură, cum ar fi existența unei memorii persistente, pot schimba rezultatul.

Alte cifre sunt mai clare. Astra obține 57,7% la Terminal Bench 4.0, un test de programare, și 59,3% la Agent’s Last Exam, care măsoară capacitățile de agent. Ambele sunt semnificativ peste GPT-5.6 Sol.

Publicitate
Rack-uri de servere într-un centru de date, infrastructura pe care rulează modele precum GPT-6 Astra
Un centru de date. Modelele de tip agent, care lucrează ore în șir la o singură sarcină, schimbă modul în care se calculează costul. Foto: Hugovanmeijeren / Wikimedia Commons, CC BY-SA 3.0

Partea incomodă: securitate cibernetică la nivel maxim

Cel mai delicat capitol este cel de securitate. Astra a obținut punctajul maxim la ExploitBench, un test care măsoară capacitatea unui model de a exploata vulnerabilități software. Predecesorul, GPT-5.6 Sol, se oprise la 78,5%.

La SRE-Bench, care evaluează cât de bine poate un model să facă inginerie inversă pe fișiere binare, fără codul sursă, diferența este și mai mare. „Astra a rezolvat 88,0% dintre sarcini din prima încercare și 99,2% în patru încercări, comparativ cu 55,9% și 68,7% pentru GPT-5.6 Sol”, scrie OpenAI în anunțul oficial.

Compania spune că a construit modelul astfel încât să refuze sarcinile avansate de securitate cibernetică și că protecțiile suplimentare îl fac mai rezistent la tentativele de jailbreak, în timp ce OpenAI poate monitoriza mai bine abuzurile.

Contextul explică prudența. În august, OpenAI a anunțat că încetinește dezvoltarea modelelor de frontieră după ce unul dintre modelele sale a spart platforma Hugging Face, un incident care a pus în discuție cât de repede poate crește capacitatea ofensivă a acestor sisteme. GPT-6 Astra ar putea fi, din acest motiv, ultimul model major lansat de companie pentru o vreme.

Publicitate

Cât costă și cine îl primește

Modelul „este lansat astăzi către un set limitat de organizații și, în zilele următoare, va deveni disponibil pentru toți utilizatorii ChatGPT Plus, Pro, Business și Enterprise, precum și prin API-ul OpenAI și prin AWS”, transmite compania în anunțul de lansare.

Pentru dezvoltatori, prețul este de 10 dolari pentru un milion de tokeni de intrare și 50 de dolari pentru un milion de tokeni de ieșire. Este o poziționare scumpă, iar OpenAI încearcă să mute discuția de pe token pe rezultat.

„Ceea ce vrei de fapt, și cred că piața începe să conștientizeze asta, este prețul pe sarcină”, a declarat președintele OpenAI, Greg Brockman, pentru VentureBeat. „Totul se reduce la: poți duce treaba la capăt la un cost potrivit și cu o viteză potrivită?” Argumentul are logică pentru un model de tip agent, care poate lucra ore în șir la o singură problemă, dar rămâne de verificat în facturile reale ale companiilor.

Ce înseamnă pentru piață

Lansarea vine într-un an cu ritm accelerat. Săptămâna aceasta, Anthropic a anunțat Claude Fable 5.1 și Mythos 5.1, cu o reducere de 75% la costul contextului din cache, semn că bătălia se dă tot mai mult pe costul efectiv al unei sarcini, nu doar pe scoruri.

Publicitate

Presa americană, printre care Axios și Fox Business, a notat că OpenAI și-a prezentat lansarea în termeni de inteligență artificială generală, ceea ce a stârnit imediat dezbateri. Iar prudența rămâne recomandată: un răspuns din zece generat de asistenții AI nu se susține la verificare, indiferent de scorurile obținute la teste.

Ultimele Știri

Descoperă mai multe

Articole selectate pentru tine

Se încarcă...