ChatGPT poate acum asculta și vorbi în același timp: ce este GPT-Live

Andrei Negrescu Andrei Negrescu
6 min citire
GPT-Live
Publicitate

OpenAI a lansat o nouă generație de modele vocale pentru ChatGPT, numită GPT-Live. Schimbarea nu este una cosmetică, ci una arhitecturală: pentru prima dată, asistentul poate asculta și răspunde simultan, fără să mai aștepte o pauză de tăcere pentru a-și da seama când utilizatorul a terminat de vorbit.

Publicitate

Compania americană descrie noul sistem drept o generație de modele vocale menite să facă discuțiile cu inteligența artificială să semene mult mai mult cu o conversație reală. Potrivit anunțului oficial al OpenAI, GPT-Live este construit pe o arhitectură full-duplex, ceea ce înseamnă că poate asculta și vorbi simultan. În timpul unei conversații, sistemul poate transmite semnale că este atent, prin sunete scurte precum „aha” sau „da”, poate interveni în discuție rapid sau poate rămâne tăcut atunci când utilizatorul are nevoie de un moment de gândire.

Termenul „full-duplex” provine din telecomunicații, unde descrie o linie telefonică pe care ambii interlocutori pot vorbi și asculta în același timp. Aplicat inteligenței artificiale, conceptul înseamnă că modelul procesează în mod continuu sunetul primit, chiar în timp ce își generează propriul răspuns vocal, fără să mai fie nevoie de o pauză clară de tăcere pentru a stabili momentul în care utilizatorul a încheiat o idee.

Vechiul sistem de voce al ChatGPT, cunoscut drept Advanced Voice Mode, procesa și genera sunet printr-un singur model, ceea ce reducea întârzierile și făcea conversațiile mai fluide. Totuși, interacțiunile rămâneau structurate pe rânduri distincte de vorbire. Modelul trebuia să aștepte ca utilizatorul să termine de vorbit înainte de a răspunde, ceea ce ducea la un dialog rigid. În plus, pentru că detectarea rândului de vorbire se baza pe tăcere, chiar și o pauză scurtă sau un zgomot de fond puteau fi interpretate greșit drept finalul discuției, iar modelul intervenea în momente nepotrivite.

Sistemul anterior funcționa, de fapt, printr-un lanț de procese: vocea utilizatorului era mai întâi transcrisă în text, textul era trimis către model pentru procesare, iar răspunsul generat era transformat din nou în voce înainte de a ajunge la utilizator. GPT-Live elimină acest lanț de transferuri, procesând sunetul de intrare direct, în paralel cu generarea răspunsului.

Cum funcționează, tehnic, delegarea către GPT-5.5?

Deși GPT-Live gestionează fluxul conversației, întrebările complexe nu sunt procesate direct de acest model. Pentru căutări pe internet, raționamente mai avansate sau sarcini care necesită mai multă putere de calcul, sistemul deleagă discret solicitarea către GPT-5.5, cel mai avansat model al companiei la momentul lansării, și readuce rezultatul în conversație imediat ce este gata. În acest timp, GPT-Live poate continua discuția cu utilizatorul, menținând fluxul natural al conversației.

Publicitate

Potrivit unor teste comparative citate de publicația MLQ News, noul model de raționament din spatele GPT-Live obține un scor de 84,2% la testul de raționament științific GPQA, comparativ cu doar 45,3% pentru modelul folosit anterior de Advanced Voice Mode. În testele de preferință realizate cu utilizatori reali, GPT-Live-1 a fost ales în detrimentul vechiului sistem în 75,7% dintre cazuri.

Utilizatorii pot alege între trei niveluri de raționament: „Instant”, pentru răspunsuri rapide, și „Mediu” sau „Ridicat”, pentru situațiile în care preferă ca ChatGPT să acorde mai mult timp gândirii înainte de a răspunde.

OpenAI lansează, deocamdată, două variante ale noului sistem: GPT-Live-1, destinat abonaților plătitori ai planurilor Go, Plus și Pro, și GPT-Live-1 mini, o versiune mai ușoară, disponibilă gratuit, care înlocuiește implicit vechiul Advanced Voice Mode pentru utilizatorii care nu plătesc un abonament. Compania a precizat că modelele sunt lansate global, pe aplicațiile Android și iOS, dar și pe versiunea web a ChatGPT.

Lansarea nu include, cel puțin pentru moment, suport pentru conversații vocale însoțite de video sau de partajarea ecranului, funcții disponibile în continuare doar prin vechiul Advanced Voice Mode. De asemenea, accesul prin interfața de programare (API) nu este încă activ, deși OpenAI a precizat că dezvoltatorii se pot înscrie pentru a fi anunțați atunci când această opțiune va deveni disponibilă.

Publicitate

OpenAI a publicat, odată cu anunțul oficial, un raport de siguranță dedicat noului sistem. Compania a extins evaluările specifice pentru conversațiile vocale, acoperind teme sensibile precum autovătămarea, episoadele de psihoză sau manie, dependența emoțională de inteligența artificială, violența și conținutul sexual. Sistemul include mecanisme care pot ajusta răspunsul chiar în timpul unei propoziții, pot afișa resurse de sprijin în situații de criză sau pot încheia o sesiune considerată cu risc ridicat.

Pentru utilizatorii adolescenți, compania a introdus controale parentale suplimentare și notificări în cazul unor semnale de autovătămare. Sistemul folosește exclusiv voci predefinite, tocmai pentru a preveni imitarea vocii unei persoane reale.

OpenAI nu este singura companie care mizează pe arhitectura full-duplex. Potrivit publicației VentureBeat, ByteDance a lansat propriul sistem, Seeduplex, încă din aprilie, în cadrul aplicației Doubao, revendicând o reducere de aproximativ 50% a răspunsurilor și întreruperilor false comparativ cu sistemul anterior al companiei. Nvidia a introdus, la rândul său, un model similar în ianuarie, numit PersonaPlex, care permite personalizarea vocii folosite de asistent.

Concurența arată clar că interacțiunea vocală full-duplex devine rapid un standard al industriei, nu neapărat un avantaj competitiv exclusiv. Avantajul OpenAI rămâne, cel puțin pentru moment, baza sa uriașă de utilizatori: peste 150 de milioane de persoane folosesc deja funcțiile de voce și dictare ale ChatGPT în fiecare săptămână. Anthropic, compania care dezvoltă asistentul Claude, a introdus propriul mod vocal anul trecut, iar Google integrează de asemenea funcții similare în Gemini Live.

Publicitate

Cum poate fi folosit GPT-Live?

Activarea noii funcții nu presupune pași complicați. Este necesară actualizarea aplicației ChatGPT, disponibilă atât din Google Play Store, cât și din App Store. După actualizare, utilizatorii pot atinge pictograma de voce din aplicație pentru a începe o conversație vocală și pot vorbi în mod natural, fără să mai aștepte un semnal clar că asistentul a terminat de „ascultat”.

Dacă funcția nu este încă vizibilă pentru toți utilizatorii, OpenAI recomandă răbdare, dat fiind că lansarea se desfășoară treptat, la nivel global, în următoarele săptămâni.

Ultimele Știri

Descoperă mai multe

Articole selectate pentru tine

Se încarcă...