Gemini vede acum exact ce privești pe ecran: Chrome 149 transformă browserul tău într-un asistent care înțelege contextul

Andrei Negrescu Andrei Negrescu
9 min citire
Chrome 149
Publicitate

Google a lansat simultan două actualizări care marchează o schimbare de paradigmă în modul în care asistentul său de inteligență artificială interacționează cu ceea ce faci pe calculator. Prima — vizibilă imediat pentru orice utilizator de Chrome — este un instrument numit „Select from screen„, disponibil în Chrome 149. A doua — destinată dezvoltatorilor — este integrarea nativă a capabilității „computer use” direct în modelul Gemini 3.5 Flash.

Publicitate

Luate împreună, cele două actualizări răspund la o problemă pe care utilizatorii de asistenți AI o resimt de ani de zile: nevoia de a descrie în cuvinte ceea ce poți arăta direct. De acum, nu mai trebuie să explici ce este pe ecran. Gemini vede exact ce vede și el.

Ce este „Select from screen” și cum funcționează în Chrome 149

Timp de luni întregi, utilizarea Gemini în Chrome a presupus un flux de lucru destul de stângaci: deschizi panoul lateral, descrii ceea ce vrei să analizezi, copiezi textul relevant din pagină, îl lipești în prompt, poate adaugi o captură de ecran făcută manual. Fiecare pas adăuga fricțiune între intenția utilizatorului și răspunsul AI.

„Select from screen” elimină toți acești pași intermediari. Funcția apare în meniul „+” din panoul lateral Gemini — același panou accesibil prin butonul „Ask Gemini” din bara de instrumente a browserului. Odată activată, fila curentă se evidențiază și cursorul se transformă într-un instrument de selecție. Utilizatorul trage o casetă peste orice text, imagine, grafic, tabel sau diagramă de pe pagina activă. Conținutul selectat se atașează automat la câmpul de prompt al Gemini, gata pentru orice întrebare.

Selecția poate fi ajustată — casetele se pot redimensiona trăgând marginile sau pot fi mutate întregi. Mai multe selecții pot fi adăugate simultan, din zone diferite ale aceleiași pagini. Dacă o selecție este greșită, un clic pe X din colțul dreapta-sus al casetei o elimină. Panoul Gemini închis resetează toate selecțiile.

Funcția este disponibilă acum în Chrome 149 pentru utilizatorii autentificați care nu navighează în modul Incognito. Dacă nu apare imediat, Google recomandă repornirea browserului.

Gemini 3.5 Flash
Funcția este disponibilă acum în Chrome 149

De ce „Select from screen” este mai mult decât o funcție de comoditate

Gemini în Chrome putea deja, înainte de această actualizare, să rezume întreaga pagină activă, să compare informații din mai multe file deschise simultan și să răspundă la întrebări despre conținutul vizibil. Aceste capacități au fost introduse în ianuarie 2026, odată cu actualizarea Gemini 3 care a adus panoul lateral persistent și funcția „Auto browse” pentru sarcini cu mai mulți pași.

Publicitate

Problema cu rezumatul întregii pagini este că mai mult context nu înseamnă întotdeauna context mai bun. Un tabel de date îngropat la jumătatea unui raport lung. O grilă de comparație a produselor pe o pagină de retailer. Două blocuri de specificații pe care utilizatorul vrea să le analizeze comparativ. În fiecare dintre aceste scenarii, a trimite întreaga pagină ca context înseamnă a lăsa modelul să ghicească ce este relevant. Selecția precisă elimină această ambiguitate.

Analogia cea mai exactă este Circle to Search pe dispozitivele Android. Lansată în 2024, Circle to Search permite utilizatorilor să încercuiască orice element de pe ecranul telefonului pentru a iniția o căutare Google — fără să iasă din aplicația curentă. Google a anunțat în februarie 2026 că Circle to Search procesează miliarde de interogări pe lună și a ajuns pe peste 300 de milioane de dispozitive Android. „Select from screen” aduce același model de interacțiune pe desktopul computerului, integrat direct în fluxul de lucru al browserii.

Gemini 3.5 Flash cu „computer use”: ce înseamnă pentru dezvoltatori și pentru viitorul agenților AI

Simultan cu lansarea „Select from screen” pentru utilizatorii obișnuiți, Google a anunțat  că modelul Gemini 3.5 Flash include acum nativ capabilitatea „computer use” — disponibilă prin Gemini API.

Această integrare înlocuiește modelul separat Gemini 2.5 Computer Use, care exista anterior ca o entitate distinctă în ecosistemul Google AI. Acum, capabilitatea este parte integrantă din Gemini 3.5 Flash, alături de instrumentele de grounding existente — căutare Google și Maps.

Publicitate

Ce înseamnă concret „computer use” pentru un model AI? Capacitatea de a percepe interfețe software — ferestre, butoane, meniuri, câmpuri de text — prin intermediul capturilor de ecran și de a interacționa cu ele prin comenzi simulate de mouse și tastatură, exact cum ar face un utilizator uman. Spre deosebire de automatizările tradiționale bazate pe cod — care necesită scriere de scripturi specifice pentru fiecare aplicație — un agent bazat pe „computer use” poate opera pe orice aplicație vizuală fără nicio instrucție prealabilă despre structura acesteia.

Agenții construiți pe Gemini 3.5 Flash pot acum să vadă, să raționeze și să ia acțiuni în browsere, aplicații mobile și medii desktop, fără a se baza pe un model separat. Google poziționează această capabilitate pentru sarcini de lungă durată, cum ar fi testarea continuă a software-ului, fluxuri de lucru enterprise și alte automatizări cu mai mulți pași.

Garanții de securitate integrate în arhitectura computer use

Puterea unui agent AI care poate vedea și controla un computer este, evident, și sursa principalei îngrijorări de securitate asociate acestei tehnologii: ce se întâmplă dacă agentul este manipulat să execute acțiuni nedorite?

Google a inclus în documentația tehnică a capabilității „computer use” din Gemini 3.5 Flash două mecanisme de protecție explicite. Primul este cerința de confirmare explicită din partea utilizatorului pentru acțiunile sensibile sau ireversibile — agentul nu execută automat operațiuni care nu pot fi anulate fără a solicita aprobare umană. Al doilea este oprirea automată a sarcinii în cazul în care este identificată o injecție de prompt indirectă — o tehnică prin care conținut malițios dintr-o pagină web încearcă să deturneze instrucțiunile date agentului.

Publicitate

Aceste garanții sunt integrate la nivel de model, nu doar la nivel de aplicație — ceea ce înseamnă că orice dezvoltator care construiește pe Gemini 3.5 Flash le moștenește automat în produsul său. Este o abordare diferită față de cea a unor competitori care lasă implementarea măsurilor de securitate exclusiv în sarcina echipelor de produs.

Cum a evoluat Gemini în Chrome: de la chatbot la asistent contextual

Actualizarea  vine la capătul unui an de evoluție accelerată a Gemini în Chrome, care urmărește o direcție clară: transformarea asistentului dintr-un chatbot în care trebuie să descrii manual contextul, într-un partener care înțelege automat ce se întâmplă pe ecran.

Cronologia este relevantă. Actualizarea din ianuarie 2026 a introdus panoul lateral persistent și funcția „Auto browse” pentru sarcini cu mai mulți pași. În luna iunie, o altă expansiune a adăugat posibilitatea de a programa întâlniri prin Calendar, de a verifica Maps, de a redacta emailuri în Gmail și de a pune întrebări despre videoclipuri YouTube — toate fără a părăsi pagina curentă. Tot în iunie a apărut suportul pentru Nano Banana 2, care permite transformarea imaginilor de pe pagini prin prompturi text în panoul lateral.

„Select from screen” se încadrează în această traiectorie ca un strat de precizie a inputului. În timp ce funcțiile anterioare extind ce poate face Gemini după ce primește o întrebare, aceasta schimbă ce furnizează utilizatorul înainte de a o pune. Este un tip diferit de upgrade: mai puțin despre capabilități, mai mult despre acuratețea contextului.

Anthropic, Microsoft și OpenAI — toți în aceeași cursă

Google nu este singurul jucător care a integrat capabilități de „computer use” în modelele sale. Anthropic a lansat în 2024 funcționalitatea Computer Use pentru modelele Claude, permițând agenților construiți pe Claude 3.5 Sonnet să interacționeze cu interfețe grafice. Microsoft integrează capacități similare în Copilot prin intermediul platformei Azure AI. OpenAI lucrează la propria sa arhitectură de agenți autonomi.

Ceea ce diferențiază abordarea Google față de concurență este integrarea directă în cel mai utilizat browser din lume — Chrome deține peste 65% din piața globală a browserelor, potrivit datelor StatCounter din mai 2026. Aceasta înseamnă că funcționalitățile Gemini nu sunt accesibile doar celor care aleg explicit să folosească un asistent AI separat, ci tuturor utilizatorilor Chrome care acceptă să activeze panoul Gemini.

La scara globală a Chrome, chiar și o rată scăzută de adoptare a „Select from screen” înseamnă zeci de milioane de utilizatori care interacționează zilnic cu o funcție de AI contextual.

Poate un browser să devină, de fapt, un asistent care te înțelege cu adevărat?

Actualizarea nu este o funcție izolată. Este o piesă dintr-un puzzle pe care Google îl asamblează sistematic: browserul ca platformă pentru un asistent AI care înțelege contextul utilizatorului în timp real, fără ca acesta să fie nevoit să descrie, să copieze sau să explice manual ceea ce are în fața ochilor.

„Select from screen” și integrarea nativă a „computer use” în Gemini 3.5 Flash merg în aceeași direcție. Prima reduce fricțiunea pentru utilizatorul obișnuit. A doua deschide ușa pentru agenți autonomi care pot executa sarcini complexe, cu mai mulți pași, pe orice platformă digitală, fără cod personalizat pentru fiecare aplicație în parte.

Dacă această direcție se va confirma comercial — dacă utilizatorii vor adopta aceste funcții la scara necesară pentru a justifica investiția Google în Gemini — browserul care domină 65% din piața mondială ar putea deveni, în câțiva ani, mai puțin un instrument de navigare și mai mult un partener digital care știe, în fiecare moment, exact ce privești.

Cum poți controla nivelul de gândire al lui Google Gemini: Noua funcție explicată

Ultimele Știri

Descoperă mai multe

Articole selectate pentru tine

Se încarcă...