Alibaba a lansat luni Qwen3.8-Max, modelul pe care îl prezintă drept cel mai capabil din familia Qwen. Compania anunță 2.400 de miliarde de parametri în total și 95 de miliarde de parametri activi la fiecare interogare. În notația americană, cifra apare scrisă drept 2,4 trilioane de parametri. Modelul poate fi folosit deja prin QwenCloud. Greutățile urmează să fie publicate săptămâna viitoare, spune Alibaba. Ar fi prima dată când compania oferă în regim deschis un model de această dimensiune.
Bursa a reacționat imediat. Acțiunile Alibaba au urcat cu 4,5% în tranzacțiile de dinaintea deschiderii sesiunii de la New York și cu 7% la Hong Kong.
Ce a anunțat, concret, Alibaba
Compania descrie Qwen3.8-Max ca fiind bun la patru lucruri: programare, sarcini reale de muncă, operare autonomă pe termen lung și înțelegere multimodală a documentelor, a clipurilor video și a imaginilor.
Lansarea include un tabel complet de benchmark-uri și documentație tehnică. Este o schimbare față de prima apariție a modelului, care venise fără date măsurabile.
De unde vine diferența dintre 2.400 de miliarde și 95 de miliarde
Raportul dintre cele două cifre spune ceva despre arhitectură. Un model care are 2.400 de miliarde de parametri, dar activează doar 95 de miliarde, folosește o structură cu experți multipli.
Practic, rețeaua este împărțită în subrețele specializate. Pentru fiecare fragment de text procesat se aprinde doar o parte din ele.
Avantajul este costul. Modelul păstrează „memoria” unui sistem uriaș, dar consumă la rulare mult mai puțin decât ar consuma un model dens de aceeași mărime. Dezavantajul este că tot are nevoie de suficientă memorie pentru a ține întreaga rețea încărcată.
O fereastră de context de 1 milion de tokeni
Fiecare interogare poate folosi până la 1 milion de tokeni de context. Asta acoperă aproximativ 750.000 de cuvinte de intrare, potrivit South China Morning Post.
Cifra este ușor de tradus în situații reale. Un milion de tokeni înseamnă câteva mii de pagini de text livrate modelului dintr-o singură mișcare, fără să fie nevoie de tăieri și rezumate intermediare.
Șaisprezece zile de programare fără intervenție umană
Cel mai neobișnuit test anunțat de companie ține de scris cod. Alibaba spune că modelul a rulat peste 16 zile într-un regim complet autonom.
În acest interval a adunat 265 de commit-uri, 127 de pull request-uri și 151 de tichete deschise, într-un depozit de software construit de el însuși. Compania precizează că nu a existat intervenție umană pe parcurs.
Un al doilea test a fost o competiție directă. Modelul a intrat în concurs cu 526 de echipe formate din oameni, a rezolvat sarcinile în limita de 24 de ore și a terminat înaintea a 87% dintre participanți.
Testele sunt raportate de Alibaba, nu de un evaluator independent. Până la verificări externe, merită citite ca demonstrații de marketing bine documentate.
Rapoarte de 200 de pagini și 100 de ore de video
Pentru munca cu documente, Alibaba susține că modelul digeră rapoarte financiare de peste 200 de pagini. La video, limita anunțată trece de 100 de ore de material.
Rezultatul nu este un simplu rezumat. Compania spune că modelul transformă materialul în baze de cunoștințe structurate, în care utilizatorul poate căuta ulterior.
Alte două exemple date de Alibaba sunt mai spectaculoase. Modelul poate reconstrui aplicații software doar citind capturi de ecran și poate transforma planuri de arhitectură bidimensionale în randări tridimensionale.

Ce arată benchmark-urile Qwen3.8-Max față de Fable 5
Alibaba a publicat comparații directe cu Fable 5, modelul Anthropic. Pe mai multe sarcini de programare și de agent general, cele două se așază la niveluri apropiate.
Pe PaperBench, Qwen3.8-Max obține 93,0 puncte, față de 88,8 pentru Fable 5. Pe IFBench, un test de capabilitate generală, diferența este mult mai mare: 82,8 față de 63,5.
Fable 5 rămâne în față la alte măsurători. Printre ele, SWE-bench Pro și majoritatea sarcinilor de agent vizual.
Cum se citesc aceste cifre
Concluzia rezonabilă este că modelele sunt apropiate, cu puncte tari diferite. Un scor mare pe un benchmark nu garantează un comportament bun în producție.
Diferența reală se vede de obicei după câteva săptămâni de testare publică, când apar și cazurile în care modelul greșește.
De la scena din Shanghai la lansarea oficială
Alibaba arătase o versiune preliminară luna trecută, la World Artificial Intelligence Conference din Shanghai. Se numea Qwen3.8-Max-Preview și nu venea cu date de benchmark.
Lansarea de luni completează imaginea. Este un tipar pe care companiile chineze îl repetă des: anunț de scenă, apoi lansare cu documentație la câteva săptămâni distanță.
QwenWork intră în beta publică
În aceeași zi, Alibaba a lansat și QwenWork, o platformă de productivitate care adună mai multe instrumente într-un singur produs. Este disponibilă în beta publică.
Potrivit South China Morning Post, ținta sunt rivali precum WorkBuddy de la Tencent și Kimi Work de la Moonshot AI. Presiunea pe acest segment a crescut brusc după ce Moonshot AI a oferit gratuit modelul Kimi K3.
380 de miliarde de yuani pentru infrastructură
Efortul are o susținere financiară pe măsură. Alibaba s-a angajat să investească peste 380 de miliarde de yuani, adică aproximativ 53 de miliarde de dolari, în cloud și inteligență artificială pe parcursul a trei ani.
Banii merg în centre de date, acceleratoare și servicii. Fără această infrastructură, un model cu context de 1 milion de tokeni nu ar putea fi oferit comercial la scară.
Ce înseamnă pentru dezvoltatori
Punctul cel mai important pentru comunitatea tehnică este promisiunea de greutăți deschise. Versiunile anterioare din familia Qwen au fost publicate liber și au devenit una dintre cele mai folosite baze pentru modele derivate.
Dacă Alibaba respectă calendarul, dezvoltatorii vor putea rula local un model comparabil cu sistemele comerciale de top. Rămâne însă bariera de hardware: un model de această mărime nu încape pe o placă video de consum.
Pentru firmele europene apare și o întrebare de conformitate. Rularea locală elimină trimiterea datelor către un furnizor din afara Uniunii Europene, ceea ce simplifică discuția despre protecția datelor.
Ce rămâne de verificat
Primul test este publicarea greutăților. Al doilea ține de siguranță.
Modelele care lucrează zile întregi fără supraveghere ridică întrebări noi despre control. Industria discută deja despre acest risc, după ce Anthropic a recunoscut că modelele sale au fost folosite în atacuri informatice, iar cursa produselor bazate pe agenți continuă și în Occident, unde OpenAI pregătește propriile dispozitive.
Surse: anunțul și documentația tehnică publicate de Qwen, informații raportate de South China Morning Post și datele de infrastructură ale Alibaba Cloud.







