Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.futunn+1officechai+1memeburn+1Alibabas Qwen3.8-Max har inntatt førsteplassen på Artificial Analysis sin Agentic Index med en skåre på 55,4. Den kniper dermed seieren foran Anthropics Claude Opus 5 med 55,3 poeng og OpenAIs GPT 5.6, ifølge de ferskeste rangeringene fra analysebyrået denne uken. Resultatet markerer første gang en kinesisk AI-modell topper listen over agent-kapasitet, som måler en modells evne til å løse komplekse oppgaver i flere steg autonomt.news.futunn+1
Alibabas aksjer notert i Hongkong steg rundt 7 % etter modellens sterke prestasjoner på flere rangeringer.memeburn
Modellen på 2,4 billioner parametere, som ble avduket 3. august, bruker en «mixture-of-experts»-arkitektur som aktiverer omtrent 95 milliarder parametere per gjennomkjøring. Den fikk også 56 poeng på den bredere Artificial Analysis Intelligence Index, noe som plasserer den på nivå med Claude Opus 4,8 og foran modeller fra Google Alphabet Inc. , Meta og xAI.officechai+2
Mye av fremgangen til Qwen3.8-Max skyldes en endring i hvordan den tilnærmer seg oppgaver. Modellen bruker i snitt 64 vendinger på GDPval-AA-evalueringen, sammenlignet med 14 for forgjengeren Qwen3.7 Max, mens bruken av input-tokens har økt omtrent 15 ganger. Den ekstra beregningskraften gir høyere skårer, men øker også kostnadene per oppgave til 1,14 dollar, mer enn en dobling fra Qwen3.7 Max sin kostnad på 0,53 dollar.officechai
Alibaba har uttalt at de vil slippe modellens vekter neste uke. Dette vil gjøre Qwen3.8-Max til den største modellen med åpne vekter som er tilgjengelig, omtrent seks ganger større enn Alibabas forrige største åpne utgivelse. API-prisen per token er satt til 2,00 dollar per million input-tokens og 6,00 dollar per million output-tokens, noe som er billigere enn forgjengeren.venturebeat+1
Lanseringen forsterker et mønster der kinesiske laboratorier tetter gapet til amerikanske utviklere. Moonshot AIs Kimi K3, med 2,8 billioner parametere, leder fortsatt blant kinesiske modeller på Intelligence Index med en skåre på 57, men Qwen3.8-Max ligger nå bare ett poeng bak. VentureBeat bemerket at modellen også utkonkurrerer GPT-5.6 Sol Max og Fable 5 på OSWorld-Verified, en referansetest for bruk av stasjonære datamaskiner.officechai+1
Fremgangen er ikke jevn. Qwen3.8-Max sin hallusineringsrate økte fra 23 % til 40 % på AA-Omniscience-evalueringen, noe som betyr at den nå forsøker seg på spørsmål den tidligere avslo, og svarer feil på mange av dem. Anthropic og OpenAI beholder ledelsen helt i toppen av den generelle Intelligence Index, og kostnadene per oppgave for agent-arbeid er fortsatt høyere enn hos flere konkurrenter i samme ytelseskategori.officechai