Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.futunn+1officechai+1memeburn+1Alibabas Qwen3.8-Max har tagit förstaplatsen på Artificial Analysis Agentic Index med 55,4 poäng. Den kniper därmed segern före Anthropics Claude Opus 5 med 55,3 poäng och OpenAIs GPT 5.6, enligt den senaste rankingen från analysföretaget som publicerades denna vecka. Resultatet markerar första gången en kinesisk AI-modell toppar listan för agent-kapacitet, som mäter en modells förmåga att lösa komplexa problem i flera steg autonomt.news.futunn+1
Alibabas Hongkong-noterade aktier steg med cirka 7 % efter modellens starka resultat på flera rankningslistor.memeburn
Modellen på 2,4 biljoner parametrar, som presenterades den 3 augusti, använder en "mixture-of-experts"-arkitektur som aktiverar cirka 95 miljarder parametrar per körning. Den fick även 56 poäng på det bredare Artificial Analysis Intelligence Index, vilket placerar den i nivå med Claude Opus 4,8 och före modeller från Google Alphabet Inc. , Meta och xAI.officechai+2
Mycket av Qwen3.8-Max framgångar beror på en förändring i hur den närmar sig uppgifter. Modellen använder i snitt 64 steg i GDPval-AA-utvärderingen, jämfört med 14 för föregångaren Qwen3.7 Max, samtidigt som användningen av input-tokens har ökat cirka 15 gånger. Den extra beräkningskraften ger högre poäng men ökar också kostnaderna per uppgift till 1,14 dollar, mer än en fördubbling från Qwen3.7 Max kostnad på 0,53 dollar.officechai
Alibaba har meddelat att de kommer att släppa modellens vikter nästa vecka, vilket skulle göra Qwen3.8-Max till den största modellen med öppna vikter som finns tillgänglig, ungefär sex gånger större än Alibabas tidigare största öppna släpp. API-priset per token är satt till 2,00 dollar per miljon input-tokens och 6,00 dollar per miljon output-tokens, vilket är billigare än föregångaren.venturebeat+1
Lanseringen förstärker ett mönster där kinesiska labb minskar gapet till amerikanska utvecklare. Moonshot AIs Kimi K3, med 2,8 biljoner parametrar, leder fortfarande bland kinesiska modeller på Intelligence Index med 57 poäng, men Qwen3.8-Max ligger nu bara en poäng bakom. VentureBeat noterade att modellen även presterar bättre än GPT-5.6 Sol Max och Fable 5 på OSWorld-Verified, ett benchmark för användning av stationära datorer.officechai+1
Framgångarna är inte jämna. Qwen3.8-Max hallucineringsfrekvens ökade från 23 % till 40 % i AA-Omniscience-utvärderingen, vilket innebär att den nu försöker besvara frågor den tidigare avböjde och svarar fel på många av dem. Anthropic och OpenAI behåller ledningen i toppen av det övergripande Intelligence Index, och kostnaderna per uppgift för agent-arbete är fortfarande högre än hos flera konkurrenter i samma prestandaklass.officechai