Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.futunn+1officechai+1memeburn+1Alibabas Qwen3.8-Max hat mit einer Punktzahl von 55,4 die Spitzenposition im Agentic Index von Artificial Analysis übernommen und damit knapp Anthropics Claude Opus 5 mit 55,3 Punkten sowie OpenAIs GPT 5.6 überholt, wie aus den neuesten Rankings der Benchmarking-Organisation von dieser Woche hervorgeht. Das Ergebnis markiert das erste Mal, dass ein chinesisches KI-Modell die Spitze der Rangliste für Agentenfähigkeiten anführt, die die Fähigkeit eines Modells misst, komplexe, mehrstufige Probleme autonom zu lösen.news.futunn+1
Die in Hongkong notierten Aktien von Alibaba stiegen nach dem starken Abschneiden des Modells in mehreren Rankings um etwa 7 %.memeburn
Das am 3. August vorgestellte Modell mit 2,4 Billionen Parametern verwendet eine "Mixture-of-Experts"-Architektur, die bei jedem Durchlauf etwa 95 Milliarden Parameter aktiviert. Es erzielte zudem 56 Punkte im breiteren Artificial Analysis Intelligence Index, womit es gleichauf mit Claude Opus 4,8 liegt und Modelle von Google Alphabet Inc. , Meta und xAI übertrifft.officechai+2
Ein Großteil der agentischen Fortschritte von Qwen3.8-Max resultiert aus einer Änderung der Aufgabenbewältigung. Das Modell benötigt im Durchschnitt 64 Schritte in der GDPval-AA-Evaluierung, verglichen mit 14 bei seinem Vorgänger Qwen3.7 Max, wobei der Verbrauch an Input-Tokens um etwa das 15-fache gestiegen ist. Diese zusätzliche Rechenleistung führt zu höheren Punktzahlen, erhöht aber auch die Kosten pro Aufgabe auf 1,14 Dollar, mehr als das Doppelte der 0,53 Dollar von Qwen3.7 Max.officechai
Alibaba hat angekündigt, die Modellgewichte nächste Woche zu veröffentlichen. Damit wäre Qwen3.8-Max das größte Modell mit offenen Gewichten, das verfügbar ist, und etwa sechsmal so groß wie Alibabas bisher größte offene Veröffentlichung. Die API-Preise pro Token wurden auf 2,00 Dollar pro Million Input-Tokens und 6,00 Dollar pro Million Output-Tokens festgelegt, was günstiger ist als beim Vorgängermodell.venturebeat+1
Die Veröffentlichung verstärkt ein Muster, bei dem chinesische Labore den Rückstand zu US-Entwicklern aufholen. Moonshot AIs Kimi K3 führt mit 2,8 Billionen Parametern weiterhin die chinesischen Modelle im Intelligence Index mit einer Punktzahl von 57 an, doch Qwen3.8-Max liegt nun nur noch einen Punkt dahinter. VentureBeat merkte an, dass das Modell auch GPT-5.6 Sol Max und Fable 5 bei OSWorld-Verified, einem Benchmark für die Nutzung von Desktop-Computern, übertrifft.officechai+1
Die Gewinne sind nicht einheitlich. Die Halluzinationsrate von Qwen3.8-Max stieg in der AA-Omniscience-Evaluierung von 23 % auf 40 %, was bedeutet, dass es nun Fragen versucht, die es zuvor abgelehnt hatte, und dabei viele falsch beantwortet. Anthropic und OpenAI behalten die Führung an der Spitze des gesamten Intelligence Index, und die Kosten pro Aufgabe für agentische Arbeit bleiben höher als bei mehreren Wettbewerbern in derselben Leistungsklasse.officechai