Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.futunn+1officechai+1memeburn+1Model Qwen3.8-Max od společnosti Alibaba obsadil první místo v žebříčku Agentic Index organizace Artificial Analysis se ziskem 55,4 bodu, čímž těsně předstihl Claude Opus 5 od Anthropicu s 55,3 body a GPT 5.6 od OpenAI, uvádí nejnovější žebříček zveřejněný tento týden. Tento výsledek znamená, že čínský AI model poprvé ovládl žebříček agentních schopností, který měří schopnost modelu autonomně řešit složité, vícekrokové úkoly.news.futunn+1
Akcie Alibaby kótované v Hongkongu po silném výkonu modelu v několika žebříčcích vzrostly o zhruba 7 %.memeburn
Model s 2,4 bilionu parametrů, představený 3. srpna, využívá architekturu mixture-of-experts, která při každém průchodu aktivuje přibližně 95 miliard parametrů. V širším indexu Artificial Analysis Intelligence Index získal 56 bodů, čímž se vyrovnal modelu Claude Opus 4.8 a předstihl modely od společností Google Alphabet Inc. , Meta a xAI.officechai+2
Velká část agentních zisků modelu Qwen3.8-Max pramení ze změny přístupu k úkolům. Model v hodnocení GDPval-AA průměrně provede 64 kroků oproti 14 u svého předchůdce Qwen3.7 Max, přičemž využití vstupních tokenů vzrostlo zhruba patnáctinásobně. Tento dodatečný výpočetní výkon vede k vyššímu skóre, ale také zvyšuje náklady na úkol na 1,14 dolaru, což je více než dvojnásobek oproti 0,53 dolaru u Qwen3.7 Max.officechai
Alibaba uvedla, že příští týden zveřejní váhy modelu, čímž se Qwen3.8-Max stane největším dostupným modelem s otevřenými vahami, zhruba šestkrát větším než předchozí největší otevřené vydání Alibaby. Ceny API jsou stanoveny na 2,00 dolary za milion vstupních tokenů a 6,00 dolarů za milion výstupních tokenů, což je levnější než u předchůdce.venturebeat+1
Toto vydání zintenzivňuje trend, kdy čínské laboratoře dohánějí náskok amerických vývojářů. Model Kimi K3 od Moonshot AI s 2,8 bilionu parametrů stále vede mezi čínskými modely v Intelligence Index se skóre 57, ale Qwen3.8-Max nyní zaostává o pouhý jeden bod. Server VentureBeat poznamenal, že model také překonává GPT-5.6 Sol Max a Fable 5 v OSWorld-Verified, což je benchmark pro používání stolních počítačů.officechai+1
Zisky nejsou rovnoměrné. Míra halucinací u Qwen3.8-Max vzrostla v hodnocení AA-Omniscience z 23 % na 40 %, což znamená, že se nyní pokouší odpovídat na otázky, které dříve odmítal, a v mnoha případech chybuje. Anthropic a OpenAI si udržují náskok na samotném vrcholu celkového Intelligence Index a náklady na agentní práci zůstávají vyšší než u několika konkurentů ve stejné výkonnostní kategorii.officechai