Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

news.futunnhi-tech+1news.futunnDeepSeek lanserade V4.1 Flash den 10 september, en multimodal Mixture-of-Experts-modell som har 552 miljarder grundparametrar men bara aktiverar en liten del under inferens. Detta markerar ett skifte i hur stora språkmodeller balanserar skala med effektivitet. Inom tre dagar efter lanseringen klättrade modellen till sjätte plats globalt i tokenförbrukning på plattformen OpenRouter, enligt data från Gelonghui.news.futunn
Modellen ersätter DeepSeeks tidigare erbjudanden V4 Flash och V4 Flash Vision, som nu omdirigeras automatiskt till V4.1 Flash via API:et. Från och med den 14 september omdirigeras även alla förfrågningar till V4 Pro-ändpunkten tillfälligt till V4.1 Flash och faktureras till dess lägre pris tills V4.1 Pro lanseras.hi-tech+1
V4.1 Flash är byggd på en Causal Encoder-Decoder-arkitektur med totalt 552 miljarder parametrar, men dess Mixture-of-Experts-design aktiverar bara 8 miljarder parametrar under indatabehandling och 16 miljarder under utdatagenerering. Det är en minskning från 13 miljarder aktiverade per token i tidigare V4 Flash, som hade totalt 284 miljarder parametrar.hackernoon+2
Modellen stöder ett kontextfönster på upp till en miljon tokens och använder en omdesignad KV-cache som lagrar ungefär 890 byte per token, cirka en fjärdedel av minnesavtrycket för V4 Flash. För organisationer som kör stora arbetsbelastningar kan minskningen av minneskrav vara viktigare än rena prestandavinster. Modellvikterna är offentligt tillgängliga på Hugging Face under en MIT-licens.mindstudio+2
Den globala tokenförbrukningen för AI-modeller nådde 127 biljoner tokens under veckan 7 till 13 september, en ökning med mer än 10 procent från veckan innan, enligt data från OpenRouter rapporterade av Gelonghui. Kinesiska AI-modeller stod för 61,17 biljoner av dessa tokens och behöll därmed sitt försprång före amerikanska modeller för tjugonde veckan i rad.news.futunn
V4.1 Flash debuterade på sjätte plats med 4,94 biljoner förbrukade tokens under sina första tre dagar, medan Xiaomis MiMo-V2.5 ökade med 230 procent jämfört med veckan innan och tog femteplatsen. Alibaba Cloud lanserade samtidigt sin egen värdbaserade plattform för DeepSeek-V4.1-Flash den 13 september, med API-tillgång och en Token Plan integrerad med verktyg som Qoder och Codex.gurufocus+1
Vid maximal resonemangsansträngning fick V4.1 Flash 74,2 på DeepSWE v1.1, 90,6 på Terminal-Bench 2.1 och 88,1 på CyberGym, enligt DeepSeeks egna utvärderingar. Modellen visade också starka multimodala resultat, inklusive 95,6 på DocVQA och 56,5 på MMMU-Pro.flowtivity+1
V4.1 Flash ligger dock efter DeepSeeks egen V4 Pro på flera kunskaps- och resonemangsbenchmarks, och dess resultat för lång kontext på LongBench-V2 på 45,2 hamnar under V4 Pro:s 51,5. DeepSeek har inte publicerat VRAM-krav, riktmärken för inferenshastighet eller vägledning för batchstorlek, vilket gör att planeringen för lokal driftsättning i stor utsträckning lämnas till utvecklarnas egna tester.hackernoon