Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

huggingface+1huggingface+1thenewstackDeepSeek a publié en open source les poids de son premier modèle multimodal, V4-Flash-Vision-Exp, rendant 305 milliards de paramètres disponibles sur Hugging Face sous licence MIT. Ce lancement, effectif le 31 août, vient parachever un déploiement débuté le 21 août lorsque le modèle a fait ses débuts sous forme d'API exclusive sur la plateforme de DeepSeek.huggingface+1
Contrairement aux modèles de vision-langage classiques conçus pour répondre à des questions sur des images, V4-Flash-Vision-Exp est taillé pour les flux de travail autonomes: il analyse les captures d'écran web, les interfaces logicielles et les graphiques afin que les agents IA puissent exécuter des tâches via des appels d'outils. DeepSeek qualifie les capacités de son modèle pour les agents multimodaux de « proches d'Opus-4.8 », le modèle phare d'Anthropic.news.aibase+2
Les résultats de référence publiés sur la page Hugging Face du modèle viennent étayer cette affirmation. Sur ApexBench Pass@1, le modèle a obtenu un score de 36,5 contre 39,4 pour Opus-4.8, tandis que sur Agents' Last Exam, il a atteint 27,3, dépassant légèrement les 25,7 d'Opus-4.8. Les performances pour les agents purement textuels restent solides: le score Terminal Bench 2.1 a légèrement progressé, passant de 82,7 à 83,9 après l'ajout des capacités visuelles. DeepSeek a également reconnu des points faibles: le modèle affiche 57,7 sur NL2Repo, loin derrière les 69,7 d'Opus-4.8.huggingface+1
Un premier comparatif réalisé par The New Stack a confronté V4-Flash-Vision-Exp au modèle Gemini 3.7 Flash de Google (Alphabet Inc. ) sur neuf tâches de vision. Il en ressort une précision équivalente entre les deux modèles, mais le coût de DeepSeek s'avère environ trois fois inférieur, soit 0,0039 $ contre 0,0122 $ au total, au prix d'un temps de réponse plus de deux fois plus long. Sur OpenRouter, V4-Flash-Vision-Exp est proposé à 0,22 $ par million de jetons d'entrée et 0,66 $ par million de jetons de sortie, contre respectivement 0,75 $ et 3,75 $ pour Gemini 3.7 Flash.openrouter+2
Le paquet open source inclut les poids du modèle, le tokenizer, les références d'encodage des prompts ainsi qu'une implémentation d'inférence PyTorch minimale. Des versions quantifiées développées par la communauté pour llama.cpp, LM Studio et Ollama sont apparues quelques heures seulement après la publication. Cette approche « l'API d'abord, les poids ouverts ensuite » reflète une stratégie délibérée: DeepSeek a lancé Harness 0.1.1 pour l'exécution continue de tâches en même temps que les débuts de l'API le 21 août, et ce modèle de vision s'intègre désormais comme la brique perceptuelle d'une boîte à outils pour agents plus vaste.reddit+2