Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

huggingface+1huggingface+1thenewstackDeepSeek ha publicado en código abierto los pesos de su primer modelo multimodal, V4-Flash-Vision-Exp, poniendo a disposición 305.000 millones de parámetros en Hugging Face bajo la licencia MIT. El lanzamiento, publicado el 31 de agosto, marca la conclusión de un despliegue que comenzó el 21 de agosto, cuando el modelo debutó únicamente como API en la plataforma de DeepSeek.huggingface+1
A diferencia de los modelos de visión y lenguaje convencionales diseñados para responder preguntas sobre imágenes, V4-Flash-Vision-Exp está creado para flujos de trabajo con agentes: procesa capturas de pantalla web, interfaces de software y gráficos para que los agentes de IA ejecuten tareas a través de llamadas a herramientas. DeepSeek describe las capacidades del modelo para agentes multimodales como "cercanas a Opus-4.8", el modelo insignia de Anthropic.news.aibase+2
Los resultados de las pruebas de rendimiento publicados en la página de Hugging Face del modelo respaldan esa afirmación. En ApexBench Pass@1, el modelo obtuvo 36,5 frente a los 39,4 de Opus-4.8, mientras que en Agents' Last Exam alcanzó 27,3, superando por poco los 25,7 de Opus-4.8. El rendimiento en tareas de agentes basadas solo en texto se mantuvo estable: Terminal Bench 2.1 subió de 82,7 a 83,9 tras añadir la capacidad visual. DeepSeek también reconoció debilidades: el modelo obtuvo 57,7 en NL2Repo, muy por detrás de los 69,7 de Opus-4.8.huggingface+1
Una comparación inicial realizada por The New Stack enfrentó a V4-Flash-Vision-Exp con Gemini 3.7 Flash de Alphabet Inc. en nueve tareas de visión, y concluyó que ambos modelos igualaron su precisión. Sin embargo, el costo de DeepSeek fue de aproximadamente un tercio ($0,0039 frente a $0,0122 en total), aunque tardó más del doble de tiempo en responder. En OpenRouter, V4-Flash-Vision-Exp cotiza a $0,22 por millón de tokens de entrada y $0,66 por millón de tokens de salida, en comparación con los $0,75 y $3,75 de Gemini 3.7 Flash, respectivamente.openrouter+2
El paquete de código abierto incluye los pesos del modelo, el tokenizador, referencias de codificación de prompts y una implementación mínima de inferencia en PyTorch. Versiones cuantizadas creadas por la comunidad para llama.cpp, LM Studio y Ollama aparecieron a las pocas horas del lanzamiento. El enfoque de lanzar primero la API y después los pesos abiertos responde a una estrategia deliberada: DeepSeek presentó Harness 0.1.1 para la ejecución continua de tareas junto con el debut de la API el 21 de agosto, y su modelo de visión ahora se posiciona como la capa de percepción dentro de un conjunto más amplio de herramientas para agentes.reddit+2