Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog.developers.googleblog.developers.googleblog+1.Google DeepMind lanzó EmbeddingGemma 2 el martes 6 de octubre. Este modelo de pesos abiertos convierte texto, código, imágenes, video y audio en un espacio de incrustación compartido de 768 dimensiones, siendo lo suficientemente ligero para ejecutarse en teléfonos y computadoras portátiles. El modelo cuenta con 740 millones de parámetros, está construido sobre la arquitectura Gemma 4 y se distribuye bajo la licencia comercialmente permisiva Apache 2.0.developers.googleblog+1
Este lanzamiento expande el trabajo de incrustación en el dispositivo de Google más allá del texto. Las incrustaciones convierten el contenido en números que capturan su significado, lo cual es fundamental para las herramientas de búsqueda y los sistemas de generación aumentada por recuperación (RAG). Google señaló que los desarrolladores pueden usar el modelo para encontrar un clip de video específico a partir de una nota de voz o buscar en horas de grabaciones de audio mediante una consulta de texto. El primer EmbeddingGemma, un modelo de solo texto de 308 millones de parámetros basado en Gemma 3, se lanzó en septiembre de 2025 y ha superado los 20 millones de descargas.blog+1
Los desarrolladores no necesitan cargar el modelo completo. Según la guía de Google, el núcleo de texto y código tiene 270 millones de parámetros, un codificador de visión añade 170 millones y un codificador de audio otros 300 millones. Cada combinación produce vectores en el mismo espacio, por lo que una consulta realizada con la configuración de solo texto puede compararse directamente con documentos procesados con el modelo completo. Todas las entradas comparten una ventana de contexto de 8,192 tokens, cuatro veces mayor que la del modelo original. Esto permite procesar hasta 29 imágenes, 58 fotogramas de video o 5.5 minutos de audio en una sola entrada.unite+2
Investing.com informó que el modelo obtuvo una puntuación de 78.68 en la prueba de código del Massive Text Embedding Benchmark, un aumento de 9.92 puntos respecto a los 68.76 de su predecesor. Una técnica llamada Matryoshka Representation Learning permite a los desarrolladores reducir los vectores a tan solo 128 dimensiones, lo que reduce el almacenamiento hasta seis veces. La guía de Google indica que los vectores de 256 dimensiones mantienen aproximadamente el 95% de la calidad total en la recuperación de imágenes, video y voz. Con 128 dimensiones, la calidad de recuperación multimodal cae a cerca del 75%.investing+1
La ficha técnica del modelo indica que EmbeddingGemma 2 no ha recibido ajustes de seguridad posteriores al entrenamiento, según Unite.AI. Esto deja la responsabilidad de las salvaguardas a nivel de aplicación en manos de los desarrolladores.unite
Con cuantización en un Pixel 11 Pro, los pesos de solo texto utilizan unos 191 megabytes de memoria activa y el modelo multimodal completo emplea unos 567 megabytes, según Google. Seeking Alpha informó que la aplicación Google AI Edge Gallery añadirá dos demostraciones basadas en este modelo. Instant Media Search permite a los usuarios buscar fotos y videos locales mediante descripciones, y Video Moments Finder puede localizar escenas como "un perro atrapando un frisbee" sin necesidad de transcribir el audio previamente. Google también presentó Google AI Edge Foresight para Mac, una aplicación experimental que busca en transcripciones de reuniones, notas, imágenes y documentos almacenados en una computadora.tradingview+1
Los pesos ya están disponibles en Hugging Face y Kaggle. Google afirma que el modelo llegará a ML Kit para Android en las próximas semanas, con soporte para aceleración de hardware en dispositivos compatibles. La disponibilidad en el Gemini Enterprise Agent Platform Model Garden también está "próxima", según Google.investing+1