Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

letsdatascience+1google+1letsdatascience+1Google DeepMind, de Alphabet Inc. , lanzó el martes DiffusionGemma, un modelo de lenguaje experimental de código abierto que abandona el enfoque de un token a la vez de los sistemas de IA convencionales en favor de generar bloques completos de texto simultáneamente, ofreciendo lo que la compañía dice que es una inferencia hasta cuatro veces más rápida en GPUs dedicadas.
A diferencia de los modelos autorregresivos estándar que producen texto de forma secuencial, DiffusionGemma utiliza un decodificador basado en difusión que redacta 256 tokens en paralelo con cada pase hacia adelante, desplazando el cuello de botella de la inferencia del ancho de banda de la memoria al cómputo bruto. El modelo es un diseño de mezcla de expertos de 26 mil millones de parámetros que activa solo 3.8 mil millones de parámetros durante la inferencia, lo que le permite ajustarse a los 18GB de VRAM de las GPUs de consumo de gama alta cuando se cuantiza.letsdatascience+2
Google informa de un rendimiento de más de 1.000 tokens por segundo en un solo acelerador Nvidia H100 y más de 700 tokens por segundo en una Nvidia GeForce RTX 5090. La compañía calificó esas cifras como aproximadamente cuatro veces la velocidad de salida de los modelos Gemma autorregresivos de tamaño comparable en cargas de trabajo de un solo usuario.blog+1
Google dijo que trabajó directamente con Nvidia para optimizar DiffusionGemma en toda la línea de hardware del fabricante de chips, desde las GPUs de consumo GeForce RTX 4090 y 5090 hasta los sistemas empresariales Hopper y Blackwell, incluidos DGX Spark y DGX Station para despliegue local. El soporte nativo para el formato de punto flotante de cuatro bits NVFP4 de Nvidia acelera el cómputo con lo que Google describió como "precisión casi sin pérdidas".blog
Los pesos del modelo están disponibles bajo una licencia Apache 2.0 en Hugging Face, y los desarrolladores también pueden acceder a DiffusionGemma a través de Nvidia NIM. El servicio es compatible a través de vLLM, MLX y Hugging Face Transformers.google+1
Google fue explícito al señalar que DiffusionGemma está por detrás de sus modelos estándar Gemma 4 en la calidad general de salida, posicionando el lanzamiento como experimental y dirigido a investigadores que exploran flujos de trabajo críticos de velocidad, como la edición en línea, el relleno de código y la generación de estructuras de texto no lineales. La ventaja de la decodificación paralela también disminuye bajo el servicio en la nube de alta concurrencia, donde los modelos autorregresivos ya pueden saturar el hardware mediante el procesamiento por lotes de solicitudes.letsdatascience+2
El lanzamiento se basa en la investigación más amplia de difusión para texto de Google, que comenzó públicamente con la demostración de Gemini Diffusion en mayo de 2025, y amplía la familia de modelos abiertos Gemma 4 que se lanzó a principios de este mes.Signal Daily News+1