Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

weex+1weexrocm.blogs.amd+1AMD Advanced Micro Devices, Inc. presentó Instella-MoE el 24 de julio, un modelo de lenguaje de mezcla de expertos totalmente abierto con 16 000 millones de parámetros totales, entrenado desde cero en las GPU AMD Instinct MI300X y MI325X. La publicación incluye los pesos del modelo de cada etapa de entrenamiento, las configuraciones de entrenamiento, las mezclas de datos, los puntos de control intermedios y el código de inferencia: lo que lo convierte en uno de los lanzamientos de modelos de IA a gran escala más transparentes hasta la fecha.
Instella-MoE activa solo 2800 millones de sus 16 000 millones de parámetros por token, lo que mantiene los costos de inferencia más cercanos a los de un modelo denso mucho más pequeño, al tiempo que ofrece resultados que, según AMD, lideran entre los modelos totalmente de código abierto de tamaño comparable. En las pruebas de rendimiento estándar, el modelo base logró una puntuación media de 76,7, situándose por delante de SmolLM3-3B-Base y OLMo-3-7B, y compitiendo con modelos de pesos abiertos como Moonlight-16B-A3B. El modelo admite ventanas de contexto de 64 000 tokens y pasó por un proceso de entrenamiento de seis etapas que abarca preentrenamiento, entrenamiento intermedio, extensión de contexto largo, ajuste fino supervisado, optimización directa de preferencias y aprendizaje por refuerzo.weex+1
La arquitectura incorpora dos técnicas novedosas: Gated Multi-head Latent Attention, que añade una puerta aprendida para filtrar de forma selectiva las respuestas de atención de baja utilidad, y FarSkip-Collective, un método de conectividad que superpone la comunicación con el cálculo durante el entrenamiento paralelo de expertos, lo que genera una aceleración del 12,7 % en el preentrenamiento y una reducción de hasta el 39,2 % en el tiempo transcurrido hasta el primer token durante la inferencia.rocm.blogs.amd
La publicación se basa en la serie anterior Instella de AMD con modelos de 3000 millones de parámetros presentados en 2025, y sigue a ZAYA1 de Zyphra, otro modelo MoE a gran escala entrenado en hardware MI300X el año pasado. Juntos, estos esfuerzos representan la campaña de AMD para demostrar que sus GPU y el entorno de software ROCm pueden respaldar el desarrollo de IA a escala frontera, un mercado dominado desde hace tiempo por Nvidia y su ecosistema CUDA.reddit+2
AMD licenció Instella-MoE bajo una licencia Research RAIL para uso académico y de investigación. La empresa afirmó que planea continuar ampliando este trabajo con modelos más grandes y más mejoras de eficiencia.rocm.blogs.amd