Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

weex+1weexrocm.blogs.amd+1AMD Advanced Micro Devices, Inc. a lancé Instella-MoE le 24 juillet, un modèle linguistique à mélange d'experts (MoE) entièrement ouvert de 16 milliards de paramètres au total, entraîné à partir de zéro sur des GPU AMD Instinct MI300X et MI325X. Le lancement comprend les poids du modèle pour chaque étape d'entraînement, les configurations d'entraînement, les mélanges de données, les points de contrôle intermédiaires et le code d'inférence, ce qui en fait l'une des publications de modèles d'IA à grande échelle les plus transparentes à ce jour.
Instella-MoE n'active que 2,8 milliards de ses 16 milliards de paramètres par jeton. Cela maintient les coûts d'inférence proches de ceux d'un modèle dense bien plus petit tout en offrant des résultats qui, selon AMD, sont en tête des modèles entièrement open source de taille comparable. Sur les benchmarks standards, le modèle de base a obtenu un score moyen de 76,7, devant SmolLM3-3B-Base et OLMo-3-7B, et rivalise avec des modèles aux poids ouverts tels que Moonlight-16B-A3B. Le modèle prend en charge des fenêtres de contexte de 64 000 jetons et a suivi un pipeline d'entraînement en six étapes comprenant le pré-entraînement, le mi-entraînement, l'extension à contexte long, le réglage fin supervisé, l'optimisation directe des préférences et l'apprentissage par renforcement.weex+1
L'architecture intègre deux nouvelles techniques: la Gated Multi-head Latent Attention, qui ajoute une porte perméable apprise pour filtrer sélectivement les réponses d'attention peu utiles, et FarSkip-Collective, une méthode de connectivité qui chevauche la communication et le calcul lors de l'entraînement parallèle d'experts. Cela génère une accélération de 12,7 % lors du pré-entraînement et une réduction allant jusqu'à 39,2 % du temps d'obtention du premier jeton lors de l'inférence.rocm.blogs.amd
Ce lancement s'appuie sur la série précédente Instella de modèles à 3 milliards de paramètres d'AMD introduite en 2025 et fait suite à ZAYA1 de Zyphra, un autre modèle MoE à grande échelle entraîné l'an dernier sur le matériel MI300X. Ensemble, ces efforts s'inscrivent dans la campagne d'AMD pour prouver que ses GPU et sa suite logicielle ROCm peuvent prendre en charge le développement d'IA de pointe, un marché longtemps dominé par Nvidia et son écosystème CUDA.reddit+2
AMD a publié Instella-MoE sous licence Research RAIL à des fins académiques et de recherche. L'entreprise a indiqué qu'elle prévoyait de poursuivre ces travaux avec des modèles plus volumineux et d'autres améliorations d'efficacité.rocm.blogs.amd