Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

weex+1weexrocm.blogs.amd+1AMD Advanced Micro Devices, Inc. hat am 24. Juli Instella-MoE veröffentlicht, ein vollständig offenes Mixture-of-Experts-Sprachmodell mit insgesamt 16 Milliarden Parametern, das von Grund auf auf AMD Instinct MI300X und MI325X GPUs trainiert wurde. Die Veröffentlichung umfasst Modellgewichte aus jeder Trainingsphase, Trainingskonfigurationen, Datenmischungen, Zwischen-Checkpoints und Inferenzcode, was sie zu einer der transparentesten Bereitstellungen großskalierter KI-Modelle bis dato macht.
Instella-MoE aktiviert pro Token nur 2,8 Milliarden seiner 16 Milliarden Parameter. Dadurch bleiben die Inferenzkosten nahe an denen eines viel kleineren Dense-Modells, während das Modell laut AMD Ergebnisse liefert, die unter vollständig quelloffenen Modellen vergleichbarer Größe führend sind. Bei Standard-Benchmarks erzielte das Basismodell einen durchschnittlichen Wert von 76,7 und lag damit vor SmolLM3-3B-Base sowie OLMo-3-7B und zeigte sich konkurrenzfähig mit Open-Weight-Modellen wie Moonlight-16B-A3B. Das Modell unterstützt Kontextfenster von 64K Tokens und durchlief eine sechsstufige Trainingspipeline aus Pre-Training, Mid-Training, Long-Context-Erweiterung, Supervised Fine-Tuning, Direct Preference Optimization und Reinforcement Learning.weex+1
Die Architektur umfasst zwei neuartige Techniken: Gated Multi-head Latent Attention, das ein gelerntes Gate hinzufügt, um weniger nützliche Attention-Antworten selektiv zu filtern, und FarSkip-Collective, eine Verbindungsmethode, die Kommunikation und Berechnung während des Experten-parallelen Trainings überlappt, was zu einer Beschleunigung von 12,7 % beim Pre-Training und einer Reduzierung der Time-to-First-Token bei der Inferenz um bis zu 39,2 % führt.rocm.blogs.amd
Die Veröffentlichung baut auf AMDs früherer Instella-Serie von Modellen mit 3 Milliarden Parametern auf, die 2025 eingeführt wurden, und folgt auf Zyphras ZAYA1, ein weiteres großskaliertes MoE-Modell, das im vergangenen Jahr auf MI300X-Hardware trainiert wurde. Zusammen stehen diese Bemühungen für AMDs Bestreben zu beweisen, dass seine GPUs und das ROCm-Software-Ökosystem die Entwicklung von KI auf Spitzenniveau unterstützen können: ein Markt, der seit Langem von Nvidia und dessen CUDA-Ökosystem dominiert wird.reddit+2
AMD hat Instella-MoE unter einer Research-RAIL-Lizenz für akademische und wissenschaftliche Zwecke lizenziert. Das Unternehmen gab an, diese Arbeit mit größeren Modellen und weiteren Effizienzsteigerungen fortsetzen zu wollen.rocm.blogs.amd