Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

weex+1weexrocm.blogs.amd+1AMD Advanced Micro Devices, Inc. , 24 Temmuz'da AMD Instinct MI300X ve MI325X GPU'larında sıfırdan eğitilen 16 milyar toplam parametreli tamamen açık uzmanlar karması (MoE) dil modeli Instella-MoE'yi yayınladı. Sürüm; her eğitim aşamasından model ağırlıklarını, eğitim yapılandırmalarını, veri karışımlarını, ara kontrol noktalarını ve çıkarım kodunu içeriyor. Bu durum, çalışmayı bugüne kadarki en şeffaf büyük ölçekli yapay zeka modeli sürümlerinden biri kılıyor.
Instella-MoE, 16 milyar parametresinden token başına yalnızca 2,8 milyarını aktif hale getiriyor. Bu sayede çıkarım maliyetlerini çok daha küçük yoğun modellerinkine yakın tutarken, AMD'ye göre benzer boyuttaki tamamen açık kaynaklı modeller arasında lider sonuçlar sunuyor. Standart kıyaslamalarda temel model, SmolLM3-3B-Base ve OLMo-3-7B'nin önünde, Moonlight-16B-A3B gibi açık ağırlıklı modellerle de rekabet edebilecek şekilde ortalama 76,7 puan elde etti. 64K token'lık bağlam pencerelerini destekleyen model: ön eğitim, orta eğitim, uzun bağlam uzatması, denetimli ince ayar, doğrudan tercih optimizasyonu ve pekiştirmeli öğrenmeyi kapsayan altı aşamalı bir eğitim sürecinden geçti.weex+1
Mimari iki yeni teknik barındırıyor: Düşük faydalı dikkat yanıtlarını seçici olarak filtrelemek için öğrenilmiş bir kapı ekleyen Kapılı Çok Kafalı Gizil Dikkat ve uzman paralelliğine dayalı eğitim sırasında iletişim ile hesaplamayı çakıştıran FarSkip-Collective. Bu teknikler ön eğitimde %12,7 hızlanma ve çıkarım sırasında ilk token süresinde %39,2'ye varan azalma sağlıyor.rocm.blogs.amd
Bu sürüm, AMD'nin 2025'te tanıttığı 3 milyar parametreli önceki Instella serisine ve geçen yıl MI300X donanımında eğitilen başka bir büyük ölçekli MoE modeli olan Zyphra'nın ZAYA1 modeline dayanıyor. Tüm bu çabalar, AMD'nin GPU'larının ve ROCm yazılım yığınının en ileri düzey yapay zeka geliştirmeyi destekleyebileceğini kanıtlama hamlesini temsil ediyor: bu pazar uzun süredir Nvidia ve CUDA ekosisteminin hakimiyetindeydi.reddit+2
AMD, Instella-MoE'yi akademik ve araştırma kullanımı için Research RAIL lisansı altında lisansladı. Şirket, bu çalışmayı daha büyük modeller ve daha fazla verimlilik iyileştirmeleriyle genişletmeye devam etmeyi planladığını açıkladı.rocm.blogs.amd