Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

weex+1weexrocm.blogs.amd+1Liepos 24 d. „AMD Advanced Micro Devices, Inc.“ pristatė „Instella-MoE“: visiškai atvirą ekspertų mišinio kalbos modelį su 16 mlrd. bendrų parametrų, nuo nulio apmokytą naudojant „AMD Instinct MI300X“ ir „MI325X“ GPU procesorius. Pristatomą paketą sudaro modelio svoriai iš kiekvieno mokymo etapo, mokymo konfigūracijos, duomenų mišiniai, tarpiniai patikros taškai ir inferencijos kodas, todėl tai yra vienas skaidriausių didelio masto DI modelio išleidimų iki šiol.
„Instella-MoE“ vienam žetonui aktyvuoja tik 2,8 mlrd. iš 16 mlrd. savo parametrų. Tai leidžia išlaikyti inferencijos sąnaudas, artimas daug mažesniam vientisam modeliui, ir kartu užtikrinti rezultatus, kurie, AMD teigimu, pirmauja tarp panašaus dydžio visiškai atvirojo kodo modelių. Standartiniuose lyginamuosiuose testuose bazinis modelis pasiekė vidutinį 76,7 balo rezultatą, aplenkdamas „SmolLM3-3B-Base“ bei „OLMo-3-7B“ ir nenusileisdamas atvirų svorių modeliams, pavyzdžiui, „Moonlight-16B-A3B“. Modelis palaiko 64 tūkst. žetonų konteksto langus ir praėjo šešių etapų mokymo procesą, apimantį pirminį mokymą, tarpinį mokymą, ilgojo konteksto išplėtimą, prižiūrimąjį tikslinimą, tiesioginį pirmenybės optimizavimą ir pastiprinamąjį mokymą.weex+1
Modelio architektūroje panaudotos dvi naujos metodikos: vartų daugiahiatė latentinio dėmesio sistema, pridedanti išmoktus vartus mažai naudingiems dėmesio atsakymams atskirti, ir „FarSkip-Collective“: ryšio metodas, paeiliui derinantis ryšį su skaičiavimais ekspertų lygiagrečiojo mokymo metu. Tai užtikrino 12,7 % greitesnį pirminį mokymą ir iki 39,2 % sutrumpino laiko iki pirmojo žetono trukmę inferencijos metu.rocm.blogs.amd
Šis išleidimas remiasi ankstesne AMD 3 mlrd. parametrų „Instella“ serija, pristatyta 2025 m., ir seka po bendrovės „Zyphra“ sukurtos „ZAYA1“: dar vieno didelio masto MoE modelio, praėjusiais metais apmokyto naudojant „MI300X“ aparatinę įrangą. Kartu šios pastangos atspindi AMD siekį įrodyti, kad jos GPU ir ROCm programinės įrangos paketas gali palaikyti pažangiausių DI modelių kūrimą: rinką, kurioje ilgą laiką dominavo „Nvidia“ ir jos „CUDA“ ekosistema.reddit+2
AMD suteikė „Instella-MoE“ licenciją pagal „Research RAIL“ licenciją akademiniam ir moksliniam naudojimui. Bendrovė pareiškė planuojanti toliau tęsti šiuos darbus kurdama didesnius modelius ir siekdama dar didesnio efektyvumo.rocm.blogs.amd