Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

weex+1weexrocm.blogs.amd+1AMD-მ (Advanced Micro Devices, Inc. ) 24 ივლისს Instella-MoE წარადგინა, სრულად ღია, ექსპერტთა ნარევის (mixture-of-experts) ენობრივი მოდელი, რომლის ჯამური 16 მილიარდი პარამეტრი ნულიდან გაიწვრთნა AMD Instinct MI300X და MI325X გრაფიკულ პროცესორებზე. რელიზი მოიცავს მოდელის წონებს ტრენინგის თითოეული ეტაპიდან, ტრენინგის კონფიგურაციებს, მონაცემთა ნარევებს, შუალედურ საკონტროლო წერტილებსა და ინფერენციის კოდს, რაც მას დღემდე გამოშვებულ ერთ-ერთ ყველაზე გამჭვირვალე მასშტაბურ AI მოდელად აქცევს.
Instella-MoE თითოეულ ტოკენზე თავისი 16 მილიარდი პარამეტრიდან მხოლოდ 2.8 მილიარდს ააქტიურებს. ეს ინფერენციის დანახარჯებს ბევრად მცირე მკვრივი მოდელების მაჩვენებლებთან აახლოებს და, AMD-ის განცხადებით, მსგავსი ზომის სრულად ღია მოდელებს შორის საუკეთესო შედეგებს უზრუნველყოფს. სტანდარტულ ბენჩმარკებში საბაზო მოდელმა საშუალო ქულა 76.7 დააგროვა, რამაც გადაასწრო SmolLM3-3B-Base-სა და OLMo-3-7B-ს, ხოლო Moonlight-16B-A3B-ის მსგავს ღია წონის მოდელებს ჯანსაღი კონკურენცია გაუწია. მოდელი მხარს უჭერს 64K ტოკენიან კონტექსტურ ფანჯარას და გაიარა ტრენინგის ექვსეტაპიანი პროცესი, რომელიც მოიცავდა წინასწარ ტრენინგს, შუალედურ ტრენინგს, ხანგრძლივი კონტექსტის გაფართოებას, ზედამხედველობით დახვეწას, პირდაპირი პრეფერენციების ოპტიმიზაციასა და განმტკიცებით სწავლებას.weex+1
არქიტექტურა ორ ინოვაციურ ტექნიკას იყენებს: Gated Multi-head Latent Attention, რომელიც ამატებს შესწავლილ ვენტილს დაბალი ეფექტურობის ყურადღების პასუხების სელექციურად გასაფილტრად, და FarSkip-Collective, კავშირის მეთოდი, რომელიც ექსპერტულ-პარალელური ტრენინგისას კომუნიკაციასა და გამოთვლებს აერთიანებს, რაც უზრუნველყოფს წინასწარი ტრენინგის 12.7%-იან დაჩქარებას და ინფერენციის დროს პირველი ტოკენის გენერირების დროის 39.2%-მდე შემცირებას.rocm.blogs.amd
ეს გამოშვება ეფუძნება AMD-ის მიერ 2025 წელს წარდგენილ 3 მილიარდი პარამეტრის მქონე Instella-ს ადრეულ სერიას და მოჰყვება Zyphra-ს ZAYA1-ს, კიდევ ერთ მასშტაბურ MoE მოდელს, რომელიც გასულ წელს MI300X აპარატურაზე გაიწვრთნა. ეს მცდელობები ერთობლივად ასახავს AMD-ის კამპანიას იმის დასამტკიცებლად, რომ მის გრაფიკულ პროცესორებსა და ROCm პროგრამულ უზრუნველყოფას უახლესი თაობის AI-ის შემუშავების მხარდაჭერა შეუძლია. ამ ბაზარზე დიდი ხანია Nvidia და მისი CUDA ეკოსისტემა დომინირებს.reddit+2
AMD-მ Instella-MoE ლიცენზირება Research RAIL ლიცენზიით მოახდინა აკადემიური და კვლევითი გამოყენებისთვის. კომპანიამ განაცხადა, რომ გეგმავს ამ მიმართულებით მუშაობის გაგრძელებას უფრო დიდი მოდელებისა და ეფექტურობის შემდგომი გაუმჯობესების გზით.rocm.blogs.amd