Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiBendrovė „Google Alphabet Inc.“ atvėrė „TPU Raiden“ atvirąjį kodą. Tai DI išvedimo optimizavimo biblioteka, tvarkanti „KV-cache“ duomenų judėjimą tarp lustų didelių kalbos modelių aptarnavimo metu. Kodas pasiekiamas „GitHub“ platformoje pagal „Apache-2.0“ licenciją. Tai vienas aiškiausių signalų, kad „Google“ pasirengusi atverti infrastruktūrą, kuri ilgą laiką buvo laikoma uždara jos TPU ekosistemos dalimi.officechai
Apie šį išleidimą pirmiausia pranešė „SemiAnalysis“, pažymėjusi, kad „Raiden“ užima tą patį DI išvedimo sistemos sluoksnį kaip ir NVIDIA NIXL biblioteka. Ji užtikrina „KV-cache“ perdavimą tarp užklausos apdorojimo (angl. prefill) ir generavimo (angl. decode) instancijų bei siūlo atminties iškėlimo funkcijas.x+1
Šiuolaikinis didelio masto DI išvedimas skaidomas į dvi fazes: užklausos apdorojimą, kai apdorojamas įvesties tekstas, ir generavimą, kai vienas po kito kuriami žetonai (angl. tokens). Abu procesus vykdyti tame pačiame luste yra neefektyvu, todėl gamybinės sistemos juos išskaido atskiruose aparatinės įrangos resursuose. Baigus apdoroti užklausą, sugeneruojama „KV-cache“ atmintis, ji yra modelio darbinė įvesties atmintis, kurią būtina greitai perduoti generavimo lustams.officechai
„Raiden“ valdo šį perdavimą. Remiantis kodo saugyklos dokumentacija, bibliotekoje yra moduliai, skirti tiesioginiam duomenų perdavimui tarp lustų vienoje mašinoje, perdavimui tarp virtualių mašinų tinklu ir atminties blokų iškėlimui iš TPU atminties į pagrindinio kompiuterio RAM. Bendros atminties režimas leidžia išsaugoti podėlį DRAM atmintyje net ir perkrovus modelio serverį, o tai naudinga atliekant įprastus gamybinius atnaujinimus.officechai
„Google“ dokumentacijoje pažymima, kad projektas vis dar yra aktyviai vystomas ir kol kas nėra skirtas visuotiniam gamybiniam naudojimui.
„Google“ niekada nepardavinėjo TPU kaip atskiros aparatinės įrangos, tačiau jos specializuotų lustų klientų gretos išsiplėtė. Bendrovė „Anthropic“ užsitikrino prieigą prie milijono TPU, o „OpenAI“ pradėjo naudoti „Google“ TPU kai kurioms savo operacijoms.officechai
Kiekvienam iš šių klientų reikia programinės įrangos įrankių, lygiaverčių tiems, kurie susiformavo aplink NVIDIA GPU. Tokios sistemos kaip „vLLM“ ir „SGLang“ yra glaudžiai integruotos su NIXL. Jei „Raiden“ pasieks panašią integraciją, įmonės, jau naudojančios NVIDIA pagrindu veikiantį išskaidytą aptarnavimą, galėtų nukreipti užduotis į TPU su mažesnėmis inžinerinėmis sąnaudomis.officechai
Laikas taip pat sutampa su pačios NVIDIA atvirojo kodo iniciatyva. Rugpjūčio 4 d. NVIDIA paskelbė atverianti savo „cuFile“ API ir duomenų saugojimo sistemą per naują kelių tiekėjų „GitHub“ organizaciją, o tarp pradinių kūrėjų nurodyti „Google“, „Intel“ ir „Meta“ .igorslab
Šie lygiagretūs veiksmai rodo visos pramonės posūkį į DI išvedimo infrastruktūros atvėrimą, kurią tiekėjai kadaise laikė uždara. „Google“ skaičiavimas paprastas: atviri įrankiai sumažina barjerą išorinėms komandoms pritaikyti TPU gamybinėms užduotims, užuot automatiškai rinkusis NVIDIA sistemą vien todėl, kad ji geriau aprašyta viešojoje erdvėje.officechai
NVIDIA anksčiau teigė, kad jos GPU išlieka karta priekyje ir yra vienintelė platforma, palaikanti kiekvieną DI modelį visur, kur vyksta skaičiavimai. Ar ši pozicija išliks, „Google“ toliau atveriant savo sistemos dalis, išlieka esminis klausimas įmonėms, besirenkančioms, kur dideliu mastu vykdyti DI išvedimo procesus.officechai