Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. ընկերությունը բաց կոդով թողարկել է TPU Raiden-ը: Սա արտածման օպտիմալացման գրադարան է, որը կառավարում է չիպերի միջև KV-քեշի տվյալների տեղաշարժը խոշոր լեզվական մոդելների սպասարկման ընթացքում: Ռեպոզիտորիան հասանելի է GitHub-ում Apache-2.0 լիցենզիայով, ինչը ամենահստակ ազդանշաններից մեկն է առ այն, որ Google-ը պատրաստ է արտաքին օգտագործմանը հանձնել այն ենթակառուցվածքը, որը երկար ժամանակ համարվում էր փակ իր TPU էկոհամակարգի համար:officechai
Թողարկման մասին առաջինը հայտնել է SemiAnalysis-ը՝ նշելով, որ Raiden-ը զբաղեցնում է արտածման ծրագրային փաթեթի նույն մակարդակը, ինչ NVIDIA-ի NIXL գրադարանը՝ ապահովելով KV-քեշի փոխանցում նախալրացման (prefill) և ապակոդավորման (decode) օրինակների միջև, ինչպես նաև քեշի բեռնաթափման հիմնական գործիքներ:x+1
Ժամանակակից լայնամասշտաբ արտածումը աշխատանքը բաժանում է երկու փուլի. նախալրացում, որը մշակում է մուտքային հարցումը, և ապակոդավորում, որը հերթականությամբ գեներացնում է թոքենները: Երկուսն էլ նույն չիպի վրա աշխատեցնելն անարդյունավետ է, որի պատճառով աշխատանքային համակարգերը դրանք ապակենտրոնացնում են ապարատային առանձին ռեսուրսների միջև: Երբ նախալրացումն ավարտվում է, այն ստեղծում է KV-քեշ, որը մոդելի աշխատանքային հիշողությունն է իր մուտքային տվյալների վերաբերյալ, որը պետք է արագ փոխանցվի ապակոդավորման չիպերին:officechai
Raiden-ը կառավարում է հենց այդ փոխանցումը: Ռեպոզիտորիայի փաստաթղթերի համաձայն՝ գրադարանը ներառում է մոդուլներ մեկ մեքենայի ներսում չիպից չիպ ուղիղ փոխանցման, ցանցի միջոցով վիրտուալ մեքենաների միջև փոխանցման և TPU հիշողությունից քեշի բլոկները հիմնական օպերատիվ հիշողություն (RAM) բեռնաթափելու համար: Ընդհանուր հիշողության ռեժիմը թույլ է տալիս քեշին պահպանվել DRAM-ում նույնիսկ մոդելի սերվերի վերագործարկման դեպքում, ինչը օգտակար է արտադրական ընթացիկ թարմացումների ժամանակ:officechai
Google-ի փաստաթղթերում նշվում է, որ նախագիծը դեռևս ակտիվ մշակման փուլում է և դեռ նախատեսված չէ ընդհանուր արտադրական օգտագործման համար:
Google-ը երբեք չի վաճառել TPU-ները որպես առանձին ապարատային սարքավորում, սակայն իր հատուկ չիպերի հաճախորդների բազան ընդլայնվել է: Anthropic-ը հասանելիություն է ստացել մեկ միլիոն TPU-ների, իսկ OpenAI-ն սկսել է օգտագործել Google TPU-ները իր գործառնությունների որոշ հատվածների համար:officechai
Այդ հաճախորդներից յուրաքանչյուրին անհրաժեշտ են ծրագրային գործիքներ, որոնք համադրելի են NVIDIA GPU-ների շուրջ ձևավորված գործիքակազմի հետ: vLLM և SGLang համակարգերը խորապես ինտեգրված են NIXL-ի հետ. եթե Raiden-ը հասնի նմանատիպ ինտեգրման, NVIDIA-ի վրա հիմնված ապակենտրոնացված սպասարկում իրականացնող ընկերությունները կկարողանան ուղղորդել աշխատանքային ծանրաբեռնվածությունը դեպի TPU-ներ ինժեներական ավելի քիչ ծախսերով:officechai
Ժամկետը համընկնում է նաև NVIDIA-ի սեփական բաց կոդով նախաձեռնության հետ: Օգոստոսի 4-ին NVIDIA-ն հայտարարեց, որ կբացի իր cuFile API-ները և տվյալների պահպանման համակարգը GitHub-ի նոր բազմամատակարար կազմակերպության միջոցով, որի սկզբնական աջակիցների թվում նշված են Google-ը, Intel -ը և Meta -ն:igorslab
Զուգահեռ քայլերը վկայում են արտածման ենթակառուցվածքների արտաքին օգտագործմանն անցնելու համաոլորտային միտման մասին, որոնք մատակարարները նախկինում փակ էին պահում: Google-ի համար հաշվարկը պարզ է. բաց գործիքները նվազեցնում են արտաքին թիմերի համար արտադրական ծանրաբեռնվածության համար TPU-ներ կիրառելու արգելքը, փոխանակ լռելյայն NVIDIA-ի համակարգն ընտրելու միայն այն պատճառով, որ այն ավելի լավ է փաստաթղթավորված բաց աղբյուրներում:officechai
NVIDIA-ն նախկինում պնդում էր, որ իր GPU-ները մնում են մեկ սերունդ առաջ և հանդիսանում են միակ հարթակը, որն աշխատեցնում է յուրաքանչյուր ԱԻ մոդել ամենուր, որտեղ կատարվում են հաշվարկներ: Արդյոք այդ դիրքորոշումը կպահպանվի, քանի որ Google-ը շարունակում է բացել իր համակարգի բաղադրիչները, մնում է առանցքային հարց այն ձեռնարկությունների համար, որոնք ընտրում են, թե որտեղ իրականացնեն լայնամասշտաբ արտածում:officechai