Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc.-მა open-source გახადა TPU Raiden: ინფერენსის ოპტიმიზაციის ბიბლიოთეკა, რომელიც მართავს KV-ქეშის მონაცემთა გადაადგილებას ჩიპებს შორის ენობრივი დიდი მოდელების მუშაობისას. რეპოზიტორი ხელმისაწვდომია GitHub-ზე Apache-2.0 ლიცენზიით, რაც ერთ-ერთი ყველაზე ნათელი სიგნალია იმისა, რომ Google მზადაა გახსნას ინფრასტრუქტურა, რომელიც დიდხანს ითვლებოდა მისი TPU ეკოსისტემის ექსკლუზიურ საკუთრებად.officechai
გამოშვების შესახებ პირველად SemiAnalysis-მა განაცხადა. მან აღნიშნა, რომ Raiden ინფერენსის სტეკში იმავე დონეს იკავებს, რასაც NVIDIA-ს NIXL ბიბლიოთეკა, და უზრუნველყოფს KV-ქეშის გადაცემას prefill და decode ინსტანციებს შორის, ქეშის ოფლოუდინგის პრიმიტივებთან ერთად.x+1
თანამედროვე მასშტაბური ინფერენსი სამუშაოს ორ ფაზად ყოფს: prefill, რომელიც ამუშავებს შეყვანილ მოთხოვნას, და decode, რომელიც ტოკენებს თითო-თითოდ აგენერირებს. ორივეს ერთ ჩიპზე გაშვება არაეფექტურია, ამიტომ საწარმოო სისტემები მათ ტექნიკის ცალკეულ ჯგუფებად ყოფენ. prefill ფაზის დასრულებისას იქმნება KV-ქეში: მოდელის მიმდინარე მეხსიერება შეყვანილი მონაცემების შესახებ, რომელიც სწრაფად უნდა გადაეცეს decode ჩიპებს.officechai
Raiden სწორედ ამ გადაცემას მართავს. რეპოზიტორის დოკუმენტაციის თანახმად, ბიბლიოთეკა მოიცავს მოდულებს ერთი მანქანის შიგნით ჩიპიდან ჩიპზე პირდაპირი გადაცემისთვის, ქსელის მეშვეობით ვირტუალურ მანქანებს შორის გადაცემისთვის და TPU მეხსიერებიდან ქეშის ბლოკების ჰოსტის RAM-ში გადატანისთვის. გაზიარებული მეხსიერების რეჟიმი საშუალებას იძლევა ქეში შენარჩუნდეს DRAM-ში მოდელის სერვერის გადატვირთვის შემთხვევაშიც კი, რაც მოსახერხებელია გეგმური განახლებების დროს.officechai
Google-ის დოკუმენტაციაში აღნიშნულია, რომ პროექტი ჯერ კიდევ აქტიური შემუშავების პროცესშია და ჯერ არ არის განკუთვნილი ზოგადი საწარმოო გამოყენებისთვის.
Google-ს TPU-ები ცალკეულ ტექნიკად არასდროს გაუყიდია, თუმცა მისი ჩიპების მომხმარებელთა ბაზა გაფართოვდა. Anthropic-მა მოიპოვა წვდომა მილიონ TPU-ზე, ხოლო OpenAI-მ დაიწყო Google TPU-ების გამოყენება თავისი ოპერაციების ნაწილისთვის.officechai
თითოეულ ამ მომხმარებელს სჭირდება პროგრამული ინსტრუმენტები, რომლებიც NVIDIA GPU-ების ირგვლივ შექმნილი ინსტრუმენტების ანალოგიური იქნება. ისეთი ფრეიმვორკები, როგორიცაა vLLM და SGLang, ღრმად არის ინტეგრირებული NIXL-თან. თუ Raiden მსგავს ინტეგრაციას მიაღწევს, კომპანიებს, რომლებიც უკვე იყენებენ NVIDIA-ზე დაფუძნებულ დეზაგრეგირებულ სერვინგს, შეეძლებათ სამუშაო დატვირთვები TPU-ებისკენ ნაკლები ინჟინრული დანახარჯით მიმართონ.officechai
ეს დროში ემთხვევა NVIDIA-ს საკუთარ open-source ინიციატივასაც. 4 აგვისტოს NVIDIA-მ გამოაცხადა, რომ გახსნის თავის cuFile API-ებსა და შენახვის სტეკს ახალი, მრავალპროფილური GitHub ორგანიზაციის მეშვეობით, სადაც თავდაპირველ მთავარშემნახველებად Google, Intel და Meta არიან დასახელებული.igorslab
ეს პარალელური ნაბიჯები მიუთითებს ინდუსტრიის მასშტაბით ტენდენციაზე ინფერენსის ინფრასტრუქტურის გახსნისკენ, რასაც მწარმოებლები ადრე დახურულად ინახავდნენ. Google-ისთვის გათვლა მარტივია: ღია ინსტრუმენტები ამცირებს ბარიერს გარე გუნდებისთვის, რათა გამოიყენონ TPU-ები სამუშაო პროცესებში და არ აირჩიონ ავტომატურად NVIDIA-ს სტეკი მხოლოდ იმის გამო, რომ ის უკეთესადაა დოკუმენტირებული ღია სივრცეში.officechai
NVIDIA მანამდე ამტკიცებდა, რომ მისი GPU-ები ერთი თაობით წინ რჩება და წარმოადგენს ერთადერთ პლატფორმას, რომელიც AI-ის ყველა მოდელს ამუშავებს ყველგან, სადაც გამოთვლითი პროცესები მიმდინარეობს. დარჩება თუ არა ეს პოზიცია უცვლელი, როდესაც Google აგრძელებს თავისი სტეკის ნაწილების გახსნას, მთავარ კითხვად რჩება იმ საწარმოებისთვის, რომლებიც ირჩევენ, სად განახორციელონ მასშტაბური ინფერენსი.officechai