Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiSpolečnost Google ze skupiny Alphabet Inc. zpřístupnila jako open-source TPU Raiden, knihovnu pro optimalizaci inference, která spravuje přesuny dat KV-cache mezi čipy při obsluze velkých jazykových modelů. Repositář je dostupný na GitHubu pod licencí Apache-2.0, což představuje jeden z nejjasnějších signálů, že je Google ochoten zveřejnit infrastrukturu, kterou dlouho považoval za výhradní vlastnictví svého ekosystému TPU.officechai
Na vydání knihovny upozornila jako první společnost SemiAnalysis. Ta poznamenala, že Raiden zabírá stejnou vrstvu inferenčního steku jako knihovna NIXL od společnosti NVIDIA , přičemž zajišťuje přenos KV-cache mezi instancemi fáze prefill a decode spolu s prvky pro odkládání mezipaměti.x+1
Moderní velkokapacitní inference rozděluje práci do dvou fází: prefill, která zpracovává vstupní výzvu (prompt), a decode, která generuje tokeny po jednom. Provozování obou fází na stejném čipu je neefektivní, proto je produkční systémy disagregují do oddělených skupin hardwaru. Po dokončení fáze prefill vzniká KV-cache, tedy průběžná paměť modelu pro jeho vstup, kterou je nutné rychle předat čipům pro fázi decode.officechai
Raiden tento přenos spravuje. Podle dokumentace v repositáři knihovna obsahuje moduly pro přímý přenos mezi čipy v rámci jednoho stroje, přenos mezi virtuálními stroji přes síť a odkládání bloků mezipaměti z paměti TPU do operační paměti hostitele (RAM). Režim sdílené paměti umožňuje zachovat mezipaměť v DRAM i při restartu serveru modelu, což je užitečné při běžných produkčních aktualizacích.officechai
Dokumentace Googlu uvádí, že projekt je stále ve fázi aktivního vývoje a zatím není určen pro běžné produkční použití.
Google nikdy neprodával TPU jako samostatný hardware, ale základna zákazníků využívajících jeho vlastní čipy se rozrostla. Společnost Anthropic získala přístup k milionu jednotek TPU a OpenAI začala využívat TPU od Googlu pro části svých provozů.officechai
Každý z těchto zákazníků potřebuje softwarové nástroje srovnatelné s těmi, které vznikly kolem GPU od společnosti NVIDIA. Frameworky jako vLLM a SGLang jsou úzce integrovány s NIXL. Pokud Raiden dosáhne podobné integrace, firmy, které již provozují disagregovanou obsluhu na bázi řešení od Nvidie, by mohly přesměrovat pracovní zátěž na TPU s nižšími vývojovými náklady.officechai
Načasování navíc odpovídá vlastní aktivitě Nvidie v oblasti open-source. Dne 4. srpna společnost NVIDIA oznámila, že otevře svá rozhraní API cuFile a úložný stek prostřednictvím nové multidodavatelské organizace na GitHubu, přičemž mezi původními správci jsou uvedeny společnosti Google, Intel a Meta .igorslab
Tyto paralelní kroky naznačují celoodvětvový posun k otevírání inferenční infrastruktury, kterou dodavatelé dříve udržovali uzavřenou. Pro Google je kalkulace jednoduchá: otevřené nástroje snižují bariéru pro externí týmy, aby nasadily TPU pro produkční zátěže, aniž by automaticky volily stek Nvidie jen proto, že je v otevřeném prostoru lépe zdokumentován.officechai
Společnost NVIDIA dříve tvrdila, že její GPU zůstávají o generaci napřed a představují jedinou platformu, na které běží každý AI model všude, kde probíhají výpočty. Zda si tuto pozici udrží i v době, kdy Google postupně otevírá části svého steku, zůstává klíčovou otázkou pro podniky, které se rozhodují, kde provozovat inferenci ve velkém měřítku.officechai