Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. har släppt TPU Raiden som öppen källkod, ett bibliotek för inferensoptimering som hanterar dataöverföring av KV-cache mellan kretsar vid körning av stora språkmodeller. Kodarkivet finns tillgängligt på GitHub under Apache-2.0-licensen, vilket är en av de tydligaste signalerna hittills på att Google är redo att öppna upp infrastruktur som länge varit proprietär för företagets TPU-ekosystem.officechai
Lanseringen uppmärksammades först av SemiAnalysis, som noterade att Raiden befinner sig på samma nivå i inferensstacken som NVIDIAs NIXL-bibliotek. Det erbjuder överföring av KV-cache mellan prefill- och decode-instanser samt primitiva funktioner för cache-avlastning.x+1
Modern storskalig inferens delar upp arbetet i två faser: prefill, som bearbetar indatatexten, och decode, som genererar token ett i taget. Att köra båda på samma krets är ineffektivt, så produktionssystem delar upp dem över separata hårdvarupooler. När prefill är klart skapar processen en KV-cache, modellens arbetsminne för indata, som snabbt måste föras över till decode-kretsarna.officechai
Raiden hanterar denna överlämning. Enligt dokumentationen i kodarkivet innehåller biblioteket moduler för direkt överföring mellan kretsar i samma maskin, överföring mellan virtuella maskiner över nätverket samt avlastning av cache-block från TPU-minne till värddatorns RAM-minne. Ett läge för delat minne gör att cachen kan ligga kvar i DRAM även om modellservern startas om, vilket är användbart vid rutinuppdateringar i produktion.officechai
Googles dokumentation poängterar att projektet fortfarande är under aktiv utveckling och ännu inte är avsett för allmän produktionsanvändning.
Google har aldrig sålt TPU:er som fristående hårdvara, men kundbasen för företagets specialanpassade kretsar har vuxit. Anthropic har säkrat tillgång till en miljon TPU:er, och OpenAI har börjat använda Googles TPU:er för delar av sin verksamhet.officechai
Var och en av dessa kunder behöver mjukvaruverktyg som kan jämföras med det ekosystem som vuxit fram kring NVIDIAs grafikprocessorer. Ramverk som vLLM och SGLang är djupt integrerade med NIXL. Om Raiden uppnår en liknande integration kan företag som redan kör NVIDIA-baserade uppdelade system flytta arbetsbelastningar till TPU:er med mindre utvecklingsarbete.officechai
Tidpunkten sammanfaller också med NVIDIAs egna satsningar på öppen källkod. Den 4 augusti meddelade NVIDIA att de öppnar sina cuFile-API:er och sin lagringsstack genom en ny leverantörsoberoende GitHub-organisation, där Google, Intel och Meta finns med bland de första förvaltarna.igorslab
De parallella dragen tyder på en branschövergripande förskjutning mot att öppna upp den inferensinfrastruktur som leverantörerna tidigare höll låst. För Google är kalkylen enkel: öppna verktyg sänker tröskeln för externa team att använda TPU:er i produktion, istället för att automatiskt välja NVIDIAs stack bara för att den är bättre dokumenterad i det öppna.officechai
NVIDIA har tidigare hävdat att deras grafikprocessorer ligger en generation före och är den enda plattformen som kör alla AI-modeller överallt där beräkningar utförs. Om den positionen står sig när Google fortsätter att öppna delar av sin mjukvarustack återstår att se, och det är den centrala frågan för företag som väljer var de ska köra inferens i stor skala.officechai