Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. har gitt ut TPU Raiden som åpen kildekode. Dette er et bibliotek for inferensoptimalisering som håndterer KV-cache-dataoverføring mellom brikker under kjøring av store språkmodeller. Kodebasen er tilgjengelig på GitHub under Apache-2.0-lisensen, noe som er et av de tydeligste signalene hittil på at Google er villig til å frigi infrastruktur som lenge ble ansett som proprietær for deres TPU-økosystem.officechai
Lanseringen ble først omtalt av SemiAnalysis, som påpekte at Raiden ligger på samme lag i inferensstakken som NVIDIAs NIXL-bibliotek, og tilbyr KV-cache-overføring mellom prefill- og decode-instanser samt funksjonalitet for cache-avlasting.x+1
Moderne storskala inferens deler arbeidet i to faser: prefill, som behandler inndatateksten, og decode, som genererer tegn for tegn. Å kjøre begge på samme brikke er ueffektivt, så produksjonssystemer deler oppgavene på tvers av adskilte maskinvaregrupper. Når prefill er fullført, genereres det en KV-cache, modellens arbeidsminne for inndataene, som må overføres raskt til decode-brikkene.officechai
Raiden håndterer denne overføringen. Ifølge dokumentasjonen i prosjektarkivet inneholder biblioteket moduler for direkte overføring fra brikke til brikke i samme maskin, overføring mellom virtuelle maskiner over nettverket, samt avlasting av cache-blokker fra TPU-minnet til vertssystemets RAM. En modus for delt minne lar cachen bli værende i DRAM selv om modelltjeneren starter på nytt, noe som er nyttig under rutinemessige produksjonsoppdateringer.officechai
Googles dokumentasjon påpeker at prosjektet fortsatt er under aktiv utvikling og ennå ikke er ment for generell produksjonsbruk.
Google har aldri solgt TPU-er som frittstående maskinvare, men kundebasen for deres spesialtilpassede brikker har vokst. Anthropic har sikret seg tilgang til en million TPU-er, og OpenAI har begynt å bruke Google TPU-er til deler av sin drift.officechai
Hver av disse kundene trenger programvareverktøy på linje med det som har vokst frem rundt NVIDIA-grafikkort. Rammeverk som vLLM og SGLang er tett integrert med NIXL. Dersom Raiden oppnår tilsvarende integrasjon, vil selskaper som allerede kjører NVIDIA-basert oppdelt tjenesteyting kunne flytte arbeidsbelastninger til TPU-er med mindre utviklingsarbeid.officechai
Lanseringen skjer samtidig med NVIDIAs eget fremstøt for åpen kildekode. Den 4. august kunngjorde NVIDIA at de ville åpne sine cuFile-API-er og sin lagringsstakk gjennom en ny leverandøruavhengig GitHub-organisasjon, der Google, Intel og Meta er oppført blant de første vedlikeholderne.igorslab
De parallelle trekkene tyder på et bransjedekkende skifte mot å åpne inferensinfrastruktur som leverandørene tidligere holdt lukket. For Google er regnestykket enkelt: åpne verktøy senker terskelen for at eksterne team tar i bruk TPU-er til produksjonsoppgaver, i stedet for automatisk å velge NVIDIA-stakken bare fordi den er bedre dokumentert i det åpne rommet.officechai
NVIDIA har tidligere hevdet at deres grafikkort ligger en generasjon foran og er den eneste plattformen som kjører alle KI-modeller uansett hvor databehandlingen skjer. Hvorvidt den posisjonen står seg etter hvert som Google åpner mer av sin teknologi, gjenstår som det sentrale spørsmålet for bedrifter som skal velge hvor de vil kjøre inferens i stor skala.officechai