Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. on julkaissut avoimena koodina TPU Raidenin, päättelyn optimointikirjaston, joka huolehtii KV-välimuistin datansiirrosta piirien välillä suurten kielimallien ajon aikana. Koodivarasto on saatavilla GitHubissa Apache-2.0-lisenssillä. Tämä on yksi selkeimmistä merkeistä siitä, että Google on valmis avaamaan infrastruktuuria, jota pidettiin pitkään sen TPU-ekosysteemin omisteisena osana.officechai
Julkaisusta uutisoi ensimmäisenä SemiAnalysis, joka pani merkille, että Raiden toimii päättelyympäristön samalla tasolla kuin NVIDIAn NIXL-kirjasto. Se tarjoaa KV-välimuistin siirron esitäyttö- ja purkuinstanssien välillä sekä perustyökalut välimuistin keventämiseen.x+1
Nykyaikainen laajan mittakaavan päättely jakaa työn kahteen vaiheeseen: esitäyttöön (prefill), joka käsittelee syötekehotteen, ja purkuun (decode), joka luo tokeneita yksi kerrallaan. Molempien ajaminen samalla piirillä on tehotonta, joten tuotantojärjestelmät erottavat ne erillisiksi laitteistoresursseiksi. Kun esitäyttö valmistuu, se muodostaa KV-välimuistin, eli mallin aktiivisen muistin syötteestään, joka on siirrettävä nopeasti purkupiireille.officechai
Raiden hallitsee tätä siirtoa. Koodivaraston dokumentaation mukaan kirjasto sisältää moduulit suoraan piirien väliseen siirtoon yhden koneen sisällä, virtuaalikoneiden väliseen siirtoon verkon yli sekä välimuistilohkojen siirtämiseen TPU-muistista isäntäkoneen RAM-muistiin. Jaetun muistin tila mahdollistaa välimuistin säilymisen DRAM-muistissa jopa mallipalvelimen käynnistyessä uudelleen, mikä on hyödyllistä rutiininomaisten tuotantopäivitysten aikana.officechai
Googlen dokumentaatiossa huomautetaan, että projekti on edelleen aktiivisen kehityksen alla eikä sitä ole vielä tarkoitettu yleiseen tuotantokäyttöön.
Google ei ole koskaan myynyt TPU-piirejä erillisinä laitteina, mutta sen räätälöidyn piiriteknologian asiakaskunta on laajentunut. Anthropic on varmistanut pääsyn miljoonaan TPU-piiriin, ja OpenAI on alkanut käyttää Googlen TPU-piirejä osassa toimintojaan.officechai
Jokainen näistä asiakkaista tarvitsee ohjelmistotyökaluja, jotka ovat vertailukelpoisia NVIDIA-näytönohjaimien ympärille kehittyneiden työkalujen kanssa. vLLM:n ja SGLangin kaltaiset kehykset on integroitu syvällisesti NIXLiin. Jos Raiden saavuttaa vastaavan integraation, NVIDIA-pohjaista hajautettua ajoa jo käyttävät yritykset voisivat ohjata työkuormia TPU-piireille pienemmällä insinöörityöllä.officechai
Ajoitus osuu myös yhteen NVIDIAn oman avoimen koodin panostuksen kanssa. Elokuun 4. päivänä NVIDIA ilmoitti avaavansa cuFile API -rajapintansa ja tallennusympäristönsä uuden toimittajariippumattoman GitHub-organisaation kautta. Google, Intel ja Meta on listattu sen ensimmäisten ylläpitäjien joukkoon.igorslab
Rinnakkaiset siirrot viittaavat koko toimialan laajuiseen muutokseen kohti sellaisen päättelyinfrastruktuurin avaamista, jonka toimittajat pitivät aiemmin suljettuna. Googlelle laskelma on selkeä: avoimet työkalut madaltavat ulkopuolisten tiimien kynnystä ottaa TPU-piirejä käyttöön tuotantotyökuormissa sen sijaan, että ne valitsisivat automaattisesti NVIDIAn ympäristön vain siksi, että se on paremmin dokumentoitu avoimesti.officechai
NVIDIA on aiemmin väittänyt, että sen näytönohjaimet ovat edelleen sukupolven edellä ja ainoa alusta, joka ajaa kaikkia tekoälymalleja kaikkialla missä laskentaa tapahtuu. Se, pitääkö tämä asema Googlen jatkaessa tekoälyympäristönsä osien avaamista, on keskeinen kysymys yrityksille, jotka valitsevat alustaa mittavan mittakaavan päättelyajoon.officechai