Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. hat TPU Raiden als Open Source bereitgestellt, eine Bibliothek zur Inferenzoptimierung, die den KV-Cache-Datentransfer zwischen Chips während der Bereitstellung großer Sprachmodelle steuert. Das Repository ist auf GitHub unter der Apache-2.0-Lizenz verfügbar. Dies ist eines der bislang deutlichsten Signale dafür, dass Google bereit ist, Infrastruktur offenzulegen, die lange Zeit als proprietärer Bestandteil des eigenen TPU-Ökosystems galt.officechai
Zuerst berichtete SemiAnalysis über die Veröffentlichung und wies darauf hin, dass Raiden dieselbe Schicht des Inferenz-Stacks besetzt wie die NIXL-Bibliothek von NVIDIA . Raiden bietet den KV-Cache-Transfer zwischen Prefill- und Decode-Instanzen sowie Grundfunktionen für das Cache-Offloading.x+1
Modernes Large-Scale-Inference teilt die Arbeit in zwei Phasen auf: Prefill, das die Eingabeaufforderung verarbeitet, und Decode, das die Tokens einzeln nacheinander generiert. Beide Phasen auf demselben Chip auszuführen ist uneffizient, weshalb Produktionssysteme sie auf separate Hardware-Pools aufteilen. Wenn die Prefill-Phase abgeschlossen ist, erzeugt sie einen KV-Cache, das laufende Gedächtnis des Modells für seine Eingabe, der schnell an Decode-Chips übergeben werden muss.officechai
Raiden verwaltet diese Übergabe. Laut der Dokumentation des Repositorys enthält die Bibliothek Module für den direkten Chip-zu-Chip-Transfer innerhalb einer einzelnen Maschine, den VM-übergreifenden Transfer über das Netzwerk und das Auslagern von Cache-Blöcken aus dem TPU-Speicher in den Host-RAM. Ein Shared-Memory-Modus sorgt dafür, dass der Cache im DRAM erhalten bleibt, selbst wenn der Modellserver neu startet, was bei gewöhnlichen Produktionsupdates nützlich ist.officechai
In der Dokumentation von Google wird darauf hingewiesen, dass sich das Projekt noch in aktiver Entwicklung befindet und noch nicht für den allgemeinen Produktionseinsatz vorgesehen ist.
Google hat TPUs nie als eigenständige Hardware verkauft, aber der Kundenkreis für die maßgeschneiderten Chips hat sich erweitert. Anthropic hat sich Zugriff auf eine Million TPUs gesichert, und OpenAI nutzt Google TPUs mittlerweile für Teile seines Betriebs.officechai
Jeder dieser Kunden benötigt Software-Werkzeuge, die mit denen vergleichbar sind, die rund um NVIDIA-GPUs entstanden sind. Frameworks wie vLLM und SGLang sind tief in NIXL integriert. Wenn Raiden eine ähnliche Integration erreicht, könnten Unternehmen, die bereits NVIDIA-basierte disaggregierte Bereitstellung nutzen, Workloads mit geringerem Entwicklungsaufwand auf TPUs verlagern.officechai
Der Zeitpunkt fällt zudem mit NVIDIAs eigener Open-Source-Offensive zusammen. Am 4. August kündigte NVIDIA an, seine cuFile-APIs und seinen Storage-Stack über eine neue herstellerübergreifende GitHub-Organisation offenzulegen, wobei Google, Intel und Meta zu den ersten Verwaltern gehören.igorslab
Die parallelen Schritte deuten auf einen branchenweiten Wandel hin zur Offenlegung von Inferenz-Infrastruktur, die von den Anbietern einst unter Verschluss gehalten wurde. Für Google ist die Rechnung einfach: Offene Tools senken die Hürde für externe Teams, TPUs für Produktions-Workloads einzusetzen, anstatt automatisch den NVIDIA-Stack zu wählen, nur weil dieser im Open-Source-Bereich besser dokumentiert ist.officechai
NVIDIA hat in der Vergangenheit argumentiert, dass seine GPUs weiterhin eine Generation voraus sind und die einzige Plattform darstellen, die jedes KI-Modell überall dort ausführt, wo Rechenleistung benötigt wird. Ob sich diese Position hält, während Google weitere Teile seines Stacks öffnet, bleibt die zentrale Frage für Unternehmen, die entscheiden müssen, wo sie Inferenz im großen Maßstab ausführen wollen.officechai