Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. a rendu open source TPU Raiden, une bibliothèque d'optimisation de l'inférence qui gère le déplacement des données du KV-cache entre les puces lors de la mise à disposition de grands modèles linguistiques. Le dépôt est disponible sur GitHub sous licence Apache-2.0, marquant l'un des signaux les plus clairs à ce jour que Google est prêt à externaliser une infrastructure longtemps considérée comme propriétaire de son écosystème TPU.officechai
La publication a été signalée pour la première fois par SemiAnalysis, qui a noté que Raiden occupe le même niveau de la pile d'inférence que la bibliothèque NIXL de NVIDIA , assurant le transfert du KV-cache entre les instances de préremplissage et de décodage, tout en fournissant des primitives pour le délestage du cache.x+1
L'inférence moderne à grande échelle divise le travail en deux phases: le préremplissage, qui traite l'invite d'entrée, et le décodage, qui génère les jetons un par un. Exécuter les deux sur la même puce est inefficace, c'est pourquoi les systèmes de production les désagrègent sur des ensembles de matériel distincts. Lorsque le préremplissage est terminé, il produit un KV-cache, la mémoire vive du modèle pour son entrée, qui doit être transmis rapidement aux puces de décodage.officechai
Raiden gère ce transfert. Selon la documentation de son dépôt, la bibliothèque comprend des modules pour le transfert direct de puce à puce au sein d'une même machine, le transfert inter-VM sur le réseau, et le délestage de blocs de cache depuis la mémoire du TPU vers la RAM hôte. Un mode de mémoire partagée permet au cache de persister dans la DRAM même si le serveur de modèle redémarre, ce qui est utile lors des mises à jour de routine en production.officechai
La documentation de Google précise que le projet est toujours en cours de développement actif et n'est pas encore destiné à une utilisation générale en production.
Google n'a jamais vendu ses TPU en tant que matériel autonome, mais la base de clients pour ses puces sur mesure s'est élargie. Anthropic s'est assuré l'accès à un million de TPU, et OpenAI a commencé à utiliser les TPU de Google pour une partie de ses opérations.officechai
Chacun de ces clients a besoin d'outils logiciels comparables à ce qui s'est développé autour des GPU de NVIDIA. Des frameworks comme vLLM et SGLang sont profondément intégrés à NIXL. Si Raiden atteint une intégration similaire, les entreprises qui utilisent déjà un service désagrégé basé sur NVIDIA pourraient orienter leurs charges de travail vers les TPU avec moins de surcoût d'ingénierie.officechai
Le calendrier coïncide également avec la poussée d'open source de NVIDIA. Le 4 août, NVIDIA a annoncé qu'elle ouvrirait ses API cuFile et sa pile de stockage par l'intermédiaire d'une nouvelle organisation GitHub multi-fournisseurs, Google, Intel et Meta figurant parmi les mainteneurs initiaux.igorslab
Ces initiatives parallèles suggèrent un virage dans toute l'industrie vers l'externalisation des infrastructures d'inférence que les fournisseurs gardaient autrefois fermées. Pour Google, le calcul est simple: des outils ouverts abaissent la barrière à l'adoption des TPU par des équipes externes pour leurs charges de travail en production, au lieu de choisir par défaut la pile NVIDIA simplement parce qu'elle est mieux documentée dans le domaine public.officechai
NVIDIA a précédemment soutenu que ses GPU conservaient une génération d'avance et restaient la seule plateforme exécutant tous les modèles d'IA partout où l'informatique est présente. Que cette position tienne toujours à mesure que Google continue d'ouvrir des éléments de sa pile reste la question centrale pour les entreprises qui choisissent où exécuter l'inférence à grande échelle.officechai