Google Alphabet Inc. a rendu open source TPU Raiden, une bibliothèque d'optimisation de l'inférence qui gère le déplacement des données du KV-cache entre les puces lors de la mise à disposition de grands modèles linguistiques. Le dépôt est disponible sur…
Google a publié TPU Raiden sur GitHub sous licence Apache-2.0, fournissant des outils de transfert de KV-cache pour l'inférence IA désagrégée sur ses puces propriétaires.officechai+1
La bibliothèque reproduit les fonctionnalités de NIXL de Nvidia , déjà intégré dans les principaux frameworks de déploiement comme vLLM, ce qui marque la volonté de Google d'égaler l'écosystème ouvert de Nvidia.officechai
La clientèle des TPU de Google comprend désormais Anthropic et OpenAI, qui ont toutes deux besoin d'outils ouverts et matures pour exécuter des charges de travail d'inférence en production à grande échelle.officechai