Google Alphabet Inc. ha publicado como código abierto TPU Raiden, una biblioteca de optimización de inferencia que gestiona el movimiento de datos de KV-cache entre chips durante la ejecución de modelos de lenguaje de gran tamaño. El repositorio está disponible…
Google lanzó TPU Raiden en GitHub bajo licencia Apache-2.0, ofreciendo herramientas de transferencia de KV-cache para la inferencia desagregada de IA en sus chips personalizados.officechai+1
La biblioteca equivale a NIXL de Nvidia , que ya está integrada en los principales entornos de ejecución como vLLM, lo que señala el esfuerzo de Google por igualar el ecosistema abierto de Nvidia.officechai
La base de clientes de las TPU de Google incluye ahora a Anthropic y OpenAI, las cuales necesitan herramientas abiertas y maduras para ejecutar cargas de trabajo de inferencia en producción a gran escala.officechai