Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. ha publicado como código abierto TPU Raiden, una biblioteca de optimización de inferencia que gestiona el movimiento de datos de KV-cache entre chips durante la ejecución de modelos de lenguaje de gran tamaño. El repositorio está disponible en GitHub bajo la licencia Apache-2.0, lo que constituye una de las señales más claras hasta la fecha de que Google está dispuesta a externalizar infraestructura que durante mucho tiempo se consideró propietaria de su ecosistema TPU.officechai
El lanzamiento fue señalado inicialmente por SemiAnalysis, que destacó que Raiden ocupa la misma capa de la pila de inferencia que la biblioteca NIXL de NVIDIA , al proporcionar transferencia de KV-cache entre instancias de prellenado (prefill) y decodificación (decode), junto con primitivas para la descarga de memoria caché.x+1
La inferencia moderna a gran escala divide el trabajo en dos fases: prellenado, que procesa la indicación de entrada, y decodificación, que genera tokens uno a uno. Ejecutar ambas en el mismo chip resulta ineficiente, por lo que los sistemas de producción las desagregan en conjuntos de hardware independientes. Cuando se completa el prellenado, este produce una KV-cache, la memoria de trabajo del modelo para su entrada, que debe transferirse rápidamente a los chips de decodificación.officechai
Raiden gestiona dicha transferencia. Según la documentación de su repositorio, la biblioteca incluye módulos para la transferencia directa de chip a chip dentro de una misma máquina, la transferencia entre máquinas virtuales a través de la red y la descarga de bloques de caché desde la memoria TPU a la RAM del host. Un modo de memoria compartida permite que la caché persista en la memoria DRAM incluso si el servidor del modelo se reinicia, algo muy útil durante las actualizaciones de producción rutinarias.officechai
La documentación de Google señala que el proyecto aún se encuentra en desarrollo activo y todavía no está destinado a un uso generalizado en producción.
Google nunca ha vendido las TPU como hardware independiente, pero la base de clientes de sus chips personalizados se ha ampliado. Anthropic ha garantizado el acceso a un millón de TPU, mientras que OpenAI ha comenzado a utilizar TPU de Google para parte de sus operaciones.officechai
Cada uno de estos clientes necesita herramientas de software comparables a las que han proliferado en torno a las GPU de NVIDIA. Entornos como vLLM y SGLang están profundamente integrados con NIXL; si Raiden logra una integración similar, las empresas que ya ejecutan servicios desagregados basados en NVIDIA podrían dirigir sus cargas de trabajo hacia las TPU con menor sobrecarga de ingeniería.officechai
El momento del anuncio coincide además con el propio impulso de código abierto de NVIDIA. El 4 de agosto, NVIDIA anunció que abriría sus API cuFile y su pila de almacenamiento a través de una nueva organización de GitHub entre diversos fabricantes, donde Google, Intel y Meta figuran entre los mantenedores iniciales.igorslab
Estos movimientos paralelos sugieren una tendencia general en la industria hacia la externalización de la infraestructura de inferencia, que anteriormente los proveedores mantenían cerrada. Para Google, la lógica es sencilla: ofrecer herramientas abiertas reduce las barreras para que equipos externos adopten las TPU en sus cargas de trabajo de producción, en lugar de recurrir por defecto al entorno de NVIDIA solo por estar mejor documentado en abierto.officechai
NVIDIA ha sostenido con anterioridad que sus GPU se mantienen una generación por delante y representan la única plataforma capaz de ejecutar cualquier modelo de IA en cualquier entorno de cómputo. Si esa posición se mantendrá a medida que Google continúe abriendo partes de su arquitectura sigue siendo la cuestión central para las empresas que deciden dónde ejecutar la inferencia a gran escala.officechai