Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

officechai+1officechaiofficechaiGoogle Alphabet Inc. , büyük dil modellerinin sunumu sırasında çipler arasındaki KV önbellek veri hareketini yöneten bir çıkarım optimizasyon kütüphanesi olan TPU Raiden'ı açık kaynak haline getirdi. Kod deposu Apache-2.0 lisansı altında GitHub'da yayında; bu durum, Google'ın uzun süredir TPU ekosistemine özel olarak kabul ettiği altyapıyı dışarıya açmaya istekli olduğunun en net göstergelerinden biri.officechai
Yayını ilk duyuran SemiAnalysis, Raiden'ın çıkarım yığınının NVIDIA'nın NIXL kütüphanesiyle aynı katmanında yer aldığını; ön doldurma (prefill) ve kod çözme (decode) örnekleri arasında KV önbellek aktarımının yanı sıra önbellek boşaltma temel bileşenlerini sağladığını belirtti.x+1
Modern büyük ölçekli çıkarım, işi iki aşamaya ayırır: girdi istemini işleyen ön doldurma (prefill) ve jetonları teker teker üreten kod çözme (decode). Her ikisini de aynı çip üzerinde çalıştırmak verimsizdir, bu nedenle canlı ortam sistemleri bunları ayrı donanım havuzlarına böler. Ön doldurma tamamlandığında, modelin girdiye dair anlık belleği olan bir KV önbelleği üretir ve bunun kod çözme çiplerine hızla devredilmesi gerekir.officechai
Raiden bu devir teslimi yönetir. Depo dokümantasyonuna göre kütüphane, tek bir makine içinde doğrudan çipten çipe aktarım, ağ üzerinden sanal makineler arası aktarım ve TPU belleğinden ana bilgisayar RAM'ine önbellek bloklarını aktarma modüllerini içerir. Paylaşılan bellek modu, model sunucusu yeniden başlatılsa bile önbelleğin DRAM'de kalmasını sağlar; bu da rutin canlı ortam güncellemeleri sırasında oldukça yararlıdır.officechai
Google'ın dokümantasyonu, projenin halen aktif olarak geliştirilmekte olduğunu ve henüz genel canlı ortam kullanımı için tasarlanmadığını belirtiyor.
Google, TPU'ları hiçbir zaman bağımsız bir donanım olarak satmadı, ancak özel çipinin müşteri tabanı genişledi. Anthropic bir milyon TPU'ya erişim sağladı, OpenAI ise operasyonlarının bir kısmı için Google TPU'larını kullanmaya başladı.officechai
Bu müşterilerin her birinin, NVIDIA GPU'ları etrafında gelişen araçlara kıyaslanabilir yazılım araçlarına ihtiyacı var. vLLM ve SGLang gibi çatılar NIXL ile derin bir entegrasyona sahiptir; Raiden benzer bir entegrasyon elde ederse, halihazırda NVIDIA tabanlı ayrıştırılmış sunum çalıştıran şirketler, daha az mühendislik yüküyle iş yüklerini TPU'lara yönlendirebilir.officechai
Zamanlama aynı zamanda NVIDIA'nın kendi açık kaynak hamlesiyle de örtüşüyor. NVIDIA, 4 Ağustos'ta cuFile API'lerini ve depolama yığınını birden fazla üreticiyi kapsayan yeni bir GitHub organizasyonu aracılığıyla açacağını duyurdu; Google, Intel ve Meta da ilk bakım yapıcılar arasında yer alıyor.igorslab
Paralel adımlar, satıcıların bir zamanlar kapalı tuttuğu çıkarım altyapısını dışarıya açmaya yönelik sektör genelinde bir kaymaya işaret ediyor. Google açısından denklem oldukça net: Açık araçlar, dış ekiplerin yalnızca açık kaynakta daha iyi belgelendiği için NVIDIA yığınına yönelmesi yerine, canlı ortam iş yükleri için TPU'ları benimseme engelini düşürüyor.officechai
NVIDIA daha önce GPU'larının bir nesil önde kalmaya devam ettiğini ve bilgi işlemin gerçekleştiği her yerde tüm yapay zeka modellerini çalıştıran tek platform olduğunu savunmuştu. Google yığınının parçalarını açmaya devam ederken bu konumun korunup korunmayacağı, büyük ölçekte çıkarımı nerede çalıştıracağını seçen kurumlar için temel soru olmaya devam ediyor.officechai