Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

letsdatascience+1google+1letsdatascience+1Google DeepMind Alphabet Inc. , Salı günü, geleneksel yapay zeka sistemlerinin her seferinde bir token üretme yaklaşımını terk ederek, bunun yerine tüm metin bloklarını aynı anda oluşturan ve şirketin özel GPU'larda dört kata kadar daha hızlı çıkarım sağladığını belirttiği deneysel bir açık kaynaklı dil modeli olan DiffusionGemma'yı yayınladı.
Metni sıralı olarak üreten standart otoregresif modellerin aksine, DiffusionGemma, her ileri geçişte 256 tokeni paralel olarak tasarlayan ve çıkarım darboğazını bellek bant genişliğinden ham hesaplama gücüne kaydıran difüzyon tabanlı bir kod çözücü kullanır. Model, çıkarım sırasında yalnızca 3,8 milyar parametreyi etkinleştiren 26 milyar parametreli bir Mixture of Experts tasarımıdır ve nicelleştirildiğinde üst düzey tüketici GPU'larının 18 GB VRAM'ine sığmasına olanak tanır.letsdatascience+2
Google, tek bir Nvidia H100 hızlandırıcıda saniyede 1.000'den fazla token ve bir Nvidia GeForce RTX 5090'da saniyede 700'den fazla token verimi bildirdi. Şirket, bu rakamları tek kullanıcılı iş yüklerinde benzer boyuttaki otoregresif Gemma modellerinin çıktı hızının yaklaşık dört katı olarak tanımladı.blog+1
Google, DiffusionGemma'yı çip üreticisinin tüketici GeForce RTX 4090 ve 5090 GPU'larından yerel dağıtım için DGX Spark ve DGX Station dahil olmak üzere kurumsal Hopper ve Blackwell sistemlerine kadar tüm donanım yelpazesinde optimize etmek için doğrudan Nvidia ile çalıştığını söyledi. Nvidia'nın NVFP4 dört bitlik kayan nokta formatına yönelik yerel destek, Google'ın "neredeyse kayıpsız doğruluk" olarak tanımladığı bir performansla hesaplamaları hızlandırıyor.blog
Model ağırlıkları Hugging Face'de Apache 2.0 lisansı altında mevcuttur ve geliştiriciler DiffusionGemma'ya Nvidia NIM aracılığıyla da erişebilirler. Sunum, vLLM, MLX ve Hugging Face Transformers aracılığıyla desteklenmektedir.google+1
Google, DiffusionGemma'nın genel çıktı kalitesinde standart Gemma 4 modellerinin gerisinde kaldığını açıkça belirtti ve bu sürümü deneysel olarak konumlandırarak satır içi düzenleme, kod tamamlama ve doğrusal olmayan metin yapıları oluşturma gibi hız açısından kritik iş akışlarını araştıran araştırmacıları hedefledi. Paralel kod çözme avantajı, otoregresif modellerin istek gruplama (batching) yoluyla donanımı zaten doyurabildiği yüksek eşzamanlı bulut sunumlarında da azalmaktadır.letsdatascience+2
Bu sürüm, Google'ın Mayıs 2025'te Gemini Diffusion demosuyla halka açık olarak başlayan ve bu ayın başlarında başlatılan Gemma 4 açık model ailesini genişleten daha geniş metin için difüzyon araştırmalarına dayanmaktadır.Signal Daily News+1