Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

letsdatascience+1google+1letsdatascience+1Společnost Google DeepMind, součást Alphabet Inc. , v úterý vydala DiffusionGemma, experimentální open-source jazykový model, který opouští přístup generování po jednom tokenu typický pro konvenční systémy AI ve prospěch generování celých bloků textu současně. Podle společnosti to přináší až čtyřikrát rychlejší inferenci na dedikovaných GPU.
Na rozdíl od standardních autoregresních modelů, které vytvářejí text sekvenčně, využívá DiffusionGemma dekodér založený na difuzi, který v každém průchodu generuje 256 tokenů paralelně, čímž přesouvá úzké hrdlo inference z propustnosti paměti na hrubý výpočetní výkon. Model využívá architekturu Mixture of Experts s 26 miliardami parametrů, z nichž se během inference aktivuje pouze 3,8 miliardy, což umožňuje jeho spuštění v rámci 18 GB VRAM u špičkových spotřebitelských GPU při kvantizaci.letsdatascience+2
Google uvádí propustnost přes 1 000 tokenů za sekundu na jediném akcelerátoru Nvidia H100 a přes 700 tokenů za sekundu na Nvidia GeForce RTX 5090. Společnost tato čísla označila za zhruba čtyřnásobek rychlosti výstupu srovnatelně velkých autoregresních modelů Gemma při úlohách pro jednoho uživatele.blog+1
Google uvedl, že spolupracoval přímo s Nvidií na optimalizaci DiffusionGemma napříč hardwarovou řadou výrobce čipů, od spotřebitelských GPU GeForce RTX 4090 a 5090 až po podnikové systémy Hopper a Blackwell, včetně DGX Spark a DGX Station pro lokální nasazení. Nativní podpora pro čtyřbitový formát s plovoucí řádovou čárkou NVFP4 od Nvidie zrychluje výpočty s tím, co Google popsal jako „téměř bezztrátovou přesnost“.blog
Váhy modelu jsou dostupné pod licencí Apache 2.0 na Hugging Face a vývojáři mohou k DiffusionGemma přistupovat také prostřednictvím Nvidia NIM. Obsluha je podporována přes vLLM, MLX a Hugging Face Transformers.google+1
Google výslovně uvedl, že DiffusionGemma zaostává za svými standardními modely Gemma 4 v celkové kvalitě výstupu, a proto vydání prezentuje jako experimentální, zaměřené na výzkumníky zkoumající pracovní postupy kritické na rychlost, jako jsou úpravy v řádcích, doplňování kódu a generování nelineárních textových struktur. Výhoda paralelního dekódování se také snižuje při cloudovém provozu s vysokou souběžností, kde autoregresní modely již mohou saturovat hardware prostřednictvím dávkování požadavků.letsdatascience+2
Vydání navazuje na širší výzkum difuze pro text společnosti Google, který veřejně začal ukázkou Gemini Diffusion v květnu 2025, a rozšiřuje rodinu otevřených modelů Gemma 4, která byla spuštěna začátkem tohoto měsíce.Signal Daily News+1