Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

letsdatascience+1google+1letsdatascience+1Alphabet Inc:n omistama Google DeepMind julkaisi tiistaina DiffusionGemman, kokeellisen avoimen lähdekoodin kielimallin, joka hylkää perinteisten tekoälyjärjestelmien yhden tokenin kerrallaan -lähestymistavan ja tuottaa sen sijaan kokonaisia tekstilohkoja samanaikaisesti. Yrityksen mukaan tämä tarjoaa jopa neljä kertaa nopeamman päättelyn erillisillä GPU-korteilla.
Toisin kuin tavalliset autoregressiiviset mallit, jotka tuottavat tekstiä peräkkäin, DiffusionGemma käyttää diffuusiopohjaista dekooderia, joka luonnostelee 256 tokenia rinnakkain jokaisella eteenpäin suuntautuvalla ajolla, siirtäen päättelyn pullonkaulan muistin kaistanleveydeltä raakaan laskentatehoon. Malli on 26 miljardin parametrin Mixture of Experts -malli, joka aktivoi vain 3,8 miljardia parametria päättelyn aikana, mikä mahdollistaa sen mahtumisen huippuluokan kuluttaja-GPU:iden 18 Gt:n VRAM-muistiin kvantisoinnin jälkeen.letsdatascience+2
Google raportoi yli 1 000 tokenin sekuntinopeudesta yhdellä Nvidia H100 -kiihdyttimellä ja yli 700 tokenin sekuntinopeudesta Nvidia GeForce RTX 5090 -kortilla. Yritys kuvaili näitä lukuja noin neljä kertaa nopeammiksi kuin vastaavan kokoiset autoregressiiviset Gemma-mallit yhden käyttäjän työkuormissa.blog+1
Google kertoi työskennelleensä suoraan Nvidian kanssa optimoidakseen DiffusionGemman koko siruvalmistajan laitteistovalikoimalle, kuluttajien GeForce RTX 4090- ja 5090-GPU:ista yritystason Hopper- ja Blackwell-järjestelmiin, mukaan lukien DGX Spark ja DGX Station paikallista käyttöönottoa varten. Nvidian NVFP4-nelibittisen liukulukumuodon natiivi tuki nopeuttaa laskentaa Googlen kuvaamalla "lähes häviöttömällä tarkkuudella".blog
Mallin painot ovat saatavilla Apache 2.0 -lisenssillä Hugging Facessa, ja kehittäjät voivat käyttää DiffusionGemmaa myös Nvidia NIMin kautta. Palvelua tukevat vLLM, MLX ja Hugging Face Transformers.google+1
Google totesi selvästi, että DiffusionGemma jää jälkeen tavallisista Gemma 4 -malleistaan yleisessä tuotoksen laadussa, ja se asemoi julkaisun kokeelliseksi ja suunnatuksi tutkijoille, jotka tutkivat nopeutta vaativia työnkulkuja, kuten rivieditointia, koodin täydentämistä ja epälineaaristen tekstirakenteiden luomista. Rinnakkaisen dekoodauksen etu vähenee myös korkean samanaikaisuuden pilvipalveluissa, joissa autoregressiiviset mallit voivat jo kyllästää laitteiston pyyntöjen eräkäsittelyn avulla.letsdatascience+2
Julkaisu perustuu Googlen laajempaan diffuusiotekstitutkimukseen, joka alkoi julkisesti Gemini Diffusion -demolla toukokuussa 2025, ja se laajentaa aiemmin tässä kuussa julkaistua Gemma 4 -avoimien mallien perhettä.Signal Daily News+1