Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

blog+1blog+1blog+1Google Alphabet Inc. a publié mardi Gemini 3.5 Live Translate, un modèle audio alimenté par l'IA qui traduit la parole en temps quasi réel dans plus de 70 langues, marquant l'un des déploiements les plus ambitieux de l'entreprise en matière de technologie de traduction sur appareil. Le même jour, Google DeepMind a présenté DiffusionGemma, un modèle ouvert expérimental qui génère du texte jusqu'à quatre fois plus rapidement que les modèles autorégressifs standard en appliquant des techniques de diffusion à l'architecture Gemma 4.
Gemini 3.5 Live Translate s'éloigne des systèmes de traduction conventionnels tour par tour qui attendent qu'un locuteur ait fini avant de produire une sortie. Au lieu de cela, le modèle traite et traduit la parole en continu, restant seulement quelques secondes derrière le locuteur tout en préservant l'intonation, le rythme et la hauteur.blog+1
Le modèle est en cours de déploiement sur trois surfaces : mondialement sur l'application Google Translate pour Android et iOS, en avant-première publique pour les développeurs via l'API Gemini Live et Google AI Studio, et en avant-première privée pour certains clients professionnels de Google Workspace sur Google Meet à partir de ce mois-ci. L'intégration Meet étend la traduction vocale de cinq langues précédemment prises en charge à plus de 70, permettant plus de 2 000 combinaisons linguistiques lors d'une seule réunion.9to5google+1
Un nouveau "mode écoute" sur Android permet aux utilisateurs d'entendre les traductions via l'écouteur de leur téléphone sans casque, simplement en tenant l'appareil à leur oreille comme lors d'un appel normal. Tout l'audio généré est filigrané avec SynthID pour aider à identifier le contenu généré par l'IA.India Today+2
Par ailleurs, Google DeepMind a publié DiffusionGemma, un modèle de mélange d'experts de 26 milliards de paramètres qui génère du texte de la même manière que les modèles de diffusion d'images créent des images : en partant du bruit et en affinant des blocs entiers allant jusqu'à 256 jetons en parallèle plutôt qu'en prédisant un mot à la fois.blogs.nvidia+1
Construit sur l'architecture Gemma 4 et n'activant que 3,8 milliards de paramètres pendant l'inférence, DiffusionGemma atteint plus de 1 000 jetons par seconde sur un seul GPU Nvidia H100 et environ 700 jetons par seconde sur une GeForce RTX 5090 grand public. Les poids du modèle sont disponibles sur Hugging Face sous la licence open source Apache 2.0.blog+2
Le PDG de Google, Sundar Pichai, a mis en avant DiffusionGemma sur les réseaux sociaux, le qualifiant de "cheval de course atteignant une inférence jusqu'à 4 fois plus rapide" qui apporte la recherche de l'entreprise sur la diffusion de texte à la famille Gemma 4.x
Google a averti que DiffusionGemma est expérimental et est à la traîne par rapport au Gemma 4 standard sur les benchmarks de qualité de sortie, le recommandant principalement pour les flux de travail locaux critiques en termes de vitesse tels que l'édition en ligne, l'itération rapide et les boucles agentiques plutôt que pour les déploiements en production nécessitant une qualité maximale. Nvidia a optimisé le modèle sur toute sa gamme de matériel, des GPU grand public aux systèmes DGX Spark, avec une prise en charge dès le premier jour dans vLLM, Hugging Face Transformers et Unsloth.thenewstack+2