EN DIRECT
CliffCompaction : une méthode de compression de contexte pour réduire le coût des agents de codage22/09/26|FleXray : un modèle généraliste pour segmenter les radiographies du corps entier22/09/26|Anthropic dévoile Claude Opus 5.522/09/26 · Anthropic|Des documents judiciaires révèlent des propos internes accablants sur le scraping de contenu par l'IA19/09/26|L'armée américaine évite de justesse un incident après un rapport de renseignement halluciné par une IA18/09/26|Une étude révèle que les biais de genre des GPT ne disparaissent pas, ils se transforment17/09/26 · OpenAI|Google DeepMind ajoute une mémoire côté serveur sécurisée à Private AI Compute23/09/26 · Google DeepMind|Google DeepMind ajoute la synthèse vocale à Gemini 3.823/09/26 · Google DeepMind|NVIDIA lance Nemotron 3 Diarization pour identifier les locuteurs en temps réel23/09/26 · NVIDIA|OpenAI élargit l'accès de son programme Daybreak à l'Ukraine pour la cyberdéfense civile23/09/26 · OpenAI|OpenAI mise sur des influenceurs pour redorer son image publique23/09/26 · OpenAI|Claude Code ne lirait le fichier AGENTS.md que si la télémétrie est activée23/09/26 · Anthropic|CliffCompaction : une méthode de compression de contexte pour réduire le coût des agents de codage22/09/26|FleXray : un modèle généraliste pour segmenter les radiographies du corps entier22/09/26|Anthropic dévoile Claude Opus 5.522/09/26 · Anthropic|Des documents judiciaires révèlent des propos internes accablants sur le scraping de contenu par l'IA19/09/26|L'armée américaine évite de justesse un incident après un rapport de renseignement halluciné par une IA18/09/26|Une étude révèle que les biais de genre des GPT ne disparaissent pas, ils se transforment17/09/26 · OpenAI|Google DeepMind ajoute une mémoire côté serveur sécurisée à Private AI Compute23/09/26 · Google DeepMind|Google DeepMind ajoute la synthèse vocale à Gemini 3.823/09/26 · Google DeepMind|NVIDIA lance Nemotron 3 Diarization pour identifier les locuteurs en temps réel23/09/26 · NVIDIA|OpenAI élargit l'accès de son programme Daybreak à l'Ukraine pour la cyberdéfense civile23/09/26 · OpenAI|OpenAI mise sur des influenceurs pour redorer son image publique23/09/26 · OpenAI|Claude Code ne lirait le fichier AGENTS.md que si la télémétrie est activée23/09/26 · Anthropic|
ReleaseGoogle DeepMind

Google DeepMind ajoute la synthèse vocale à Gemini 3.8

Google DeepMind dévoile une fonction de synthèse vocale intégrée à Gemini 3.8, permettant au modèle de générer de la parole à partir de texte.

23 septembre 20263 min de lecturePublié parGoogle DeepMind

Google DeepMind a annoncé l'arrivée d'une fonctionnalité de synthèse vocale au sein de Gemini 3.8, la dernière itération de sa famille de modèles multimodaux. Cette capacité permet au système de convertir du texte en parole de manière native, sans passer par un service tiers dédié à la voix. L'entreprise présente cette avancée comme une extension logique de son approche multimodale, qui vise à unifier texte, image, audio et désormais génération vocale au sein d'un même modèle.

Si les détails techniques précis n'ont pas encore été rendus publics dans leur intégralité, l'annonce s'inscrit dans une tendance plus large observée chez les grands acteurs de l'IA générative, qui cherchent à intégrer la voix comme modalité de sortie standard plutôt que comme un module séparé. Cette intégration pourrait simplifier le développement d'applications vocales, des assistants conversationnels aux outils d'accessibilité, en réduisant le besoin de faire appel à des API de synthèse vocale distinctes.

La numérotation "3.8" suggère une mise à jour incrémentale plutôt qu'une refonte majeure du modèle Gemini, ce qui correspond à la stratégie de Google consistant à livrer des améliorations régulières plutôt que des sauts de version espacés. L'accent mis sur la parole naturelle et la génération audio de qualité s'inscrit dans la compétition croissante entre laboratoires d'IA sur les capacités vocales, un domaine où des acteurs comme OpenAI et ElevenLabs ont également investi ces derniers mois.

Pour les développeurs et les entreprises utilisant l'écosystème Gemini, cette fonctionnalité pourrait ouvrir de nouveaux cas d'usage, notamment dans la production de contenu audio, les interfaces vocales et les outils d'assistance. Reste à voir comment cette capacité se positionnera face aux solutions spécialisées existantes en termes de qualité, de latence et de coût.

Tags
text-to-speechgeminivoice-aigooglemultimodal

À lire aussi