Google a annoncé sur son blog officiel l'arrivée de Gemini 3.8 Live ainsi que d'une variante baptisée Gemini 3.8 Live Extended Thinking, deux nouvelles itérations de sa gamme de modèles pensée pour les échanges vocaux et multimodaux en temps réel. Ces modèles s'inscrivent dans la continuité de l'API Live de Google, déjà utilisée pour des assistants capables de tenir une conversation fluide avec latence réduite, en intégrant voix, image et texte dans un même flux d'interaction.
La déclinaison Extended Thinking se distingue par l'ajout d'une phase de raisonnement plus approfondie avant de produire une réponse, une approche que Google avait déjà explorée avec les variantes 'thinking' de précédentes générations Gemini. L'objectif affiché est de permettre au modèle de mieux gérer les requêtes complexes ou ambiguës sans sacrifier la réactivité attendue d'un système conversationnel en temps réel, un compromis qui reste techniquement délicat à tenir.
Le billet de blog publié par Google reste toutefois succinct sur les détails techniques précis : benchmarks, tarification, disponibilité par région ou limites de latence ne sont pas encore documentés dans le communiqué initial. Cette annonce s'inscrit dans un rythme de mises à jour de plus en plus rapproché pour la famille Gemini, Google cherchant visiblement à maintenir la pression face à la concurrence sur les assistants vocaux et les agents conversationnels.
En l'absence de données de performance comparatives, il est difficile d'évaluer précisément l'apport réel de cette version par rapport aux itérations précédentes. Les développeurs et entreprises utilisant l'API Live devront attendre une documentation plus complète, ou des tests indépendants, pour mesurer si le gain en capacité de raisonnement se traduit par une amélioration tangible dans des cas d'usage concrets comme les agents vocaux d'entreprise ou les assistants multimodaux grand public.