Google DeepMind a annoncé le lancement de Gemini 3.8 Live et de sa variante Gemini 3.8 Live Extended Thinking, deux mises à jour de sa gamme d'API conçues pour les interactions en temps réel. Ces modèles s'inscrivent dans la lignée de l'API Live de Gemini, qui permet aux développeurs de construire des applications capables de dialoguer en voix et en vidéo avec une latence réduite, dans des cas d'usage comme les assistants vocaux, les agents conversationnels ou les interfaces multimodales interactives.
La version Extended Thinking se distingue en intégrant un mode de raisonnement plus approfondi au sein même du flux d'interaction en direct, une combinaison qui répond à une limite fréquemment observée sur les modèles temps réel : la difficulté de concilier rapidité de réponse et capacité à traiter des requêtes complexes nécessitant plusieurs étapes de raisonnement. En théorie, cette approche permettrait à un agent vocal de continuer à interagir naturellement avec l'utilisateur tout en menant, en arrière-plan, un raisonnement plus élaboré avant de livrer une réponse.
L'annonce, publiée sur le blog officiel de Google DeepMind, reste pour l'instant sobre en détails techniques précis — architecture sous-jacente, benchmarks comparatifs ou tarification ne sont pas encore détaillés dans la communication initiale. Il s'agit néanmoins d'une itération notable dans la stratégie de Google visant à décliner sa famille Gemini selon des profils d'usage spécifiques : latence minimale d'un côté, profondeur de raisonnement de l'autre, avec cette nouvelle offre qui tente de rapprocher les deux.
Ce lancement confirme la tendance des grands laboratoires à multiplier les variantes spécialisées d'un même modèle plutôt que de proposer un modèle unique polyvalent, une stratégie qui complexifie le choix pour les développeurs mais répond à des contraintes de coût et de latence très différentes selon les applications visées.