Google lance Gemini 3.8 Live et 3.5 Transcribe pour les applications vocales en temps réel

Cette fiche résume une publication officielle diffusée par Google Blog. Position Zéro en présente les informations essentielles et leur intérêt pour les professionnels du numérique.

L’annonce en bref

Google annonce la disponibilité de Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking dans Gemini API et Google AI Studio. Ces modèles de synthèse vocale native peuvent raisonner, exécuter des tâches et maintenir le fil d’une conversation, avec notamment les appels de fonctions asynchrones, le contexte visuel et la prise en charge de plus de 97 langues. Ils sont accessibles via la Live API, au tarif annoncé de 0,005 dollar par minute d’audio entrant et 0,018 dollar par minute d’audio sortant.

Google présente aussi Gemini 3.5 Transcribe, un modèle de transcription en temps réel prenant en charge plus de 85 langues. Il affiche un taux moyen d’erreur de mots de 4,0 % en streaming et de 2,6 % hors streaming, et propose notamment le changement automatique de langue, le vocabulaire personnalisé et un mode de transcription structuré.

Le titre distingue les deux annonces principales et précise leur usage pour les applications vocales en temps réel.

Ces modèles sont proposés dans Gemini API et via plusieurs partenaires d’intégration de la Live API, ce qui élargit les options de déploiement pour les développeurs.

Publicité