News, Fast

Atom Brief

26 août 2026 · Archives
Tech

Google lance Gemini 3.5 Transcribe, son modèle vocal le plus précis

Le système détecte automatiquement plus de 85 langues, étiquette jusqu'à trois locuteurs avec des horodatages et retranscrit l'audio 70 % plus vite que Chirp 3.

  • La transcription en streaming affiche un taux d'erreur par mot de 4,0 %, et 2,6 % hors streaming, selon Artificial Analysis.
  • Deux API distinctes sont lancées : gemini-3.5-transcribe-live pour le temps réel et gemini-3.5-transcribe pour les enregistrements.
  • Les premiers partenaires incluent Agora, LiveKit, LangChain, Vercel et Pipecat pour tester les modèles.

Pourquoi c'est important: Un modèle vocal qui n'oublie jamais ce qu'il entend transforme la conversation en un registre permanent détenu par Google.

Google DeepMind ↗ · 26 août 202626/08/26