Google lance Gemini 3.5 Transcribe, son modèle vocal le plus précis
Le système détecte automatiquement plus de 85 langues, étiquette jusqu'à trois locuteurs avec des horodatages et retranscrit l'audio 70 % plus vite que Chirp 3.
- La transcription en streaming affiche un taux d'erreur par mot de 4,0 %, et 2,6 % hors streaming, selon Artificial Analysis.
- Deux API distinctes sont lancées : gemini-3.5-transcribe-live pour le temps réel et gemini-3.5-transcribe pour les enregistrements.
- Les premiers partenaires incluent Agora, LiveKit, LangChain, Vercel et Pipecat pour tester les modèles.
Pourquoi c'est important: Un modèle vocal qui n'oublie jamais ce qu'il entend transforme la conversation en un registre permanent détenu par Google.