Google lanza Gemini 3.5 Transcribe, su modelo de voz más preciso
El sistema detecta más de 85 idiomas de forma automática, etiqueta hasta tres hablantes con marcas de tiempo y transmite audio un 70 % más rápido que Chirp 3.
- La transcripción en tiempo real registra una tasa de error de palabras del 4,0 %, y la de archivos grabados alcanza el 2,6 %, según Artificial Analysis.
- Se lanzan dos API independientes: gemini-3.5-transcribe-live para tiempo real y gemini-3.5-transcribe para grabaciones.
- Entre los socios iniciales que prueban los modelos se encuentran Agora, LiveKit, LangChain, Vercel y Pipecat.
Por qué importa: Un modelo de voz que nunca olvida lo que escucha convierte la conversación en un registro permanente en poder de Google.