Google lancia Gemini 3.5 Transcribe, il suo modello vocale più preciso
Il sistema riconosce automaticamente oltre 85 lingue, etichetta fino a tre parlanti con timestamp e trasmette l'audio in streaming il 70% più velocemente di Chirp 3.
- La trascrizione in streaming registra un tasso di errore medio del 4,0%, mentre quella offline raggiunge il 2,6%, secondo Artificial Analysis.
- Vengono rilasciate due API separate: gemini-3.5-transcribe-live per il tempo reale e gemini-3.5-transcribe per le registrazioni.
- Tra i primi partner che testano i modelli ci sono Agora, LiveKit, LangChain, Vercel e Pipecat.
Perché conta: Un modello vocale che non dimentica ciò che ascolta trasforma la conversazione in un archivio permanente in mano a Google.