Google lanceert Gemini 3.5 Transcribe, zijn meest nauwkeurige spraakmodel
Het systeem herkent automatisch meer dan 85 talen, labelt tot drie sprekers met tijdstempels en streamt audio 70% sneller dan Chirp 3.
- Streaming transcriptie haalt gemiddeld 4,0% woordfouten, niet-streaming bereikt 2,6% volgens Artificial Analysis.
- Er verschijnen twee afzonderlijke API's: gemini-3.5-transcribe-live voor real-time en gemini-3.5-transcribe voor opnames.
- Vroege partners als Agora, LiveKit, LangChain, Vercel en Pipecat testen de modellen momenteel.
Waarom dit ertoe doet: Een spraakmodel dat nooit vergeet wat het hoort, verandert een gesprek in een permanent archief in handen van Google.