Google startet Gemini 3.5 Transcribe als genauestes Sprachmodell
Das System erkennt über 85 Sprachen automatisch, markiert bis zu drei Sprecher mit Zeitstempeln und streamt Audio 70 Prozent schneller als Chirp 3.
- Laut Artificial Analysis liegt die Wortfehlerrate beim Streaming im Schnitt bei 4,0 Prozent und ohne Streaming bei 2,6 Prozent.
- Es erscheinen zwei separate APIs: gemini-3.5-transcribe-live für Echtzeit und gemini-3.5-transcribe für Aufnahmen.
- Frühzeitige Partner wie Agora, LiveKit, LangChain, Vercel und Pipecat testen die Modelle bereits.
Warum das wichtig ist: Ein Sprachmodell, das nichts vergisst, was es hört, macht aus jeder Unterhaltung einen dauerhaften Datensatz von Google.