News, Fast

Atom Brief

26. Aug. 2026 · Archiv
Tech

Google startet Gemini 3.5 Transcribe als genauestes Sprachmodell

Das System erkennt über 85 Sprachen automatisch, markiert bis zu drei Sprecher mit Zeitstempeln und streamt Audio 70 Prozent schneller als Chirp 3.

  • Laut Artificial Analysis liegt die Wortfehlerrate beim Streaming im Schnitt bei 4,0 Prozent und ohne Streaming bei 2,6 Prozent.
  • Es erscheinen zwei separate APIs: gemini-3.5-transcribe-live für Echtzeit und gemini-3.5-transcribe für Aufnahmen.
  • Frühzeitige Partner wie Agora, LiveKit, LangChain, Vercel und Pipecat testen die Modelle bereits.

Warum das wichtig ist: Ein Sprachmodell, das nichts vergisst, was es hört, macht aus jeder Unterhaltung einen dauerhaften Datensatz von Google.

Google DeepMind ↗ · 26. Aug. 202626.8.26