News, Fast

Atom Brief

26 Ağu 2026 · Arşiv
Tech

Google En Doğru Ses Modeli Gemini 3.5 Transcribe'ı Çıkardı

Sistem 85'ten fazla dili otomatik algılıyor, zaman damgalarıyla üç konuşmacıyı etiketliyor ve sesleri Chirp 3'ten yüzde 70 daha hızlı aktarıyor.

  • Artificial Analysis'e göre canlı aktarım ortalama yüzde 4,0 kelime hata oranı sunarken, kayıttan aktarım yüzde 2,6'ya ulaşıyor.
  • İki ayrı API sunuluyor: Gerçek zamanlı işlemler için gemini-3.5-transcribe-live, kayıtlar için gemini-3.5-transcribe.
  • Erken dönem ortakları arasında modelleri test eden Agora, LiveKit, LangChain, Vercel ve Pipecat yer alıyor.

Neden önemli: Duyduğunu asla unutmayan bir ses modeli, sohbetleri Google'ın elinde tuttuğu kalıcı bir kayda dönüştürür.

Google DeepMind ↗ · 26 Ağu 202626.08.26