Google En Doğru Ses Modeli Gemini 3.5 Transcribe'ı Çıkardı
Sistem 85'ten fazla dili otomatik algılıyor, zaman damgalarıyla üç konuşmacıyı etiketliyor ve sesleri Chirp 3'ten yüzde 70 daha hızlı aktarıyor.
- Artificial Analysis'e göre canlı aktarım ortalama yüzde 4,0 kelime hata oranı sunarken, kayıttan aktarım yüzde 2,6'ya ulaşıyor.
- İki ayrı API sunuluyor: Gerçek zamanlı işlemler için gemini-3.5-transcribe-live, kayıtlar için gemini-3.5-transcribe.
- Erken dönem ortakları arasında modelleri test eden Agora, LiveKit, LangChain, Vercel ve Pipecat yer alıyor.
Neden önemli: Duyduğunu asla unutmayan bir ses modeli, sohbetleri Google'ın elinde tuttuğu kalıcı bir kayda dönüştürür.