Google ra mắt Gemini 3.5 Transcribe, mô hình giọng nói chính xác nhất
Hệ thống tự động phát hiện hơn 85 ngôn ngữ, gán nhãn tối đa ba người nói kèm dấu thời gian và truyền phát âm thanh nhanh hơn 70% so với Chirp 3.
- Tỷ lệ lỗi từ khi truyền phát trực tiếp đạt trung bình 4,0%, chế độ không truyền phát đạt 2,6%, theo Artificial Analysis.
- Hai API riêng biệt gồm gemini-3.5-transcribe-live cho thời gian thực và gemini-3.5-transcribe cho bản ghi âm.
- Các đối tác thử nghiệm sớm gồm Agora, LiveKit, LangChain, Vercel và Pipecat.
Vì sao quan trọng: Mô hình giọng nói không bao giờ quên những gì nó nghe thấy biến cuộc trò chuyện thành hồ sơ vĩnh viễn do Google nắm giữ.