Google uruchamia Gemini 3.5 Transcribe, swój najdokładniejszy model mowy
System automatycznie wykrywa ponad 85 języków, oznacza do trzech mówców za pomocą znaczników czasu i przesyła dźwięk strumieniowo o 70% szybciej niż Chirp 3.
- Strumieniowa transkrypcja osiąga średni wskaźnik błędu słownego na poziomie 4,0%, a bezstrumieniowa 2,6% według firmy Artificial Analysis.
- Wypuszczono dwa oddzielne interfejsy API: gemini-3.5-transcribe-live dla czasu rzeczywistego oraz gemini-3.5-transcribe dla nagrań.
- Wśród wczesnych partnerów testujących modele znalazły się firmy Agora, LiveKit, LangChain, Vercel i Pipecat.
Dlaczego to ważne: Model mowy, który nigdy nie zapomina tego, co usłyszał, zamienia zwykłą rozmowę w trwały zapis kontrolowany przez Google.