News, Fast

Atom Brief

26 sie 2026 · Archiwum
Tech

Google uruchamia Gemini 3.5 Transcribe, swój najdokładniejszy model mowy

System automatycznie wykrywa ponad 85 języków, oznacza do trzech mówców za pomocą znaczników czasu i przesyła dźwięk strumieniowo o 70% szybciej niż Chirp 3.

  • Strumieniowa transkrypcja osiąga średni wskaźnik błędu słownego na poziomie 4,0%, a bezstrumieniowa 2,6% według firmy Artificial Analysis.
  • Wypuszczono dwa oddzielne interfejsy API: gemini-3.5-transcribe-live dla czasu rzeczywistego oraz gemini-3.5-transcribe dla nagrań.
  • Wśród wczesnych partnerów testujących modele znalazły się firmy Agora, LiveKit, LangChain, Vercel i Pipecat.

Dlaczego to ważne: Model mowy, który nigdy nie zapomina tego, co usłyszał, zamienia zwykłą rozmowę w trwały zapis kontrolowany przez Google.

Google DeepMind ↗ · 26 sie 202626.08.26