News, Fast

Atom Brief

26 sie 2026 · Archiwum
Tech

Google uruchamia Gemini 3.5 Transcribe, swój najdokładniejszy model mowy

Google uruchamia Gemini 3.5 Transcribe, swój najdokładniejszy model mowy

System automatycznie wykrywa ponad 85 języków, oznacza do trzech mówców za pomocą znaczników czasu i przesyła dźwięk strumieniowo o 70% szybciej niż Chirp 3.

  • Strumieniowa transkrypcja osiąga średni wskaźnik błędu słownego na poziomie 4,0%, a bezstrumieniowa 2,6% według firmy Artificial Analysis.
  • Wypuszczono dwa oddzielne interfejsy API: gemini-3.5-transcribe-live dla czasu rzeczywistego oraz gemini-3.5-transcribe dla nagrań.
  • Wśród wczesnych partnerów testujących modele znalazły się firmy Agora, LiveKit, LangChain, Vercel i Pipecat.

Dlaczego to ważne: Model mowy, który nigdy nie zapomina tego, co usłyszał, zamienia zwykłą rozmowę w trwały zapis kontrolowany przez Google.

Google DeepMind ↗ · 26 sie 202626.08.26