News, Fast

Atom Brief

2026年8月26日 · 過往報導
Tech

Google 推出 Gemini 3.5 Transcribe 語音識別模型

該系統能自動偵測 85 種以上語言,標記最多三位發言者並附上時間戳記,串流音訊處理速度比 Chirp 370%

  • 根據 Artificial Analysis 測試,串流轉錄的平均字詞錯誤率為 4.0%,非串流則達到 2.6%
  • 推出兩個獨立 API:gemini-3.5-transcribe-live 用於即時處理,gemini-3.5-transcribe 用於錄音檔。
  • 早期合作夥伴包括 Agora、LiveKit、LangChain、Vercel 以及正在測試模型的 Pipecat。

為什麼重要: 一個絕不遺忘所聞的語音模型,會將日常對話變成由 Google 永久掌控的記錄。

Google DeepMind ↗ · 2026年8月26日26/8/26