News, Fast

Atom Brief

2026年8月26日 · アーカイブ
Tech

グーグル、最高精度の音声モデル「Gemini 3.5 Transcribe」を発表

このシステムは85言語以上を自動検出し、タイムスタンプ付きで最大3人の話者を識別し、Chirp 3よりも70%高速に音声をストリーミング処理する。

  • アーティフィシャル・アナリシスによれば、ストリーミング文字起こしの単語誤り率は平均4.0%、非ストリーミングでは2.6%に達する。
  • リアルタイム用の「gemini-3.5-transcribe-live」と、録音用の「gemini-3.5-transcribe」の2つのAPIが提供される。
  • 初期パートナーとして、Agora、LiveKit、LangChain、Vercel、Pipecatがこのモデルのテストに参加している。

なぜ重要か: 聞いたことを決して忘れない音声モデルは、会話をグーグルが握る永久的な記録へと変えてしまう。

Google DeepMind ↗ · 2026年8月26日26/8/26