구글, 가장 정확한 음성 모델 '제미나이 3.5 트랜스크라이브' 출시
이 시스템은 85개 이상의 언어를 자동으로 감지하고 타임스탬프와 함께 최대 3명의 화자를 태깅하며, '칠프 3'보다 70% 빠르게 오디오를 스트리밍한다.
- 아티피셜 애널리시스에 따르면 스트리밍 전사의 평균 단어 오류율은 4.0%, 비스트리밍은 2.6%에 달한다.
- 실시간용 '제미나이-3.5-트랜스크라이브-라이브'와 녹음 파일용 '제미나이-3.5-트랜스크라이브' 등 두 가지 개별 API가 제공된다.
- 아고라, 라이브킷, 랭체인, 베르셀, 파이프캣 등의 초기 파트너사들이 이 모델을 테스트하고 있다.
왜 중요한가: 들은 것을 결코 잊지 않는 음성 모델은 대화를 구글이 보유한 영구적인 기록으로 바꿔놓는다.