AI 요약
구글이 최신 음성-텍스트 변환 모델인 Gemini 3.5 Transcribe를 공개했다. 이 모델은 배경 소음, 전문 용어, 어색한 발화 처리에 강점을 가지며, 원시 오디오를 정제된 형식의 텍스트로 직접 변환한다. 실시간 스트리밍(Live API)과 사전 녹음 오디오 처리(Interactions API)를 위한 두 가지 API로 제공되며, 자체 수정 인식, 필러 단어 제거, 자동 서식 지정, 함수 호출, 85개 이상 언어 지원 등의 기능을 갖췄다. 스트리밍 기준 평균 단어 오류율(WER) 4.0%, 비스트리밍 기준 2.6%를 기록했다.
핵심 포인트
- Gemini 3.5 Transcribe는 2026년 8월 26일 공개된 구글의 최신 음성 인식 모델
- 실시간 스트리밍(Live API)과 사전 녹음 오디오(Interactions API) 두 가지 API로 제공
- 평균 WER: 스트리밍 4.0%, 비스트리밍 2.6% (Artificial Analysis 측정 기준)
- 85개 이상 언어 자동 감지 및 전사, 맞춤 어휘 인식, 함수 호출 기능 지원
향후 전망
- 음성 에이전트, 실시간 자막, 통화 후 분석 파이프라인 등 다양한 개발자 워크플로우에 통합될 전망
- Gemini 앱 및 Android, macOS에서 이미 활용 중이며, API 공개로 개발자 생태계 확장 기대
