Gemini-3.5-Transcribe

Gemini 3.5 Transcribe는 Google이 2026년 8월 26일에 발표한 최신 음성-텍스트 모델로, 실시간 스트리밍과 사전 녹음 오디오 처리를 지원하며, 각각 4.0%와 2.6%의 단어 오류율(WER)을 달성했다. 이 모델은 배경 소음, 전문 용어, 자기 수정 및 필러 단어를 처리하고, 85개 이상의 언어를 지원하며, 사용자 정의 어휘와 함수 호출 기능을 제공한다.

AI 요약

구글이 최신 음성-텍스트 변환 모델인 Gemini 3.5 Transcribe를 공개했다. 이 모델은 배경 소음, 전문 용어, 어색한 발화 처리에 강점을 가지며, 원시 오디오를 정제된 형식의 텍스트로 직접 변환한다. 실시간 스트리밍(Live API)과 사전 녹음 오디오 처리(Interactions API)를 위한 두 가지 API로 제공되며, 자체 수정 인식, 필러 단어 제거, 자동 서식 지정, 함수 호출, 85개 이상 언어 지원 등의 기능을 갖췄다. 스트리밍 기준 평균 단어 오류율(WER) 4.0%, 비스트리밍 기준 2.6%를 기록했다.

핵심 포인트

  • Gemini 3.5 Transcribe는 2026년 8월 26일 공개된 구글의 최신 음성 인식 모델
  • 실시간 스트리밍(Live API)과 사전 녹음 오디오(Interactions API) 두 가지 API로 제공
  • 평균 WER: 스트리밍 4.0%, 비스트리밍 2.6% (Artificial Analysis 측정 기준)
  • 85개 이상 언어 자동 감지 및 전사, 맞춤 어휘 인식, 함수 호출 기능 지원

향후 전망

  • 음성 에이전트, 실시간 자막, 통화 후 분석 파이프라인 등 다양한 개발자 워크플로우에 통합될 전망
  • Gemini 앱 및 Android, macOS에서 이미 활용 중이며, API 공개로 개발자 생태계 확장 기대
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...