텍스트 음성 모델 응답 속도 50ms 미만으로 줄인 비결

Qwen3-TTS 1.7B CustomVoice 구현은 단일 NVIDIA H100 SXM에서 초당 10건의 요청을 처리하며 p95 시간 대비 첫 오디오 도달 시간을 50ms 미만으로 유지한다. 이는 리딩 사일런스 제거와 프레임 누적 튜닝을 통해 달성했으며, 비용은 100만 자당 약 2달러로 기존 서비스보다 저렴하다.

AI 요약

나리랩스(Nari Labs)가 Qwen3-TTS 1.7B 모델을 활용해 단일 NVIDIA H100 SXM에서 초당 10건의 요청(RPS)과 50ms 미만의 p95 TTFA(첫 오디오 도달 시간)를 달성한 구현을 공개했다. vLLM-Omni, SGLang-Omni, VoxServe 등 5가지 구현을 비교한 결과, 자체 구현만이 50ms 미만의 p95 TTFA를 달성했다. 비용은 100만 캐릭터당 약 2달러로, ElevenLabs V3(100달러)나 Cartesia Sonic 3.5(49달러)보다 훨씬 저렴하다. 선행 무음 제거와 프레임 누적 튜닝 등 지연시간 최적화 기법이 핵심이다.

핵심 포인트

  • 단일 NVIDIA H100 SXM에서 10 RPS 처리량과 50ms 미만 p95 TTFA 달성, 20 RPS에서도 100ms 미만 유지
  • 10 RPS 기준 초당 약 630자 생성, 시간당 4.29달러 인스턴스 기준 100만 캐릭터당 약 2달러 비용
  • ElevenLabs V3(100달러/1M) 및 Cartesia Sonic 3.5(49달러/1M) 대비 현저히 낮은 비용
  • 선행 무음(leading silence) 동적 트림과 코덱 프레임 누적 튜닝으로 TTFA 약 80ms 개선

향후 전망

  • 오픈소스 TTS 구현의 지연시간과 비용 효율성이 크게 개선되어 실시간 음성 서비스 확산에 기여할 전망
Share

이것도 읽어보세요

댓글

이 소식에 대한 의견을 자유롭게 남겨주세요.

댓글 (0)

불러오는 중...