AI 요약
나리랩스(Nari Labs)가 Qwen3-TTS 1.7B 모델을 활용해 단일 NVIDIA H100 SXM에서 초당 10건의 요청(RPS)과 50ms 미만의 p95 TTFA(첫 오디오 도달 시간)를 달성한 구현을 공개했다. vLLM-Omni, SGLang-Omni, VoxServe 등 5가지 구현을 비교한 결과, 자체 구현만이 50ms 미만의 p95 TTFA를 달성했다. 비용은 100만 캐릭터당 약 2달러로, ElevenLabs V3(100달러)나 Cartesia Sonic 3.5(49달러)보다 훨씬 저렴하다. 선행 무음 제거와 프레임 누적 튜닝 등 지연시간 최적화 기법이 핵심이다.
핵심 포인트
- 단일 NVIDIA H100 SXM에서 10 RPS 처리량과 50ms 미만 p95 TTFA 달성, 20 RPS에서도 100ms 미만 유지
- 10 RPS 기준 초당 약 630자 생성, 시간당 4.29달러 인스턴스 기준 100만 캐릭터당 약 2달러 비용
- ElevenLabs V3(100달러/1M) 및 Cartesia Sonic 3.5(49달러/1M) 대비 현저히 낮은 비용
- 선행 무음(leading silence) 동적 트림과 코덱 프레임 누적 튜닝으로 TTFA 약 80ms 개선
향후 전망
- 오픈소스 TTS 구현의 지연시간과 비용 효율성이 크게 개선되어 실시간 음성 서비스 확산에 기여할 전망
출처:hackernews
