Open TTS Leaderboard 공개, 다국어 음성 합성·복제·응답 지연 비교
Hugging Face가 9월 30일 공개한 Open TTS Leaderboard는 오픈소스 음성 합성 모델의 다국어 오류율·화자 유사도·속도를 비교한다. H200 GPU와 일부 CPU의 첫 오디오 지연도 제공하며, 한국어는 문자 오류율로 평가한다. 자연스러움과 표현력은 수치 평가에 포함되지 않아 출력 음성을 직접 비교할 수 있게 했다.
기본 순위는 Seed TTS Eval과 CV3 Eval의 영어 분할에서 구한 평균 단어 오류율을 사용한다.
중국어·일본어·한국어는 문자 오류율을 보고하며, 영어·중국어 외 언어는 CV3 Eval의 zero-shot 평가를 사용한다.
음성 복제를 지원하는 모델은 생성 음성과 참조 음성의 WavLM 임베딩 유사도를 비교한다.
스트리밍 평가는 동일한 영어 프롬프트 50개를 배치 크기 1로 실행하고, 첫 3회 준비 실행을 제외한 첫 오디오 지연의 중앙값을 보고한다.
비스트리밍 모델의 첫 오디오 지연은 전체 발화 생성이 끝날 때까지의 시간이다.
평가 스크립트는 향후 오픈소스로 공개할 예정이며, Listen 탭에서 실제 출력 비교와 투표를 지원한다.
음성 에이전트용 모델을 고를 때는 전체 문장 생성 속도보다 첫 오디오 지연을 살펴야 대화 시작까지의 대기 시간을 줄일 수 있다.
원문
- Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice CloningHugging Face · 원문 2026-09-30