Open TTS Leaderboard 공개, 다국어 음성 합성·복제·응답 속도 비교
Hugging Face가 9월 30일 오픈소스 음성 합성 모델을 비교하는 Open TTS Leaderboard를 공개했다. 언어별 인식 오류율·화자 유사도·첫 음성 출력 시간을 평가하며 한국어는 문자 오류율을 쓴다. 자연스러움이나 청취 선호도를 직접 측정하지는 않으며, 생성 음성을 듣고 비교하는 기능도 제공한다.
기본 순위는 Seed TTS Eval과 CV3 Eval의 영어 오류율을 평균한 결과이며, 다른 언어를 선택해 별도 비교할 수 있다.
한국어·중국어·일본어는 문자 오류율(CER)을 보고하며, 영어·중국어 외 언어는 CV3 Eval 자료로 평가한다.
스트리밍 평가는 동일한 영어 프롬프트 50개를 배치 크기 1로 실행한다. H200 GPU 결과와 일부 모델의 CPU 결과를 제공한다.
스트리밍 모델은 첫 음성 조각까지, 비스트리밍 모델은 전체 발화 생성까지 걸린 시간을 측정한다.
평가 스크립트는 향후 오픈소스로 공개할 계획이다.
음성 에이전트용 모델을 고를 때 대상 언어의 발음 정확도와 첫 응답 속도를 함께 좁혀본 뒤 실제 음성을 비교할 수 있다.
원문
- Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice CloningHugging Face · 원문 2026-09-30