Pulse 게시 ·

Open TTS Leaderboard 공개, 다국어 음성 합성·복제 성능 비교

Hugging Face가 9월 30일 공개한 Open TTS Leaderboard는 음성 합성 모델의 전사 오류율·속도·화자 유사도를 비교한다. 한국어는 문자 오류율을 사용하며, 첫 오디오 지연은 동일한 영어 프롬프트 50개로 측정한다. 자연스러움이나 청취 선호도를 직접 평가하는 지표는 아니며, 출력 음성을 들어보는 탭도 제공한다.

기본 순위는 Seed TTS Eval과 CV3 Eval의 영어 분할에서 계산한 평균 단어 오류율을 기준으로 한다.

중국어·일본어·한국어는 문자 오류율을 사용하고, 영어·중국어 외 언어는 CV3 Eval의 제로샷 평가를 이용한다.

배치 처리 속도는 H200 GPU에서 측정하며, 스트리밍 탭은 H200과 일부 모델의 CPU 결과를 제공한다.

첫 오디오 지연은 배치 크기 1·기본 음성으로 측정하고, 준비 실행 3회를 제외한 중앙값을 보고한다.

비스트리밍 모델은 문장 전체 생성까지의 시간이 첫 오디오 지연으로 계산된다.

평가 스크립트는 앞으로 오픈소스로 공개할 예정이라고 밝혔다.

음성 에이전트용 모델을 고를 때는 첫 오디오 지연으로 후보를 좁힌 뒤, 사용할 언어의 출력 음성을 직접 비교할 수 있다.

원문