Pulse 게시 ·

Open TTS Leaderboard 공개, 다국어 음성 합성·복제·응답 속도 비교

Hugging Face가 9월 30일 오픈소스 음성 합성 모델을 비교하는 Open TTS Leaderboard를 소개했다. 언어별 인식 오류율과 화자 유사도, H200·일부 CPU의 첫 오디오 지연을 제공한다. 자연스러움·표현력은 이 수치로 직접 평가하지 않으며, 생성 음성을 듣고 비교하는 기능도 마련했다.

기본 순위는 Seed TTS Eval과 CV3 Eval의 영어 오류율 평균이며, 한국어·중국어·일본어는 문자 오류율을 보고한다.

음성 복제 지원 모델은 참조 음성과 생성 음성의 WavLM 임베딩 유사도로 비교한다.

스트리밍 평가는 동일한 영어 프롬프트 50개를 배치 크기 1로 실행하고, 초기 3회를 제외한 첫 오디오 지연의 중앙값을 사용한다.

비스트리밍 모델의 첫 오디오 지연은 전체 발화 생성이 끝날 때까지의 시간이다.

평가 스크립트는 향후 오픈소스로 공개할 계획이다.

음성 에이전트용 모델을 고를 때는 전체 문장 생성 속도보다 재생 가능한 첫 음성이 도착하는 시간을 비교하는 데 쓸 수 있다.

원문