Pulse 게시 ·

Open TTS Leaderboard 공개, 다국어 음성 합성·복제·지연시간 비교

Hugging Face에 9월 30일 공개된 Open TTS Leaderboard는 오픈소스 음성 합성 모델의 발음 오류율·화자 유사도·속도를 비교한다. 한국어는 문자 오류율로 평가하며, 첫 오디오 지연은 H200과 일부 모델의 CPU 결과를 제공한다. 자연스러움·표현력은 이 수치로 측정하지 않으며, 출력 음성을 직접 비교하는 탭도 마련했다.

Qwen3 ASR로 생성 음성을 전사해 입력문과의 단어·문자 오류율을 계산하고, WavLM 임베딩으로 참조 음성과의 화자 유사도를 비교한다.

기본 순위는 Seed TTS Eval과 CV3 Eval의 영어 오류율 평균이다. 한국어 등 영어·중국어 외 언어는 CV3 Eval의 zero-shot 평가를 사용한다.

스트리밍 평가는 같은 영어 프롬프트 50개를 기본 음성·배치 크기 1로 실행한다. 첫 3회는 제외하고 나머지 첫 오디오 지연의 중앙값을 보고한다.

스트리밍 모델은 첫 음성 조각이 도착할 때까지, 비스트리밍 모델은 전체 발화 생성이 끝날 때까지를 측정한다.

평가 스크립트는 추후 오픈소스로 공개할 계획이며, 청취 탭에서 출력 비교와 이용자 투표를 지원한다.

음성 에이전트용 모델은 배치 처리 속도보다 첫 오디오 지연을 살피고, 한국어 용도라면 영어 기본 순위 대신 한국어 평가와 샘플을 함께 볼 수 있다.

원문