Pulse 게시 ·

Open TTS Leaderboard 공개, 다국어 음성 합성·복제·응답 지연 비교

Hugging Face에 9월 30일 공개된 Open TTS Leaderboard가 공개 음성 합성 모델의 다국어 발음 정확도·처리 속도·음성 복제 유사도를 비교한다. H200 GPU와 일부 CPU에서 첫 오디오까지의 지연도 측정하며, 한국어는 문자 오류율을 사용한다. 자연스러움과 청취 선호를 직접 측정하는 지표는 아니어서 생성 음성을 듣고 비교하는 탭도 제공한다.

기본 순위는 Seed TTS Eval과 CV3 Eval의 영어 분할에서 측정한 평균 단어 오류율을 기준으로 한다.

한국어·중국어·일본어에는 문자 오류율을 사용하며, 영어·중국어 외 언어는 CV3 Eval 결과로 비교한다.

스트리밍 평가는 동일한 영어 프롬프트 50개를 배치 크기 1로 실행하고, 초기 3회를 제외한 첫 오디오 지연의 중앙값을 보고한다.

음성 복제 유사도는 생성 음성과 참조 음성의 WavLM 화자 임베딩 간 코사인 유사도로 계산한다.

평가 스크립트는 향후 오픈소스로 공개할 계획이다.

음성 에이전트용 모델을 고를 때는 대량 생성 속도와 함께 첫 오디오 지연을 살펴야 대화 시작까지의 대기 시간을 판단할 수 있다.

원문