NVIDIA, Nemotron 음성 인식의 사우디 방언 미세조정 절차 공개
NVIDIA가 9월 30일 Nemotron 3.5 ASR의 사우디 방언 미세조정 절차를 소개했다. 나지디·히자지 음성 133.7시간에 기존 언어 데이터를 섞어 학습한 실험에서, 대상 시험군의 단어 오류율은 55.05%에서 29.96%로 낮아졌다. 영어 시험군도 11.04%에서 10.42%로 개선됐다.
학습 데이터는 사우디 방언 90%, FLEURS 영어 7%, 아랍어 3%로 가중 혼합해 기존 언어 능력의 손실을 줄였다.
길이가 비슷한 음성을 묶는 배치 구성을 적용했으며, RTX PRO 6000 Blackwell GPU 2대로 1만2000단계를 약 4.5시간 학습했다.
대상 시험군에서 인코더 전체 24개 층을 갱신할 때 오류율 29.96%, 상위 8개 층만 갱신할 때 32.32%를 기록했다.
미래 참조 범위를 3프레임에서 13프레임으로 늘리고 MALSD beam-8을 사용하면 오류율이 27.25%가 됐다.
재현용 노트북과 미세조정 skill을 제공하며, 다른 언어로 적용할 때는 정규화·토크나이저·회귀 평가 데이터를 조정해야 한다.
추가 학습 없이도 미래 음성 참조 범위와 빔 탐색을 늘려 오류율을 27.25%로 낮췄지만, 약 800ms의 추가 버퍼링은 실시간 자막에 부담이 된다.
원문
- Fine-Tuning NVIDIA Nemotron for Saudi Arabic Dialects, with a Path to Other LanguagesNVIDIA Developer · 원문 2026-10-01