Pulse 게시 ·

NVIDIA, 대규모 결정론적 학습의 시간 부담 약 2%로 줄인 사례 공개

NVIDIA가 10월 6일 Megatron Core의 비트 단위 결정론적 사전학습 최적화 사례를 공개했다. 회사 측 Nemotron 실험은 GPU 2432개에서 정상 상태의 스텝 시간 부담을 약 2%로 줄이고 800스텝 동안 동일한 결과를 유지했다. 재현성 검증은 하드웨어·소프트웨어·학습 설정이 같은 환경에 한정된다.

내용·출처 업데이트 · 2026. 10. 11. 오전 7:11

독립 실행 간 결과 일치뿐 아니라 체크포인트를 복원한 실행과 중단 없는 실행의 비트 단위 일치를 목표로 한다.

조 단위 파라미터 Nemotron 사례는 상태공간 모델과 Transformer attention 계층을 결합하며, 저정밀 계산·분산 통신·계층 전환까지 결정론적 실행을 다룬다.

GPU 2432개에서 측정한 약 2%는 가장 빠른 지원 비결정론적 설정 대비 정상 상태 스텝 시간의 추가 부담이다.

별도 Nemotron 3 Ultra 실험에서는 GPU 3072개에서 부담을 약 1.5%로 낮췄다. 서로 다른 워크로드의 결과다.

grouped-GEMM의 여러 쓰기 작업에 개별 출력 공간을 주고 고정 순서로 합산해, 병렬 실행을 유지하면서 결과의 순서 의존성을 제거했다.

Megatron-LM PR #7262는 랭크별 텐서 지문을 기록해 최초 차이가 발생한 연산을 추적하는 절차를 제안한다.

중단 후 재개한 학습도 같은 수치 경로를 따르게 하면, 손실 급등이 코드 변경 때문인지 실행마다 생기는 차이 때문인지 좁혀볼 수 있다.

원문