NVIDIA cuOpt, 대규모 선형계획을 여러 GPU에 나누는 mPDLP 소개
NVIDIA가 10월 7일 NVLink로 연결된 GPU에 선형계획 문제를 분산하는 cuOpt mPDLP를 소개했다. 회사에 따르면 Kinaxis는 변수 1억3500만개 이상인 공급망 모델에서 H100 8개로 3.3배 가속을 기록했다. 작은 문제나 GPU 간 통신이 많은 구조에서는 오히려 느려질 수 있다.
단일 GPU PDLP 대비 GPU당 최대 메모리 사용량을 최대 6분의 1로 줄였다고 밝혔다. 지원 문제의 비영 원소 수 상한은 21억개다.
DGX B200 기반 100개 이상 문제 평가에서 비영 원소가 1000만개를 넘는 대부분의 사례는 기존 D-PDLP보다 1.2~2.5배 빨랐지만, 초대형 사례 3개에서는 느렸다.
tsp-gaia-10m의 PDLP 계산 단계만 비교하면 최대 11.4배, 전처리·분할 등을 포함한 전체 실행은 4.2배 가속이었다.
PSR은 변수 1억8500만개인 에너지 확장 모델에서 B200 8개로 5배 이상의 가속을 보고했다. 자체 MPS 파일로 GPU 수별 성능을 비교하는 튜토리얼을 제공한다.
서로 의존하는 계산을 같은 GPU에 배치해 데이터 이동을 줄이는 방식이어서, GPU 수뿐 아니라 제약 행렬의 연결 구조가 성능을 좌우한다.
원문
- Scaling Decision Optimization to 100 Million Variables and Beyond with mPDLP in NVIDIA cuOptNVIDIA Developer · 원문 2026-10-08