Pulse 게시 ·

NVIDIA, GPU 직접 통신을 GPUNetIO 공통 기반으로 통합

NVIDIA가 10월 6일 NCCL·NVSHMEM 등에서 GPU가 직접 통신하는 경로를 GPUNetIO로 통합한 구조를 소개했다. 공개 구현은 RDMA Verbs 중심이고, DOCA SDK는 Ethernet·DMA 등으로 범위를 넓힌다. CPU가 초기 설정을 맡은 뒤 CUDA 커널이 송수신을 수행하며, NCCL은 2.27부터 공개 구현을 활용한다.

내용·출처 업데이트 · 2026. 10. 11. 오전 7:21

오픈소스 GPUNetIO는 경량 RDMA Verbs 구현이며, 전체 DOCA SDK와 기능 범위가 같지는 않다.

공개 구현은 SDK가 없을 때 단독으로 동작한다. SDK 경로를 지정하면 런타임에 선택된 비공개 SDK 함수를 dlopen으로 호출할 수 있다.

CPU는 장치 초기화·메모리 할당·통신 큐 생성과 GPU 메모리로의 descriptor 전달을 담당한다.

GPU 데이터 경로는 작업 큐 등록, NIC 알림, 선택적인 완료 확인으로 구성된다.

고수준 API는 공유 큐의 동시 접근을 처리하지만, 저수준 API는 애플리케이션이 직접 동기화해야 한다.

DGX Spark처럼 GPU와 NIC가 직접 연결되지 않은 시스템에서는 CPU 스레드가 NIC에 알림을 전달하는 보조 방식도 지원한다.

통신 라이브러리마다 따로 구현하던 경로를 공유하면 NIC 지원과 오류 수정을 공통 기반에 반영할 수 있다.

원문