NVIDIA Kumo Tabular 공개, 추가 학습 없이 표 데이터 분류·회귀 수행
NVIDIA가 9월 29일 표 데이터 예측 모델 Kumo Tabular의 가중치와 실행 코드를 공개했다. 정답이 있는 행을 문맥으로 받아 추가 학습 없이 새 행을 분류하거나 수치를 예측한다. 2800만~2억1500만 파라미터의 3종이며 상업 이용을 허용한다. 수치·범주형 열이 기본 대상이고 텍스트·이미지·시각은 전처리가 필요하다.
인공적으로 생성한 표만으로 사전학습했으며, 분류와 회귀 모델은 별도로 학습했다.
가중치는 Hugging Face, GPU 기반 실행 라이브러리는 GitHub에 공개했다. 라이선스는 OpenMDW-1.1이다.
NVIDIA는 자체 평가에서 TabArena·BeyondArena·TALENT·ScoringBench의 종합 순위 1위를 기록했다고 밝혔다.
한 번의 순전파는 최대 10개 클래스를 처리하며, 라이브러리가 오류 정정 출력 코드를 이용해 더 많은 클래스로 확장한다.
훈련은 최대 6만 행·100열까지 확장했다. 훈련 범위를 크게 넘는 표나 문맥과 예측 행의 분포가 다른 경우 정확도가 떨어질 수 있다.
학습 방법과 인공 데이터 생성기는 추후 공개할 예정이다.
예측 과제가 바뀔 때마다 모델을 다시 학습하는 대신, 정답이 있는 행을 입력으로 바꿔 여러 과제를 빠르게 시도할 수 있다.
원문
- NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionHugging Face · 원문 2026-09-30