NVIDIA Kumo Tabular 공개, 추가 학습 없이 표 데이터 분류·회귀 예측
NVIDIA가 9월 29일 표 데이터용 모델 Kumo Tabular를 공개했다. 정답이 붙은 행을 문맥으로 받아 추가 학습·튜닝 없이 새 행의 분류·회귀 값을 예측한다. 합성 데이터만으로 사전학습한 2800만~2억1500만 파라미터 모델 3종이며, 상업적 이용을 허용하는 OpenMDW-1.1 라이선스로 제공한다. 직접 처리하는 열은 수치형·범주형이다.
가중치는 Hugging Face, 실행 코드는 GitHub의 structured-data-models 라이브러리로 제공한다. 학습 방법과 합성 데이터 생성기는 추후 공개할 예정이다.
단일 순전파는 최대 10개 클래스를 처리하며, 라이브러리는 오류 정정 출력 코드를 이용해 클래스 수를 확장한다.
텍스트·이미지·타임스탬프는 전처리로 특징을 변환해야 한다. 학습 범위를 크게 벗어난 표나 문맥과 분포가 다른 예측 행에서는 정확도가 떨어질 수 있다.
NVIDIA는 TabArena·BeyondArena·TALENT·ScoringBench에서 1위를 기록했다고 보고했다.
같은 표에 새 행이 계속 들어오는 작업에서는 기존 문맥의 키·값 캐시를 재사용해 후속 예측의 계산을 줄일 수 있다.
원문
- NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionHugging Face · 원문 2026-09-30