NVIDIA, 추가 학습 없이 표 데이터를 예측하는 Kumo Tabular 공개
NVIDIA가 9월 29일 표 데이터 분류·회귀 모델 Kumo Tabular를 공개했다. 정답이 있는 행을 입력하면 추가 학습·튜닝 없이 새 행을 예측한다. 2800만~2억1500만 파라미터의 세 크기로 제공하며 상업적 이용을 허용한다. 수치·범주형 열이 기본 대상이고, 학습 범위를 크게 벗어난 표에서는 정확도가 낮아질 수 있다.
인공적으로 생성한 표만으로 사전학습했으며, 분류와 회귀는 별도 모델로 제공한다.
가중치는 Hugging Face, 실행 코드는 NVIDIA의 structured-data-models 오픈소스 라이브러리로 제공한다. 라이선스는 OpenMDW-1.1이다.
NVIDIA 자체 평가에 따르면 TabArena·BeyondArena·TALENT·ScoringBench에서 1위를 기록했다.
한 번의 순전파는 최대 10개 클래스를 처리하며, 라이브러리가 오류정정 출력 코드를 사용해 더 많은 클래스로 확장한다.
텍스트·이미지·타임스탬프는 전처리로 특징을 만들어 사용한다. 예측 대상 행의 분포가 기존 정답 행과 다르면 정확도가 떨어질 수 있다.
학습 방법과 인공 데이터 생성기는 추후 공개할 예정이라고 밝혔다.
같은 표에 새 행이 계속 들어오는 작업에서는 기존 행의 계산 결과를 캐시해 후속 예측에 재사용할 수 있다.
원문
- NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionHugging Face · 원문 2026-09-30