NVIDIA, 추가 학습 없이 표 데이터를 예측하는 Kumo Tabular 공개
NVIDIA가 9월 29일 표 데이터의 분류·회귀 모델 Kumo Tabular를 공개했다. 회사에 따르면 정답이 있는 행을 문맥으로 받아 추가 학습·튜닝 없이 새 행을 예측한다. 2800만~2억1500만 파라미터의 세 크기로 제공하며 상업적 이용을 허용한다. NVIDIA 평가에서는 표 데이터 벤치마크 4종에서 1위를 기록했다.
가중치는 Hugging Face에, 실행용 structured-data-models 라이브러리는 GitHub에 공개됐으며 OpenMDW-1.1 라이선스를 적용한다.
인공 표 데이터만으로 사전학습했으며, 학습 절차와 데이터 생성기는 추후 공개할 예정이다.
수치형·범주형 열을 직접 처리한다. 텍스트·이미지·타임스탬프는 전처리로 특징을 변환해야 한다.
한 번의 순전파는 최대 10개 클래스를 처리하며, 라이브러리는 오류 정정 출력 코드를 통해 더 많은 클래스로 확장한다.
학습 범위를 크게 벗어난 표나 문맥 행과 분포가 다른 예측 행에서는 정확도가 낮아질 수 있다.
회사 평가에서 TabArena·BeyondArena·TALENT·ScoringBench의 종합 순위가 1위였다.
예측 과제마다 별도 모델을 학습하는 대신 정답이 있는 표를 입력해, 수요·가격 예측 등의 초기 실험 절차를 줄일 수 있다.
원문
- NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionHugging Face · 원문 2026-09-30