Pulse 게시 ·

NVIDIA, 추가 학습 없이 표 데이터를 예측하는 Kumo Tabular 공개

NVIDIA가 9월 29일 표 데이터의 분류·회귀용 모델 Kumo Tabular를 공개했다. 정답이 있는 행을 문맥으로 받아 추가 학습이나 튜닝 없이 새 행을 예측하며, 가중치와 실행 라이브러리를 제공한다. 상업적 이용이 가능한 OpenMDW 1.1 라이선스를 적용했고, 기본 입력은 수치·범주형 열이다.

2800만~2억1500만 파라미터의 세 크기로 제공하며, 분류와 회귀 모델은 따로 학습했다.

사전학습에는 인공적으로 생성한 표만 사용했다. 학습 절차와 데이터 생성기는 추후 공개할 예정이다.

NVIDIA는 TabArena·BeyondArena·TALENT·ScoringBench에서 1위를 기록했다고 보고했다.

단일 순전파는 최대 10개 클래스를 처리하며, 라이브러리가 오류정정 출력 코드를 이용해 더 많은 클래스를 지원한다.

텍스트·이미지·타임스탬프는 전처리로 특징으로 변환할 수 있다. 학습 범위를 크게 벗어난 표나 문맥과 다른 분포의 예측 행에서는 정확도가 낮아질 수 있다.

문맥 행의 키·값을 재사용하며, 각 예측은 함께 처리하는 다른 예측 행에 의존하지 않는다.

정답을 붙인 행들을 교체해 새 예측 과제에 적용할 수 있어, 과제마다 모델을 다시 학습하는 작업을 줄이는 방식이다.

원문