NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular Prediction
Quick Summary
NVIDIA Kumo Tabular는 인공 데이터만으로 사전학습한 공개 표 데이터 파운데이션 모델로, 별도 학습·튜닝·특성 엔지니어링 없이 분류와 회귀를 수행하며 네 벤치마크에서 정확도와 효율성의 새로운 최고 수준을 제시했다고 NVIDIA는 밝혔다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
NVIDIA Kumo Tabular는 인공 데이터만으로 사전학습한 공개 표 데이터 파운데이션 모델로, 별도 학습·튜닝·특성 엔지니어링 없이 분류와 회귀를 수행하며 네 벤치마크에서 정확도와 효율성의 새로운 최고 수준을 제시했다고 NVIDIA는 밝혔다.
📌 핵심 요약
- NVIDIA Kumo Structured 모델 모음에 속하는 NVIDIA Kumo Tabular는 레이블이 있는 행을 문맥으로 받아 새 행의 클래스 확률이나 수치 예측을 한 번의 순전파로 반환하며, Hugging Face에서 OpenMDW-1.1 라이선스로 상업적 사용이 가능하게 공개됐다.
- 모델은 28M~215M 파라미터의 Small·Medium·Large 세 크기로 제공되며, 실제 데이터 없이 인공 표만으로 사전학습했다. 각 크기는 약 3,500만·7,100만·1억 3,700만 개의 인공 표를 학습했다.
- 열·행·인컨텍스트 어텐션을 결합하고 문맥의 키·값을 재사용한다. 회귀에서는 999개 분위수를 출력해 점 예측과 불확실성 추정치를 제공하며, 표 크기에 따라 어텐션 온도를 조절한다.
- NVIDIA의 평가에서 Kumo Tabular는 TabArena, BeyondArena, TALENT, ScoringBench에서 선두를 기록했다. TabArena의 전체 ELO는 1950이며, BeyondArena의 ELO는 1418, Improvability 점수는 7.78%였다.
- 직접 처리하는 열은 수치형·범주형이며, 텍스트·이미지·타임스탬프는 전처리로 특성화할 수 있다. 단일 순전파는 최대 10개 클래스를 처리하고 라이브러리는 오류 정정 출력 코드로 이를 확장한다. 학습 범위를 크게 벗어난 표나 문맥과 질의의 분포 차이에서는 정확도가 낮아질 수 있어, 배포 전 자체 홀드아웃 데이터로 정확도와 보정 수준을 검증해야 한다.
🧩 주요 포인트
- 레이블이 있는 표를 문맥으로 활용 → 과제마다 모델을 새로 학습하던 작업 흐름을 사전학습 모델의 즉시 예측으로 전환한다.
- 인공 표의 결측·범주·회귀 분포를 다양화하고 문맥을 최대 60,000행, 열을 최대 100개까지 학습 → 현실 데이터의 불완전성에 대응하도록 설계했지만 학습 범위 밖의 일반화는 검증이 필요하다.
- 행 압축·문맥 캐시 재사용과 네 벤치마크의 선두 성적을 결합 → 정확도와 추론 효율성을 함께 개선했다는 주장을 뒷받침하되, 실제 적용 판단에는 자체 데이터의 정확도와 보정 수준이 필요하다.
🧠 상세 정리
1. 표 예측의 작업 흐름을 바꾸려는 공개 모델
2026년 9월 29일 공개된 글은 고객 기록, 거래, 센서 로그, 보험 청구, 주문 같은 표 데이터가 기업 머신러닝의 기반이라는 문제의식에서 출발한다. 지난 20년간 널리 사용된 그래디언트 부스팅 트리는 좋은 성과를 냈지만, 새 과제마다 레이블 수집, 특성 엔지니어링, 하이퍼파라미터 탐색, 검증과 배포를 반복하고 각 과제를 처음부터 학습해야 했다고 설명한다. NVIDIA는 사전학습 모델이 가중치를 갱신하지 않고 예시를 통해 과제를 해결하는 인컨텍스트 학습을 표에도 적용한다. NVIDIA Kumo Structured 모델 모음에 속하는 Kumo Tabular는 레이블이 있는 행과 예측할 행을 받아 한 번의 순전파로 분류 확률이나 회귀 예측을 반환한다. 별도 학습·튜닝·특성 엔지니어링이 필요 없다는 점을 핵심 가치로 제시하며, 28M~215M 파라미터의 세 크기로 공개했다.
2. 셀과 행의 구조를 반영하는 Transformer
Kumo Tabular는 TabICL과 TabPFN에서 소개된 열·행·인컨텍스트 어텐션을 활용해, 열 안에서 값의 의미를 파악하고 행 안의 특성 상호작용을 학습하도록 설계됐다. 셀 임베딩에서는 셀 묶음을 토큰으로 만들고, 수치형과 범주형 값에 각각 별도의 가중치를 적용한 학습 주파수의 사인·코사인 Fourier 특성을 사용하며, 결측값은 대치 없이 특별하게 처리하고 문맥 토큰에는 레이블 임베딩을 부여한다. 행 임베딩은 열 어텐션과 행 어텐션을 여러 차례 번갈아 적용해 구성한다. 열 어텐션은 유도 자기어텐션을 통해 같은 열의 분포에서 값이 보통인지 극단적인지 파악하며 비용이 행 수에 선형으로 증가하고, 행 어텐션은 회전 위치 표현으로 열을 구별하면서 한 행 안의 특성 관계를 학습한다. 각 행에 추가된 네 개의 학습 가능한 [CLS] 토큰이 최종 행 표현을 만들며, 이렇게 행을 압축한 뒤에는 마지막 단계의 비용이 열 수에 의존하지 않는다.
3. 문맥 재사용과 큰 표에 대응하는 어텐션
마지막 Transformer는 행 임베딩을 처리하며, 문맥 행끼리는 서로 참조하지만 질의 행은 문맥 행만 참조하도록 구성된다. 따라서 각 예측은 문맥과 해당 질의 행에만 의존하고, 함께 점수를 계산하는 다른 질의 행에는 영향을 받지 않는다. 문맥이 질의를 참조하지 않으므로 문맥의 키·값을 한 번 계산해 후속 예측에 재사용할 수 있고, 질의 행에는 Test-GQA를 적용해 각 예측이 읽는 캐시를 줄인다. 출력 헤드는 분류의 클래스 확률 또는 회귀의 999개 분위수를 생성하며, 회귀 분위수로부터 점 예측과 불확실성 추정치를 얻는다. 또한 키 수가 늘어나면 Softmax 어텐션이 분산되는 문제에 대응해, 키 수의 로그에 따라 증가하는 온도로 질의를 스케일링하고 어텐션 헤드마다 계수를 따로 학습한다. NVIDIA는 이 방식이 추론 시 표가 학습 때보다 길거나 넓어져도 어텐션의 집중도를 유지하도록 돕는다고 설명한다.
4. 인공 표 생성과 현실 데이터의 불완전성
Kumo Tabular의 사전학습 데이터는 전부 구조적 인과 모델인 SCM에서 생성한 인공 표다. 생성기는 먼저 표 크기, 과제, 생성 메커니즘과 결측 조건을 정하고, 무작위 인과 그래프로 숨은 변수를 연결한 뒤 각 노드에 선형 변환, 작은 신경망, 트리 또는 Gaussian process 같은 무작위 함수를 적용한다. 일부 노드는 수치형·범주형 열이 되고 하나는 예측 대상이 되며, 나머지는 실제 데이터의 관측되지 않은 원인처럼 숨겨진 상태로 남는다. 후처리로 열 집단의 상관관계, 이상치 제한, 결측값을 반영하고, 빠른 트리 앙상블 검사로 학습 가능한 신호가 없는 표를 제외한다. 학습된 생성 모델이 아닌 절차적 샘플러이므로 새로운 그래프와 메커니즘을 가진 표를 계속 만들 수 있으며, 여러 결측 패턴, 값의 거친 구간화로 인한 동일 행의 레이블 불일치, 수준이 많은 범주형 열과 꼬리가 두꺼운 회귀 목표도 포함한다. 이러한 불완전성을 가진 수백만 개의 표를 경험하게 해 별도 정리 없이 대응하도록 학습한다는 것이 글의 설명이다.
5. 분류·회귀를 분리한 3단계 사전학습
각 인공 표에서 모델은 대부분의 행과 레이블을 문맥으로 보고, 나머지 행의 레이블을 예측하는 방식으로 학습한다. 분류에는 교차 엔트로피 손실을, 회귀에는 분위수 손실을 사용하며, 분류 모델과 회귀 모델은 별도로 학습한다. TabICLv2와 유사한 3단계 학습 중 가장 긴 첫 단계에서는 1,024행과 최대 100개 열의 표를 사용해 표의 기본 구조를 익힌다. 두 번째 단계에서는 문맥을 400~10,240행으로 변화시키고, 세 번째 단계에서는 최대 100개 열을 유지하면서 문맥을 60,000행까지 확장한다. Small·Medium·Large는 각각 약 3,500만·7,100만·1억 3,700만 개의 인공 표를 학습했으며, 학습 방법과 인공 데이터 생성기는 추후 공개할 예정이라고 밝혔다. 큰 문맥을 처리하는 능력은 이러한 학습 범위와 연결되지만, 원문은 그 범위를 크게 벗어나는 표에서도 같은 정확도를 보장한다고 주장하지 않는다.
6. 네 벤치마크의 성능과 효율성 주장
NVIDIA는 세 모델 크기를 기본 설정으로 평가하고, 튜닝된 그래디언트 부스팅 트리, AutoGluon과 최신 표 파운데이션 모델을 포함한 TabArena 전체 순위표와 비교했다. Kumo Tabular는 전체 ELO 1950으로 1위를 기록했으며, 세 크기 모두 정확도와 효율성의 파레토 전선에서 새로운 최고 수준을 달성했다고 주장한다. 단일 RTX 6000 Pro로 통일한 평가에서 LimiX-2보다 빠르다고 보고하지만, 제공된 원문에는 '17 faster'라고만 적혀 있어 17의 배수나 단위가 명확하지 않다. BeyondArena에서는 ELO 1418과 Improvability 7.78%로 1위에 올랐다. TALENT에서는 분류 정확도, 분류 로그 손실, 회귀 RMSE의 평균 순위가 각각 6.67, 3.98, 4.22로 전체 최상위였고, 예측 분포를 평가하는 ScoringBench에서는 Kumo Tabular-Large와 Medium이 평균 순위 기준으로 각각 1위와 2위를 차지했다.
7. 입력 유형과 일반화의 한계
Kumo Tabular가 직접 처리하는 입력은 수치형과 범주형 열이며, 텍스트·이미지·타임스탬프는 내장 전처리 방법으로 특성으로 변환할 수 있다. 단일 순전파가 다루는 클래스는 최대 10개지만, 라이브러리는 오류 정정 출력 코드를 이용해 임의의 클래스 수로 확장한다. 이러한 지원 범위와 별개로, 표가 학습 범위를 크게 벗어나거나 질의 행의 분포가 문맥 행과 다르면 정확도가 저하될 수 있다고 원문은 명시한다. 따라서 네 벤치마크의 선두 성적만으로 개별 기업 데이터에서의 결과를 확정할 수는 없으며, 글은 다른 예측 모델과 마찬가지로 배포 전에 자체 홀드아웃 데이터에서 정확도와 보정 수준을 검증하도록 요구한다. 이는 별도 학습 없이 예측할 수 있다는 장점과, 실제 적용 환경에서 성능을 확인해야 한다는 조건을 함께 제시하는 대목이다.
8. GPU 라이브러리와 공개 이용 조건
모델은 NVIDIA가 새로 공개한 GPU 기반 structured-data-models 라이브러리로 실행하며, 처음 사용할 때 Hub에서 가중치를 내려받는다. 이 라이브러리는 평가에 사용한 전처리, 앙상블과 다중 클래스 처리 기능을 제공한다. 예제는 pandas.DataFrame을 CUDA 장치의 TableTensor로 변환한 뒤, 목표값의 결측 여부로 레이블이 있는 문맥 행과 예측할 질의 행을 나누고 KumoTabular에 특성과 목표값을 전달하는 흐름을 보여준다. 코드 저장소는 https://github.com/NVIDIA/structured-data-models이고 모델 가중치는 https://huggingface.co/nvidia/Kumo-Tabular에 공개됐으며, OpenMDW License Agreement 버전 1.1에 따라 상업적으로 사용할 수 있다. NVIDIA는 신뢰할 수 있는 AI를 공동 책임으로 설명하며, 개발자가 지원 모델 팀과 협력해 해당 산업과 용도의 요구사항 및 예상하지 못한 제품 오용을 검토하고 모델 품질·위험·보안 취약점·NVIDIA AI 관련 우려를 신고하도록 안내한다.
🧾 핵심 주장 / 시사점
- 핵심 변화는 표마다 별도 모델을 학습하는 대신, 레이블이 있는 행을 예측 시점의 문맥으로 제공한다는 점이다. 모델 학습 부담은 줄어들지만 적절한 문맥과 적용 데이터의 검증은 여전히 중요하다.
- 인공 데이터만으로 학습하면서 결측과 복잡한 범주·회귀 분포를 포함한 설계는 현실 표의 다양성에 대응하려는 접근이다. 다만 학습 범위 밖의 표와 문맥·질의 간 분포 차이에 대한 한계도 함께 제시됐다.
- 정확도와 효율성의 주장은 네 벤치마크 성적 및 문맥 재사용 구조로 뒷받침된다. 그러나 LimiX-2 대비 속도 수치는 제공된 원문에서 단위가 불명확하므로 정확한 배수로 해석하기 어렵다.
✅ 액션 아이템
- NVIDIA Kumo Tabular의 레이블 문맥 기반 분류·회귀 방식을 현재 표 예측 과제에 적용할 수 있는지 검토.
- 수치형·범주형 열의 지원 범위와 최대 10개 클래스 제약을 확인하고, 필요한 전처리 및 오류 정정 출력 코드 확장 방식의 적용성 점검.
- 배포 전 자체 홀드아웃 데이터로 NVIDIA Kumo Tabular의 정확도와 보정 수준을 검증하고, 문맥과 질의의 분포 차이에 따른 성능 저하 확인.
❓ 열린 질문
- NVIDIA Kumo Tabular에 제공할 레이블 문맥은 실제 예측할 질의 행의 분포를 얼마나 잘 대표하는가?
- 적용할 표가 최대 60,000행·100개 열의 학습 범위를 크게 벗어날 때 정확도는 어떻게 달라지는가?
- 자체 홀드아웃 데이터에서 NVIDIA Kumo Tabular의 정확도와 보정 수준은 배포에 필요한 기준을 충족하는가?