[모델]엔비디아, 테이블 데이터용 파운데이션 모델 Kumo Tabular 공개
엔비디아가 추가 학습이나 피처 엔지니어링 없이 한 번의 추론으로 테이블 데이터를 예측하는 파운데이션 모델 'Kumo Tabular'를 공개했습니다. 28M부터 215M 파라미터 크기로 제공되며, 순수 합성 데이터로만 사전 학습되어 상업적 사용이 가능한 OpenMDW-1.1 라이선스로 배포됩니다.
전문 읽기접기
무슨 일이야
엔비디아가 정형(Tabular) 데이터를 다루는 오픈 파운데이션 모델 Kumo Tabular를 발표했습니다. 이 모델은 기존처럼 모델을 매번 새로 학습시키거나 피처 엔지니어링 및 하이퍼파라미터 튜닝을 거칠 필요 없이, 라벨이 있는 행들을 컨텍스트로 제공하면 단 한 번의 순전파(forward pass)만으로 새 데이터의 분류와 회귀 결과를 예측합니다.
Kumo Tabular는 테이블 구조에 맞춘 트랜스포머 아키텍처를 기반으로 설계되었습니다. 셀 임베딩 단계에서 결측치 대체 없이 수치형과 범주형 데이터를 처리하고, 열(column) 어텐션과 행(row) 어텐션을 번갈아 적용해 데이터 내 상호작용을 파악합니다. 마지막 인컨텍스트 단계에서는 라벨이 있는 컨텍스트 행의 Key-Value를 한 번만 계산해 캐싱해두고 재사용할 수 있도록 최적화했습니다. 또한 테이블 크기가 커져도 어텐션이 흐려지지 않도록 길이에 따라 어텐션 온도를 조절하는 메커니즘을 적용했습니다.
이 모델은 구조적 인과 모델(SCM)을 통해 생성된 100% 인공 합성 데이터로만 사전 학습되었습니다. 모델 크기는 28M부터 215M 파라미터까지 총 3가지로 구성되었으며, 현재 Hugging Face와 자체 오픈소스 라이브러리를 통해 상업적으로 활용 가능한 OpenMDW-1.1 라이선스로 공개되었습니다.
왜 중요해
지난 20여 년간 테이블 데이터 분석은 그래디언트 부스팅 트리(GBDT) 계열이 주도해왔지만, 매번 새로운 작업마다 처음부터 학습 과정을 반복해야 하는 번거로움이 있었습니다. Kumo Tabular는 LLM처럼 몇 가지 예시를 컨텍스트로 주면 바로 추론하는 인컨텍스트 러닝 방식을 정형 데이터에 성공적으로 안착시켰습니다.
실제로 Kumo Tabular는 TabArena, BeyondArena, TALENT, ScoringBench 등 4대 주요 정형 데이터 벤치마크에서 1위를 기록했습니다. 기업 환경에서 고객 이탈 예측, 수요 예측, 불량 거래 탐지 등의 반복적인 ML 파이프라인 구축 비용을 크게 줄여줄 수 있습니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.