Understanding the Surprising Generalization Properties of Tabular Foundation Models
이 논문은 표 형식 파운데이션 모델(Tabular Foundation Models)이 단 하나의 실제 테이블에 대한 자기지도 사전 학습을 통해 강력한 일반화 성능을 달성할 수 있음을 밝히며, 이들의 성능이 방대한 데이터셋보다는 태스크와 피처의 수와 품질에 더 의존한다는 점과 이들의 인컨텍스트 학습 메커니즘이 근본적으로 검색 기반이라는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 광활한 풍경 속에서, 데이터는 서로 구별되고 고립된 세계에 존재한다는 지속적인 믿음이 존재해 왔다. 손글씨 숫자를 인식하도록 훈련된 컴퓨터 프로그램은 부동산 중개인이 주택 가격을 추정하는 데 도움을 줄 가능성이 전혀 없다고 생각하는 것이다. 두 작업 사이에는 공통점이 없어 보이기 때문이다. 이러한 관점은 데이터 테이블을 하나의 규칙이 다른 곳에 적용될 수 없는 경직되고 특정한 퍼즐로 취급한다. 그러나 표형 파운데이션 모델(tabular foundation models)로 알려진 새로운 세대의 AI 모델들은 이러한 가설에 도전하기 시작했다. 이 시스템들은 단일 데이터셋을 영구적으로 암기하는 대신, 문제가 해결하도록 요구받는 순간 제시되는 일련의 예시들로부터 학습하도록 설계되었다. 이들은 현재 제공된 몇 개의 레이블이 있는 예시들을 살펴보고, 그 맥락을 사용하여 레이블이 없는 새로운 행들에 대한 답을 예측함으로써 작동한다. 연구자들의 핵심 질문은, 이 모델들이 일반화하는 방법을 배우기 위해 수천 개의 서로 다른 실제 세계 데이터셋으로 구성된 거대하고 다양한 라이브러리를 필요로 하는가, 아니면 더 단순하고 근본적인 메커니즘이 작용하고 있는가 하는 것이었다.
한 연구팀은 이 학습 과정의 한계를 테스트하기 위해 놀랍고도 직관에 반하는 실험으로 시작했다. 그들은 강력한 AI 모델을 오직 단 하나의 실제 데이터셋, 즉 벡터화된 손글씨 숫자 이미지가 포함된 테이블만을 사용하여 훈련시켰다. 표준적인 설정이라면, 이러한 모델이 캘리포니아의 주택 가격이나 대학 등록 통계와 같이 전혀 관련 없는 것을 예측하려 할 때 처참하게 실패할 것이라고 예상할 것이다. 그러나 결과는 이러한 예상을 뒤엎었다. 숫자 데이터만을 보았던 모델은 이와 완전히 다른 작업들에 대해서도 정확한 예측을 수행하는 견고한 능력을 보여주었다. 이 발견은 모델이 단순히 숫자에 관한 사실을 암기한 것이 아니라, 더 일반적인 기술, 즉 일련의 예시를 살펴보고 무엇이 중요한지 찾아내어 이를 이용해 새로운 문제를 해결하는 법을 배웠음을 시사했다.
왜 이런 현상이 일어났는지 이해하기 위해, 연구진은 무엇이 이 모델들을 가르치는 데 "좋은" 데이터셋을 만드는지 조사했다. 그들은 작은 컬렉션부터 거대한 아카이브에 이르기까지 수십 개의 서로 다른 테이블을 분석하여 어떤 속성이 최상의 성능을 이끌어내는지 확인했다. 그들은 테이블의 행(instances)의 수가 놀라울 정도로 중요하지 않다는 것을 발견했다. 수백만 개의 행이 있지만 열(columns)이 적은 데이터셋은 열이 많은 더 작은 데이터셋보다 모델을 더 잘 가르치지 못했다. 대신, 핵심 요인은 사용 가능한 특징(features), 즉 열의 개수였다. 다양한 유형의 정보가 담긴 테이블은 모델이 더 넓은 범위의 논리적 관계를 연습할 수 있게 해주었다. 연구진은 진정한 성공의 동력이 데이터의 순수한 양이 아니라, 모델이 연습할 수 있는 작업의 다양성이라는 것을 발견했다. 서로 다른 열의 조합을 서로 다른 문제로 취급함으로써, 단 하나의 테이블은 수천 개의 독특한 학습 기회를 제공할 수 있었다. 모델이 훈련 중에 해결할 수 있는 서로 다른 작업이 많아질수록, 모델은 새롭고 보지 못한 과제를 처리하는 데 더 능숙해졌다.
이러한 통찰은 연구팀으로 하여금 이 모델들을 실제 세계에 어떻게 대비시킬 것인지에 대해 다시 생각하게 했다. 전통적인 관행은 강력한 모델을 구축하기 위해 거대한 데이터셋 모음을 큐레이션하고, 중복된 것을 신중히 제거하며, 너무 단순하거나 구조가 좋지 않아 보이는 테이블을 걸러내야 한다고 제안했다. 연구진은 1,700개가 넘는 실제 데이터셋으로 구성된 대규모 코퍼스로 모델을 훈련시켜 이를 테스트했다. 그들은 정확한 중복을 제거하는 것이 최종 성능에 아무런 차이를 만들지 않는다는 것을 발견했으며, "취약한" 데이터셋을 공격적으로 걸러내는 것이 오히려 모델의 일반화 능력을 해친다는 것을 발견했다. 심지어 특징이 적은 단순한 테이블이라도 특정 유형의 논리적 추론을 위한 가치 있는 연습을 제공할 수 있다는 것이 밝혀졌다. 가장 효과적인 전략은 데이터를 버리는 것이 아니라, 더 미세한 수준에서 정제하는 것이었다. 서로 거의 동일하거나 결측치가 너무 많은 열을 제거함으로써, 연구진은 라이브러리의 규모를 줄이지 않으면서도 연습 과제의 품질을 개선했다. 이러한 미세한 정제는 광범위한 벤치마크에서 모델의 성능을 일관되게 향상시켰다.
논문은 결론적으로 이 모델들이 실제로 어떻게 작동하는지에 대한 새로운 이해를 제공한다. 모델은 모든 가능한 상황에 대한 보편적인 규칙을 저장하는 거대한 백과사전처럼 작동하기보다는, 숙련된 사서처럼 기능한다. 새로운 문제가 제시되었을 때, 모델은 미리 작성된 정답지에 의존하지 않는다. 대신, 모델은 제공된 예시들을 훑어보고, 현재의 질문과 가장 유사한 것이 무엇인지 식별하며, 그 답변들을 종합하여 예측을 형성한다. 연구진은 일반화 능력이 가장 뛰어난 모델들이 제공된 예시로부터 올바른 정보를 검색하는 능력 또한 가장 뛰어나다는 것을 보여줌으로써 이에 대한 강력한 증거를 제시했다. 그들은 모델이 단순한 유사성 매칭에 의존하도록 강제하는 것이 모델을 망가뜨리지 않는다는 것을 발견했다. 오히려 더 약한 모델들의 경우, 과정을 단순한 이웃 찾기와 같은 직접적인 검색 방식으로 만드는 것이 결과를 개선했다. 이는 이 시스템의 마법이 복잡하고 미리 계산된 규칙의 우주를 저장하는 데 있는 것이 아니라, 주어진 맥락으로부터 올바른 정보 조각을 찾아내고 사용하는 법을 배우는 데 있음을 시사한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.