Do Tabular Foundation Models Agree with Themselves?
이 논문은 표 형식 파운데이션 모델(TFMs)이 평가된 모든 데이터셋과 작업에 걸쳐 주변화 및 인수분해 일관성 요구 사항을 모두 위반함으로써 충실한 결합 분포를 생성하는 데 실패한다는 점을 밝히고 있습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 범죄 현장에서 단서를 찾는 대신 거대한 스프레드시트에서 단서를 찾는 탐정이라고 상상해 보십시오. 이것이 바로 **표 형식 파운데이션 모델(Tabular Foundation Models)**의 세계입니다. 이는 컴퓨터가 행과 열로 이루어진 데이터를 바탕으로 대출금을 상환할지 혹은 집값이 얼마가 될지를 예측하는 것처럼 무언가를 예측하는 법을 배우는, 아주 뜨거운 새로운 AI 분야입니다. 이 모델들은 **베이지안 추론(Bayesian inference)**이라는 영리한 아이디어에 기반하여 구축되었는데, 이는 기본적으로 "새로운 증거를 바탕으로 우리의 믿음을 업데이트하자"라는 멋진 말입니다. 이는 마치 날씨 예보관이 비가 올 것 같다는 일반적인 추측으로 시작했다가, 먹구름을 보는 즉시 "좋아, 확실히 비가 오겠군"이라고 예측을 업데이트하는 것과 같습니다.
오랫동안 과학자들은 이 AI 모델들이 데이터에 대한 완벽한 "날씨 예보관"이 되기를 희망했습니다. 그들은 만약 모델에게 한 가지를 예측하게 한 뒤, 그 예측을 사용하여 다른 것을 추측하게 한다면, 그 모델이 들려주는 전체 이야기가 마치 모든 장이 논리적으로 연결되는 잘 쓰인 소설처럼 완벽하게 들어맞을 것이라고 믿었습니다. 하지만 여기 함정이 있습니다. 현실 세계에서는 우리가 대조해 볼 수 있는 "정답"을 모르는 경우가 많습니다. 이는 마치 정답지가 없는 상태에서 학생의 에세이를 채점하려는 것과 같습니다. 그래서 연구자들은 "이 모델이 옳은가?"라고 묻는 대신, 더 단순하면서도 까다로운 질문을 던졌습니다: "이 모델은 과연 자기 자신에게 일관된 이야기를 들려주고 있는가?" 그들은 AI가 그저 그럴싸해 보이는 무작위 숫자를 만들어내고 있는 것인지, 아니면 실제로 엄격한 논리와 확률의 규칙을 따르고 있는 것인지를 알고 싶었습니다.
당신이 지금 듣게 될 논문인 **"표 형식 파운데이션 모델은 스스로와 일치하는가? (Do Tabular Foundation Models Agree with Themselves?)"**는 바로 이 미스터리를 깊이 파고듭니다. 크리스티안 클뢰터겐스(Christian Klötergens)와 그의 팀이 이끄는 연구진은 가장 인기 있는 표 형식 데이터용 AI 모델들(예: TabPFN, TabICL, TabFM)을 엄격한 "논리 테스트"에 통과시키기로 결정했습니다. 그들은 단순히 모델에게 예측을 요구한 것이 아니라, 모델에게 두 가지 다른 방식으로 같은 이야기를 해보라고 요청한 뒤 그 이야기들이 일치하는지 확인했습니다.
당신이 미스터리 스무디의 맛을 맞히려고 노력한다고 상상해 보십시오.
- 테스트 1 (한계 결합 일관성, Marginalization Consistency): 당신은 AI에게 "이 스무디의 맛은 무엇인가요?"라고 묻습니다. 그다음, "만약 이 스무디가 빨간색이라면 맛이 무엇인가요? 그리고 만약 파란색이라면 맛이 무엇인가요?"라고 묻습니다. 마지막으로, 스무디가 빨간색일 확률과 파란색일 확률에 따라 이 두 답변을 조합합니다. 만약 AI가 일관성이 있다면, 이 "조합된" 답변은 첫 번째 직접적인 답변과 정확히 일치해야 합니다.
- 테스트 2 (인수 분해 일관성, Factorization Consistency): 당신은 AI에게 스무디의 재료에 대해 두 가지 다른 순서로 이야기를 해달라고 요청합니다. 먼저 과일을 추측한 다음 감미료를 추측합니다. 그다음, 감미료를 먼저 추측한 다음 과일을 추측합니다. 만약 AI가 데이터를 진정으로 이해하고 있다면, 어떤 재료를 먼저 추측했느냐에 관계없이 최종적인 스무디의 모습은 동일해야 합니다.
연구진은 와인 품질 등급부터 자동차 가격, 의료 기록에 이르기까지 매우 다양한 실제 데이터셋에 대해 이 테스트를 실행했습니다. 그들은 모델 간의 차이를 측정하기 위해 **전변동 거리(Total Variation Distance)**라는 수학적 자를 사용했습니다. 점수가 0이면 모델이 완벽하게 일치함을 의미하며, 점수가 높을수록 모델이 스스로 모순을 일으키고 있음을 의미합니다.
결과는 충격적이었습니다. 테스트한 모든 모델이 두 테스트 모두에서 실패했습니다. 모든 데이터셋에 대해, 예/아니오 형태의 단순 분류 문제와 숫자 예측 문제 모두에서, 모델들은 질문을 어떻게 하느냐에 따라 서로 다른 답을 내놓았습니다. 마치 AI가 직접 물었을 때는 스무디가 "딸기맛"이라고 말해놓고, 색깔을 먼저 물어보자 색깔은 그대로인데 갑자기 "블루베리맛"이라고 결정해 버리는 것과 같습니다.
논문은 일부 모델이 다른 모델보다 일관된 이야기를 하는 데 약간 더 나았다는 사실을 발견했습니다 (예를 들어, TabFM이라는 모델이 가장 일관된 분류 모델이었고, TabPFNv3가 회귀 분석에서 일관성에 가장 근접한 모델이었습니다). 하지만 그 어떤 모델도 진정으로 일관되지는 못했습니다. 모든 데이터셋에서, 분류 문제든 회귀 문제든 모델들은 질문 방식에 따라 다른 답을 내놓았습니다. 이는 AI가 실제 데이터의 단일하고 통합된 "결합 분포(joint distribution)"를 나타내지 못하고 있다는 뜻입니다. 쉽게 말해, 이 모델들은 자신들이 흉내 내고자 하는 엄격한 확률 법칙을 따르고 있지 않습니다. 이들은 질문 순서에 따라 서로 다른 버전의 현실을 "환각(hallucinating)"하고 있는 것입니다.
저자들은 또한 흥-미로운 사실을 발견했습니다: "좋은" 예측가(정답을 가장 자주 맞히는 모델)가 된다는 것이 반드시 "일관된" 예측가가 된다는 것을 의미하지는 않는다는 점입니다. 어떤 모델은 집값을 맞히는 데 매우 정확할 수 있지만, 질문의 순서를 바꾸어 추론 과정을 설명하게 하면 여전히 자기 모순을 일으킬 수 있습니다. 이는 일관성이 현재의 벤치마크가 놓치고 있는 별개의, 숨겨진 결함임을 시사합니다.
그렇다면 이것이 미래에 무엇을 의미할까요? 이 논문은 이 모델들이 쓸모없다고 말하는 것이 아닙니다. 이들은 여전히 많은 작업에서 우리가 가진 최고의 도구입니다. 하지만 우리는 이 모델들이 변수 간의 복잡한 관계에 대해 말할 때, 그것이 논리적으로 일관될 것이라고 맹목적으로 신뢰해서는 안 된다는 강력한 경고를 보내고 있습니다. 연구진은 향후 모델들이 단순히 최종 정답을 맞히는 데만 집중하는 것이 아니라, 이러한 모순에 벌점을 주는 방식을 통해 "일관성"을 핵심 기능으로 구축해야 한다고 제안합니다. 그때까지 우리는 이 강력한 AI "탐정들"이 단서를 포착하는 데는 뛰어나지만, 누구가 묻느냐에 따라 서로 다른 버전의 이야기를 들려줄 수 있다는 점을 기억해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.