← 최신 논문
🤖 machine learning

Localized TabICLv2: Scaling Tabular In-Context Learning through k-NN

이 논문은 각 쿼리에 대해 k-최근접 훈련 이웃만을 검색함으로써 기존의 최첨단 TabICLv2 모델의 추론 비용을 크게 줄이고 확장성을 개선하여, 원래 모델 정확도의 98% 이상을 유지하면서도 상당한 속도 향상을 달성한 Localized TabICLv2 방법을 소개한다.

원저자: Beimnet Bekele Guta

게시일 2026-08-18
📖 5 분 읽기🧠 심층 분석

원저자: Beimnet Bekele Guta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

데이터의 세계에서 정보는 종종 깔끔한 직사각형 격자 형태로 도착합니다. 고객의 행, 거래의 열, 그리고 숫자나 범주로 채워진 셀들 말입니다. 수십 년 동안 이러한 격자에서 패턴을 찾는 가장 신뢰할 수 있는 방법은 그래디언트 부스팅 결정 트리(gradient-boosted decision tree)라고 불리는 특정 유형의 컴퓨터 프로그램들을 사용하는 것이었습니다. 이 프로그램들은 데이터 속을 훑어보기 위해 일련의 단순한 예/아니오 질문을 던지며 복잡한 의사결정 구조를 하나씩 구축해 나가는 전문가 팀과 같습니다. 이들은 매우 효과적이지만, 중대한 한계가 있습니다. 바로 새로운 데이터셋이 생길 때마다 처음부터 다시 학습시켜야 한다는 점입니다. 만약 어떤 회사가 한 제품에 대한 고객 이탈을 예측하다가 다른 제품에 대한 대출 연체 예측으로 전환하고 싶다면, 모델을 다시 학습시켜야 하며, 이 과정에는 시간과 컴퓨팅 자원, 그리고 세밀한 설정 조정이 필요합니다.

최근에는 언어 연구에서 기법을 빌려온 새로운 접근 방식이 등장했습니다. 새로운 모델을 매번 학습시키는 대신, 이 새로운 시스템들은 주어진 사례로부터 즉석에서 학습할 수 있는 하나의 사전 학습된 파운데이션 모델을 사용합니다. '인컨텍스트 러닝(in-context learning)'이라 불리는 이 방법은 모델이 해결하려는 문제의 몇 가지 사례를 살펴보고, 내부 설정을 전혀 변경하지 않은 채 새로운 사례에 대해 예측을 수행할 수 있게 해줍니다. 이는 표 형식 데이터(tabular data)를 위한 보편적인 도구로 나아가는 유망한 길을 제시하지만, 커다란 장애물이 여전히 남아 있습니다. 모델이 고려해야 할 과거 데이터의 양이 늘어남에 따라, 단 한 번의 예측을 수행하는 데 걸리는 시간이 폭발적으로 증가한다는 점입니다. 모델은 새로운 질문이 들어올 때마다 자신이 본 적 있는 모든 과거 데이터를 일일이 대조해야 하며, 이는 대규모 실시간 사용을 불가능하게 만드는 계산상의 병목 현상을 초과합니다.

케임브리지 대학교의 연구진은 'Localized TabICLv2'라고 부르는 방법으로 이 병목 현상을 해결했습니다. 그들의 연구는 이미 다양한 분류 작업에서 최첨단 성능을 보여준 TabICLv2라는 특정 버전의 인컨텍스트 러닝 모델에 초점을 맞추고 있습니다. 기존 모델의 핵심 문제는 예측의 마지막 단계에서 모든 새로운 데이터 포인트가 전체 훈련 데이터셋에 동시에 주목하도록 강제한다는 점입니다. 만약 데이터셋에 수십만 개의 행이 포함되어 있다면, 모델은 매 쿼리마다 방대한 양의 정보를 처리해야 하며, 이는 느린 응답 시간과 높은 에너지 비용으로 이어집니다. 연구진은 간단한 질문을 던졌습니다. 모델이 좋은 예측을 하기 위해 정말로 모든 과거 사례를 다 봐야 하는가, 아니면 필요한 단서를 담고 있는 더 작고 관련성 높은 사례 그룹을 찾을 수 있는가?

이에 답하기 위해 연구진은 최종 예측이 이루어지기 전 필터 역할을 하는 검색 단계를 도입했습니다. 데이터의 전체 이력을 모델에 입력하는 대신, 먼저 각 데이터 행을 필수적인 특징을 포착하는 수학적 표현으로 변환합니다. 새로운 쿼리가 도착하면, 시스템은 저장된 이력 중에서 새로운 사례와 가장 유사한 수십 개의 행을 찾아냅니다. 그런 다음 전체 데이터셋이 아닌, 이 가장 가까운 매칭 사례들만을 예측 엔진에 입력합니다. 이 접근 방식은 마치 사람이 인생의 모든 사건을 기억하려고 애쓰기보다, 몇 가지 관련 있는 과거 경험을 떠올리며 문제를 해결하는 방식과 유사합니다. 이처럼 문맥(context)을 가장 가까운 이웃들로 제한함으로써, 연구진은 모델이 한 번에 처리해야 하는 정보량을 획기적으로 줄였습니다.

하지만 단순히 데이터를 줄이는 것만으로는 기존 시스템의 높은 정확도를 유지하기에 충분하지 않았습니다. 모델은 전체 문맥을 기대하도록 학습되었기에, 대부분을 제거하면 초기 성능이 떨어지게 됩니다. 이를 해결하기 위해 연구진은 모델의 내부 메커니즘을 미세 조정(fine-tuning)했습니다. 그들은 모델이 데이터를 생성하는 방식과 그 표현을 사용하여 예측하는 방식을 조정했으며, 특히 이 작은 국소적 관점에서도 잘 작동하도록 학습시켰습니다. 이 과정을 통해 모델은 단순히 데이터의 양에 의존하여 패턴을 찾는 것이 아니라, 단 몇 개의 사례로부터 가장 중요한 정보를 추출하는 법을 배웠습니다.

이 접근 방식의 결과는 신용카드 부정 결제 탐지부터 고객 이탈에 이르기까지 광범위한 실제 데이터셋을 대상으로 측정되었습니다. 연구진이 38개의 서로 다른 데이터셋을 포함하는 표준 벤치마크에서 국소화된 모델을 테스트했을 때, 미세 조정된 버전이 원래 모델의 정확도를 거의 그대로 유지한다는 것을 발견했습니다. 구체적으로, 이 모델은 원래 성능의 98.64%를 보존했으며, 이는 훨씬 느린 전체 문맥 버전만큼이나 정확한 예측을 수행했음을 의미합니다. 반면 트레이드오프 측면에서는 엄청난 속도 향상을 얻었습니다. 모델이 데이터를 배치(batch) 단위로 처리하는 시나리오에서는 두 배 이상 빨라졌습니다. 모델이 한 번에 하나의 질문에 답해야 하는 상황에서는 그 속도 향상이 더욱 극적이었는데, 기존 시스템보다 중앙값 기준 249배나 빠른 속도에 도달했습니다.

또한 연구는 데이터셋의 크기가 이러한 속도 향상에 있어 매우 중요하다는 점을 밝혀냈습니다. 훈련 세트가 클수록 국소화의 이점이 더 커졌습니다. 작은 데이터셋의 경우, 적절한 이웃을 찾는 데 드는 시간이 데이터를 적게 처리해서 얻는 시간 절감 효과를 상쇄하기도 했습니다. 그러나 훈련 행의 수가 수십만 개로 늘어남에 따라 국소화된 방법은 점점 더 효율적이 되었으며, 이는 이 모델들을 느리게 만드는 바로 그 데이터 크기에서도 이 접근 방식이 잘 확장(scale)된다는 것을 입증했습니다. 나아가 연구진은 이들의 방법을 단순히 검색된 이웃만을 사용하는 표준 결정 트리나 기본적인 투표 시스템과 같은 더 단순한 대안들과 비교했습니다. 그들의 국소화된 모델은 이러한 단순한 베이스라인들을 지속적으로 능가하며, 스마트한 검색과 특화된 예측 엔진의 결 조합이 성공의 핵심임을 입증했습니다.

이 연구는 표 형식 머신러닝의 미래가 더 많은 에너지를 소비하는 더 큰 모델을 만드는 데 있는 것이 아니라, 기존 모델이 어떤 정보가 필요한지에 대해 더 똑똑해지는 데 있음을 시사합니다. 강력한 파운데이션 모델이 가장 관련 있는 사례에만 집중하도록 가르침으로써, 연구진은 방대한 데이터셋을 처리하는 무거운 계산 비용 없이도 높은 정확도를 달 수 있음을 보여주었습니다. 이 결과는 이러한 모델들이 속도와 효율성이 예측력만큼이나 중요한 실제 현장에 배치될 수 있음을 나타냅니다. 이 방법은 가장 유사한 과거 사례가 가장 유익한 정보를 제공한다는 가정에 기반하고 있지만, 결과는 이 가정이 방대한 종류의 데이터 유형 전반에 걸쳐 유효함을 보여주었습니다. 연구는 적절한 조정을 거친다면, 표 형식 데이터를 위한 인컨텍스트 러닝의 약속이 대규모 애플리케이션에 필요한 효율성을 희생하지 않고도 실현될 수 있다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →