← 최신 논문
🤖 machine learning

TopoFE: topology-aware LLM-guided Automated Feature Engineering

TOPOFE는 계층적 탐색, 적응형 프롬프트 메모리, 그리고 위상 유도 지식 전이를 통합함으로써 무상태 생성과 균질한 탐색의 한계를 극복하고, 29개의 정형 데이터셋에 걸쳐 다양하고 성능이 뛰어난 피처 프로그램을 발견하도록 LLM 가이드 자동 피처 엔지니어링을 강화하는 위상 인식 멀티 아일랜드 진화 프레임워크이다.

원저자: Sha Li, Naren Ramakrishnan

게시일 2026-07-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sha Li, Naren Ramakrishnan

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 컴퓨터에게 대출 신청자가 돈을 갚을지, 혹은 환자가 특정 질병을 앓고 있는지 예측하는 것과 같이 똑똑한 결정을 내리도록 가르치려 한다고 상상해 보십시오. 컴퓨터는 정답을 알고 시작하는 것이 아닙니다. 대신 숫자, 범주, 날짜로 이루어진 가공되지 않은 데이터 스프레드시트를 보고 어떤 패턴이 중요한지 스스로 찾아내야 합니다. 이 과정을 **머신러닝(machine learning)**이라고 부릅니다. 하지만 까다로운 점이 있습니다. 가공되지 않은 데이터는 종종 지저서 이해하기 어렵다는 것입니다. 요리사가 손질되지 않은 채소만 가지고 훌륭한 수프를 만들 수 없듯이, 컴퓨터 역시 데이터를 먼저 변환하지 않으면 최선의 패턴을 찾을 수 없는 경우가 많습니다. 이 변환 단계를 **특징 공학(feature engineering)**이라고 합니다. 이것은 가공되지 않은 숫자들을 서로 섞어서 컴퓨터가 진실을 볼 수 있도록 돕는 더 똑똑한 단서들을 만들어내는 기술입니다. 오랫동안 인간은 어떤 숫자의 조합이 유용할지 추측하며 이를 수동으로 수행해야 했습니다. 최근에는 이를 돕기 위해 **대규모 언어 모델(LLM)**이라는 초지능적인 컴퓨터 프로그램들을 사용하기 시작했습니다. 이 LLM들을 수학과 과학에 박식한, 아주 잘 읽힌 조수라고 생각하면 됩니다. 이들은 데이터를 섞는 새로운 방법들을 제안할 수 있습니다. 하지만 이 똑똑한 조수들에게도 문제가 있습니다. 때때로 같은 유형의 조합만을 반복해서 제안하거나, 이전에 무엇을 시도했는지 잊어버려 막다른 길에서 시간을 낭비하기도 한다는 점입니다.

여기에서 TOPOFE라는 새로운 프레임워크가 등장합니다. 버지니아 공대의 연구자인 샤 리(Sha Li)와 나렌 라마크리슈난(Naren Ramakrishnan)은 가능한 데이터 조합의 공간이 너무나 방대하고 다양하기 때문에, 단일하고 균일한 탐색 전략만으로는 충분하지 않다는 것을 깨달았습니다. 그들은 데이터 단서를 찾는 과정을 하나의 거대한 군중이 아니라, 서로 다른 영토에서 활동하는 전문 탐사팀처럼 다루는 시스템을 제proposed했습니다.

TOPOFE는 하나의 큰 그룹이 문제를 동시에 해결하려고 애쓰는 대신, 작업을 다섯 개의 뚜렷한 "섬(islands)"으로 나눕니다. 각 섬은 특정 수학적 기법에 집중하는 전문가 팀입니다. 한 섬은 숫자를 더하거나 곱하는 것과 같은 단순 산술만을 살펴봅니다. 또 다른 섬은 평균이나 개수와 같은 통계에 집중합니다. 세 번째 섬은 지난 일주일간의 판매량 변화와 같은 시간 기반 패턴을 다룹니다. 다른 하나는 서로 다른 그룹 간의 관계를 처리하며, 마지막 섬은 곡선 형태의 비선형 구조를 다룹니다. 이렇게 전문가들을 분리함으로써, 시스템은 특정 유형의 수학적 기법이 전체를 장악하여 다른 기법의 발견을 가로막지 않도록 보장합니다.

하지만 진짜 마법은 이 섬들이 서로 소통할 때 일어납니다. 기존의 시스템에서는 한 팀이 막히게 되면 다른 팀과 무작위로 아이디어를 교환하곤 했는데, 이는 대개 도움이 되지 않았습니다. TOPOFE는 더 똑똑합니다. 이 시스템은 어떤 팀이 서로를 돕는 데 가장 적합한지를 학습하는 동적인 지도인 "위상 그래프(topology graph)"를 사용합니다. 만약 "시간(Time)" 섬이 막히게 되면, 시스템은 지도를 확인하여 "산술(Arithmetic)" 섬이 도움을 주는 데 가장 적합하다는 것을 파악합니다. 그러면 시스템은 두 팀이 최고의 아이디어를 결합하여, 어느 한 팀이 혼자서는 결코 발명할 수 없었을 완전히 새로운 "하이브리드" 특징을 만들어내는 특별한 이벤트를 실행합니다. 예를 들어, 시간 기반 평균과 나눗셈 연산을 결합하여 매우 예측력이 높은 새로운 단서를 만들어낼 수 있습니다.

또한 이 시스템은 자신의 실수를 통해 배우는 "기억력"을 가지고 있습니다. 특정 유형의 수학적 기법이 특정 데이터셋에서 계속 실패한다면, 시스템은 이를 기억하여 해당 기법을 제안하지 않는 대신, 효과가 있는 기법들을 강화합니다. 이 과정은 메인 컴퓨터 브레인을 다시 훈련시킬 필요 없이 매우 효율적으로 이루어집니다.

연구진은 이 아이디어를 심장병 예측부터 자전거 대여 예측에 이르기까지 29개의 다양한 실제 데이터셋에 대해 테스트했습니다. 그 결과, TOPOFE가 기존의 가장 뛰어난 방법들을 지속적으로 능가한다는 것을 발견했습니다. TOPOFE는 단순히 더 나은 답을 찾는 것에 그치지 않고, 더 다양한 답을 찾아냈습니다. 다른 방법들은 종종 매우 유사한 단서들의 더미로 끝나는 반면, TOPOFE의 특화된 섬들과 스마트한 팀워크는 더 넓은 영역을 커버하고 다양한 유형의 예측 모델에 잘 작동하는 단서 세트를 만들어냈습니다. 이 연구는 탐색을 전문화되고 소통하는 그룹으로 조직함으로써, 우리가 데이터를 이해하는 컴퓨터를 가르치는 훨씬 더 강력한 방법을 열 수 있음을 시사합니다. 결과는 이 접근 방식이 견고함을 보여주며, 밑바탕이 되는 컴퓨터 "두뇌"가 바뀌더라도 잘 작동한다는 것을 입증했습니다. 이는 핵심적인 비결이 모델의 지능 자체가 아니라, 탐색의 구조 자체에 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →