InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance
InsightSR는 대규모 언어 모델을 활용하여 의미론적 및 구조적 가이드를 통해 탐색 공간을 반복적으로 정교화함으로써 PySR 유전 프로그래밍 엔진을 강화하는 새로운 심볼릭 회귀 프레임워크로, 심층 표현 트리 구축을 의미론적으로 정보가 풍부한 특징들 위의 얕은 트리 조립으로 변환함으로써 최첨단 정확도와 일반화 성능을 달성한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
과학은 언제나 단순하고 강력한 아이디어, 즉 자연계의 복잡한 행동이 간결한 수학적 법칙으로 설명될 수 있다는 아이디어에 의존해 왔습니다. 물리학자가 떨어지는 사과나 행성의 궤도를 바라볼 때, 그들은 단순히 움직임을 보는 것이 아니라 그것을 지배하는 숨겨진 방정식을 찾고 있는 것입니다. 이러한 근본적인 공식을 찾는 과정을 심볼릭 회귀(symbolic regression)라고 부릅니다. 데이터를 맞추기 위해 수백만 개의 내부 노브를 조정하며 패턴을 학습하는 일반적인 컴퓨터 모델과 달리, 심볼릭 회귀는 덧셈, 곱셈, 삼각함수와 같은 친숙한 수학적 구성 요소를 사용하여 실제 방정식 자체를 써 내려가려고 시도합니다. 목표는 정확할 뿐만 아니라 인간이 읽고 이해할 수 있을 만큼 단순한 규칙을 찾는 것입니다. 그러나 이러한 규칙을 찾는 것은 매우 어렵습니다. 가능한 수학적 조합의 수가 너무 빠르게 증가하여 거대하고 혼란스러운 가능성의 바다가 되기 때문입니다. 대부분의 컴퓨터 탐색은 이 바다에서 길을 잃어, 데이터에는 완벽하게 들어맞지만 물리적으로는 아무런 의미가 없는 공식을 만들어내거나, 탐색 공간이 너무 방대하여 진정한 법칙을 찾는 데 실패하곤 합니다.
한 연구팀은 진화 알고리즘의 원초적인 탐색 능력과 대규모 언어 모델의 추론 능력을 결합하여 이 혼돈을 헤쳐 나갈 새로운 접근 방식을 개발했습니다. '인사이트SR(InsightSR)'이라 명명된 이 시스템은 컴퓨터에게 최종 답을 직접 추측하라고 요구하지 않습니다. 대신, 언어 모델을 가이드로 사용하여 탐색 자체를 재구성합니다. 탐로를 찾기 위해 빽빽하고 미개척된 숲을 탐험하는 탐험대 팀을 상상해 보십시오. 기존 방식에서 탐험가들은 올바른 길을 우연히 발견하기를 바라며 무작정 헤매야 했습니다. 이 새로운 방식에서 언어 모델은 일반적인 지형을 알고 있는 숙련된 가이드 역할을 합니다. 가이드는 그들을 대신해 길을 걸어주는 것이 아니라, 어떤 방향이 물리적으로 불가능한지 알려주고 여정에 어떤 도구가 유용할지를 제안합니다.
이 시스템은 가이드를 두 가지 상호 보완적인 흐름으로 나누어 작동합니다. 첫 번째 흐름은 방정식의 '골격'에 집중합니다. 언어 모델은 데이터의 물리적 단위(예를 들어 변수가 시간, 거리, 질량 중 무엇을 나타내는지)를 살펴보고, 차원적으로 일관되어야 하는 기본적인 구조를 제안합니다. 이는 시간 측정값에 거리 값을 더하는 것과 같이 물리 법칙을 위반하는 수학적 조합을 배제한다는 것을 의미합니다. 이러한 물리적으로 타당한 시작점을 제공함으로써, 시스템은 수십억 개의 불가능한 공식에 시간을 낭비하는 것을 피합니다. 두 번째 흐름은 재료 그 자체에 집중합니다. 언어 모델은 이전의 시도에서 관찰된 패턴을 바탕으로, 변수를 제곱하거나 사인 값을 취하는 것과 같이 원시 데이터를 변환하는 새로운 방법들을 제안합니다. 이러한 새로운 특징들은 검색 엔진이 사용할 수 있는 재료 풀에 추가됩니다. 시간이 흐름에 따라 재료 풀은 더욱 풍성해지며, 이를 통해 시스템은 원시 데이터의 깊고 얽힌 나무를 구축하려 애쓰는 대신 단순하고 얕은 조합을 사용하여 복잡한 관계를 구축할 수 있게 됩니다.
이 과정은 단 한 번의 추측이 아니라 지속적인 정교화의 루프입니다. 컴퓨터가 후보 방정식 세트를 생성하면, 언어 모델이 이를 평가합니다. 모델은 단순히 숫자에 얼마나 잘 들어맞는지만 확인하는 것이 아니라, 새로운 특징들이 얼마나 유용했는지, 그리고 구조가 타당한지를 검토합니다. 이 피드백은 동적인 지식 베이스에 저장되어 다음 단계의 탐색에 정보를 제공합니다. 시스템은 자신의 성공과 실패로부터 배우며, 점차 가장 유망한 해결책을 향해 탐색 범위를 좁혀 나갑니다. 이는 탐색이 매 반복마다 더욱 집중되고 효율적으로 변하는 자기 교정 주기를 만들어냅니다.
연구진은 이 방법을 세 가지 뚜렷한 도전 과제에 대해 테스트했습니다. 첫째, 고전 역학에서 양자 이론에 이르는 100개의 유명한 물리 방정식 벤치마크를 사용했습니다. 이 테스트에서 시스템은 기존 방식보다 크게 개선된 성과를 보이며 95%의 확률로 원래의 정확한 공식을 찾아냈습니다. 또한 화학, 생물학, 재료 과학을 아우르는 광범위한 과학 문제에서도 복잡한 변환이 포함된 작업에서 80% 이상의 정확도를 달며 탁월한 성능을 보여주었습니다. 마지막으로, 연구팀은 진동자(oscillator)의 진동이나 박테리아의 성장 패턴과 같은 실제 세계의 데이터로 시스템을 테스트했습니다. 이러한 시나리오에서 시스템은 정확한 공식을 찾아냈을 뿐만 아니라, 한 번도 본 적 없는 데이터에 대해서도 성능을 유지하며 강력한 일반화 능력을 입증했습니다.
이 결과는 언어 모델을 전통적인 검색 엔진 주변의 가이드 층으로 배치함으로써, 방대한 탐색 공간과 물리적 일관성이라는 두 가지 과제를 극복할 수 있음을 시사합니다. 이 시스템은 진화적 탐색을 대체하는 것이 아니라 이를 정교화하여, 눈먼 무작위 탐색을 목적이 있는 유도된 발견으로 바꿉니다. 원시 변수의 깊고 복잡한 나무를 만드는 부담을 풍부하게 사전 보강된 특징들의 단순한 조합을 조립하는 것으로 전환함으로써, 이 방법은 과학적 법칙의 발견을 더 효율적이고 신뢰할 수 있게 만듭니다. 이 접근 방식은 인간과 같은 추론과 기계 기반의 탐색을 결합함으로써 우리 세계를 지배하는 숨겨진 수학적 법칙을 밝혀낼 수 있음을 보여주며, 자동화된 과학적 발견을 위한 실질적인 경로를 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.