기술 요약: 연산자 유도 및 정규화된 심볼릭 포레스트를 통한 방정식 발견을 위한 확률적 심볼릭 회귀
1. 문제 정의
심볼릭 회귀(Symbolic Regression, SR)는 데이터로부터 입력-출력 관계를 직접 지배하는 해석 가능한 분석적 표현식을 발견하는 것을 목표로 하며, 이는 과학적 머신러닝의 핵심 과제이다. 기존의 SR 방법론들(예: 유전 프로그래밍, 딥 심볼릭 회귀, 압축 센싱 접근법 등)은 유망한 성과를 보여왔으나, 다음과 같은 통계적 및 계산적 문제에 직면해 있다:
- 휴리스틱 의존성: 많은 방법론이 확률적 탐색 휴리스틱에 의존하며, 이는 특히 노이즈가 많고 샘플 수가 적은 과학적 데이터셋에서 예측 정확도와 표현 복잡도 사이의 균형을 맞추는 데 어려움을 겪는다.
- 불확실성 특성화: 현재의 접근 방식들은 심볼릭 불확실성을 규명하는 능력이 제한적이며, 대안적인 구조적 설명의 타당성을 정량화하지 못한 채 단 하나의 "최적" 표현식만을 반환하는 경우가 많다.
- 이론적 공백: 심볼릭 회귀에 대한 사후 집중율(posterior concentration rates)에 관한 이론적 처리가 부족하며, 특히 오설정(misspecification) 또는 비식별성(non-identifiability, 대수적으로 구별되는 표현식이 동일한 예측을 생성하는 경우) 조건 하에서의 연구가 미비하다.
본 논문은 심볼릭 표현식을 트리들의 앙상블로 취급함으로써 완전한 불확실성 전파와 엄격한 이론적 보장을 가능하게 하는 통합된 확률적 프레임워크를 제안하여 이러한 공백을 해결한다.
2. 방법론: BayeSymX 프레임워크
저자들은 알려지지 않은 회귀 곡면 f를 심볼릭 트리들의 아핀 결합(affine combination)인 "심볼릭 포레스트(symbolic forest)"로 모델링하는 확률적 프레임워크인 BayeSymX(Bayesian Symbolic regression forests for eXpression discovery)를 소개한다.
2.1 모델 구조
모델은 관측치 yi=f(xi)+ϵi를 가정한다:
yi=β0+j=1∑Kg(xi;Tj)βj+ϵi
여기서 g(x;Tj)는 j번째 심볼릭 트리 Tj의 평가값을 나타내며, β는 외부 회귀 계수이다. 트리는 기본 피처와 수학적 연산자(단항 및 이항)의 라이브러리로부터 재귀적으로 구축된다.
2.2 사전 분포 지정 (Prior Specifications)
본 프레임워크는 복잡도를 정규화하고 데이터 적응형 선호도를 학습하도록 설계된 계층적 베이지안 명세를 채택한다:
- 트리 토폴로지 사전 분포: 깊이에 따른 분할 확률 pm=α0(1+m)−δ0는 깊은 트리를 억제하여, 더 단순한 표현을 선호하는 오캄의 면도날(Occam's razor) 형태를 강제한다.
- 연산자 및 피처 사전 분포: 고정된 가중치 방식과 달리, BayeSymX는 트리별 연산자 및 피처 할당 가중치에 디리클레(Dirichlet) 사전 분포를 사용한다. 이를 통해 모델은 특정 트리에 적합한 연산자와 피처를 데이터 적응적으로 학습할 수 있다.
- 회귀 계수: 외부 계수 β와 노이즈 분산 σ2에 대해 공액 정규-역감마(Normal-Inverse-Gamma, NIG) 사전 분포를 배치하여, 모든 모델 파라미터에 대한 완전한 불확실성 전파를 보장한다.
2.3 사후 추론
- 한계화(Marginalization): 연속 파라미터 (β,σ2)는 NIG 공액성을 사용하여 분석적으로 한계화되며, 이를 통해 심볼릭 포레스트의 이산 공간에 대한 결합 한계 사후 분포(joint marginal posterior, JMP)를 얻는다.
- 샘플링: Metropolis-within-partially-collapsed Gibbs 샘플러를 사용하여 심볼릭 표현 공간을 탐색한다. 이 샘플러는 이산 공간을 탐색하기 위해 7가지 로컬 트리 이동(성장, 가지치기, 서브트리 교체, 삭제, 삽입, 변경, 연산자 변경)을 사용한다.
- 모델 선택 (오캄의 창, Occam's Window): 단일 최적 트리를 선택하는 대신, BayeSymX는 오캄의 창 접근법을 활용한다. 이는 높은 사후 확률을 가진 일련의 포레스트 집합(Jr)을 유지함으로써 여러 가능한 심볼릭 모델 간의 불확실성을 포착한다.
- 정교화(Refinement): 사후 MCMC 정교화 단계에서는 베이지안 정보 기준(BIC)을 사용하여 중복된 트리를 제거하고 최종 표현식을 대수적으로 단순화한다.
3. 주요 기여
3.1 이론적 보장
본 논문은 이론적 처리가 부족했던 심볼릭 회귀 분야에서 새로운 사후 집중 결과를 확립한다:
- 근사 실현 가능성(Approximate Realizability): 완만한 정규성 가정 하에서, 저자들은 사후 분포가 경험적 근사 오차와 새롭게 도출된 심볼릭 복잡도 척도(CK,S,n) 사이의 트레이드오프에 의해 제어되는 실제 데이터 생성 함수 f0 주변으로 집중됨을 증명한다.
- 준-파라메트릭 속도(Near-Parametric Rates): 정확한 유한 심볼릭 표현 가능성의 경우, 프레임워크는 O(n−1/2(lognloglogn)1/2)의 준-파라메트릭 집중 속도를 달성한다.
- 오설정 및 오라클 부등식(Misspecification and Oracle Inequalities): 심볼릭 오설정(즉, f0가 모델 클래스 내에 존재하지 않는 경우) 상황에서도, 본 논문은 **날카로운 오라클 집중 결과(sharp oracle concentration result)**를 확립한다. 이 프레임워크는 고전적인 오설정 이론에서 일반적으로 요구되는 유한한 쿨백-라이블러 최소화 집합의 존재나 특수한 테스트 조건 없이도 최적의 모집단 근사 오차 주변으로 사후 분포가 집중됨을 보여준다.
- 비식별성 처리: 보증(guarantees)은 예측 함수 수준에서 공식화되어, 서로 다른 심볼릭 구조가 동일한 함수를 나타낼 수 있음을 인정한다.
3.2 방법론적 혁신
- 연산자 유도 포레스트: 단일 트리 대신 포레스트(앙상블)를 사용하는 것은 해석 가능성을 유지하면서도 가산적(additive)인 과학적 구조를 허용한다.
- 데이터 적응형 학습: 연산자/피처 가중치에 대한 디리클레 사전 분포를 통해 모델은 구조적 선호도를 적응적으로 학습하며, 기존의 베이지안 SR(예: BSR)에서 발견되는 경직된 고정 가중치 사전 분포의 제약을 피한다.
- 불확실성을 고려한 요약: 오캄의 창 전략은 단일 점 추정치를 보고하는 대신, 여러 경쟁적인 과학적 가설을 원칙적으로 보고할 수 있는 방법을 제공한다.
4. 실험 결과
저자들은 두 가지 뚜렷한 벤치마크에서 최첨단 경쟁 모델들(gplearn, operon, PySR, DSR, QLattice, SISSO++, BMS, BSR 포함)을 대상으로 BayeSymX를 평가하였다.
4.1 Feynman 방정식 (SRBench)
- 설정: 다양한 노이즈 수준과 구조적 복잡도 하에서 Feynman 강의의 5가지 물리 법칙을 복구함.
- 결과: BayeSymX는 예측 정확도(최저 테스트 RMSE), 심볼릭 간결성(압축된 표현식), 그리고 정확한 구조적 복구를 위해 일관되게 우수한 균형을 달성했다. 경쟁 방법들은 정확한 구조를 복구하지 못하거나, 유사한 정확도를 달성하기 위해 지나치게 복잡한 표현식을 생성하는 경향을 보였다. BayeSymX는 다른 방법들이 성능이 저하되는 높은 노이즈 수준에서도 견고함을 입증했다.
4.2 산화물 페로브스카이트 촉매 발견
- 설정: 촉매 조성과 산소 발생 반응(OER) 활성을 연결하는 "재료 유전자(materials genes, 기술자)"의 발견.
- 결론: BayeSymX는 알려진 구조-활성 관계(예: 허용 인자 μ, 전기음성도 χA,χB와 관련된 관계)를 복구하는 압축적이고 과학적으로 해석 가능한 기술자 표현식(26
40개 노드)을 식별했다. 반면, operon과 같은 고정밀 경쟁 모델은 다루기 힘든 표현식(90104개 노드)을 생성했고, PySR와 같은 압축 중심 모델은 낮은 예측 성능을 보였다. BayeSymX는 정확도-복잡도 트레이드오프의 파레토 최적선(Pareto frontier)을 점유했다.
5. 의의 및 주장
본 논문은 BayeSymX가 다음과 같은 측면에서 확률적 심볼릭 회귀의 중요한 진전을 이루었다고 주장한다:
- 구조와 불확실성의 통합: 구조를 학습하고, 정규화를 통해 복잡도를 제어하며, 여러 가능한 모델 간의 불확실성을 정량화하는 프레임워크를 제공한다.
- 이론적 엄밀성: 정확한 표현 가능성과 오설정 모두를 다루는 최초의 사후 집중 보증을 제공하여, 준-파라메트릭 속도와 날카로운 오라클 부등식을 확립한다.
- 과학적 유용성: 확률적 접근 방식이 재료 발견 및 물리학과 같이 노이즈가 많고 샘플 수가 적은 환경에서 해석 가능한 과학 법칙을 복구하는 데 있어 휴리스틱 및 딥러닝 기반 방법보다 뛰어날 수 있음을 입증한다.
저자들은 이 프레임워크가 도메인 지식이 피처 선택을 가이드하지만, 기저의 함수 형태는 알려져 있지 않고 구조적 불확실성에 대한 견고한 처리가 필요한 과학적 발견 환경에 특히 적합하다고 결론짓는다.