NestyNet. III. Symbolic Regression from Analytic Neural Surrogates
NestyNet-SR는 해석적 신경 대리 모델(analytic neural surrogates)을 활용하여 복잡한 데이터를 분리 가능한 성분들로 재귀적으로 분해하고, 이를 다시 정확한 폐쇄형 수식(closed-form expressions)으로 증류함으로써 벤치마크에서 최첨단 성능을 달성하고 실제 천문 데이터를 통해 근본적인 물리 법칙을 성공적으로 재발견하는 새로운 기호 회귀 프레임워크이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
자연은 종종 단순한 법칙들을 복잡성이라는 베일 뒤에 숨겨둡니다. 물리 법칙은 가공되지 않은 데이터로 쓰여 있을 때는 얽히고설킨 변수들의 매듭처럼 보일 수 있지만, 우리가 보는 법을 알기만 한다면 단 한 줄의 우아한 문장이 될 수도 있습니다. 수 세기 동안 과학자들은 그 적절한 관점을 찾아내어, 매듭을 풀고 그 아래에 숨겨진 깨끗한 구조를 드러내기 위해 인간의 직관에 의존해 왔습니다. 하지만 우주가 우리에게 더 많은 데이터와 더 복잡한 시스템을 제시함에 따라, 우리의 도움 없는 정신은 그 패턴을 파악하는 데 어려움을 겪을 수 있습니다. 이제 질문은 기계가 훨씬 더 넓은 범위의 가능성을 조사하여, 데이터를 완벽하게 설명할 뿐만 아니라 우리가 한 번도 보지 못한 새로운 상황에서 사물이 어떻게 행동할지까지 예측할 수 있는 관계를 찾아낼 수 있는지로 옮겨갔습니다. 이것이 바로 심볼릭 회귀(symbolic regression)라고 불리는 분야의 목표입니다. 즉, 단순히 그래프에 곡선을 맞추는 것이 아니라, 세상을 설명하는 실제 수학적 문장을 찾는 것입니다.
문제는 가능한 문장의 수가 너무 방대하여 하나씩 검색하며 찾는 것이 불가능하다는 점입니다. 이는 모든 선반에 가능한 모든 단어의 조합이 들어 있는 도서관에서 특정 책을 찾으려는 것과 같습니다. 이 문제를 해결하기 위해 로드리고 이바타(Rodrigo Ibata)와 그의 팀은 네스티넷-SR(NestyNet-SR)이라는 새로운 방법을 개발했습니다. 무작위로 문장을 추측하는 대신, 이 시스템은 먼저 인공 신경망의 일종을 사용하여 데이터에 대한 매우 정확하고 유연한 모델을 구축합니다. 이 모델은 대리물(surrogate), 즉 데이터를 아주 잘 알고 있는 대역 역할을 합니다. 핵심적인 혁신은 이 대리물이 수학적으로 투명하게 설계되었다는 점입니다. 이는 연구자들이 입력을 미세하게 조정할 때 출력이 정확히 어떻게 변하는지 계산할 수 있게 해줍니다. 이러한 변화를 연구함으로써, 시스템은 데이터가 더 단순하고 독립적인 부분들로 분해될 수 있는지 감지할 수 있습니다. 시스템은 다음과 같은 질문을 던집다: 이 부분은 온도에만 의존하는가, 아니면 저 부분은 압력에만 의존하는가? 혹은 특정 비율이나 합계와 같이 전체를 단순하게 만드는 숨겨진 변수의 조합이 존재하는가?
시스템이 이러한 더 단순한 구성 요소들을 식별하면, 두 번째 단계인 인간이 읽을 수 있는 언어로의 번역으로 넘어갑니다. 여기서 이 방법의 진가가 드러납니다. 이 방식은 단순히 하나의 완벽한 공식을 찾는 것이 아니라, 구조를 찾는 과정과 숫자를 찾는 과정을 분리합니다. 열쇠의 이빨 크기를 정확히 모르는 상태에서 열쇠의 모양을 찾는다고 상상해 보십시오. 시스템은 먼저 방정식의 골격인 '모양'을 찾은 다음, 그에 맞는 정확한 숫자들을 맞춥니다. 이러한 접근 방식 덕분에 기존의 방법들이 어려워하던 복잡한 중첩 계층을 처리할 수 있습니다. 시스템은 관계가 사인파, 제곱근, 또는 멱법칙(power law)을 포함하고 있음을 발견할 수 있으며, 데이터에 노이즈가 있거나 여러 다른 실험에서 동시에 나온 데이터일 때도 이를 수행할 수 있습니다. 또한 이 시스템은 물리적 실체에 대해 엄격합니다. 측정 단위가 타당한지 확인하여, 공식이 실수로 미터(m)에 초(s)를 더하는 것과 같은 오류를 범하지 않도록 합니다.
연구팀은 컴퓨터가 풀기 어렵기로 유명한 120개의 물리 방정식 세트인 AI 파인만(AI Feynman) 벤치마크를 통해 이 방법을 테스트했습니다. 노이즈가 없는 세상에서, 이 시스템은 120개의 방정식 모두를 정확하게 복구해 냈으며, 이는 이 유형의 벤치마크에서 처음 있는 일이었습니다. 시스템은 복잡한 방정식을 단순하게 만드는 숨겨진 내부 좌표를 찾아냄으로써 이를 수행했습니다. 현실적인 노이즈를 추가하여 실제 세계의 측정 과정에서 발생하는 불완전함을 시뮬레이션했을 때도, 시스템은 거의 절반의 문제에 대해 올바른 구조를 찾아냈으며, 구조의 어느 부분이 여전히 신뢰할 수 있는지 연구자들에게 알려줄 수 있었습니다. 진정한 법칙과 운 좋은 추측을 구별하는 이러한 능력은 중요한 진전입니다.
이 방법이 실제 천문학 데이터에서도 작동함을 증명하기 위해, 연구진은 SPARC 조사(SPARC survey)의 나선 은하 컬렉션에 이를 적용했습니다. 그들은 컴퓨터에 은하 회전에 대한 가스와 별의 개별 기여도만을 제공했을 뿐, 이들을 어떻게 결합해야 하는지는 알려주지 않았습니다. 시스템은 이 은하들이 어떻게 회전하는지를 지배하는 규칙을 찾도록 요청받았습니다. 사전 지시 없이도, 알고리즘은 회전 속도가 가스와 별 양쪽 모두로부터 오는 가속도의 단일 결합된 척도에 의존한다는 것을 발견했습니다. 시스템은 별의 질량-광도 비(mass-to-light ratio)와 일치하도록 별과 가스의 무게를 맞추는 올바른 방법을 찾아냈습니다. 나아가, 관측된 운동과 이 결합된 가속도 사이의 관계가 수년간 천문학계에서 논쟁이 되어온 특정한, 비고유한 형태를 따른다는 점을 확인했습니다. 또한 시스템은 이 관계의 기울기에 대한 통계적 확신도를 제공함으로써, 은하의 깊고 느리게 움직이는 부분과 빠르고 바깥쪽 가장자리가 서로 다른 규칙을 따른다는 것을 보여주었습니다.
이 연구는 정확한 수학적 대리물과 스마트한 계층적 탐색 전략을 결합함으로써, 우리가 가공되지 않은 데이터로부터 해석 가능한 자연의 법칙으로 나아갈 수 있음을 보여줍니다. 이 시스템은 단순히 숫자를 예측하는 것이 아니라 우주의 구조를 드러내며, 은하의 복잡한 춤 속에서도 우리가 보는 법을 안다면 발견될 수 있는 단순하고 발견 가능한 규칙들이 존재함을 보여줍니다. 연구진은 자신의 코드와 데이터를 공개하여, 행성의 운동부터 유체의 거동에 이르기까지 다른 이들이 자신의 문제에 이 방법을 테스트할 수 있도록 했습니다. 신경 네트워크로부터 폐쇄형 방정식(closed-form equation)으로 가는 길은 더 이상 미스터리가 아닙니다. 그것은 우리 세상을 지배하는 근본적인 법칙을 이해하기 위한 실질적인 경로입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.