← 최신 논문
🤖 machine learning

Decomposable Neural Symbolic Regression

이 논문은 멀티셋 트랜스포머(Multi-Set Transformers), 유전 알고리즘, 그리고 유전 프로그래밍을 활용하여 불투명한 회귀 모델을 원래의 수학적 구조를 일관되게 복원하면서도 경쟁력 있는 예측 성능을 유지하는 정확하고 해석 가능한 다변량 수식으로 증류하는 분해 가능한 신경 기호 회귀 방법을 소개한다.

원저자: Giorgio Morales, John W. Sheppard

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Giorgio Morales, John W. Sheppard

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 과학의 세계에서 컴퓨터는 데이터 속에서 패턴을 찾아내는 데 있어 믿기 힘들 정도로 강력한 도구가 되었습니다. 컴퓨터는 자연계로부터 얻은 수천 개의 측정값을 살펴보고, 미래의 결과를 높은 정확도로 예측하는 복잡한 모델을 구축할 수 있습니다. 이러한 모델들은 종-종 "불투명하다(opaque)"라고 불리는데, 그 이유는 모델이 잘 작동함에도 불구하고 내부 로직이 너무 얽히고설켜 있어 인간이 그 결론에 도달하는 과정을 쉽게 이해할 수 없기 때문입니다. 이들은 마치 블랙박스와 같습니다. 데이터를 넣으면 결과가 나오지만, 그 사이의 경로는 숨겨져 있습니다. 물리학, 생물학, 또는 공학을 연구하는 과학자들에게 이러한 투명성의 결여는 커다란 장애물입니다. 우주를 진정으로 이해하기 위해서 연구자들에게는 단순한 예측 그 이상의 것, 즉 자연이 어떻게 작동하는지를 설명하는 명확한 수학적 문장인 지배 방정식이 필요합니다. 이것이 바로 관찰된 데이터를 단순히 암기하는 것이 아니라, 데이터를 설명할 수 있는 단순하고 읽기 쉬운 공식을 찾는 데 전념하는 분야인 기호 회귀(symbolic regression)의 목표입니다.

몬태나 주립 대학교의 한 연구팀은 이 문제를 해결하기 위한 새로운 방법을 개발하여, 이러한 복잡한 컴퓨터 모델의 층을 벗겨내어 그 아래에 숨겨진 단순한 수학적 진실을 드러낼 수 있는 방식을 제시했습니다. SeTGAP라고 부르는 그들의 접근 방식은 먼저 시스템의 거동을 학습하도록 표준적이고 매우 복잡한 컴퓨터 모델을 훈련하는 것으로 시작합니다. 일단 이 "불투명한" 모델이 훈련되어 작동하기 시작하면, 연구진은 모델의 수백만 개 내부 설정을 역공학으로 분석하려 하지 않습니다. 대신, 그들은 모델을 하나의 '진실의 원천'으로 취급하고 모델에게 스스로를 설명하도록 요청합니다. 그들은 온도나 압력과 같은 각 입력 요인을 체계적으로 격리하고, 단 하나의 요인만 움직일 때 모델의 출력이 어떻게 변하는지 묻습니다. 이렇게 함으로써, 시스템은 각 퍼즐 조각의 관계 형태를 설명하는 단순한 단일 변수 스케치(single-variable sketches)의 일련을 생성합니다.

그 후 연구진은 이러한 개별 스케치들을 하나로 엮어내는 정교한 과정을 사용합니다. 복잡한 기계를 이해하기 위해 먼저 각 기어가 단독으로 어떻게 회전하는지 파악한 다음, 그것들이 어떻게 서로 맞물리는지 살펴보는 과정을 상상해 보십시오. 연구팀은 인공지능과 진화 알고리즘을 결합하여 이 단일 변수 스케치들을 완전한 다변수 공식으로 병합합니다. 그들은 모든 조각을 한꺼번에 던져 넣지 않는데, 이는 종종 혼란을 야기하거나 지나치게 복잡한 결과를 초래하기 때문입니다. 대신, 그들은 변수를 하나씩 추가하며 매 단계마다 공식의 구조가 깨끗하고 논리적인 상태를 유지하도록 보장합니다. 이 방법은 초기 단계에서 식별한 원래의 함수 관계를 보존할 수 있게 해주며, 결과적으로 방정식이 데이터를 맞추기는 하지만 의미는 통하지 않는 지저분한 숫자 더미가 되는 것을 방지합니다.

연구팀이 합성 수학 문제부터 실제 물리 방정식에 이르기까지 다양한 문제에 이 방법을 테스트했을 때, 그 결과는 놀라웠습니다. 합성 문제에서 그들의 방법은 실행한 모든 테스트 케이스에서 기저 시스템의 올바른 수학적 구조를 성공적으로 복구해 냈습니다. 반면, 딥러닝이나 전통적인 진화 컴퓨팅에 의존하는 다른 선도적인 방법들은 올-바른 형태를 찾는 데 자주 실패했으며, 숫자는 정확히 예측할지라도 표현식이 너무 복잡하거나 아예 틀린 경우가 많았습니다. 새로운 접근 방식은 데이터에 노이즈나 오류가 포함된 경우, 즉 실제 측정에서 흔히 발생하는 상황에서도 특히 견고함을 입증했습니다. 다른 방법들이 훈련된 데이터 범위를 넘어 일반화하는 데 어려움을 겪는 반면, 이 방법으로 발견된 방정식은 새로운 미지의 값 범위에서도 잘 작동했습니다.

연구진은 또한 이 기술을 중력부터 빛의 거동까지 모든 것을 설명하는 법칙을 담고 있는 유명한 물리 방정식 모음인 파인만 데이터셋(Feynman dataset)에 적용했습니다. 이 벤치마크에서 그들의 방법은 올바른 방정식을 식별하는 데 있어 약 61.2%의 성공적인 복구율을 기록하며 높은 성공률을 보였고, 기존의 확립된 기술들과 비교하여 경쟁력 있는 예측 성능을 입증했습니다. 이 연구는 복잡한 문제를 작고 관리 가능한 부분으로 나누고 이를 신중하게 재조립함으로써 현재 인공지능의 한계를 우회할 수 있음을 시사합니다. 이것은 컴퓨터의 능력이 떨어졌다는 의미가 아닙니다. 오히려 컴퓨터에게 스스로를 설명하도록 요청하는 방식이 더 효과적이라는 것을 의미합니다. 이 작업은 현대 머신러닝의 깊고 숨겨진 층으로부터 명확하고 인간이 읽을 수 있는 자연 법칙을 추출하는 것이 가능하며, 불투명한 예측을 투명한 이해로 바꿀 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →