← 최신 논문
🤖 AI

LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization

이 논문은 계층적 물리적 타당성과 토큰 수준의 구조적 절약성을 강제함으로써 대규모 언어 모델을 기호 회귀를 위한 적응형 생성기로 변환하여, 최첨단 방정식 발견을 달고 소규모 모델이 폐쇄형 거대 모델들을 능가하도록 만드는 강화 학습 프레임워크인 PiT-PO를 소개한다.

원저자: Boxiao Wang, Kai Li, Tianyi Liu, Chen Li, Junzhe Wang, Yifan Zhang, Jian Cheng

게시일 2026-08-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Boxiao Wang, Kai Li, Tianyi Liu, Chen Li, Junzhe Wang, Yifan Zhang, Jian Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 풀고 있다고 상상해 보십시오. 하지만 지문이나 발자국을 찾는 대신, 세상이 어떻게 작동하는지를 지배하는 비밀스러운 수학적 레시피를 추적하고 있습니다. 이 분야를 **기호 회귀(Symbolic Regression)**라고 부릅니다. 오늘날 대부분의 컴퓨터 프로그램은 '왜' 그런 결과가 나왔는지 설명하지 못한 채 정답만을 추측하는 블랙박스와 같지만, 기호 회귀는 데이터 더미 속에 숨겨진 실제 방정식, 즉 '자연의 법칙'을 찾아내려 노력합니다. 이는 마치 노래를 듣고 단순히 흥얼거리는 것에 그치지 않고, 처음부터 악보를 직접 써 내려가는 것과 같습니다.

오랫동안 과학자들은 이러한 레시피를 찾기 위해 전통적인 방식들을 사용해 왔지만, 그 방식들은 느렸고 가능한 수학 공식들의 광활한 황무지 속에서 길을 잃기 일쑤였습니다. 최근에는 **대규모 언어 모델(LLM)**이라는 새로운 종류의 '슈퍼 브레인'이 이 게임에 등장했습니다. 이들은 당신과 대화를 나누거나 이야기를 쓸 수 있는 것과 같은 유형의 AI이지만, 수백만 권의 과학 교과서를 읽기도 했습니다. 이 덕분에 이들은 과학 방정식이 어떤 모습일지 매우 잘 추측할 수 있습니다. 하지만 함정이 하나 있습니다. 이 AI 모델들은 보통 교과서는 통째로 외웠지만 시험은 한 번도 치러본 적 없는 학생과 같습니다. 이들은 겉보기에 그럴싸하고 숫자에 완벽하게 들어맞는 공식을 내뱉을 수는 있지만, 물리 법칙을 어기거나 불필요하게 복잡할 수도 있습니다. 마치 요리사가 그냥 기분이 내키는 대로 소금 한 컵을 넣으라고 요구하는 레시피처럼 말이죠.

여기서 새로운 연구가 등장합니다. 왕샤오왕(Boxiao Wang)과 카이 리(Kai Li)가 이끄는 연구진은 이 '암기형 학생' 문제를 해결하고자 했습니다. 그들은 PiT-PO(물리 정보 기반 토큰 규제 정책 최적화, Physics-informed Token-Regularized Policy Optimization)라는 시스템을 만들었습니다. AI에게 단순히 추측을 던져주고 운에 맡기는 대신, PiT-PO는 AI를 실시간으로 자신의 실수로부터 배우는 학생으로 변화시킵니다. 이는 마치 똑똑하지만 엄격한 물리 선생님이 AI 바로 옆에 서서 "안 돼, 그 항은 물리적으로 말이 안 돼"라거나 "재료를 너무 많이 쓰고 있어, 단순화해!"라고 속삭여 주는 것과 같습니다.

연구팀은 영리한 피드백 루프를 구축했습니다. AI가 후보 방정식을 생성하면, PiT-PO는 두 가지 엄격한 규칙에 따라 이를 검사합니다. 첫째, **물리적 타당성(Physical Validity)**을 확인합니다. 이 방정식이 물리 법칙을 준수하는가? 예를 들어, 만약 방정식이 에너지 공급 없이 유체가 언덕 위로 흐른다고 예측한다면, 시스템은 벌점을 부여합니다. 둘째, **중복성(Redundancy)**을 확인합니다. 방정식이 불필요한 부분들로 비대해지지는 않았는가? 연구진은 '지지 집합 제외 정리(Support Exclusion Theorem)'라는 수학적 기법을 사용하여 단순한 노이즈에 불과한 항들을 찾아내고, AI가 이를 포함했을 때 벌칙을 주었습니다.

결과는 인상적이었습니다. 테스트에서 PiT-PO는 단순히 데이터에 들어맞는 방정식을 찾는 데 그치지 않고, 데이터가 지저분한 상황에서도 실제 밑바닥에 깔린 법칙을 찾아냈습니다. 특히 "주기적 언덕 위의 흐름(Flow over Periodic Hills)"이라는 이름의 혼돈스러운 공기 흐름을 다룬 특정 테스트에서, 이 AI는 기존 방식보다 훨씬 더 현실에 가까운 방식으로 난류를 모델링하는 새로운 방법을 발견했습니다. 무엇보다 흥격한 점은, 이 시스템이 매우 효과적이어서 작은 규모의 오픈 소스 AI 모델(표준 컴퓨터에서 실행 가능한 수준의 모델)이 거대하고 값비싼 '폐쇄형 소스'의 거물들을 능가할 수 있었다는 사실입니다.

AI에게 스스로의 탐색 과정으로부터 배우도록 가르치고 물리 법칙을 엄격하게 적용함으로써, PiT-PO는 정적인 추측 기계를 적응형 과학 발견자로 탈바꿈시킵니다. 이는 우리가 우주의 비밀을 풀기 위해 슈퍼컴퓨터를 기다릴 필요가 없음을 시사합니다. 적절한 훈련만 있다면, 더 작고 접근하기 쉬운 AI 도구들이 유체 역학에서 생물학적 성장까지 모든 것을 움직이는 근본적인 방정식들을 밝혀내는 데 도움을 줄 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →