← 최신 논문
💬 NLP

In Context Learning and Reasoning for Symbolic Regression with Large Language Models

이 논문은 체인 오브 씽킹 프롬프팅과 과학적 맥락을 포함한 자연어 지시를 활용하여 대규모 언어 모델 (LLM) 이 데이터 패턴을 분석하고 외부 도구를 통해 최적화된 기호 회귀 수식을 반복적으로 개선하여 성공적으로 재발견할 수 있음을 보여줍니다.

원저자: Samiha Sharlin, Tyler R. Josephson

게시일 2026-04-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Samiha Sharlin, Tyler R. Josephson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 핵심 개념: "수학 공식 찾기 게임" (상징적 회귀)

과학자들은 실험 데이터를 보면 "아, 이 데이터는 저런 공식으로 설명될 거야"라고 추측합니다. 예를 들어, "압력이 올라가면 흡착량이 어떻게 변할까?" 같은 질문이죠.

전통적인 컴퓨터 프로그램은 이걸 찾으려고 무작위로 수천, 수만 개의 공식을 만들어서 하나하나 테스트합니다. 마치 무작위로 조합된 레고 블록을 쌓아보며 원하는 모양을 찾는 것과 비슷합니다. 하지만 이 방법은 시간이 너무 오래 걸리고, 과학적인 상식과 맞지 않는 엉뚱한 공식을 만들어내기도 합니다.

2. 이 연구의 혁신: "AI 에게 '생각하는 시간'을 주다"

저자들은 최신 AI(거대 언어 모델, GPT-4 등) 를 활용했습니다. 하지만 AI 에게 단순히 "공식을 찾아줘"라고만 하면, AI 는 **가상의 숫자 (허위 사실)**를 만들어내거나 엉뚱한 답을 내놓곤 했습니다.

그래서 저자들은 AI 에게 다음과 같은 세 가지 전략을 적용했습니다.

📝 비유 1: "시험지 풀 때 '풀이 과정'을 적게 하라 (스크래치패드)"

  • 상황: 학생이 시험을 볼 때, 바로 답만 적으면 실수가 많지만, 풀이 과정을 종이에 적어가며 생각하면 정답에 가까워집니다.
  • 적용: 연구진은 AI 에게 "답만 말하지 말고, 데이터를 보며 어떤 패턴이 보이는지, 왜 이런 공식을 생각해냈는지 먼저 적어보라"고 지시했습니다. 이를 **'스크래치패드 (Scratchpad)'**라고 부릅니다.
  • 결과: AI 가 "아, 압력이 높아지면 흡착량이 늘어나다가 어느 정도에서 멈추네? 그럼 이런 공식이 아닐까?"라고 스스로 추론하게 되어, 훨씬 더 정확한 공식을 찾아냈습니다.

🗣️ 비유 2: "과학자에게 '맥락'을 알려주다"

  • 상황: 만약 누군가에게 "이 숫자 1, 2, 3, 4, 5 가 무슨 뜻인지 알려줘"라고만 하면, 그 사람은 guessing(추측) 만 할 수 있습니다. 하지만 **"이건 '기압'과 '물 흡착량' 데이터야"**라고 알려주면, 그 사람은 물리 법칙을 떠올리며 훨씬 더 똑똑한 추측을 합니다.
  • 적용: 연구진은 AI 에게 **자연어 (일상 언어)**로 "이 데이터는 질소가 미카에 붙는 현상이다"라고 설명해 주었습니다.
  • 결과: AI 는 단순히 숫자 패턴만 보는 게 아니라, 과학적 이론을 고려해서 공식을 만들었습니다. 예를 들어, "압력이 0 이면 흡착량도 0 이어야 한다"는 상식을 공식에 반영하게 된 것입니다.

🔄 비유 3: "AI 와 과학자의 '토론' (피드백 루프)"

  • 상황: 한 번에 완벽한 공식을 찾기 어렵습니다. 대신, AI 가 공식을 제안하면, 컴퓨터가 그 공식을 정밀하게 계산해 보고 "이건 오차가 좀 크네, 저건 너무 복잡해"라고 피드백을 줍니다.
  • 적용: AI 는 이 피드백을 받아 "아, 그럼 이 부분을 고쳐볼까?"라고 공식을 수정하고 다시 제안합니다. 이 과정이 여러 번 반복됩니다.
  • 결과: AI 는 스스로 학습하며 점점 더 정교하고 간단한 공식을 만들어냅니다.

3. 실제 성과: 무엇을 찾아냈나요?

이 방법은 세 가지 다른 상황에서 테스트되었습니다.

  1. 이미 알려진 공식 찾기 (랜뮤어 모델):

    • 과거에 과학자들이 이미 찾아낸 유명한 공식이 있는 데이터를 줬습니다.
    • 결과: AI 가 스크래치패드와 과학적 맥락을 사용했을 때, 그 유명한 공식을 다시 찾아내는 데 성공했습니다. 특히 최신 모델인 GPT-4o 가 더 잘했습니다.
  2. 복잡한 공식 찾기 (듀얼 사이트 랜뮤어 모델):

    • 공식이 더 복잡하고, 데이터 패턴이 애매한 경우입니다.
    • 결과: AI 는 단순히 데이터에 맞는 짧은 공식을 만들려 했지만, 과학적 제약 조건 (예: "압력이 0 이면 값도 0 이어야 해") 을 자연어로 지시해 주자, 물리적으로 의미 있는 올바른 복잡한 공식을 찾아냈습니다.
  3. 아무도 모르는 미스터리 해결 (니쿠라드세 데이터):

    • 파이프 내 마찰력을 설명하는 데이터로, 정답이 아직 정해지지 않은 어려운 문제였습니다.
    • 결과: 기존에 알려진 최고의 프로그램보다 정확도는 조금 떨어졌지만, 훨씬 적은 비용과 시간으로 경쟁력 있는 공식을 찾아냈습니다. 특히 AI 가 "이 데이터는 이런 특징이 있어"라고 스스로 분석하며 새로운 접근법을 제시했습니다.

4. 결론: 왜 이 연구가 중요할까요?

이 연구는 **"AI 가 단순히 답을 외우는 기계가 아니라, 과학적 맥락을 이해하고 추론하는 파트너가 될 수 있다"**는 것을 보여줍니다.

  • 기존 방식: 컴퓨터가 무작위로 공식을 쏟아내며 계산하는 것 (비효율적, 비과학적일 수 있음).
  • 이 연구의 방식: AI 에게 "데이터를 보고, 과학적 상식을 떠올리고, 생각 과정을 적어보게" 하여, 인간 과학자와 함께 협력하게 함.

한 줄 요약:

"이 연구는 AI 에게 **'수학 문제를 풀 때 풀이 과정을 적고, 과학적 상식을 활용하라'**고 가르쳐서, 복잡한 과학 데이터 속에서 숨겨진 진리를 찾아내는 새로운 방법을 제시했습니다."

이 방법은 앞으로 과학자들이 방대한 데이터를 분석할 때, AI 를 더 쉽고 효과적으로 활용할 수 있는 길을 열어줄 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →