← 최신 논문
🤖 AI

Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

이 논문은 135만 개의 합성 다항식 예시에 대한 지도 미세 조정, 기호적 보상을 활용한 그룹 상대적 정책 최적화(GRPO), 그리고 정확한 검증을 위한 네이티브 SymPy 도구 사용을 결합하여 검증된 가중 제곱합(weighted sum-of-squares) 증명서를 생성하는 데 높은 성공률을 달성한 LLM 에이전트를 제시한다.

원저자: Bohan Chen, Shivam N. Patel, Richard Hoffmann, Sam Looi, Tony Yue Yu

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Bohan Chen, Shivam N. Patel, Richard Hoffmann, Sam Looi, Tony Yue Yu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 지시사항을 따르는 데는 매우 뛰어나지만, 어떤 지시를 따라야 할지 결정하는 데는 서툰 세상을 상상해 보십시오. 이것이 현재 인공지능, 특히 글을 쓰고 코드를 짜며 수수께끼를 풀 수 있는 초스마트 챗봇인 거대언어모델(LLM)이 직면한 최전선입니다. 이러한 모델들은 문장에서 다음에 올 단어를 추측하는 데는 능숙하지만, 복잡한 수학 증명처럼 긴 논리적 단계가 필요한 문제를 마주하면 종종 비틀거립니다. 이를 해결하기 위해 과학자들은 AI 에이전트에게 인간 수학자가 계산기, 자, 또는 특수 소프트웨어를 집어 드는 것처럼 "도구"를 사용하는 법을 가르치고 있습니다. 중요한 질문은 AI가 도구를 '사용할 수 있느냐'가 아니라, 단일 도구로는 해결할 수 없는 퍼즐을 풀기 위해 전체 도구 상자를 '조정(coordinate)'하는 법을 배울 수 있느냐 하는 것입니다. 이는 망치를 가지고 있는 것과, 언제 망치질을 하고, 언제 나사를 조이며, 언제 벽을 부수기 전에 멈춰야 하는지를 아는 것의 차이와 같습니다.

이 논문은 "제곱합(Sum-of-Squares, SOS)" 분해라는 특정 유형의 수학 퍼즐을 사용하여 바로 이 과제에 파고듭니다. 이것을 복잡하고 지저분한 다항식을 항상 양수(절대 음수가 되지 않음)로 만드는 과정이라고 생각해 보십시오. 이 식을 증명하는 "비결"은 식을 완전제곱식의 합(예: x2+y2x^2 + y^2)의 형태로 재배열하는 것입니다. 왜냐하면 제곱은 항상 양수이기 때문입니다. 하지만 식을 적절하게 재배열하는 방법을 찾는 것은 마치 눈을 가리고 루빅스 큐브를 맞추는 것과 같습니다. 조각들을 돌릴 수 있는 방법은 수백만 가지지만, 그중 해결책으로 이어지는 방법은 극히 일부뿐입니다. 저자들은 AI 에이전트가 자신의 작업을 즉시 확인할 수 있도록 기호 수학 도구(SymPy)를 사용하도록 학습시켰습니다. 그들은 이 에이전트를 단순히 최종 퍼즐만 가지고 훈련시킨 것이 아니라, 먼저 135만 개의 더 작고 단순한 대수학 문제들로 훈련시켰습니다.

결과는 단순히 AI에게 도구를 주는 것만으로는 충분하지 않다는 것을 보여줍니다. AI는 도구를 효과적으로 사용하기 전에 그 도구 뒤에 숨겨진 수학을 깊이 이해하는, 즉 "대수학적 근거(algebra-grounded)"를 갖추어야 합니다. 연구진이 완전히 훈련된 에이전트(수학을 배우고 도구 사용법까지 익힌 모델)를 테스트했을 때, 이 모델은 복잡한 퍼즐의 78.96%를 성공적으로 해결했습니다. 반면, 동일한 도구를 가지고 있지만 기초 수학 훈련을 받지 못한 버전의 AI는 44.73%만을 해결했습니다. 더욱 놀라운 점은, 완전히 훈련된 에이전트가 9가지 다른 유형의 대수학 과제에서 91.75%의 정확도를 보였다는 것입니다. 이 연구는 AI가 진정한 문제 해결사가 되기 위해서는 단순히 "버튼"을 누르는 법이 아니라 그 분야의 "기술(craft)"을 배워야 한다는 점을 시사합니다.

수학 탐정 이야기

당신이 거대하고 지저분한 대수 방정식이라는 용의자를 쫓는 탐정이라고 상상해 보십시오. 당신의 임무는 이 방정식이 항상 "좋은(양수인)" 상태이고 결코 "나쁜(음수인)" 상태가 아님을 증명하는 것입니다. 이를 증명하는 유일한 방법은 방정식을 양수인 벽돌들을 쌓아 올리는 것과 같은 완전제곱식들의 더미로 분해하는 것입니다. 만약 당신이 이 방정식이 단지 이러한 벽돌들의 더미라는 것을 보여줄 수 있다면, 사건을 해결한 것입니다.

하지만 여기 함정이 있습니다. 방정식이 뒤섞이고 혼란스러운 방식으로 쓰여 있다는 점입니다. 이 식을 다시 풀기 위해서는 식을 즉시 확장, 축소 또는 재배열할 수 있는 특별한 "수학 마법 지팡이"(SymPy라는 컴퓨터 프로그램)가 필요합니다. 하지만 이 지팡이는 당신에게 무엇을 해야 할지 알려주지 않습니다. 그저 당신이 요청하는 대로 수행할 뿐입니다. 만약 당신이 엉뚱한 부분을 확장하라고 요청한다면, 상황을 더 악화시킬 수도 있습니다. 당신은 어느 부분을 돌릴지, 언제 멈출지, 그리고 어떻게 조각들을 다시 결합할지를 스스로 결정해야 합니다.

Caltech과 OpenAI의 연구진은 AI가 이 탐정이 될 수 있는지 확인하고 싶었습니다. 그들은 단순히 AI에게 지팡이를 준 것이 아니라, "훈련 캠프"를 만들었습니다. 그들은 135만 개의 연습 문제를 만들었습니다. 먼저 AI는 문자를 분류하고, 유사한 항목을 그룹화하며, 숫자를 인수분해하는 것과 같은 간단한 작업들을 연습했습니다. 그다음, 그들은 시뮬레이션된 환경에서 지팡이를 사용하는 법을 가르쳤고, 지팡이에게 무언가를 요청했을 때 어떤 일이 일어나는지 보여주었습니다. 마지막으로, AI가 실제 지팡이를 사용하여 거대한 "제곱합(Sum-of-Squares)" 퍼즐을 풀도록 했습니다.

핵심 결과: 훈련이 도구를 이긴다

실험은 네 가지 서로 다른 버전의 AI 탐정을 비교했습니다:

  1. 루키 (Base): 훈련 캠프를 경험한 적이 없고 지팡이도 없는 AI.
  2. 학생 (SFT): 훈련 캠프를 공부했지만 테스트 중에는 지팡이가 없는 AI.
  3. 도구 사용자 (Base+Tools): 공부는 하지 않았지만 갑자기 지팡이를 손에 쥐게 된 루키.
  4. 마스터 (Full): 훈련 캠프를 공부했고 지팡이까지 갖춘 학생.

결과는 마스터의 압도적인 승리였습니다. 복잡한 퍼즐에 직면했을 때:

  • 루키는 지팡이가 있었음에도 약 **44.73%**만을 해결했습니다.
  • 마스터(수학을 알고 지팡이도 가진 모델)는 **78.96%**를 해결했습니다.

이는 매우 중요한 점을 입증합니다. 똑똑한 AI에게 강력한 도구를 쥐여주는 것만으로는 부족하다는 것입니다. AI는 도구 이면에 숨겨진 논리를 이해해야 합니다. 이는 숙련된 요리사에게 첨단 오븐을 주는 것과 같습니다. 요리법을 모른다면 오븐은 아무런 도움이 되지 않습니다. 하지만 레시피를 알고 있다면, 오븐은 그들을 무적의 존재로 만들어 줍니다.

연구진은 이 강도 높은 수학 훈련이 일반적인 수학 문제와 같은 다른 능력들을 저하시키는지도 확인했습니다. 결과는 그렇지 않았습니다. 마스터 AI는 표준 테스트에서 **96.29%**를 기록하며 일반적인 수학 문제에서도 오히려 약간 더 나은 성적을 보였는데, 이는 도구를 조정하는 법을 배우는 것이 기존의 기술을 망가뜨리지 않았음을 보여줍니다.

AI가 배운 것 (그리고 배우지 못한 것)

이 논문은 자신들의 주장에 대해 매우 신중합니다. AI가 이제 세상의 모든 수학 문제를 풀 수 있는 천재가 되었다고 말하는 것이 아닙니다. 사용된 퍼즐들은 컴퓨터가 만든 합성적인 것이며, 변수가 1개에서 3개 사이인 비교적 작은 규모였습니다. AI는 새로운 수학을 "발견"한 것이 아니라, 특정 유형의 증명을 찾기 위해 기존의 도구들을 조정하는 법을 배운 것입니다.

하지만 이 연구는 "모델에 도구 인터페이스를 그냥 씌우기만 하면 작동할 것"이라는 흔한 가정을 반박합니다. "도구 사용자(Base+Tools)" 버전은 훈련 없이 수학을 공부한 "학생(SFT)" 버전보다 성능이 낮았습니다. 이는 대수학에 대한 깊은 이해가 없다면 도구가 오히려 AI를 혼란스럽게 하여 잘못된 선택을 유도할 수 있음을 시사합니다.

또한 연구진은 AI가 세 가지 구체적인 방식으로 실패한다는 점을 언급했습니다. 너무 일찍 포기하거나, 형태는 맞지만 구조적으로 틀린 솔루션을 만들거나, 혹은 구조는 맞지만 원래의 방정식과 일치하지 않는 솔루션을 만드는 경우입니다. 시스템 내의 "정확한 검증기(exact verifier)"는 이러한 모든 실수를 잡아내어, 완벽한 솔루션만을 정답으로 카운트했습니다.

시사점

이 논문은 더 똑똑한 AI 에이전트를 구축하기 위한 청사진을 제공합니다. 이는 수학이나 과학 분야의 AI 미래가 단순히 더 큰 모델이나 더 화려한 도구에 달려 있는 것이 아님을 시사합니다. 핵심은 **조정(coordination)**입니다. AI에게 해당 영역의 기초 기술(예: 대수학)을 훈련시키고, 자신의 작업을 검증하기 위해 도구를 사용하는 법을 가르침으로써, 우리는 훨씬 더 신뢰할 수 있는 에이전트를 만들 수 있습니다. "마스터" AI는 단순히 추측한 것이 아니라, 인간 전문가처럼 계획하고, 실행하고, 확인하고, 수정했습니다. 비록 이 특정 연구는 통제된 수학 환경 내로 제한되었지만, 이는 우리가 향-후 더 어려운 현실 세계의 문제들을 해결하기 위해 AI를 어떻게 가르칠 수 있는지에 대한 길을 밝혀줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →