← 최신 논문
💻 computer science

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

본 논문은 기존 평가에서 계산 및 응용 수학 분야의 대표성 부족 문제를 해결하기 위해 교과서 연습문제를 적응시키는 의존성 복원 파이프라인을 활용하고, 국소적 맥락 추적 및 기본 정리 적용이 필요한 작업에서 대규모 언어 모델의 성능을 분석하는 1,000 개의 공식화된 문제를 포함하는 새로운 Lean 4 벤치마크인 CAM-Bench 를 소개합니다.

원저자: Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 천재적이지만 문자 그대로만 이해하는 로봇에게 수학을 가르치려 합니다. 이를 테스트하는 두 가지 방법이 있습니다:

  1. "정답 키" 테스트: 로봇에게 수학 문제를 주고 최종 숫자를 적게 합니다. 숫자가 맞으면 금색 별을 줍니다. 이것이 현재 대부분의 AI 수학 테스트가 작동하는 방식입니다.
  2. "단계별" 테스트: 로봇에게 교과서의 증명처럼 모든 논리적 단계를 하나씩 적게 한 후, 각 단계가 논리적으로 무결한지 확인합니다. 이는 훨씬 어렵지만, 로봇이 단순히 답을 추측하는 것이 아니라 수학을 실제로 이해하고 있음을 입증합니다.

이 논문은 CAM-Bench라는 새로운 초강력 "단계별" 테스트를 소개합니다.

문제: 로봇은 "올림피아드" 수학만 알고 있습니다

현재 수학 AI 를 위한 대부분의 테스트는 올림피아드 퍼즐과 같습니다. 이들은 까다롭고 독립적인 수수께끼들입니다 (예: "X 가 참이면 Y 도 참임을 증명하라"). AI 는 이러한 문제들을 잘 해결합니다. 왜냐하면 그것들이 격리된 논리 게임과 같기 때문입니다.

하지만 공학, 금융, 물리학 같은 현실 세계의 수학은 다릅니다. 그것은 보통 깔끔한 수수께끼가 아닙니다. 그것은 요리책에서 레시피를 따르는 것과 더 비슷합니다.

  • 레시피 (문제) 는 이미 "볶다"가 무엇을 의미하는지 알고 있다고 가정합니다.
  • 특정 유형의 프라이팬 (3 장의 정의) 을 가지고 있다고 가정합니다.
  • 양파를 다지는 방법 (1 장의 알고리즘) 을 알고 있다고 가정합니다.

로봇에게 레시피의 마지막 문장 ("수프를 만드세요") 만 건네주면, 로봇은 혼란에 빠집니다. 왜냐하면 원래 저자가 당신이 가지고 있다고 가정했던 "로컬 컨텍스트"(정의, 도구, 이전 단계) 가 없기 때문입니다.

CAM-Bench최적화(무언가를 수행하는 최선의 방법 찾기), 수치 선형 대수(거대한 숫자 격자로 수학 수행), 수치 해석(해의 근사치 계산) 과 같은 분야에서 AI 가 이러한 "요리책 스타일" 수학을 처리할 수 있는지 테스트하도록 설계되었습니다.

해결책: "컨텍스트 탐정" 파이프라인

저자들은 단순히 교과서에서 문제를 가져와 AI 에게 공급하지 않았습니다. 대신 문제를 준비하기 위해 정교한 파이프라인(공장 라인) 을 구축했습니다. 이를 컨텍스트 탐정으로 생각하세요:

  1. 원시 단서: 그들은 "알고리즘 16.4 를 사용하여 문제 16.76 을 해결하라"고 말하는 지저분한 교과서 연습문제부터 시작합니다.
  2. 탐정 작업: 파이프라인은 "알고리즘 16.4"가 실제로 무엇인지 파악하기 위해 책으로 돌아가서 이전 장들에 숨겨진 정의, 공식, 가정들을 찾아냅니다.
  3. 재구성: 이 산재된 조각들을 모두 이어 붙여 하나의 거대하고 독립적인 "비공식 정리"로 만듭니다. 마치 "비밀 소스를 추가하라"고 말하는 레시피를 "토마토, 바질, 마늘로 만든 소스를 추가하라"고 다시 쓰는 것과 같습니다.
  4. 번역: 마지막으로, 이 깔끔하고 독립적인 이야기를 Lean(논리에 아주 작은 구멍 하나라도 있으면 거부하는 초-엄격한 수학 교사처럼 작동하는 엄격한 컴퓨터 언어) 으로 번역합니다.

결과: AI 는 "요리책"에 갇혀 있습니다

저자들은 이 새로운 벤치마크에서 세계 최고의 AI 모델 몇 가지를 테스트했습니다. 결과는 다음과 같습니다:

  • "정답 키" 격차: AI 모델들은 평범한 영어로 문제를 해결하는 것 (올바른 답을 얻는 것) 은 실제로 꽤 잘했습니다. 하지만 Lean(엄격한 언어) 으로 증명을 작성해야 할 때, 성공률은 급락했습니다.
    • 비유: AI 는 대화에서 케이크를 굽는 방법을 알려줄 수는 있지만, 무엇도 추측할 수 없는 로봇에게 지시를 쓰라고 요청하면 로봇은 부엌을 태워버립니다.
  • "로컬 컨텍스트" 실패: AI 는 "로컬 규칙"을 계속 잊어버렸습니다. 현재 장에 존재하지 않는 도구를 사용하려 하거나, 교과서가 암시했지만 특정 문장에는 명시적으로 언급되지 않은 작은 가정 (예: "숫자는 양수여야 함") 을 놓치는 식이었습니다.
  • "긴 사슬" 문제: 실제 수학 문제는 종종 작은 단계들의 긴 사슬 (벽돌을 하나씩 쌓아 집을 짓는 것과 같음) 을 요구합니다. AI 모델들은 종종 사슬의 중간에 빠져서 무엇을 짓고 있는지 잊어버리거나 장기적인 목표를 잃어버렸습니다.

"에이전트" 업그레이드

연구자들은 또한 AI 가 도구 상자를 가진 인간 탐정처럼 행동하는 더 진보된 방법을 시도했습니다. 단순히 답을 추측하는 대신, AI 는 다음과 같은 작업을 수행할 수 있습니다:

  • 실수를 했을 때 컴퓨터 (Lean) 에게 도움을 요청합니다.
  • 자신의 작업을 확인합니다.
  • 오류 메시지를 기반으로 다시 시도합니다.

이 "에이전트" 접근 방식은 성공률을 두 배로 늘려 훨씬 더 잘 작동했습니다. 그러나 여전히 완벽하지는 않았으며, 실행하는 데 훨씬 더 많은 "뇌력"(컴퓨터 토큰) 이 소모되었습니다.

결론

CAM-Bench는 AI 가 수학 수수께끼를 푸는 데는 능숙해지고 있지만, 컨텍스트를 이해하고, 로컬 규칙을 기억하며, 단계별로 긴 논리적 주장을 구축하는 응용 수학에서는 여전히 어려움을 겪고 있음을 보여줍니다.

이 논문은 AI 를 현실 세계의 수학에 대해 진정으로 신뢰할 수 있게 만들기 위해서는 격리된 수수께끼로 테스트하는 것을 멈추고, 이러한 지저분하고 컨텍스트가 풍부한 "요리책" 문제로 테스트를 시작해야 한다고 결론지었습니다. 현재 모델들은 답을 암기할 수는 있지만, 바닥부터 집을 짓는 법은 아직 배우지 못한 학생들과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →