← 최신 논문
💬 NLP

MathDuels: Evaluating LLMs as Problem Posers and Solvers

이 논문은 정적 수학 벤치마크의 한계를 극복하기 위해 모델이 문제 생성자와 해결자라는 이중 역할을 수행하며 상호 경쟁하는 'MathDuels'라는 새로운 평가 프레임워크를 제안하고, 이를 통해 생성 능력과 해결 능력이 부분적으로 분리되어 있음을 입증합니다.

원저자: Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik

게시일 2026-04-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 왜 기존 시험은 더 이상 쓸모가 없나요? (정적 시험의 한계)

지금까지 AI 의 수학 실력을 볼 때는 고정된 문제집을 사용했습니다. 마치 학생들에게 매년 똑같은 '수능 모의고사'를 치르게 하는 것과 비슷하죠.

  • 문제점: AI 가 너무 빨리 똑똑해져서, 예전에는 어려웠던 문제들이 이제는 AI 에게 너무 쉬워졌습니다. 마치 초등학생이 고등학교 수학 문제를 쉽게 푼다면, 그 시험은 더 이상 그 아이의 진짜 실력을 가려낼 수 없죠.
  • 결과: AI 들이 모두 만점을 받아서 서로 누가 더 뛰어난지 구별할 수 없게 되었습니다. 새로운 문제를 만들어내는 속도보다 AI 의 실력이 더 빠르게 발전하고 있기 때문입니다.

2. 새로운 아이디어: "서로 싸우게 하라!" (수학 듀얼)

이 논문은 16 세기 이탈리아 수학자 '타르탈리아'의 일화를 빗대어 새로운 방식을 제안합니다. 당시 두 수학자가 서로에게 문제를 내고, 상대방이 그 문제를 풀게 하는 '수학 결투'를 벌였습니다.

**MathDuels(수학 듀얼)**은 이 원리를 AI 에게 적용합니다.

  • 이중 역할: 각 AI 는 두 가지 역할을 동시에 합니다.
    1. 문제 출제자 (Author): 상대방을 당황하게 할 만큼 어려운 문제를 직접 만듭니다.
    2. 문제 해결자 (Solver): 다른 AI 가 만든 문제를 풉니다.

3. 어떻게 작동하나요? (게임 규칙)

이 평가는 마치 치열한 토너먼트처럼 진행됩니다.

  1. 문제 만들기: 각 AI 는 6 가지 수학 분야 (대수, 기하, 확률 등) 에서 어려운 문제를 30 개씩 만듭니다. 이때 AI 는 "상대방이 풀지 못하게 하라"는 미션이 주어집니다.
  2. 문제 풀기: 만든 AI 를 제외한 나머지 AI 들은 그 문제들을 모두 풉니다.
  3. 심사 (검증): 만약 답이 맞지 않거나 문제가 애매하면, 별도의 '심사위원 AI'가 문제를 다시 검토합니다. 문제가 너무 이상하거나 답이 없는 것은 제외합니다.
  4. 점수 매기기:
    • 풀이 점수: 다른 AI 가 만든 문제를 얼마나 많이 풀었나요?
    • 출제 점수: 내가 만든 문제가 다른 AI 들을 얼마나 많이 막아냈나요? (상대가 못 풀면 내 점수가 올라갑니다!)
    • 최종 점수: 이 두 가지 점수를 합쳐서 순위를 매깁니다.

4. 놀라운 발견: "문제 푸는 것"과 "문제 내는 것"은 다릅니다!

이 실험을 통해 아주 중요한 사실을 발견했습니다.

  • 해석: "수학 문제를 잘 푸는 AI"와 "어려운 문제를 잘 만드는 AI"는 서로 다른 능력일 수 있습니다.
  • 예시: 어떤 AI 는 문제를 아주 잘 풀지만, 정작 문제를 만들 때는 상대방이 너무 쉽게 풀 수 있는 쉬운 문제만 냅니다. 반대로 어떤 AI 는 문제를 풀기는 조금 느리지만, 만든 문제는 다른 AI 들이 당황해서 풀지 못하게 만듭니다.
  • 의미: 기존 시험은 '풀기' 능력만 봤기 때문에, '문제 만들기'라는 중요한 능력을 놓치고 있었습니다. MathDuels 는 이 두 가지를 모두 봅니다.

5. 왜 이 방식이 더 좋을까요? (한계가 없는 경기장)

  • 진화하는 난이도: 고정된 시험지라면 AI 가 다 풀면 끝이지만, MathDuels 는 AI 가 더 똑똑해질수록 더 어려운 문제를 만들어냅니다.
    • 새로운 AI 가 경기장에 들어오면, 그 AI 가 만든 문제는 기존에 강했던 AI 들도 풀지 못하게 만듭니다.
    • 마치 체스나 바둑에서 새로운 대국자가 등장하면 게임의 수준이 자연스럽게 올라가는 것처럼, 이 평가 시스템은 AI 의 발전 속도에 맞춰 자동으로 난이도가 올라갑니다.
  • 공정한 순위: 단순히 문제를 많이 푼 순서가 아니라, "누가 더 창의적이고 어려운 문제를 만들어내며, 동시에 그 문제를 해결할 능력도 있는가"를 종합적으로 봅니다.

6. 결론: AI 의 진짜 실력을 보는 거울

이 논문은 AI 를 단순히 '지식을 암기하는 기계'가 아니라, **'창의적으로 문제를 설계하고 해결하는 파트너'**로 평가해야 한다고 말합니다.

  • 비유: 기존의 시험이 "주어진 미로에서 가장 빨리 출구로 나가는지"를 본다면, MathDuels 는 "상대방이 헤매도록 미로를 설계할 수 있는가"와 "그 미로를 풀 수 있는가"를 동시에 봅니다.

이 방식은 AI 가 수학의 최전선 (연구 수준) 에 도달하는 시대에, AI 들의 진정한 실력을 비교하고 발전 방향을 잡아주는 훌륭한 나침반이 될 것입니다.


한 줄 요약:

"AI 들에게 고정된 시험지를 주는 대신, 서로에게 어려운 문제를 내게 하고 풀게 하는 **'수학 결투'**를 시켜서, 누가 진짜로 똑똑하고 창의적인지 가려내자!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →