← 최신 논문
🤖 AI

Enhancing Mathematical Problem Solving in LLMs through Execution-Driven Reasoning Augmentation

이 논문은 기존 멀티 에이전트 시스템의 경직된 구조와 실행 피드백 활용의 한계를 극복하기 위해, 실행 결과와 언어 모델의 사고 과정을 결합하여 프로그래밍적 추론 체인을 반복적으로 개선하는 'IIPC(Iteratively Improved Program Construction)' 방법론을 제안하여 수학적 문제 해결 능력을 향상시켰습니다.

원저자: Aditya Basarkar, Benyamin Tabarsi, Tiffany Barnes, Dongkuan Xu

게시일 2026-02-10
📖 2 분 읽기☕ 가벼운 읽기

원저자: Aditya Basarkar, Benyamin Tabarsi, Tiffany Barnes, Dongkuan Xu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 AI의 문제점: "고집불통 수학 천재" 🧠🚫

기존의 똑똑한 AI들은 수학 문제를 풀 때 마치 **'한 번 자기 논리에 빠지면 앞뒤 안 가리고 달리는 고집불통 천재'**와 같았습니다.

  • 연쇄 오류 (Cascading Errors): 문제를 풀다가 중간에 계산을 한 번 잘못하면, 그 틀린 답을 '정답'이라고 믿고 다음 단계로 넘어갑니다. 결국 마지막엔 아주 엉뚱한 답을 내놓죠. 마치 요리하다가 소금을 설탕으로 착각해 넣었는데, 그걸 깨닫지 못하고 계속 요리를 완성해서 결국 '소금 케이크'를 만드는 것과 같습니다.
  • 도구 의존성 (Program Bias): 계산기(코드)를 쓰긴 하지만, 계산기가 이상한 값을 내뱉어도 "아, 이게 맞겠지" 하고 맹목적으로 믿어버리는 경향이 있었습니다.

2. IIPC의 해결책: "꼼꼼한 검토와 두 개의 뇌" 🛠️🧠🧠

이 논문에서 제안하는 **IIPC(Iteratively Improved Program Construction)**는 이 문제를 해결하기 위해 두 가지 특별한 장치를 도입했습니다.

① 첫 번째 장치: "오답 노트와 무한 수정 루프" (Iterative Refinement) 📝🔄

IIPC는 문제를 풀 때 바로 답을 내지 않습니다. 대신 **'수학 프로그램을 짜는 프로그래머'**처럼 행동합니다.

  • 실행과 피드백: 코드를 짜서 실행해보고, 에러가 나거나 답이 이상하면 "어? 왜 틀렸지?"라고 스스로 반성합니다.
  • 오답 노트 (Reflection Memory): 특히 똑똑한 점은 **'오답 노트'**를 쓴다는 것입니다. "아까 2단계에서 이런 실수를 했었지, 이번엔 조심하자!"라고 기억하며 똑같은 실수를 반복하지 않도록 스스로를 통제합니다.

② 두 번째 장치: "이성적인 뇌 vs 논리적인 뇌" (Dual-Branch Architecture) ⚖️

이게 이 논문의 핵심입니다. IIPC는 머릿속에 두 개의 서로 다른 사고 체계를 가집니다.

  • 왼쪽 뇌 (언어적 사고 - CoT): "문제를 읽어보니 이런 원리가 필요하네..."라며 말로 풀어서 논리적으로 생각합니다. (인간의 직관과 논리)
  • 오른쪽 뇌 (프로그램 사고 - Program): "자, 이제 파이썬 코드로 정확하게 계산해볼까?"라며 계산기를 두드립니다. (기계의 정확성)

중요한 건 마지막 단계입니다! 마지막에 이 두 뇌가 만나서 서로 대화합니다.

오른쪽 뇌: "계산 결과는 8이야!"
왼쪽 뇌: "잠깐, 내가 논리적으로 따져보니 결과는 마이너스(-)가 나와야 해. 네 계산이 틀렸어!"
결론: "아, 계산이 틀렸구나. 다시 계산해서 최종 답은 -8로 하자!"

이렇게 '말(논리)'과 '계산(코드)'이 서로를 감시하고 보완하기 때문에, 한쪽이 실수해도 다른 쪽이 잡아낼 수 있는 것입니다.


3. 요약하자면? 🌟

이 논문의 IIPC는 마치 **"실수를 하면 오답 노트를 보며 고치고, 머릿속으로 논리적 추론과 정밀한 계산을 동시에 진행하며 서로 검토하는 아주 꼼꼼한 수학 선생님"**을 만든 것과 같습니다.

결과적으로:
기존 AI들이 어려워하던 고난도 수학 문제(AIME, MATH 등)에서 훨씬 더 높은 정답률을 기록하며, "AI가 수학을 더 믿을 수 있게(Reliable) 만들 수 있다"는 것을 증명해냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →