← 최신 논문
🤖 AI

HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs

이 논문은 기존 방식들과 비교하여 대규모 언어 모델의 수학적 추론을 더욱 정확하고 효율적이며 검증 가능하게 만들기 위해, 비형식적 추론과 Lean을 이용한 형식 검증 증명을 교차시키는 새로운 도구 보조 에이전트인 Hermes를 소개한다.

원저자: Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 어려운 수학 퍼즐을 풀려고 한다고 상상해 보세요. 당신에게는 천재적이지만 약간 산만하며, 아이디어를 브레인스토밍하고 길고 창의적인 설명을 쓰는 데 능숙한 조수(대규모 언어 모델, 또는 LLM)가 있습니다. 하지만 이 조수는 가끔 작은 논리적 실수를 하거나, 혼란에 빠지거나, 그럴듯하게 들리지만 사실이 아닌 정보를 "환각(hallucinate)"하기도 합니다.

반면에, 당신에게는 엄격하고 타협 없는 수학적 판사(정식 증명 시스템인 Lean)가 있습니다. 이 판사는 절대 실수를 하지 않지만, 매우 경직되어 있습니다. 판사는 당신의 창의적인 브레인스토밍을 이해하지 못하며, 오직 완벽하게 구조화된 정식 코드만을 받아들입니다. 만약 당신이 엉망인 설명을 제공한다면, 판사는 그저 "오류(Error)"라고 말할 뿐입니다.

Hermes는 이 둘 사이에서 번역가이자 품질 관리자 역할을 하는 새로운 도구입니다. 이는 당신의 창의적인 조수가 자유롭게 작업할 수 있게 해주면서도, 몇 단계마다 멈춰서 엄격한 판사에게 다음과 같이 묻습니다. "이 특정 단계가 실제로 사실인가요?"

Hermes가 어떻게 작동하는지 간단한 부분으로 나누어 설명하면 다음과 같습니다.

1. 문제점: "긴 산책" 대 "엄격한 시험"

  • 기존 방식 (비정형 추론): 당신의 조수가 하나의 긴 사고 흐름 속에서 전체 문제를 해결하려고 시도합니다. 유연하고 빠르지만, 초기에 잘못된 방향으로 발을 디디면 실수를 깨닫기 전까지 한참 동안 잘못된 방향으로 계속 걸어갈 수 있습니다. 이는 눈을 감고 운전하며 벽에 부딪히지 않기를 바라는 것과 같습니다.
  • 다른 방식 (정식 증명): 당신의 조수가 처음부터 엄격한 코드로 솔루션을 작성하려고 시도합니다. 완벽하게 정확하지만, 너무 느리고 어려워서 조수가 종종 막히거나 포기하게 됩니다. 이는 매 벽돌을 놓기 전에 설계도와 대조하며 집을 한 땀 한 땀 쌓아 올리는 것과 같습니다.

2. Hermes 솔루션: "체크포인트" 시스템

Hermes는 두 세계의 장점을 결합합니다. 조수가 몇 단계의 창의적인 설명을 쓰도록 내버려 둔 다음, "체크포인트"를 실행하기 위해 잠시 멈춥니다.

  • 번역기 (정식화 모듈): 조수가 "따라서 각도는 45도이다"라고 말하면, Hermes는 그 문장을 판사가 이해할 수 있는 엄격한 코드로 번역합니다.
  • 판사 (증명 모듈): 엄격한 판사가 그 코드를 검사합니다.
    • 통과하면: 좋습니다! Hermes는 그 단계를 **메모리 뱅크(Memory Bank)**에 저장하고 조수에게 "좋습니다, 계속하세요"라고 말합니다.
    • 실패하면: 판사가 "아니요, 틀렸습니다"라고 말합니다. Hermes는 조수에게 "멈추세요! 여기서 실수를 했습니다. 돌아가서 수정하세요"라고 알려줍니다.
  • 메모리 뱅크: 수학 문제는 종종 긴 논리의 사슬을 가지므로, Hermes는 검사를 통과한 모든 단계를 기억합니다. 이는 조수가 이미 증명한 규칙들을 잊지 않도록 보장하며, 전체 논증이 일관성을 유지하도록 돕습니다 있습니다.

3. 왜 더 나은가 (결과)

논문은 다양한 AI 모델을 사용하여 까다로운 수학 경시 대회(AIME 및 HARDMath2 등)에서 Hermes를 테스트했습니다.

  • 정확도: Hermes는 AI를 훨씬 더 똑똑하게 만들었습니다. 가장 어려운 문제에서, Hermes는 AI의 성공률을 최대 **40%**까지 향상시켰습니다. 이는 AI가 틀린 답을 자신 있게 제시하는 것을 막아주었습니다.
  • 효율성: 매 단계마다 확인하는 것이 느리고 비용이 많이 들 것이라고 생각할 수도 있습니다. 놀랍게도, Hermes는 5개 또는 10개의 서로 다른 답을 생성한 뒤 가장 좋은 것을 고르려는 다른 방법들보다 실제로 더 빠르고 저렴했습니다(컴퓨터 자원 측면에서). 이는 10개의 경로를 헤매며 가장 좋은 경로를 찾는 대신, 검증된 직항 경로를 택하는 것과 같습니다.
  • 명확성: 단순히 "이 답이 맞을 확률이 80%입니다"라고 말하는 다른 방법들과 달리, Hermes는 특정 단계에 대해 명확한 "예" 또는 "아니요"를 제공하여, 답이 왜 맞는지 혹은 왜 틀린지를 더 쉽게 알 수 있게 합니다.

핵심 요약

Hermes는 당신의 창의적인 수학 조수에게 실시간으로 작업 내용을 점검해 주는 스마트한 자동 편집기를 주는 것과 같습니다. 이것은 조수의 창의적인 사고를 방해하지 않습니다. 단지 조수가 낭떠러지로 떨어지지 않도록 보장할 뿐입니다. 그 결과, 더 정확할 뿐만 아니라 더 효율적이고 신뢰하기 쉬운 수학 해결 AI가 탄생합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →