← 최신 논문
💬 NLP

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

본 논문은 단계별 프로세스 평가를 통해 증대된 테스트 시간 계산 자원을 활용하여 추론 모델을 평가자로 사용하는 것이 평가 정확도를 크게 향상시키고, 생성 중 계산 자원 확장 시의 이점과 유사하게 재랭킹을 통해 언어 모델의 문제 해결 능력을 강화할 수 있음을 보여준다.

원저자: Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어려운 수학 시험을 치르고 있다고 상상해 보세요. 보통 더 좋은 점수를 얻기 위해 문제를 풀기 위해 더 열심히 생각하거나 해결 단계를 더 많이 적어내는 시도를 합니다. 이 논문은 흥미로운 질문을 던집니다. 정답에 대해 더 열심히 생각하는 대신, 정답을 채점하는 것에 대해 더 열심히 생각한다면 어떨까요?

다음은 이 논문의 핵심 아이디어를 간단한 비유로 풀어낸 것입니다:

1. 구식 방법: "빠른 채점자"

전통적으로 AI 가 다른 AI 의 정답이 맞는지 확인하기 위해 사용할 때는 "직접 평가자 (Direct Evaluator)"를 사용합니다. 이는 마치 패스트푸드점 계산원과 같습니다. 계산원에게 영수증 (정답) 을 건네면, 그들은 즉시 "좋아 보인다"거나 "나빠 보인다"고 말합니다. 왜 좋은지 혹은 나쁜지 멈춰서 생각하지도 않고, 이전에 본 패턴을 바탕으로 즉각적인 점수를 매길 뿐입니다.

2. 새로운 아이디어: "추론 채점자"

연구자들은 다른 시도를 했습니다. 채점을 위해 **추론 모델 (Reasoning Model)**이라는 특별한 유형의 AI 를 사용했습니다. 이는 정답을 그냥 훑어보기를 거부하는 정교한 교수와 같습니다.

빠른 점수를 매기는 대신, 이 "교수"는 자신의 추론을 설명하는 길고 상세한 에세이 (생각의 사슬, Chain of Thought) 를 작성하도록 스스로를 강요합니다. 다음과 같이 말할 수 있습니다:

  • "잠깐, 3 단계를 다시 확인해 볼게..."
  • "흠, 이 논리는 불안정해 보이네."
  • "되돌아가서 더 나은 방법이 있는지 확인해 보자."
  • "좋아, 전체를 검증했으니 확신이 있어."

이 논문은 이를 **"평가 시간 계산 확장 (Scaling Evaluation-Time Compute)"**이라고 부릅니다. 쉬운 말로 바꾸면: 문제를 풀기 위해 더 많은 시간을 보내는 대신, 채점하기 위해 더 많은 시간과 두뇌 에너지를 쓰는 것입니다.

3. 그들이 채점한 두 가지 방법

연구자들은 이 "교수"가 채점하는 두 가지 방식을 테스트했습니다:

  • 결과 평가 (Outcome Evaluation): 최종 정답을 보고 "결과가 정확한가?"라고 묻는 것입니다. (시험의 최종 점수를 확인하는 것과 같습니다.)
  • 과정 평가 (Process Evaluation): 해결 과정의 모든 단계를 살펴보고 "이 특정 단계가 논리적인가?"라고 묻는 것입니다. (시험지에 적힌 풀이 과정을 확인하는 것과 같습니다.)

큰 발견: "교수" (추론 평가자) 는 자신의 추론 단계를 더 많이 "생각"하고 적어내도록 강요받을수록 채점을 훨씬 더 잘하게 되었습니다. 학생이 더 오래 생각함으로써 수학 문제를 푸는 데 더 능숙해지는 것처럼, 채점자도 더 오래 생각함으로써 실수를 찾아내는 데 더 능숙해집니다.

4. "최고의 N 개 (Best-of-N)" 게임: 품질 대 양

이 더 나은 채점이 실제로 도움이 되는지 테스트하기 위해, 그들은 Best-of-N이라는 게임을 플레이했습니다.

  • 설정: 생성 AI 가 어려운 문제에 대한 64 개의 서로 다른 정답을 만들어낸다고 상상해 보세요.
  • 구식 전략: "빠른 채점자"를 사용하여 64 개의 정답을 빠르게 확인하고 가장 좋은 것을 선택합니다.
  • 새 전략: "추론 채점자" (교수) 를 사용하여 단 8 개의 정답만 깊이 있게 분석하되, 매우 신중하게 분석합니다.

결과: 64 개 중 가장 좋은 것을 선택한 "빠른 채점자"보다, 단 8 개 중 가장 좋은 것을 선택한 "추론 채점자"의 성능이 더 좋았습니다.

비유: 64 개의 단서를 훑어보기 위해 100 명의 인턴을 고용하는 대신, 8 개의 단서를 매우 철저하게 조사하는 한 명의 전문가 형사를 고용하는 것과 같습니다. 넓고 얕은 검색보다 심층 조사가 진실을 더 자주 찾아냈습니다.

5. 왜 이것이 작동할까요?

이 논문은 "추론 채점자"가 특히 숨겨진 오류를 찾아내는 데 탁월하다는 것을 발견했습니다.

  • 때로는 AI 가 올바른 최종 정답을 얻지만, 거기에 도달하는 방법은 틀릴 수 있습니다 (수학 시험에서 운 좋게 맞는 숫자를 맞추는 것과 같습니다).
  • "빠른 채점자"는 정답이 맞기 때문에 "잘했다!"라고 말할 수 있습니다.
  • "추론 채점자"는 단계를 살펴보고 실수를 발견하며, "잠깐, 정답은 맞지만 논리는 결함이 있다"라고 말하고 이를 기각합니다.

요약

이 논문은 정답을 생성하기 위해 더 많은 컴퓨팅 파워를 쓰는 것만큼이나, 정답을 평가하기 위해 더 많은 컴퓨팅 파워를 쓰는 것도 효과적임을 증명합니다.

AI 채점자가 "소리를 내어 생각"하고 모든 단계를 신중하게 검토하도록 강요함으로써, 더 적은 시도로도 더 좋은 결과를 얻을 수 있습니다. 이는 "올바른 정답을 얻기 위해 더 열심히 노력하는 것"에서 "올바른 정답을 찾기 위해 더 열심히 생각하는 것"으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →