← 최신 논문
💬 NLP

MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation

본 논문은 대규모 언어 모델의 다회전 상호작용 추론 능력을 평가하도록 설계된 40 개의 작업과 3,600 개의 인스턴스로 구성된 포괄적이고 완전 자동화된 벤치마크인 MTR-Bench 를 소개하며, 최첨단 모델조차 이러한 작업에서 어려움을 겪는다는 점을 밝힙니다.

원저자: Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 자동차 엔진을 테스트한다고 상상해 보세요. 지금까지는 완전히 매끄러운 고속도로에서 직선으로만 운전해 봤습니다. 엔진은 훌륭하게 작동합니다! 하지만 울퉁불퉁한 흙길이나 교통 체증, 혹은 병렬 주차를 시도하는 상황에서는 테스트해 본 적이 없습니다. 운전의 messy하고 오가는 현실을 어떻게 처리하는지 확인하기 전까지는 그 엔진이 정말 '좋은' 엔진인지 알 수 없습니다.

이 논문, MTR-Bench가 인공지능 (AI) 에 대해 하고 있는 일이 바로 이것입니다.

문제: "한 번만 하면 끝"인 테스트

현재 인공지능 (대형 언어 모델) 을 위한 대부분의 테스트는 저런 직선 고속도로와 같습니다. AI 에게 단일 질문을 던지고 AI 가 단일 답변을 내놓는 방식입니다.

  • 테스트: "2 + 2 는 무엇인가?"
  • 답변: "4."

하지만 실제 삶은 그렇지 않습니다. 실제 문제 해결은 대화입니다. '스무 고개' 게임이거나 체스 경기이거나, 잃어버린 물건을 찾는 과정에서 "부엌에 있나요?" "아니요." "침실에 있나요?" "아니요." "침대 아래에 있나요?" "네!"라고 묻고 답하는 과정입니다.

저자들은 현재의 AI 모델들은 그런 '직선 고속도로'식 테스트에서는 훌륭하지만, 이전 답변을 기억하고 전략을 조정하며 퍼즐을 해결할 때까지 계속 나아가야 하는 다중 턴 추론이 필요한 게임에서는 종종 실패한다고 주장합니다.

해결책: MTR-Bench (장애물 코스)

이를 해결하기 위해 연구자들은 AI 를 위한 방대하고 자동화된 '장애물 코스'인 MTR-Bench를 구축했습니다. 하나의 질문을 던지는 대신, AI 가 컴퓨터 심판과 끊임없이 게임을 하도록 설정했습니다.

이 '장애물 코스'가 어떻게 작동하는지 네 가지 유형의 도전 과제로 나누어 설명하겠습니다.

  1. 탐정 게임 (정보 탐색):

    • 비유: '누구일까요?' 게임을 상상해 보세요. 하지만 컴퓨터가 비밀 요원 목록을 숨기고 있습니다. "이 세 사람 그룹에 요원이 있나요?"라고 물을 수 있습니다. 컴퓨터는 '예' 또는 '아니요'라고 답합니다. 당신은 요원이 정확히 누구인지 알아내기 위해 현명한 질문을 해야 합니다.
    • 도전: 같은 질문을 반복해서 묻는다면 이길 수 없습니다. 답변을 활용해 진실을 추론해야 합니다.
  2. 변신하는 비밀번호 (동적 적응):

    • 비유: 비밀번호를 맞추려 한다고 상상해 보세요. "1234"라고 추측합니다. 틀렸습니다. 하지만 여기에는 반전이 있습니다. 매번 틀릴 때마다 비밀번호가 비밀 수학 규칙에 따라 변화합니다. 당신은 추측하고, 결과를 보고, 규칙을 파악한 뒤 다시 추측해야 합니다.
    • 도전: 목표가 계속 움직입니다. 답을 단순히 외울 수 없습니다. 변화하는 규칙에 적응해야 합니다.
  3. 눈가린 미로 (상태 조작):

    • 비유: 미로에 있지만 지도는 숨겨져 있습니다. 더 나쁜 것은 컨트롤러의 버튼이 바뀔 수도 있다는 점입니다. '위'를 누르지만 캐릭터는 '아래'로 움직입니다. 당신은 버튼을 누르고 어디로 가는지 지켜보며 미로의 숨겨진 규칙을 파악하면서 출구에 도달해야 합니다.
    • 도전: 당신은 게임을 하는 동안 세계의 규칙을 배워야 합니다.
  4. 체스 경기 (전략적 게임):

    • 비유: 컴퓨터 상대와 하는 체스나 체커 게임입니다. 당신이 수를 두면 컴퓨터가 수를 두고, 당신은 상대방이 다음에 무엇을 할지 생각하며 세 수 ahead를 계획해야 합니다.
    • 도전: 빠른 반응이 아니라 장기적인 계획이 필요합니다.

결과: AI 는 여전히 걷는 법을 배우고 있습니다

연구자들은 o3-mini 와 R1 과 같은 오늘날 이용 가능한 가장 똑똑한 모델을 포함해 20 개의 서로 다른 AI 모델에서 이 테스트를 실행했습니다. 그들이 발견한 바는 다음과 같습니다.

  • 똑똑한 모델들도 여전히 고군분투 중: 한 번에 복잡한 수학 문제를 풀 수 있는 가장 첨단 AI 모델조차도 이러한 상호작용 게임에서는 종종 막힙니다. 두 턴 전에 배운 것을 잊어버리거나, 벽을 통과하려는 것과 같은 불법적인 수를 두기도 합니다.
  • 난이도가 중요합니다: 게임이 어려워질수록 (플레이어가 많아지고 미로가 커질수록) AI 의 성능은 크게 떨어졌습니다.
  • 속도 대 지능: 흥미롭게도 가장 많은 정답을 낸 모델 (o3-mini) 이 가장 빠른 것은 아니었습니다. 더 깊이 생각하고 작업을 확인했기 때문에 퍼즐을 풀기 위해 더 많은 턴이 걸렸습니다. '빠른' 모델들은 종종 실수를 하고 처음부터 다시 시작해야 했습니다.
  • 작은 모델들은 길을 잃었습니다: 작은 AI 모델들 (더 적은 '뇌 세포'를 가진) 은 기본적으로 게임을 전혀 할 수 없었습니다. 규칙을 따르거나 대화를 기억할 수 없었습니다.

핵심 교훈

이 논문은 우리가 AI 를 잘못된 것으로 테스트해 왔다고 결론 내립니다. 우리는 그들이 사실을 암송하거나 단일 수학 문제를 해결하는 능력을 테스트해 왔습니다. 하지만 현실 세계에서 우리를 도울 수 있는 진정한 유용한 AI 를 구축하려면, 상호작용 추론—시간에 따라 대화하고, 경청하고, 적응하고, 계획하는 능력—을 테스트해야 합니다.

MTR-Bench는 AI 가 이러한 현실 세계의 대화를 위해 훈련할 수 있는 새로운 체육관입니다. 그리고 현재로서는 결과가 보여주듯, 오늘날의 '챔피언'들조차 진정으로 게임을 플레이하기 전에 여전히 할 일이 많이 남아 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →