← 최신 논문
🤖 AI

Evidence-State Rewards for Long-Context Reasoning

이 논문은 정보의 추가, 연결 또는 삭제와 같은 증거 상태 전이에 행동 수준의 보상을 할당함으로써 긴 문맥 추론 능력을 향age시키는 강화 학습 프레임워크인 Maven을 소개하며, 이를 통해 여러 벤치마크에서 기존의 결과 중심적 방법들을 능가하는 성능을 보여준다.

원저자: Ya Gao, Pekka Marttinen

게시일 2026-07-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ya Gao, Pekka Marttinen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 미스터리를 풀려는 탐정이라고 상상해 보십시오. 하지만 당신의 손에 쥐어진 것은 책상 위의 몇 가지 단서가 아니라, 수천 권의 책, 신문, 그리고 메모가 가득한 도서관입니다. 당신의 목표는 사건을 해결하는 데 필요한 구체적인 사실들을 찾아내는 것입니다.

이것이 바로 AI를 위한 도전 과제인 MAVEN이 다루는 내용입니다.

문제점: 도서관에서 길을 잃다

현재의 AI 모델들은 방대한 양의 텍스트(긴 컨텍스트)를 읽는 능력은 점점 좋아지고 있지만, 그 안에서 추론하는 데에는 종종 어려움을 겪습니다.

  • 기존 방식: 탐정이 유망해 보이는 단서 하나를 발견하자마자, 그것을 덥석 잡아서 즉시 해결책을 적어 내려가는 상황을 상상해 보십시오. 만약 그 첫 번째 단서가 레드 헤링(가짜 단서)이었다면, 탐정은 잘못된 답에 갇히게 됩니다.
  • 한계점: 이전의 AI 학습 방식은 마치 최종 정답만을 채점하는 선생님과 같았습니다. 탐정이 정답을 맞혔다면, 설령 중간에 절반의 단서를 무시했거나 운이 좋았더라도 "A"를 받았습니다. 반대로 틀렸을 경우에는 "F"를 받았지만, 선생님은 왜 잘못된 단서를 선택했는지 혹은 왜 올바른 단서를 놓쳤는지에 대해 설명해주지 않았습니다.

해결책: MAVEN (스마트한 탐정)

저자들은 MAVEN(Marginal-Value Evidence Navigation)을 제안합니다. MAVEN은 단순히 최종 정답만을 채점하는 대신, AI가 "증거 메모리(Evidence Memory)"—생각하는 동안 단서를 능동적으로 수집하고, 연결하고, 버릴 수 있는 정신적 연습장—를 관리하도록 가르칩니다.

MAVEN을 다음과 같이 훈련된 탐정이라고 생각하십시오:

  1. 단서를 보드에 추가한다.
  2. 두 단서를 연결하여 어떻게 맞아떨어지는지 확인한다.
  3. 단서가 오도하는 정보라는 것을 깨달으면 이를 버린다.
  4. 보드가 깨끗해졌을 때 비로소 답한다.

MAVEN이 AI를 가르치는 방법 (보상)

MAVEN의 핵심은 결과뿐만 아니라, AI가 연습장을 어떻게 사용하는지에 대해 보상을 준다는 점에 있습니다. 이를 위해 MAVEN은 매 단계마다 증거 상태를 확인하기 위해 "고정된 검증기(frozen verifier, 똑똑하게 사전 훈련된 AI 판사)"를 사용합니다.

다음은 AI가 얻게 되는 세 가지 유형의 "점수"입니다:

  • "추가" 보상 (금광 찾기):

    • 비유: 새로운 단서를 발견했습니다. 이 단서가 지금 당장 진실에 다가가는 데 도움이 되었나요? 아니면, 당장은 도움이 되지 않더라도 나중에 문제를 푸는 데 절대적으로 필요했나요?
    • MAVEN의 기술: 즉각적인 도움이 되는 단서에 점수를 줄 뿐만 아니라, 처음에는 쓸모없어 보였더라도 최종 해결책에 필수적이었던 단서에 대해서도 "사후 보상(hindsight points)"을 제공합니다.
  • "삭제" 보상 (보드 정리하기):

    • 비유: 이전에 집어 들었던 단서가 사실은 가짜 단서라는 것을 깨달았습니다. 고집스럽게 붙들고 있는 대신, 그것을 버립니다.
    • MAVEN의 기술: 단서를 제거했을 때 답이 더 명확해진다면 AI는 보상을 받습니다. 이는 모델이 잘못된 경로를 고수하기보다 실수를 인정하고 추론을 수정하도록 가르칩니다.
  • "연결" 보상 (점 잇기):

    • 비류: 단독으로는 이해되지 않는 두 개의 단서가 있지만, 이 둘을 나란히 놓았을 때 전체 이야기가 드러납니다.
    • MAVEN의 기술: AI가 두 증거가 어떻게 함께 작용하는지 명시적으로 설명할 때 보상을 줍니다. 이는 AI가 단순히 무작위적인 사실들을 수집하는 것을 방지하며, 증거들을 종합하도록 강제합니다.

결과: 더 나은 탐정

연구진은 다양한 AI 모델(Llama 및 Qwen 등)을 대상으로 어려운 독해 테스트를 통해 MAVEN을 테스트했습니다.

  • 더 높은 정확도: MAVEN으로 훈련된 모델은 최종 정답만을 기준으로 훈련되거나 단순히 "관련 있는" 텍스트를 찾는 훈련을 받은 모델보다 더 많은 문제를 정확하게 해결했습니다.
  • 적은 노이즈: MAVEN 모델은 기억 속에 더 적은 수의 "방해 요소(distractors, 가짜 단서)"를 유지했습니다. 이들은 어떤 단서가 틀렸는지 깨닫고 이를 버리는 데 더 뛰어난 모습을 보였습니다.
  • 더 완전한 정보 수집: 이들은 부분적인 정보에 근거해 추측하는 대신, 문제를 해결하는 데 필요한 데 필요한 더 많은 증거를 수집했습니다.

결론

MAVEN은 게임의 규칙을 "정답을 찾아라"에서 "정답을 만드는 법을 배워라"로 바꿉니다. 이는 긴 컨텍스트에 대한 추론을 일회성 검색이 아니라, 그림이 명확해질 때까지 정보를 끊임없이 추가하고, 연결하고, 버리는 증거 상태의 탐색이라는 역동적인 과정으로 취급합니다.

논문은 AI가 긴 텍스트에 대해 진정으로 추론하기 위해서는, 단순히 정적인 사실 목록을 추출하는 것이 아니라 자신의 증거를 관리하고 수정하는 법을 배워야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →