← 최신 논문
💬 NLP

Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling

이 논문은 궤적의 말단(trajectory tails)으로부터 단계별 감독 신호를 생성하기 위해 대조적 동적 분기 샘플링(contrastive dynamic branch sampling)을 채택함으로써, 희소한 보상과 계산 효율성 문제를 극복하고 질의응답 벤치마크에서 우수한 정확도를 달면서 장기적 설정(long-horizon settings)에서 다회차 탐색 에이전트를 개선하는 가치 불필요(value-free) 강화 학습 방법인 BranPO를 소개한다.

원저자: Yubao Zhao, Weiquan Huang, Sudong Wang, Ruochen Zhao, Chen Chen, Yao Shu, Chengwei Qin

게시일 2026-02-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yubao Zhao, Weiquan Huang, Sudong Wang, Ruochen Zhao, Chen Chen, Yao Shu, Chengwei Qin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 요약: 탐정에게 미스터리를 해결하는 법 가르치기

당신이 주니어 탐정(AI 에이전트)에게 질문하기, 단서 수집하기, 그리고 최종 보고서 작성하기와 같은 여러 단계가 필요한 복잡한 미스터리를 해결하는 법을 가르치고 있다고 상상해 보세요.

이 논문이 다루는 문제는, 오직 마지막에 전달되는 피드백인 "사건 해결" 또는 **"사건 실패"**만을 가지고 이 탐정을 어떻게 교육할 것인가 하는 점입니다.

만약 탐정이 보고서의 마지막 문장에서 실수를 했다면, 기존의 훈련 방식은 "실패했습니다"라고 말하며 탐정이 이전에 했던 모든 행동에 대해 벌을 줄 것입니다. 설령 처음 90%의 과정이 완벽했더라도 말이죠. 이는 마치 학생이 수학 문제를 모두 맞혔음에도 불구하고, 이름의 철자를 틀렸다는 이유로 최종 시험에서 'F' 학점을 받는 것과 같습니다. 매우 혼란스럽고 비효율적인 방식입니다.

핵심 문제: 긴 과업에서의 "책임 전가 게임"

AI의 세계에서는 이를 **신용 할당 문제(Credit Assignment Problem)**라고 부릅니다.

  • 기존 방식 (GRPO): AI는 시작부터 끝까지 전체 경로를 시도합니다. 만약 마지막에 실패하면, AI는 "내가 첫 번째 질문을 그렇게 했어야 했나?"라고 생각하게 됩니다. 하지만 첫 번째 질문은 완벽했을 수도 있습니다! 실제 오류는 마지막 단계에 있었던 것이죠.
  • 트리(Tree) 방식: 일부 연구자들은 매 단계마다 가능성을 가지치기하여 어떤 일이 일어나는지 확인하는 "트리" 구조를 구축하려고 시도했습니다. 하지만 이것은 매 턴마다 100명의 탐정을 보내 모든 가능한 경로를 시도하게 만드는 것과 같으며, 비용이 엄청나게 많이 들고 속도가 느립니다.

발견: 실수는 실제로 어디에서 발생하는가?

저자들은 수천 개의 AI 탐정 이야기들을 분석하여 하나의 패턴을 발견했습니다:

  1. 시작은 대개 괜찮습니다: AI는 조사를 시작하고 처음 몇 개의 질문을 던지는 데 능숙합니다.
  2. 끝에서 무너집니다: 실수는 거의 항상 마지막 단계에서 발생합니다. 즉, AI가 너무 빨리 포기하거나, 최종 답변을 작성할 때 사실을 지어내는 "환각(Hallucination)" 현상을 보입니다.

비유: 케이크를 굽는다고 상상해 보세요. AI는 반죽을 섞고 오븐에 넣는 초기 단계(초반 과정)는 잘 해냅니다. 하지만 종종 케이크를 태우거나 프로스팅을 잊어버립니다(후반 과정). 만약 케이크가 탔다는 이유로 케이크 전체를 버린다면, 완벽하게 섞인 반죽을 낭비하는 셈입니다.

해결책: BranPO (Branching Relative Policy Optimization)

저자들은 BranPO라는 새로운 훈련 방법을 제안합니다. 작동 방식은 다음과 같습니다.

1. "되감기 및 다시 시도" 전략

실패할 때마다 AI를 처음부터 다시 시작하게 하는 대신, BranPO는 "좋았던 부분은 유지하자"라고 말합니다.

  • 행동: AI가 과업을 마쳤을 때, 시스템은 끝부분을 살펴봅니다. 만약 답이 틀렸다면, 마지막 몇 단계를 절단(Truncate) 합니다.
  • 가지치기(Branch): 초기 단계(Prefix, 즉 좋았던 앞부분)는 그대로 유지한 채, 마지막 단계만을 재샘플링(Resample, 다시 시도) 하도록 AI에게 요청합니다.
  • 결과: 이를 통해 "대조적(Contrastive)" 쌍이 만들어집니다:
    • 경로 A: 원래의 시도 (마지막에 실패한 경로).
    • 경로 B: 새로운 시도 (동일한 시작점을 사용하되, 마지막에 성공한 경로).

비유: 당신이 에세이를 쓰고 있다고 상상해 보세요. 서론과 본론은 훌륭하게 썼지만 결론이 엉망이었습니다. 에세이 전체를 다시 쓰는 대신, 앞의 90%는 그대로 두고 결론 부분만 10가지 버전으로 다시 써보는 것입니다. 그런 다음 AI에게 이렇게 가르칩니다: "보라, 시작은 좋았다. 문제는 오직 결론뿐이었다. 다음에는 다른 결론을 써보아라."

2. 스마트 샘플링 (난이도 인지형)

모든 작업에 똑같은 양의 도움이 필요한 것은 아닙니다.

  • 쉬운 작업: AI가 쉽게 정답을 맞히면, 시스템은 시간을 낭비하지 않고 바로 다음으로 넘어갑니다.
  • 어려운 작업: AI가 고전하고 있다면, 시스템은 더 공격적으로 변합니다. 과업을 다양한 지점에서 끊고, 제대로 된 결과를 찾을 때까지 AI가 수많은 결말을 시도하도록 강제합니다.
  • 비유: 코치를 생각해 보세요. 선수가 골을 쉽게 넣으면 코치는 "잘했어, 다음 플레이!"라고 말합니다. 하지만 선수가 계속 골대를 빗나간다면, 코치는 경기를 멈추고 "이 특정 샷을 10번 반복해 보자"라고 말하며 그 움직임을 고치는 데 집중합니다.

3. "불필요한 단계" 필터링

때때로 AI는 정답을 찾았음에도 불구하고 불필요하게 정보를 계속 검색합니다 (마치 범인을 찾고 나서도 10분 동안 집을 더 뒤지는 탐정처럼 말이죠).

  • 해결책: 시스템에는 "불필요한 단계 마스크(Redundant Step Mask)"가 있습니다. 만약 AI가 답을 찾았는데도 추가적인 단계를 밟는다면, 시스템은 훈련 과정에서 그 추가 단계들을 무시합니다. 이를 통해 AI가 일을 마친 즉시 멈추도록 가르칩니다.
  • 비유: 학생에게 "너는 5분 만에 수학 문제를 풀었어. 잘했어! 하지만 그 후 10분을 더 썼구나. 다음에는 5분 만에 멈춰라. 우리는 추가적인 10분이 필요 없다"라고 말하는 것과 같습니다.

왜 이것이 더 나은가?

  1. 정밀함: 초기의 올바른 결정이 후반부의 오류 때문에 잘못된 것으로 간주되는 것을 방지합니다.
  2. 효율성: 전체 과정을 다시 시뮬레이션하는 데 돈과 시간을 낭비하지 않습니다. 오직 수정이 필요한 부분(끝부분)만을 시뮬레이션합니다.
  3. 안정성: 시작점은 동일하게 유지하면서 "좋은 결말"과 "나쁜 결말"을 비교함으로써, AI가 정확히 무엇을 바꿔야 하는지 학습하게 합니다.

결과

저자들은 다양한 질의응답 벤치마크(예: 다단계 수수께끼 해결)에서 테스트를 진행했습니다.

  • 결과: BranPO는 다른 강력한 방법들을 지속적으로 뛰어넘었습니다.
  • 핵심 성과: 표준적인 방법들보다 더 많은 컴퓨팅 자원이나 시간을 투입하지 않고도, 길고 복잡한 과업에서 성능이 크게 향 향상되었습니다.

한 문장 요약

BranPO는 AI 에이전트의 잘 된 초기 작업은 유지하고, 엉망이 된 마지막 단계만을 다시 시도하게 함으로써, 이미 잘한 것을 다시 하는 데 시간을 낭비하지 않고 정확히 어디서 틀렸는지를 효과적으로 가르칩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →