← 최신 논문
💬 NLP

DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling

본 논문은 단계별 지도와 후보 공간의 복잡성이라는 과제를 해결하기 위해 이중 가치 모델과 계층적 빔 탐색을 통해 계획 및 검색 과정을 분리함으로써 에이전트 기반 RAG를 강화하는 새로운 프레임워크인 DecoupleSearch를 제안한다.

원저자: Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. "굴치체크 하툰의 시아버지는 누구인가?"와 같이 매우 까다로운 수수께끼를 풀려고 노력하고 있다고 말입니다. 당신은 많은 것을 알고 있지만, 때로는 사실을 지어내거나 막히기도 하는 매우 똑똑한 비서 (AI) 를 가지고 있습니다. 이를 돕기 위해 비서에게 사실들을 찾아볼 수 있도록 도서관 이용증을 발급해 줍니다. 이를 **검색 증강 생성 (Retrieval-Augmented Generation, RAG)**이라고 합니다.

그러나 이 논문은 도서관 이용증만으로는 부족하다고 주장합니다. 비서는 그것을 어떻게 사용할지 알아야 합니다. 바로 **에이전트 RAG (Agentic RAG)**가 등장하는 지점입니다. 비서는 탐정처럼 행동하며, 조사를 계획하고 단계별로 단서를 찾아냅니다.

문제는 이 탐정이 자주 길을 잃는다는 점입니다. 나쁜 조사 경로를 계획하거나, 잘못된 단서를 찾을 수도 있습니다. DecoupleSearch라는 이 논문은 탐정이 길을 잃지 않도록 훈련하는 새로운 방법을 제안합니다.

간단한 비유를 사용하여 작동 방식을 설명해 보겠습니다:

1. 문제: "전부 아니면 전무 (All-or-Nothing)" 탐정

구식 시스템에서는 탐정이 한 번 계획을 세우고, 한 번 검색한 후 최선을 다해 결과를 기다렸습니다. 계획이 약간만 어긋나거나 검색이 지루한 책을 반환했다면, 전체 답변이 틀리게 되었습니다. 이는 건초더미에서 바늘을 찾기 위해 단 한 곳만 들여다보는 것과 같았습니다.

2. 해결책: "이중 코치" 시스템

저자들은 DecoupleSearch라는 시스템을 만들었습니다. 이는 탐정을 위해 두 명의 전문 코치를 고용하는 것과 같습니다:

  • 계획 코치 (The Planning Coach): 이 코치는 오직 계획만 봅니다. "이것이 수수께끼를 풀기 위한 좋은 전략인가?"
  • 검색 코치 (The Search Coach): 이 코치는 오직 단서만 봅니다. "이 책이 현재 계획에 실제로 도움이 되는가?"

이 두 가지 업무를 분리함으로써, 시스템은 검색을 걱정하지 않고 나쁜 계획을 수정할 수 있고, 그 반대의 경우도 가능합니다.

3. 훈련: "실전 토너먼트" (MCTS)

이 코치들을 어떻게 가르칠까요? 중간 단계가 까다롭기 때문에 정답 키만 보여줄 수는 없습니다.
대신, 이 논문은 **몬테카를로 트리 탐색 (Monte Carlo Tree Search, MCTS)**이라는 방법을 사용합니다. AI 가 같은 레벨을 수천 번 플레이하는 비디오 게임을 상상해 보세요.

  • 다양한 경로 (계획) 와 검색을 시도합니다.
  • 때로는 이깁니다 (올바른 답변을 얻음), 때로는 집니다.
  • 모든 게임이 끝날 때마다, AI 는 자신이 취한 모든 행동을 되돌아봅니다. "그 행동이 승리로 이어졌으니 좋았군. 그 행동은 막다른 길로 이어졌으니 나빴군."
  • 모든 단일 단계에 '점수'를 매깁니다. 이는 무엇이 작동하고 무엇이 작동하지 않는지에 대한 거대한 지도를 생성합니다.

4. 추론: "가지치기" 과정

AI 가 실제로 사용자에게 질문에 답할 때, 단순히 추측하지 않습니다. **계층적 빔 탐색 (Hierarchical Beam Search)**이라는 기법을 사용합니다.
특정 과일을 찾기 위해 나무를 오르는 상황을 상상해 보세요.

  • 가지 뻗기: 모든 가지에서 AI 는 하나의 경로만 선택하지 않습니다. 여러 개의 새로운 가지 (계획) 를 키우고 여러 가지 다른 단서를 찾습니다.
  • 가지치기: 여기서 계획 코치검색 코치가 등장합니다. 그들은 모든 새로운 가지를 봅니다.
    • 계획 코치는 말합니다. "이 가지는 유망해 보이지만, 저 가지는 막다른 길이야. 막다른 길을 잘라내."
    • 검색 코치는 말합니다. "우리가 찾은 이 책은 쓸모없어. 버려. 이 책은 유지해."
  • 결과: AI 는 최고의 가지들만 유지하고 나머지는 잘라냅니다. 최종 답변 (나무 꼭대기) 에 도달할 때까지 이 과정을 반복합니다.

왜 작동하는가

이 논문은 다단계 역사 수수께끼와 같은 많은 어려운 질문들에서 이를 테스트했습니다. 그들은 다음과 같은 사실을 발견했습니다:

  1. 더 나은 계획이 핵심입니다: 탐정이 나쁜 계획을 세우면, 아무리 많이 검색해도 도움이 되지 않습니다. "계획 코치"가 결정적입니다.
  2. 작은 모델도 똑똑할 수 있습니다: 이 "가지치기" 기법을 사용한다면, 70 억 매개변수 모델과 같은 작은 AI 모델조차 훨씬 크고 비싼 모델만큼 잘 수행할 수 있습니다. 마치 잘 훈련된 작은 팀이 훈련받지 않은 거대 팀을 이기는 것과 같습니다.
  3. 경쟁을 압도합니다: 이 시스템은 계획을 검색과 분리하지 않았거나 이 "실전 토너먼트" 훈련을 사용하지 않은 다른 방법들보다 더 나은 성과를 냈습니다.

요약

DecoupleSearch는 AI 탐정에게 두 명의 전문가 코치와 실습 시뮬레이터를 제공하는 것과 같습니다. 맹목적으로 추측하는 대신, AI 는 여러 경로를 시도하고 시뮬레이터에서 실수로부터 배운 후, 실제 문제를 해결할 때 나쁜 아이디어는 과감히 잘라내고 최고의 것들만 유지합니다. 이는 특히 깊이 파고들어야 하는 복잡한 질문들에 대해 더 정확한 답변을 이끌어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →