← 최신 논문
💬 NLP

DynaKRAG: A Unified Framework for Learnable Evidence Control in Multi-Hop Retrieval-Augmented Generation

DynaKRAG는 멀티홉 검색 증강 생성을 상태 조건부 제어 문제로 정식화하여, 학습된 정책을 통해 검색 및 쿼리 재구성과 같은 유효한 증거 연산들로부터 동적으로 선택함으로써 HotpotQA, 2Wiki, MuSiQue와 같은 벤치마크에서 기존 방법들을 능가하는 통합 프레임워크입니다.

원저자: Yaqi Wu, Xiaolei Guo, Chenyu Zhou, Jiaqi Huang, Xianfa Zhang, Junxu Zhang, Zhuo Yu, Zhubo Shi, Jianghao Lin, Dongdong Ge

게시일 2026-07-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yaqi Wu, Xiaolei Guo, Chenyu Zhou, Jiaqi Huang, Xianfa Zhang, Junxu Zhang, Zhuo Yu, Zhubo Shi, Jianghao Lin, Dongdong Ge

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 복잡한 미스터리, 예를 들어 "누가 왕관 보석을 훔쳤으며, 그것들을 어디에 숨겼는가?"를 해결하려는 탐정이라고 상상해 보세요.

과거의 방식(표준 AI 시스템)에서 탐정은 엄격한 규칙 책을 받게 됩니다: "서류함의 첫 세 개 파일을 확인하라. 만약 답을 찾지 못했다면, 다음 세 개를 확인하라. 어떤 일이 있어도 다섯 번째 파일까지만 확인하고 멈춰라." 이것은 경직되어 있습니다. 때로는 첫 번째 파일이 조사 방향을 완전히 바꿀 수 있는 단서를 제공하기도 하지만, 규칙 책은 탐정이 잘못된 파일을 계속 찾도록 강요합니다.

DynaKRAG는 탐정이 일하는 더 똑똑하고 새로운 방식입니다. 고정된 규칙 책을 따르는 대신, 지금까지 발견한 내용에 따라 다음 단계를 결정하는 유연하고 학습 기반인 관리자를 사용합니다.

이것이 어떻게 작동하는지, 간단한 개념으로 나누어 설명하겠습니다.

1. 탐정의 노트 (The "State")

탐정이 새로운 종이 조각(증거)을 발견할 때마다, 그들은 그것을 노트에 기록합니다. 이 노트는 단순히 종이 뭉치가 아니라 살아있는 지도입니다. 노트는 다음을 추적합니다:

  • 원래의 질문이 무엇이었는지.
  • 이미 읽은 종이들은 무엇인지.
  • 어떤 단서가 누락되었는지 (예: "범인의 이름은 알지만, 그가 어디에 사는지는 모른다").
  • 지금까지 취해진 행동들이 무엇인지.

2. 행동의 메뉴 (The "Actions")

어느 순간이든 탐정에게는 가능한 행동의 메뉴가 있지만, 모든 행동이 항상 가능한 것은 아닙니다.

  • 선반 뒤지기: 더 많은 문서를 찾는다.
  • 질문 다시 쓰기: 원래 질문이 혼란스러웠을 수도 있습니다. 질문을 다르게 던져봅시다.
  • 단서 추적하기: 만약 문서가 특정 인물(가교 역할을 하는 엔티티)을 언급한다면, 그 사람에 대한 정보를 더 찾아봅니다.
  • 공백 확인하기: "우리가 이것을 해결할 만큼 충분한 정보를 가지고 있는가?"라고 질문합니다. 만약 아니라면, 무엇이 부족한지 확인합니다.
  • 멈추고 해결하기: 증거가 충분하다면, 최종 답변을 작성합니다.

3. 2단계 의사결정 과정

이것이 DynaKRAG의 핵심 비법입니다. 탐정이 행동을 선택하기 전에 두 가지 단계가 일어납니다.

  • 단계 A: 문지기 (Validity Layer): 클럽의 문지기를 상상해 보세요. 문지기는 현재 상황을 보고 말합니다. "당신은 지금 당장 그것을 할 수 없습니다." 예를 들어, 문서를 하나도 읽지 않았다면 "질문을 다시 쓰는 것"을 할 수 없습니다. 단서를 찾지 못했다면 "단서를 추적"할 수도 없습니다. 문지기는 불가능한 움직임을 걸러내어, 유효한 옵션들의 목록만을 남깁니다.
  • 단계 B: 코치 (Learned Controller): 이제 문지기가 탐정에게 유효한 행동 목록을 건네주면, 코치가 등장합니다. 코치는 수천 개의 과거 탐정 사례로부터 학습했습니다. 코치는 현재의 노트를 살펴보고 이렇게 말합니다. "이 유효한 옵션들 중에서, 지금 우리에게 가장 효율적으로 미스터리를 해결하게 해줄 최선의 방법은 용의자의 주소를 추적하는 것이다."

4. 왜 이것이 더 나은가

  • 낭비 없는 노력: 기존 시스템은 이미 답을 찾았음에도 계속해서 정보를 찾거나, 똑같은 질문을 반복해서 던질 수 있습니다. DynaKRAG는 언제 멈춰야 할지를 압니다.
  • 미스터리에 대한 적응: 만약 첫 번째 단서가 완전히 새로운 관점을 드러낸다면, 시스템은 맹목적으로 정해진 계획을 따르는 대신 (질문을 다시 쓰는 것과 같이) 즉시 전략을 전환합니다.
  • 에너지 절약: 이 시스템은 "토큰 효율적"입니다. AI 용어로 "토큰"은 비용과 시간이 드는 단어나 데이터 조각을 의미합니다. DynaKRAG는 퍼즐을 풀기에 충분한 정보를 모으는 즉시 정보 수집을 멈추므로, 단순히 계속 파헤치는 시스템에 비해 시간과 비용을 절약합니다.

결과

저자들은 이 "똑똑한 탐정"을 세 가지 매우 어려운 퍼즐 데이터셋(HotpotQA, 2Wiki, MuSiQue)으로 테스트했습니다.

  • 더 나은 답변: 이전의 가장 뛰어난 방법들보다 더 많은 퍼즐을 정확하게 해결했습니다.
  • 더 똑똑한 소비: 더 나은 답변을 얻으면서도 더 적은 자원(적은 "토큰" 사용량)을 사용했습니다.
  • 개념 증명: "코치"(학습된 의사결정자)를 제거하고 시스템이 유효한 목록에서 무작위로 행동을 선택하게 했을 때, 성능이 현저히 떨어졌습니다. 이는 다음 단계를 선택하는 것 자체가 유효한 행동을 할 수 있는 능력만큼이나 중요하다는 것을 증명합니다.

요약하자면: DynaKRAG는 AI를 경직된 대본을 따르는 로봇에서, 이미 발견한 내용에 기반하여 다음에 어떤 도구를 사용할지 정확히 아는 유연한 탐정으로 변화시키며, 이를 통해 최소한의 낭비로 미스터리를 해결하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →