← 최신 논문
💬 NLP

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

이 논문은 추론 단계 수준에서 지식 격차를 감지하여 대규모 추론 모델의 검색 시점을 최적화하는 ReaLM-Retrieve 프레임워크를 소개하며, 이는 표준 및 고정 간격 접근 방식에 비해 불필요한 검색 호출을 줄이면서 답변 정확도와 검색 효율성을 크게 향상시킵니다.

원저자: Dongxin Guo, Jikun Wu, Siu Ming Yiu

게시일 2026-04-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Dongxin Guo, Jikun Wu, Siu Ming Yiu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

다음은 논리 추론을 위한 대규모 모델의 적응형 검색을 다룬 논문 "When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models"에 대한 쉬운 언어와 일상적인 비유를 활용한 설명입니다.

핵심 문제: "도서관 방문"의 불일치

복잡한 미스터리를 해결하려는 천재 형사 (대규모 추론 모델) 가 되어보세요. 당신은 단계별로 생각을 적어내는 수첩을 가지고 있습니다. 때로는 증인의 이름이나 사건의 날짜와 같은 특정 사실을 모르면 막히게 됩니다.

기존 방식 (표준 RAG):
현재 대부분의 시스템은 당신이 수첩에 쓰기를 시작하기 전에 책 더미를 건네주는 사서처럼 행동합니다. 당신은 책을 읽고 나서야 미스터리를 해결하려 합니다.

  • 결함: 20 페이지 분량의 사고 과정에서 중간에 세부 사항을 잊어버려 막히더라도, 새로운 책을 요청하러 돌아갈 수 없습니다. 초기에 제공받은 정보로만 해결해야 하며, 그 정보가 후속 단계에 충분하지 않더라도 그대로 갇히게 됩니다.

새로운 방식 (ReaLM-Retrieve):
이 논문은 ReaLM-Retrieve라는 시스템을 소개합니다. 모든 책을 한 번에 받는 대신, 형사는 노트를 쓰는 도중에도 도서관에 갈 수 있지만, 진정으로 필요할 때만 갈 수 있습니다.

작동 원리: 세 가지 마법 도구

연구자들은 이 "사고 중 도서관 방문"이 완벽하게 작동하도록 세 가지 주요 부분으로 구성된 시스템을 구축했습니다.

1. "신뢰도 확인" (단계별 불확실성)

형사가 수첩의 매 단락 뒤에 멈춰서 스스로에게 묻는다고 상상해보세요: "내가 정말로 이것을 알고 있는 건가, 아니면 그냥 추측하는 건가?"

  • 기존 방법은 매 단어마다 (너무 빈번함) 또는 문장마다 (너무 경직됨) 이를 확인했습니다.
  • ReaLM-Retrieve논리적 단계에서 확인합니다. *"방금 완전한 생각을 끝냈는가? 다음 논리적 도약에 대해 불확실한가?"*라고 묻습니다.
  • 형사가 "지식 공백" (불확실성) 을 느끼면 시스템이 이를 표시합니다. 엔진이 작동한다고 해서 켜지는 것이 아니라, 실제로 연료가 필요할 때만 켜지는 "엔진 경고등"과 같습니다.

2. "스마트 관리자" (학습된 개입 정책)

형사가 불확실함을 느낀다고 해서 매번 도서관으로 달려가야 하는 것은 아닙니다. 때로는 사실을 놓친 것이 아니라 깊이 생각하고 있는 것일 뿐입니다.

  • 이 시스템은 형사 옆에 앉은 스마트 관리자처럼 행동합니다.
  • 관리자는 "신뢰도 확인"과 사건 기록을 살펴봅니다. *"좋아, 지금 그 특정 사실을 찾아봐야 해"*라고 결정하거나 *"아니, 계속 생각해봐, 네가 알아낼 거야"*라고 판단합니다.
  • 또한 사서에게 완벽한 질문 (검색 쿼리) 을 작성하는 데 도움을 주어, 형사가 관련 없는 정보로 가득 찬 책 전체가 아니라 딱 필요한 페이지를 받도록 합니다.

3. "신속한 배송" (효율적 통합)

도서관에 가는 데는 시간이 걸립니다. 형사가 사실을 필요로 할 때마다 5 분씩 멈춘다면 전체 과정이 느려집니다.

  • 연구자들은 고속 배송 서비스를 구축했습니다.
  • 형사에게 책 전체를 handing 하는 대신, 필요한 정확한 단락만 제공합니다 (정보 압축).
  • 또한 "추측적"인 트릭을 사용합니다: 형사가 다음에 "파리"에 대한 사실을 필요로 할 가능성이 높다면, 시스템은 형사가 현재 문장을 쓰는 동안 그 정보를 미리 가져옵니다. 필요하다면 즉시 그곳에 있습니다.
  • 결과: 이 시스템은 정보를 얻는 속도가 기존 방법보다 3.2 배 빠릅니다.

결과: 더 똑똑하고, 더 빠르고, 더 저렴함

팀은 많은 연결점을 찾아 답을 도출해야 하는 세 가지 어려운 퍼즐 게임 (MuSiQue, HotpotQA, 2WikiMultiHopQA) 에서 이를 테스트했습니다.

  • 더 나은 답변: 시스템은 "한 번에 모든 책을 가져오는" 표준 방식보다 10% 더 자주 정답을 맞췄습니다.
  • 덜 빈번한 방문: 도서관 방문 횟수가 47% 감소했습니다. 기존 IRCoT 방법처럼 문장 몇 개마다 도서관을 확인하는 대신, 절대적으로 필요할 때만 갔습니다.
  • 최적의 지점: 가장 어려운 퍼즐 (4 단계 논리 필요) 에서 새로운 방식이 훨씬 더 우수했습니다. 이는 빈번하고 무작위적인 도서관 방문보다 적은 횟수지만 타이밍이 잘 잡힌 방문이 더 낫다는 것을 증명했습니다.

논문 속 실제 예시

논문의 예시 질문은 다음과 같습니다: "베를린 장벽이 무너진 해에 최우수 작품상을 받은 영화를 감독한 사람은 누구인가?"

  • 형사의 사고 과정:

    1. "베를린 장벽은 1989 년에 무너졌다." (확신, 도서관 방문 불필요).
    2. "1989 년 최우수 작품상은 '드라이빙 미스 데이지'였다." (확신, 방문 불필요).
    3. "누가 감독했지?" (여기서 형사는 공백을 느낍니다. 시스템이 말합니다: 도서관으로 가세요).
    4. 시스템이 감독의 이름을 즉시 가져옵니다.
    5. 형사가 답을 마무리합니다.
  • 기존 방식: 형사가 3 단계까지 필요로 하지 않았음에도 불구하고, 맨 처음에 감독의 이름을 가져와서 시간을 낭비하고, 너무 일찍 너무 많은 정보로 형사를 혼란스럽게 만들었을 것입니다.

요약

ReaLM-Retrieve는 AI 모델이 시작하기 전에 도움을 요청하거나 너무 자주 도움을 요청하는 대신, 막힐 때 정확히 멈추어 도움을 요청하도록 가르칩니다. 이는 백과사전을 언제 열어야 할지 정확히 아는 똑똑한 비서가 있는 것과 같아, 시간을 절약하고 더 나은 결과를 얻습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →