← 최신 논문
💬 NLP

COSEARCH: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

이 논문은 추론 에이전트와 문서 순위 모델을 강화학습을 통해 공동으로 훈련하는 'CoSearch' 프레임워크를 제안하여, 기존 고정된 검색 시스템의 한계를 극복하고 복잡한 질문 답변 성능을 크게 향상시켰습니다.

원저자: Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **'코서치 (COSEARCH)'**라는 새로운 인공지능 (AI) 시스템을 소개합니다. 이 시스템을 이해하기 위해 우리가 일상에서 겪는 **'현명한 비서와 도서관 사서'**의 관계를 상상해 보겠습니다.

📖 핵심 비유: "현명한 비서"와 "부족한 사서"

상상해 보세요. 당신이 복잡한 질문을 던졌을 때, **AI(비서)**가 답을 찾아주려고 합니다. 하지만 이 비서는 직접 모든 지식을 기억하지 못하므로, **도서관 사서 (검색 시스템)**에게 책을 찾아달라고 요청합니다.

  • 기존 방식 (Search-R1 등):

    • 비서 (AI): "이 책을 찾아줘!"라고 말은 잘하지만, 사서가 가져온 책이 엉뚱한 것일지라도 그걸로 답을 만들어냅니다.
    • 사서 (검색 시스템): 고정되어 있습니다. 비서가 어떤 책을 요청하든, 사서는 항상 똑같은 방식으로만 책을 찾아옵니다. 비서가 "이 책이 필요해!"라고 해도 사서는 "아, 알았어"라고만 하고 변하지 않습니다.
    • 문제점: 비서가 아무리 똑똑해져도, 사서가 잘못된 책을 가져오면 비서도 엉뚱한 답을 낼 수밖에 없습니다.
  • 코서치 (COSEARCH) 의 방식:

    • 비서와 사서의 '함께 성장': 이 시스템은 비서와 사서가 함께 훈련받습니다.
    • 비서가 "이런 책을 찾아줘!"라고 요청하면, 사서는 그 요청을 듣고 "아, 비서가 원하는 건 이런 책이구나!"라고 배우면서 더 정확한 책을 찾아오려고 노력합니다.
    • 반대로 사서가 좋은 책을 가져오면 비서도 더 정확한 답을 낼 수 있고, 둘 다 칭찬 (보상) 을 받습니다.
    • 결과: 비서도 똑똑해지고, 사서도 더 똑똑해져서 둘이 협력하면 훨씬 더 정확한 답을 내놓습니다.

🔍 이 논문이 발견한 놀라운 사실

연구진은 먼저 실험을 통해 **"사서 (검색 시스템) 가 얼마나 중요한지"**를 확인했습니다.

  • 실험: 만약 사서가 완벽하게 가장 중요한 책 (정답이 있는 책) 을 맨 앞에 가져다준다면 (이를 '오라클'이라고 부름), 비서의 성능이 얼마나 좋아질까요?
  • 결과: 놀랍게도 비서의 실력이 최대 26.8% 까지 향상되었습니다!
  • 의미: 비서 (추론 능력) 가 아무리 발전해도, 사서 (검색 능력) 가 뒤처지면 전체 시스템의 성능은 그걸로 멈춥니다. 즉, 검색 시스템을 함께 업그레이드하는 것이 핵심이라는 것을 발견한 것입니다.

🛠️ 코서치가 어떻게 작동할까? (기술적 설명을 쉽게)

이 시스템은 **강화 학습 (RL)**이라는 기술을 사용하는데, 마치 게임에서 점수를 얻으며 배우는 방식과 같습니다.

  1. 함께 훈련하기 (Joint Training):

    • 기존에는 비서만 훈련하고 사서는 고정해 두었습니다. 하지만 코서치는 비서와 사서를 동시에 훈련시킵니다.
    • 비서가 질문을 던지고, 사서가 책을 고르면, 최종 답이 맞았는지 확인합니다. 답이 맞으면 둘 다 칭찬받고, 틀리면 둘 다 다시 노력합니다.
  2. 미묘한 문제 해결 (의미 그룹화):

    • 문제: 비서가 같은 질문을 해도, 생각의 흐름에 따라 사서에게 던지는 "구체적인 요청 (하위 질문)"은 조금씩 다릅니다. 예를 들어 "한국 수도는?"이라고 물어도, 비서는 "서울", "대한민국 수도", "서울은?" 등 다양한 말로 요청할 수 있습니다.
    • 해결: 코서치는 이 다양한 요청들을 의미가 비슷한 것끼리 묶어서 (클러스터링) 처리합니다. "서울", "대한민국 수도"는 같은 의미로 묶어서 사서에게 "이런 요청들이 모여 있으니, 이 그룹에 맞춰 더 잘 찾아줘!"라고 가르칩니다. 이렇게 하면 사서가 혼란스러워하지 않고 효율적으로 배울 수 있습니다.
  3. 두 가지 칭찬 (복합 보상):

    • 사서에게 주는 칭찬은 두 가지입니다.
      1. 즉각적인 칭찬: "찾아온 책이 질문과 관련이 있니?" (검색의 정확도)
      2. 장기적인 칭찬: "찾아온 책 덕분에 최종 답이 맞았니?" (전체 문제 해결 능력)
    • 이 두 가지 칭찬을 합쳐서 사서가 단순히 책만 잘 찾는 게 아니라, 비서가 답을 잘 낼 수 있도록 도와주는 책을 찾도록 가르칩니다.

🏆 실제 성과

이 시스템을 7 개의 다양한 질문 답변 테스트 (단순한 질문부터 복잡한 추론이 필요한 질문까지) 에 적용해 보았습니다.

  • 결과: 기존에 가장 잘하던 시스템 (Search-R1) 보다 약 6.6%~10.8% 더 높은 점수를 받았습니다.
  • 특이점: 비서 (AI) 가 작을수록 (성능이 낮을수록) 사서 (검색 시스템) 의 도움이 더 크게 작용했습니다. 즉, 검색 시스템을 잘 훈련시키면, 상대적으로 덜 똑똑한 AI 도 더 똑똑한 AI 처럼 행동할 수 있게 됩니다.

💡 결론

이 논문은 **"AI 가 답을 찾는 과정은 '생각하는 능력'과 '찾는 능력'이 서로 손을 잡고 가야 한다"**는 것을 증명했습니다.

기존에는 AI 가 혼자 고민하는 데만 집중했지만, 코서치는 AI 와 검색 시스템을 함께 훈련시켜 서로를 보완하게 함으로써, 훨씬 더 정확하고 효율적인 '지능형 검색 에이전트'를 만들어냈습니다. 이는 앞으로 우리가 AI 비서를 사용할 때, 더 빠르고 정확한 답변을 받을 수 있는 중요한 발걸음이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →