← 최신 논문
🤖 AI

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

이 논문은 하이브리드 모드 강화 학습을 활용하여 제안자(proposer), 해결사(solver), 심판(judge)을 협력적으로 진화시키는 하이브리드 개방형 삼중 진화(Hybrid Open-Ended Tri-Evolution, HOTE) 프레임워크를 제안하며, 이를 통해 8B 모델이 시간 오버헤드를 줄이면서도 개방형 작업에서 더 큰 규모의 정적 및 최첨단 딥 리서치 모델들을 능가할 수 있게 한다.

원저자: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

게시일 2026-06-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 개념: 로봇에게 세계적인 연구자가 되는 법을 가르치기

당신이 세계적인 수준의 연구가처럼 행동할 수 있는 AI를 만들고 싶다고 상상해 보세요. 이 AI는 인터넷에서 정보를 찾고, 수천 개의 기사를 읽고, 복잡한 주제(예: "2050년 기후 변화가 커피 생산에 어떤 영향을 미치는가?")에 대해 길고 상세한 보고서를 작성해야 합니다.

문제는 대부분의 AI 모델이 정해진 교과서로만 공부하는 학생과 같다는 점입니다. 교과서를 다 읽고 나면 학습을 멈춰버립니다. 스스로 새로운 것을 연구하며 발전하는 능력이 부족합니다.

이 논문은 HOTE(Hybrid Open-Ended Tri-Evolution)라고 불리는 새로운 시스템을 소개합니다. HOTE를 단순한 학생 한 명이 아니라, 자신과 게임을 하며 스스로 발전하는 자기 진화형 연구 팀이라고 생각해보세요.

팀을 구성하는 세 가지 캐릭터

HOTE는 단순히 하나의 AI가 모든 것을 수행하게 하는 대신, 함께 진화하는 세 가지 특화된 역할을 사용합니다.

  1. 솔버 (The Solver, 연구자):

    • 역할: 실제로 업무를 수행하는 AI입니다. 질문을 받으면 웹을 검색하고, 문서를 읽고, 긴 연구 보고서를 작성합니다.
    • 비유: 솔버를 미스터리를 풀려는 탐정이라고 생각해보세요.
  2. 저지 (The Judge, 심판):

    • 역할: 솔버가 작성한 보고서를 읽는 AI입니다. 단순히 "좋음" 또는 "나쁨"이라고 말하는 대신, 보고서를 채점하기 위한 맞춤형 체크리스트(루브릭)를 만듭니다. 강점과 약점을 구체적으로 찾아냅니다.
    • 비유: 저지는 엄격한 편집자스포츠 심판과 같습니다. 탐정이 단서를 놓쳤다면, 심판은 휘슬을 불며 "이 구체적인 세부 사항을 놓쳤습니다"라고 지적합니다. 결정적으로, 저지는 새로운 유형의 실수를 볼 때마다 자신의 규칙집을 업데이트하므로, 과거의 규칙에 갇히지 않습니다.
  3. 프로포저 (The Proposer, 퀴즈 마스터):

    • 역할: 저지의 피드백과 탐정의 실수를 살펴보고, 새롭고 더 어려운 질문을 만들어냅니다. 목표는 탐정의 약점을 찾아내어 도전 과제를 던지는 것입니다.
    • 비유: 프로포저는 선수가 특정 동작에서 실패하는 것을 지켜보고, 그 약점을 정확히 고칠 수 있도록 새롭고 약간 더 어려운 훈련법을 설계하는 체육 코치와 같습니다.

학습 방법: "트라이-에볼루션(Tri-Evolution)" 게임

마법은 이 세 존재가 루프(순환 구조) 속에서 함께 작동하며 끊임없이 발전할 때 일어납니다.

  1. 퀴즈 마스터가 까다로운 연구 질문을 만듭니다.
  2. 탐정이 그 질문에 답하기 위해 웹을 검색하고 보고서를 작성합니다.
  3. 심판이 보고서를 채점하고, 새로운 체크리스트를 만들며, 탐정이 어디에서 실패했는지 정확히 짚어줍니다.
  4. 탐정은 성적을 바탕으로 배우고 다시 시도합니다.
  5. 퀴즈 마스터는 탐정이 여전히 어려워하는 부분이 무엇인지 파악하여 다음 라운드를 위한 더 어려운 질문을 만듭니다.

이 사이클은 수천 번 반복됩니다. 논문에서는 이 과정을 "트라이-에볼루션(삼중 진화)"이라고 부르는데, 이는 세 캐릭터가 동시에 진화(발전)하기 때문입니다.

"하이브리드"의 비결

논문은 또한 "듀얼 모드 하이브리드(Dual-Mode Hybrid)" 전략을 언급합니다. 이것은 운동선수를 두 가지 방식으로 훈련시키는 것과 같습니다.

  • 모드 A (도구 사용): 탐정은 답을 찾기 위해 인터넷(검색 도구)을 사용할 수 있습니다. 이는 현실적이지만 노이즈가 많고 느릴 수 있습니다.
  • 모드 B (도구 미사용): 탐정은 아무것도 찾아보지 않고 오직 기억과 논리만으로 답해야 합니다. 이는 빠르지만 이미 알고 있는 지식에 의존합니다.

HOTE 시스템은 탐정을 두 모드 모두에서 동시에 훈련시킵니다.

  • 왜 그럴까요? 인터넷 사용만 훈련하면 탐정이 검색 결과에 너무 의존하며 게을러질 수 있습니다. 반대로 도구 없이 훈련만 하면 인터넷을 효과적으로 사용하는 법을 잊을 수 있습니다. 이 둘을 혼합함으로써, 탐정은 언제 검색해야 하는지와 도구 없이 어떻게 깊이 생각해야 하는지를 모두 아는 숙련된 연구가가 됩니다.

결과: 왜 중요한가?

연구진은 이 시스템을 세 가지 어려운 벤치마크(건강, 과학, 일반 연구)에서 테스트했습니다.

  • 주장: HOTE로 훈련된 80억 파라미터 규모의 모델(중형 AI)은 훨씬 더 큰 모델(32B 이상) 및 다른 최첨단 연구 AI들보다 더 똑똑해졌습니다.
  • 효율성: 다른 방법들보다 더 적은 시간더 적은 컴퓨팅 자원을 사용하여 이러한 결과를 달성했습니다.
  • 지속 가능성: 다른 방식들은 시간이 지나면 개선이 멈추는 것과 달리, HOTE 팀은 "퀴즈 마스터"가 아직 해결하지 못한 새롭고 도전적인 문제들을 계속 찾아냈기 때문에 오랫동안 계속해서 발전할 수 있었습니다.

한 문장 요약

HOTE는 연구자, 비평가, 퀴즈 마스터가 서로 "체스" 게임을 지속하며, 인터넷 검색과 순수한 사고를 혼합 사용하여 중형 AI를 세계적인 수준의 딥 리서처로 더 빠르고 더 훌륭하게 만드는 자기 진화형 AI 시스템입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →