← 최신 논문
🤖 AI

Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

Harness-1은 일상적인 상태 관리는 외부의 상태 유지형 하네스로 오프로드하면서도 의미론적 의사결정 능력은 유지함으로써, 기존의 오픈 및 프런티어 모델들과 비교하여 우수한 검색 성능과 다양한 벤치마크에 걸친 강력한 일반화 성능을 달성하는 20B 규모의 강화 학습 기반 탐색 에이전트입니다.

원저자: Pengcheng Jiang, Zhiyi Shi, Kelly Hong, Xueqiang Xu, Jiashuo Sun, Jimeng Sun, Hammad Bashir, Jiawei Han

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Pengcheng Jiang, Zhiyi Shi, Kelly Hong, Xueqiang Xu, Jiashuo Sun, Jimeng Sun, Hammad Bashir, Jiawei Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 복잡한 미스터리를 풀려고 한다고 상상해 보세요. 당신에게는 천재적인 탐정(AI 모델)이 있지만, 그는 아주 고약한 버릇이 있습니다. 방금 읽은 것을 모두 까먹고, 너무 많은 서류에 혼란을 느끼며, 같은 단서를 반복해서 다시 읽느라 시간을 허비하곤 합니다.

이 논문은 이 문제를 해결하기 위해 탐정에게 초정밀하게 정리된 조수(이른가 "Harness")를 붙여주는 새로운 시스템인 Harness-1을 소개합니다.

작동 방식은 다음과 같습니다.

1. 문제점: "천재적이지만 건망증이 심한" 탐정

보통 AI가 답을 찾기 위해 검색을 할 때, AI는 모든 것을 머릿속에 기억해야 하는 탐정처럼 행동합니다. 그들은 다음을 기억해야 합니다:

  • 어떤 문서를 이미 읽었는지.
  • 어떤 것이 유용했고 어떤 것이 쓰레기였는지.
  • 아직 찾아야 할 사실이 무엇인지.
  • 남은 시간이 얼마나 되는지.

이 논문은 AI에게 이 모든 "장부 정리"(파일 정리)를 강요하는 것이 뇌 용량의 낭비라고 주장합니다. 이는 마치 천재 수학자에게 서기 역할까지 맡기는 것과 같습니다. 그러면 그들은 지치게 되고, 실수를 저지르며, 효과적인 검색을 중단하게 됩니다.

2. 해결책: "상태 유지형 하네스(Stateful Harness)" (초정밀 조수)

Harness-1은 업무를 두 가지 명확한 역할로 나눕니다:

  • 정책(The Policy, 탐정): 이것은 AI 모델(200억 파라미터 모델)입니다. 이 모델의 유일한 임무는 현명한 결정을 내리는 것입니다: "다음에 무엇을 검색해야 할까?" "이 문서는 중요한가?" "충분한 증거를 모았으니 이제 멈춰도 될까?"
  • 하네스(The Harness, 조수): 이것은 AI 주변에서 실행되는 특화된 소프트웨어 프로그램입니다. 이 프로그램은 모든 지루하고 기계적인 일을 수행합니다. 발견된 모든 문서의 완벽한 목록을 유지하고, 중요도(예: "매우 높음" 또는 "낮음")를 태그하며, 서로 다른 문서 간의 연결 고리를 만들고, 검증된 사실이 무엇인지 정확히 기억합니다.

비유: AI를 셰프라고 하고, 하네스를 수셰프(부주방장)라고 생각해 보세요.

  • **셰프(AI)**는 결정합니다: "양파를 다지고 소스가 준비되었는지 확인해야겠어."
  • **수셰프(Harness)**는 실제로 수행합니다: "여기 다진 양파가 있습니다. 좋은 토마토와 나쁜 토마토를 이미 분류해 두었습니다. 그리고 소금이 떨어졌다고 적어 두었습니다."
  • 셰프는 양파가 어디에 있는지나 토마토가 통에 몇 개 남았는지 걱정할 필요가 없습니다. 그저 요리에만 집중하면 됩니다.

3. 그들이 함께 학습하는 법 (강화 학습)

연구팀은 이 시스템을 **강화 학습(Reinforcement Learning)**을 사용하여 훈련시켰습니다.

  • 훈련: AI가 탐정 역할을 수행하도록 수천 번 플레이하게 했습니다. AI가 좋은 움직임(올바른 단서를 찾거나, 파일을 잘 정리하는 등)을 할 때마다 보상을 주었습니다.
  • 반전: 하네스가 번거로운 세부 사항들을 처리해주었기 때문에, AI는 훨씬 더 빠르게 학습했습니다. AI는 파일을 어디에 두었는지 기억하는 데 에너지를 낭비하는 대신, 어떤 파일이 중요한지에 대해서만 배우면 되었습니다.
  • 결과: AI는 숙련된 전략가가 되는 법을 배웠습니다. 폭넓게 검색한 뒤 범위를 좁히고, 사실을 검증하며, 답을 얻었을 때 정확히 멈추는 법을 배웠습니다.

4. 조수의 "마법 같은" 기능들

하네스는 단순한 메모장이 아닙니다. 탐정을 더 똑똑하게 만드는 특별한 도구들을 갖추고 있습니다:

  • "증거 그래프(Evidence Graph)": 단서들을 빨간 실로 연결해 놓은 탐정의 게시판을 상상해 보세요. 하네스는 이 실들을 자동으로 그려냅니다. 만약 문서 A에 "브뤼셀"이 언급되고 문서 B에도 "브뤼셀"이 언급된다면, 하네스는 이 둘을 연결합니다. 이를 통해 AI는 모든 단어를 다시 읽지 않고도 큰 그림을 볼 수 있습니다.
  • 자동 시딩(Auto-Seeding): 검색이 시작될 때, 하네스는 탐정이 빈 책상을 바라보며 멍하니 있게 두지 않습니다. 즉시 가장 가능성 높은 8개의 문서를 책상 위에 올려두어 "시작점"을 제공합니다. 이는 AI가 초기에 길을 잃는 것을 방지합니다.
  • 압축(Compression): 만약 검색 결과로 50페이지짜리 보고서가 나오면, 하네스는 이를 가장 중요한 4개의 문장으로 요약하여 AI에게 보여줍니다. 이는 AI의 "작업 기억(Working Memory)"이 과부하되는 것을 막아줍니다.

5. 결과: 작은 모델, 큰 승리

이 논문은 8가지의 어려운 검색 과제(금융 데이터 찾기, 특허 정보, 다단계 상식 퀴즈 등)를 통해 Harness-1을 테스트했습니다.

  • 놀라운 점: 이 하네스를 사용하는 상대적으로 작은 AI 모델(200억 파라미터)이, 이 특별한 조수가 없는 훨씬 더 크고 비싼 "프런티어(Frontier)" 모델들(일부 모델은 1,200억 개 이상의 파라미터 보유)보다 더 뛰어난 성능을 보였습니다.
  • 일반화 능력: AI가 훈련 과정에서 본 적 없는 주제(예: 금융 질문에서 역사 질문으로 전환)로 테스트했을 때도 여전히 매우 뛰어난 성능을 보였습니다. 이는 AI가 단순히 정답을 암기한 것이 아니라, 검색하는 '기술'을 배웠음을 증명합니다.

요약

Harness-1은 AI 검색 에이전트를 구축하는 새로운 방식입니다. AI에게 모든 것(생각하기, 검색하기, 정리하기)을 요구하는 대신, 조직적인 업무를 처리할 수 있는 강력하고 상태 유지형인 조수를 붙여주는 것입니다. 이를 통해 더 작은, 더 저렴한 AI가 잘못된 세부 사항을 기억하는 데 에너지를 쓰는 대신 올바른 결정을 내리는 데 집중함으로써, 거대하고 비싼 모델들을 능가할 수 있게 합니다.

논문의 핵심 주장: 환경(하네스)에 "장부 정리" 업무를 위임함으로써, AI는 더 효과적으로 검색하는 법을 배우고, 새로운 주제에 더 잘 일반화하며, 현재의 최첨단 방식들보다 더 높은 정확도를 달 up하면서도 더 작은 규모의 모델을 사용할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →