← 최신 논문
💬 NLP

Harness-G: A Graph-Structured Harness for Search Agents

Harness-G는 자유 형식의 쿼리 생성을 유한한 행동 선택으로 재구성하는 그래프 구조 인터페이스를 도입하고, 여러 QA 벤치마크에서 기존 베이스라인들을 크게 상회하는 구조적 비근시적 신용(Structured Non-myopic Credit) 메커니즘을 결합함으로써 강화 학습 탐색 에이전트의 검색 등가성 붕괴(retrieval-equivalence collapse) 문제를 해결한다.

원저자: Yanning Hou, Haoyuan Chen, Sihang Zhou, Xiaoshu Chen, Xirui Liu, Duanyang Yuan, Lingyuan Meng, Quan Liu, Jian Huang

게시일 2026-07-31
📖 5 분 읽기🧠 심층 분석

원저자: Yanning Hou, Haoyuan Chen, Sihang Zhou, Xiaoshu Chen, Xirui Liu, Duanyang Yuan, Lingyuan Meng, Quan Liu, Jian Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마치 마지막 남은 쿠키를 누가 훔쳐갔는지 알아내려는 것처럼 까다로운 미스터리를 풀고 있다고 상상해 보세요. 당신에게는 수백만 권의 책을 읽고 답을 찾아낼 수 있는 초스마트한 탐정(인공지능)이 있습니다. 하지만 여기 함정이 하나 있습니다. 이 탐정은 사서에게 도움을 요청하는 법을 모릅니다. 대신 "쿠키 병에 관한 책을 보여주세요"라고 말하는 대신, "나는 바삭한 부스러기의 이야기를 원한다!"라거나 "설탕 가득한 도둑의 이야기를 밝혀내라!"와 같이 무작위적이고 화려한 문장들을 외치기 시작합니다.

이것이 현재 대부분의 AI 검색 에이전트가 작동하는 방식입니다. 그들은 **강화 학습(Reinforcement Learning)**이라는 기술을 사용하는데, 이는 기본적으로 AI가 정답을 맞히면 "하이파이브(보상)"를 받고 틀리면 "엄지 아래로(벌점)"를 받는 비디오 게임 스타일의 훈련입니다. 문제는 AI가 서로 다르게 들리는 문장을 만들어내는 데 너무 능숙해서, 종종 똑같은 정보를 열 가지 다른 방식으로 요청한다는 것입니다. 그것은 마치 동시에 "쿠키!", "달콤한 간식!", "맛있는 먹거리!"라고 외치는 것과 같습니다. 사서(검색 엔진)는 이 모든 요청에 대해 똑같은 책 더미를 가져다주지만, AI는 자신이 새로운 영역을 탐험하고 있다고 생각합니다. 이는 AI가 배우고 있다고 착각하지만, 실제로는 똑같은 질문을 다양한 의상을 입혀서 반복하며 제자리걸음을 하는 혼란스러운 상황을 만듭니다.

국방과학기술대학교의 연구진은 이 탐정이 사서와 대화하는 방식에서 발생하는 이러한 혼란을 발견하고 이를 해결하기로 했습니다. 그들은 AI가 무작위 문장을 외치도록 내버려 두는 것이 문제라는 점을 깨달았습니다. AI가 스스로 질문을 만들어내는 대신, 특정 행동을 선택할 수 있는 비디오 게임 인터페이스와 같은 특별한 메뉴를 구축했습니다. 이제 AI는 단순히 "묻는" 것이 아니라, 특정 문장을 "선택(Select)"하거나, 특정 인물을 "조회(Lookup)"하거나, 질문에 "답변(Answer)"해야 합니다. AI가 명확한 목록에서 선택하도록 강제함으로써, AI가 스스로 만든 복잡한 문장들 속에서 길을 잃는 것을 막았습니다. 또한 그들은 새로운 방식의 공로 인정법을 발명했습니다. 만약 AI가 어떤 인물을 조회하는 올바른 선택을 했지만, 그 답이 세 단계 뒤에 나타난다면, 시스템은 최종 결과뿐만 아니라 그 첫 번째 영리한 움직임에 대해서도 공로를 인정하도록 만들었습니다.

새로운 게임: Harness-G

이 논문은 Harness-G라는 새로운 시스템을 소개합니다. 이것은 당신의 AI 탐정에게 아주 잘 정리된 새로운 지도와 엄격한 규칙책을 주는 것이라고 생각하면 됩니다.

문제점: "탐험의 환상"
저자들은 AI 에이전트가 기존의 "자유 형식(free-form)" 방식(무작위 문장을 외치는 방식)을 사용할 때, 소위 **"검색 등가성 붕괴(retrieval-equivalence collapse)"**를 겪는다는 것을 발견했습니다. 당신이 숨겨진 보물을 찾는 게임을 하고 있다고 상상해 보세요. 기존의 AI는 열 군데의 다른 지점을 파헤치려 하겠지만, AI가 모호한 지시를 내리기 때문에 게임 엔진은 열 곳 모두에 정확히 똑같은 흙더미를 가져다줄 것입니다. AI는 "와, 나는 열 가지 다른 시도를 했어!"라고 생각하겠지만, 실제로는 똑같은 구덩이를 열 번 판 것에 불과합니다. 이로 인해 모든 움직임이 시스템에 똑같이 보이기 때문에, AI가 어떤 움직임이 실제로 좋은 것인지 배우는 것이 불가능해졌습니다.

해결책: 액션 메뉴
Harness-G는 게임의 규칙을 바꿉니다. AI가 스스로 질문을 쓰는 대신, 시스템은 모든 책의 단락, 문장, 그리고 이름(엔티티)을 연결하는 거대한 웹인 **그래프(graph)**를 구축합니다. AI가 정보를 찾고 싶을 때, 문장을 쓰는 것이 아니라 시스템이 제공하는 메뉴의 옵션 중 하나를 고릅니다.

메뉴는 오직 세 가지 유형의 움직임만을 제공합니다:

  1. Select (선택): "나는 이 특정 문장을 나의 근거로 선택한다."
  2. Lookup (조회): "나는 이 특정 이름(예: 'Caroline Leaf')에 대한 더 많은 정보를 찾고 싶다."
  3. Answer (답변): "나는 다 끝났다, 여기 나의 답이 있다."

그러면 시스템은 그 선택을 완벽한 검색 쿼리로 자동 변환합니다. 이를 통해 AI가 혼란스러운 유의어를 만들어내는 것을 방지합니다. 만약 AI가 "Caroline Leaf"를 조회하고 싶다면, 목록에서 "Lookup Caroline Leaf"를 선택합니다. AI가 실수로 "영화 감독을 조회하라"를 선택하여 다른 결과를 얻을 수 없습니다. 왜냐하면 시스템이 이들이 동일한 것임을 알고 자동으로 처리하기 때문입니다. 이 방식은 모든 움직임을 뚜렷하고 명확하게 만듭니다.

스마트한 공로 인정 시스템: SNC
논문은 또한 **SNC(Structured Non-myopic Credit)**라고 불리는 새로운 "하이파이브" 방식을 도입했습니다. 기존의 게임에서는 AI가 초기에 영리한 움직임(예: 두 아이디어 사이의 다리를 찾는 것)을 했더라도, 최종 답을 훨씬 나중에 얻게 되면 그 초기 움직임에 대해 공로를 인정받지 못하는 경우가 많았습니다. 이는 마치 축구 선수가 동료에게 완벽한 패스를 했음에도 불구하고, 골을 넣은 사람만이 골을 기록한 것으로 인정받는 것과 같습니다.

Harness-G는 전체 사건의 사슬을 살펴봄으로써 이를 해결합니다. 시스템은 다음과 같이 묻습니다: "이 초기 움직임이 이후의 성공을 가능하게 했는가?" 만약 AI가 적절한 연결 문장을 선택했다면, 최종 답이 세 단계 뒤에 나오더라도 시스템은 그 움직임에 공로를 인정합니다. 또한 시스템은 AI의 선택을 그 순간에 사용 가능한 다른 옵션들과 비교합니다. 만약 AI가 최선의 옵션을 선택하면 큰 보상을 주고, 평범한 것을 선택하면 적은 보상을 줍니다. 이는 AI가 단순히 운이 좋은 것이 아니라 전략적으로 행동하도록 가르칩니다.

결과
연구진은 단순한 상식 퀴즈부터 복잡한 다단계 퍼즐에 이르기까지 여섯 가지 서로 다른 질의응답 챌린지에 이 새로운 시스템을 테스트했습니다. 그들은 Harness-G를 Graph-R1과 같은 기존의 가장 우수한 방법들과 비교했습니다.

결과는 명확했습니다:

  • Harness-G가 승리했습니다. Harness-G는 모든 테스트에서 가장 높은 평균 점수를 기록했습니다.
  • 작은 뇌를 가진 모델에게 가장 효과적이었습니다. 15억 개의 파라미터를 가진 작은 AI 모델을 사용했을 때, Harness-G는 다음으로 우수한 방법보다 10.74점 더 높은 점수를 기록했습니다. 30억 개의 파라미터를 가진 더 큰 모델을 사용했을 때도 경쟁 모델을 3.98점 차이로 앞섰습니다.
  • 더 효율적이었습니다. AI는 답을 찾기 위해 질문을 덜 던졌으며, 관련 없는 정보를 읽는 데 시간을 낭비하지 않았습니다.

그들이 배제한 것
논문은 AI의 무작위 외침에 대해 더 "밀도 높은" 보상(더 빈번한 하이파이브)을 주는 것만으로는 문제를 해결할 수 없다는 점을 명시적으로 주장합니다. 그들은 더 나은 점수 체계를 갖추더라도, AI가 자유롭게 문장을 외치도록 허용하면 여전히 자신이 새로운 일을 하고 있다고 착각하는 "탐험의 환상"에 빠지게 된다는 것을 보여주었습니다. 해결책은 단순히 더 나은 점수 체계가 아니라, 인터페이스 자체를 바꾸는 것입니다.

얼마나 확신하는가?
저자들은 이 시스템을 여섯 가지 데이터셋과 두 가지 크기의 AI 모델에 걸쳐 실제 데이터로 테스트했기 때문에 자신들의 결과에 매우 확신하고 있습니다. 그들은 단순히 시뮬레이션을 한 것이 아니라, 실제로 AI를 훈련시키고 학습 과정을 관찰했습니다. 또한 그들은 "어블레이션 연구(ablation studies)", 즉 자신들의 시스템을 해체하여 메뉴스마트 공로 인정 시스템이 모두 필요하다는 것을 증명했습니다. 메뉴를 제거했을 때 성능이 떨어졌고, 스마트 공로 인정을 제거했을 때도 성능이 떨어졌습니다. 두 부분 모두 필수적입니다.

요약하자면, Harness-G는 때때로 AI를 더 똑똑하게 만드는 최선의 방법은 질문을 더 창의적으로 하게 만드는 것이 아니라, 다음 움직임을 선택할 수 있는 더 명확하고 구조화된 방법을 제공하는 것임을 보여줍니다. 이는 혼란스러운 외침을 정교하고 전략적인 체스 게임으로 바꿉니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →