Recursive Agent Harnesses
이 논문은 부모 에이전트가 파일 시스템 및 실행 도구를 갖춘 병렬 서브에이전트 하네스를 생성하는 코드 우선 프레임워크인 Recursive Agent Harness (RAH)를 소개하며, 이는 고정된 더 강력한 백본 모델로 평가되었을 때 전통적인 모델 재귀 베이스라인보다 롱 컨텍스트 추론 및 코딩 작업에서 상당한 개선을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
수백만 권의 책이 담긴 거대한 도서관이 있고, 당신은 그 모든 책에서 특정 사실 하나를 찾아내야 한다고 상상해 보십시오.
과거의 방식: 과로하는 사서
이전에 만약 당신이 똑똑한 AI(소위 "코딩 에이전트")에게 이 일을 시켰다면, 그 AI는 초고속 사서처럼 행동하려 했을 것입니다. 그것은 특정 키워드를 찾는 것과 같은 단순한 규칙을 사용하여 책을 스캔할 것입니다. 하지만 도서관이 너무나 거대하기 때문에, 사서는 한 번에 몇 권의 책만 손에 쥘 수 있습니다. 그들은 대부분의 책을 실제로 읽는 것을 건너뛰고 단순한 규칙에 의존해야만 합니다. 만약 정답을 찾기 위해 특정 페이지에 대한 깊은 사고가 필요하다면, 사서는 이를 놓치게 됩니다.
"모델 재귀(Model Recursion)" 방식: 사고의 사슬
"재귀적 언어 모델(RLM)"이라고 불리는 또 다른 접근 방식은 도서관을 더 작은 더미로 나누어 해결하려고 시도했습니다. AI는 한 더미에 대해 생각하고, 그다음 더미를 생각하고, 그다음 더-음 하는 식으로 긴 사고의 사슬을 이어갔습니다. 하지만 이 AI는 마치 책을 만지는 것이 금지된 사서와 같습니다. 그들은 주어진 텍스트에 대해서는 생각할 수 있지만, 파일을 열거나, 도구를 사용하거나, 돋보기를 사용할 수는 없습니다. 똑똑하지만 도구 없이는 무력한 상태입니다.
새로운 방식: "재귀적 에이전트 하네스(Recursive Agent Harness, RAH)"
이 논문은 **재귀적 에이전트 하네스(RAH)**라는 새로운 전략을 소개합니다.
RAH를 단 한 명의 사서가 아니라, 이 업무를 위해 전체 팀을 구축하는 총괄 계약자라고 생각하십시오.
- 마스터 플랜: 메인 AI(부모)는 거대한 도서관을 바라보며 깨닫습니다. "나는 혼자 할 수 없고, 그냥 생각만 해서도 안 된다."
- 스크립트 작성: 스스로 일을 하려고 노력하는 대신, 부모 AI는 컴퓨터 프로그램(스크립트)을 작성합니다. 이 스크립트는 마치 다음과 같은 지침을 담은 명령서와 같습니다: "도서관에 있는 모든 책에 대해, 완전히 갖춰진 새로운 조수를 고용하라."
- 하위 팀: 이 스크으로 인해 수백 명의 **하위 에이전트(sub-agents)**가 즉각적으로 생성됩니다. 결정적인 점은, 각 하위 에이전트가 완전한 작업자라는 것입니다. 그들은 각자의 책상, 자신만의 도구(파일 열기, 검색 엔진, 코드 실행기 등), 그리고 자신만의 컨텍스트 윈도우(자신만의 정신적 공간)를 가집니다.
- 병렬 작업: 과거의 사서는 한 번에 한 권의 책만 볼 수 있었고, 사고의 사슬 방식의 AI는 한 번에 한 더미에 대해서만 생각할 수 있었지만, RAH는 수천 명의 완벽한 장비를 갖춘 조수들을 보내 각자의 책에 대해 동시에 작업하게 합니다.
- 결과: 각 조수는 자신의 특정 책을 읽고, 도구를 사용하여 답을 찾아낸 뒤, 결과를 기록합니다. 그 후 부모 AI가 모든 답을 수집합니다.
"도구 상자"의 비유
핵심적인 차이점은 도구 상자입니다.
- 코딩 에이전트는 도구 상자를 가지고 있지만, 한 번에 몇 권의 책만 볼 수 있습니다.
- RLM은 거대한 두뇌를 가졌지만 도구 상자가 없습니다. 파일을 열 수 없습니다.
- RAH는 모든 작업자에게 각자의 완전한 도구 상자를 주고 그들이 병렬로 작업하게 합니다.
연구 결과
연구진은 이 방법을 "Oolong"이라는 매우 어려운 테스트를 통해 검증했습니다. 이 테스트는 약 400만 단어(작은 소설 한 권 정도의 분량이지만 수천 개의 항목이 포함됨) 길이의 문서에서 답을 찾는 과정을 포함합니다.
- 공정한 비교를 위해 모든 테스트에 동일한 "두뇌"(GPT-5)를 사용했습니다.
- 기존의 "코딩 에이전트"는 약 **72%**의 정답률을 보였습니다.
- "모델 재귀(도구 없음)"는 약 **64%**의 정답률을 보였습니다.
- 새로운 RAH 방식은 **81%**의 정답률을 기록했습니다.
시사점
이 논문은 개선의 원인이 더 똑똑한 AI 모델을 사용했기 때문이 아니라, 전적으로 업무가 조직되는 방식을 바꿨기 때문이라고 주장합니다. "재귀적 단위(반복되는 작업의 단위)"를 단순한 "생각"에서 "도구를 갖춘 완전한 작업자"로 바꿈으로써, 시스템이 훨씬 더 복잡하고 대규모인 문제를 해결할 수 있게 되었습니다.
저자들은 이것이 단순한 이론이 아니라고 언급합니다. 이는 Anthropic의 다이내믹 워크플로우(dynamic workflows)와 같은 실제 운영 시스템들이 이미 작동하기 시작한 방식과 유사합니다. 그들은 단지 이 패턴에 이름을 붙이고, 이것이 기존 방식보다 더 효과적임을 증명했을 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.