IterResearch: Rethinking Long-Horizon Agents with Interaction Scaling
IterResearch는 상호작용 스케일링(Interaction Scaling)과 MDP 기반의 워크스페이스 재구성을 바탕으로 한 반복적 딥 리서치 패러다임을 도입하여, 기존 에이전트의 컨텍스트 제한을 극복하고 학습된 모델 및 프런티어 시스템을 위한 프롬프팅 전략으로서 장기적 과제(long-horizon tasks)에서 상당한 성능 향상을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 문제: "끝없는 스크롤"의 덫
당신이 인터넷 깊숙이 숨겨진 특정 사실을 찾아내는 것과 같은 매우 어려운 미스터리를 풀려고 노력하고 있다고 상상해 보세요.
현재 대부분의 AI 에이전트는 페이지를 절대 넘기지 않고 책을 읽으려는 사람처럼 작동합니다. 1페이지를 읽고, 그다음 2페이지, 그다음 3페이지를 읽습니다. 하지만 기존의 페이지들을 덮고 새로 시작하는 대신, 그들은 똑같은 거대한 종이 뭉치 맨 아래에 계속해서 새로운 페이지를 추가합니다.
- 결과: 50페이지쯤 되면 종이 더미가 너무 높아져서 사람은 더 이상 꼭대기를 볼 수 없게 됩니다. 그들은 모든 오래된 텍스트에 의해 "질식"하게 됩니다.
- 노이즈: 만약 그들이 5페이지에서 실수로 잘못된 사실을 읽었다면, 그 잘못된 사실은 50페이지에서도 그들을 혼란스럽게 만들기 위해 종이 더미 속에 영원히 박혀 있게 됩니다.
논문에서는 이를 **"단일 문맥 패러다임(Mono-contextual Paradigm)"**이라고 부릅니다. 이는 마치 매 걸음마다 점점 더 무거워지는 무거운 배낭을 등에 지고 마라톤을 하는 것과 같습니다. 결국, 당신은 쓰러지고 맙니다.
해결책: "스마트 노트" (IterResearch)
저자들은 AI가 생각하는 새로운 방식인 IterResearch를 소개합니다. AI는 거대한 종이 더미를 질질 끌고 다니는 대신, 새로운 것을 배울 때마다 다시 작성되는 스마트 노트를 사용합니다.
작동 방식은 다음과 같습니다.
"리셋(Reset)" 버튼:
당신이 탐정이라고 상상해 보세요. 당신은 단서들을 모읍니다. 손에 닿았던 모든 종이 조각을 다 간직하는 대신, 지금까지 알고 있는 내용을 깨끗한 노트에 요약하여 적고, 그 후 지저분한 조각들을 버립니다.- 논문의 용어: 반복적 워크스페이스 재구성 (Iterative Workspace Reconstruction).
- 비유: AI는 책상을 정리하고, 필수적인 "사건 파일(보고서)"만 남긴 채, 깨끗하고 새로운 상태에서 다음 단계의 조사를 시작합니다. 이는 너무 많은 오래된 텍스트로 인해 "질식"하는 것을 방지합니다.
"진화하는" 보고서:
AI는 단순히 사실을 기억하는 것이 아니라, 살아있는 보고서를 작성합니다. 새로운 정보를 찾을 때마다 이 보고서를 업데이트하며, 불필요한 정보는 걸러내고 오직 황금 같은 정보만을 남깁니다.- 논문의 용어: 진화하는 보고서 메모리 (Evolving Report Memory).
- 비유: 이것은 AI가 실시간으로 편집하는 위키피디아 페이지와 같습니다. 오래되거나, 틀렸거나, 관련 없는 정보는 삭제되고, 새롭고 정확한 정보가 추가됩니다. "메모리"는 조사가 얼마나 오래 지속되든 작고 깨끗한 상태를 유지합니다.
"효율성" 코치:
AI는 얼마나 효율적으로 검색할지를 배워야 합니다. 논문은 EAPO(효율성 인지 정책 최적화, Efficiency-Aware Policy Optimization)라고 불리는 훈련 방법을 도입했습니다.- 비유: 당신이 퍼즐을 5번의 움직임으로 풀면 금색 별을 주지만, 50번의 움직임으로 풀면 아주 희미한 별을 주는 코치를 상상해 보세요. 설령 정답을 맞혔더라도, 코치는 당신이 운 좋게 답을 찾을 때까지 계속 파헤치는 것이 아니라, 더 빠르고 똑똑하게 해결하도록 가르칩니다.
놀라운 결과
이 논문은 이 새로운 "스마트 노트" 방식을 기존의 "끝없는 스크롤" 방식들과 비교 테스트했습니다. 결과는 다음과 같았습니다.
- 경쟁자를 압도하다: 새로운 AI (IterResearch)는 6가지의 다른 어려운 테스트에서 다른 어떤 오픈 소스 AI 에이전트보다 현저히 높은 점수를 기록했습니다. 이들은 구글이나 OpenAI와 같은 가장 비싸고 독점적인 시스템들과의 격차를 좁혔습니다.
- "초장거리" 마라톤: 가장 충격적인 결과는 **상호작용 스케일링 (Interaction Scaling)**이었습니다.
- 비유: 기존의 에이전트들은 "배낭"이 너무 무거워져서 보통 20~30단계 후에 포기하거나 혼란에 빠집니다. 하지만 IterResearch는 땀 한 방울 흘리지 않고 2,048단계까지 계속 달릴 수 있었습니다.
- 결과: 더 많은 단계(최대 2,048단계)를 밟을 수 있게 허용했을 때, 성능은 형편없는 3.5%에서 놀라운 42.5%로 급증했습니다. 이는 문제가 AI가 과제를 해결하기에 "너무 멍청해서"가 아니라, 기존 방식들이 AI가 충분히 오래 들여다볼 수 있게 해주지 못했기 때문임을 증명했습니다.
- 보편적인 기술: 저자들은 이 방식을 사용하기 위해 AI를 새로 훈련시킬 필요조차 없다는 것을 발견했습니다. 만약 "스마트 노트" 지침(프롬프트)을 다른 강력한 AI에게 제공하기만 하면, 그 AI는 즉시 긴 작업에 훨씬 더 능숙해집니다. 이는 마치 일반 손전등에 수 마일을 더 멀리 볼 수 있게 만드는 새로운 렌즈를 끼워주는 것과 같습니다.
요약
IterResearch는 AI가 심층 연구를 수행하는 새로운 방식입니다. 발견한 모든 정보를 모조리 쌓아두는 대신(이는 결국 AI를 질식하게 만듭니다), 주기적으로 알고 있는 것을 요약하고, 노이즈를 버리고, 새로 시작합니다.
이를 통해 AI는 다음을 할 수 있습니다:
- 훨씬 더 긴 시간 동안(최대 2,048단계) 명확하게 생각할 수 있습니다.
- 더 효율적으로 답을 찾아냅니다.
- 현재 이용 가능한 거의 모든 오픈 소스 에이전트보다 더 잘 작동합니다.
이것은 AI를 종이 더미에 빠져 허우적거리는 사람이 아니라, 완벽하게 정리되고 끊임없이 업데이트되는 사건 파일을 가진 탐정으로 변화시킵니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.