상상해 보세요. AI 는 인터넷을 검색하며 문제를 해결하는 탐정입니다. 하지만 이 탐정에게는 아주 작은 **책상 (메모장)**만 주어졌습니다.
기존 방식 (ReAct): 탐정이 단서를 하나씩 찾아올 때마다, 그 단서를 책상 위에 그대로 쌓아둡니다.
"A 라는 사람 이름 찾음", "B 라는 사진 발견", "C 라는 날짜 확인"...
문제는 단서가 너무 많으면 책상이 꽉 차버린다는 것입니다. 책상이 꽉 차면 더 이상 새로운 단서를 받아들일 수 없게 되고, 탐정은 "아, 더 이상 못 찾겠다"라고 포기하고 만습니다.
복잡한 사건 (예: "할아버지가 돌아가신 후, 이모가 결혼하고, 사촌이 이혼하고..." 같은 복잡한 가족 관계 찾기) 은 단서가 너무 많아서 책상이 금방 꽉 차버립니다.
기존 해결책의 문제: 다른 연구자들은 "책상 크기를 키우자"거나 "책상 위에 숨겨진 비밀 상자를 만들자"고 제안했습니다. 하지만 이는 AI 의 구조를 완전히 뜯어고쳐야 하거나, AI 를 처음부터 다시 가르쳐야 하는 엄청난 비용이 듭니다.
💡 ReSum 의 해결책: "정리하는 비서 (ReSum)"
이 논문은 **"책상 크기를 키우는 게 아니라, 책상을 주기적으로 정리하자"**는 아이디어를 제시합니다.
비유: 탐정이 책상에 단서를 쌓다가 책상이 반쯤 차면, **전문 비서 (ReSumTool)**가 와서 "자, 지금까지 찾은 단서들 중에서 진짜 중요한 것만 딱 3 줄로 요약해 드릴게요"라고 말합니다.
과정:
탐정은 책상 (기존 메모) 을 비서에게 넘깁니다.
비서는 "A 사람, B 날짜, C 관계" 같은 핵심만 뽑아 짧은 요약문을 만들어 탐정에게 줍니다.
탐정은 이제 빈 책상에 그 짧은 요약문만 올려놓고 다시 검색을 계속합니다.
이 과정을 반복하면, 탐정은 책상 크기에 상관없이 끝없이 단서를 찾아낼 수 있게 됩니다.
이 방식은 AI 의 구조를 바꾸지 않고, 플러그인처럼 끼워만 쓰면 되므로 매우 쉽고 저렴합니다.
🚀 더 똑똑하게 만들기: "ReSum-GRPO (훈련)"
하지만 요약문을 보고 다시 시작하는 게 처음이라, AI 가 처음엔 어색해할 수 있습니다. "요약문만 보고 어떻게 다시 시작하지?"라고 고민할 수 있죠.
그래서 연구자들은 AI 를 훈련시켰습니다.
비유: 탐정에게 "너는 요약문을 보고도 문제를 해결할 수 있어!"라고 수천 번의 모의 훈련을 시킨 것입니다.
효과: AI 는 요약문을 보고도 논리적으로 이어가는 법을 배우게 되었고, 아주 적은 데이터 (1,000 개 정도) 만으로도 최고 수준의 성능을 발휘하게 되었습니다.
🏆 실제 성과: "작은 AI 가 거인보다 잘한다?"
실험 결과 놀라운 일이 일어났습니다.
기존 방식: 복잡한 문제를 풀다가 책상이 꽉 차서 실패했습니다.
ReSum 사용: 책상을 정리하면서 계속 찾아서 문제를 해결했습니다.
특이점: 이 방법을 쓴 **중형 AI(30B 모델)**가, 훨씬 더 크고 비싼 **유명 AI(클로드 4, 김치 K2 등)**보다 복잡한 검색 문제에서 더 좋은 성적을 내기도 했습니다.
📝 한 줄 요약
"AI 가 인터넷을 검색할 때 메모장이 꽉 차서 멈추는 문제를, '중요한 것만 요약해서 책상을 비우는 비서'를 도입함으로써 해결했습니다. 이 방법은 AI 를 다시 가르치지 않아도 되며, 아주 적은 비용으로도 AI 가 훨씬 더 길고 복잡한 문제를 해결하게 해줍니다."
이 기술은 앞으로 우리가 AI 에게 "이 복잡한 사건을 조사해 줘"라고 할 때, AI 가 지치지 않고 끝까지 찾아다닐 수 있게 해주는 게임 체인저가 될 것입니다.
논문 개요
이 논문은 대규모 언어 모델 (LLM) 기반 웹 에이전트가 복잡한 정보 검색 (Long-Horizon Search) 과제를 수행할 때 직면하는 문맥 창 (Context Window) 의 한계를 해결하기 위해 제안된 ReSum이라는 새로운 추론 패러다임과 이를 최적화하는 ReSum-GRPO 알고리즘을 소개합니다.
1. 문제 정의 (Problem)
문맥 창 제약과 긴 탐색의 모순: 복잡한 웹 검색 작업 (예: 여러 엔티티와 얽힌 관계를 가진 질문) 은 수많은 검색, 브라우징, 교차 검증을 필요로 합니다. 그러나 기존 ReAct 패러다임은 모든 생각 (Thought), 행동 (Action), 관찰 (Observation) 을 히스토리에 계속 추가하므로, 작업이 완료되기 전에 LLM 의 제한된 문맥 창 (예: 32k 토큰) 을 빠르게 소모하여 에이전트가 실패하거나 강제로 중단됩니다.
기존 해결책의 한계: MEM1, MemAgent 와 같은 기존 방법들은 내부 메모리 토큰 생성 등 아키텍처 변경을 요구하거나, 기존 에이전트와의 호환성을 깨뜨리고 비용이 많이 드는 엔드 - 투 - 엔드 재학습을 필요로 합니다.
2. 방법론 (Methodology)
가. ReSum 패러다임 (Plug-and-Play Paradigm)
핵심 아이디어: 에이전트가 문맥 한계에 도달하기 직전, 외부 도구 (Summary Tool) 를 호출하여 누적된 상호작용 히스토리를 **압축된 요약 (Compact Summary)**으로 변환합니다.
동작 방식:
에이전트는 일반 ReAct 방식으로 탐색을 진행합니다.
문맥 사용량이 임계치에 도달하면 ReSumTool 이 현재 히스토리를 요약하여 핵심 증거와 정보 격차를 추출합니다.
원본 질문과 이 요약을 결합한 새로운 상태 (q, s) 로 히스토리를 초기화하고 탐색을 재개합니다.
이 과정을 통해 에이전트는 문맥 창을 초과하지 않으면서 **무한한 탐색 (Unbounded Exploration)**이 가능해집니다.
나. ReSumTool-30B (전용 요약 모델)
개발 배경: 일반 LLM 은 긴 히스토리에서 핵심 증거와 노이즈를 구분하거나 다음 단계를 제안하는 데 한계가 있습니다.
구현: Qwen3-30B-A3B-Thinking 을 기반으로, 고수준의 추론 능력을 가진 교사 모델 (GPT-OSS-120B) 로부터 생성된 고품질의 <대화, 요약> 쌍을 통해 파인튜닝되었습니다.
특징: 30B 규모의 모델임에도 DeepSeek-R1-671B 같은 초대규모 모델보다 요약 품질이 우수하며, 웹 검색 컨텍스트에 특화되어 있습니다.
다. ReSum-GRPO (패러다임 적응을 위한 강화학습)
목적: 요약된 문맥에서 추론하는 방식은 에이전트의 기존 학습 데이터에 없으므로, 에이전트가 이 새로운 패러다임에 적응하도록 돕기 위해 강화학습 (RL) 을 적용합니다.
알고리즘 (GRPO 변형):
트래젝토리 세그멘테이션: 요약이 발생하는 지점에서 긴 탐색 경로를 여러 세그먼트 (에피소드) 로 나눕니다.
Advantage Broadcasting: 최종 답변의 정확도 (Reward) 를 전체 트래젝토리 수준에서 계산한 후, 이를 해당 트래젝토리를 구성하는 모든 세그먼트에 전파합니다.
효과: 요약된 상태에서도 논리적으로 추론할 수 있도록 장려하고, 초기 탐색 단계가 최종 성공에 기여했음을 인정받아 크레딧 (Credit) 을 부여받도록 합니다.
3. 주요 기여 (Key Contributions)
ReSum: 아키텍처 변경 없이 기존 에이전트에 바로 적용 가능한 '플러그 - 앤 - 플레이'형 패러다임으로, 문맥 압축을 통해 무한 탐색을 가능하게 함.
ReSumTool-30B: 웹 검색 맥락에서 고품질 요약을 수행하도록 특화된 모델로, 대규모 모델보다 효율적이면서 우수한 성능을 보임.
ReSum-GRPO: 요약 기반 추론을 마스터하기 위한 강화학습 알고리즘으로, 소량의 데이터 (1K 샘플) 로도 에이전트의 성능을 극대화함.
4. 실험 결과 (Results)
데이터 학습 없이 (Training-free):
ReSum 은 기존 ReAct 대비 평균 **4.5%**의 성능 향상을 보였습니다.
특히 ReSumTool-30B 를 사용할 때, 30B 모델이 Claude-4, Kimi-K2 와 같은 상용 모델들을 BrowseComp 벤치마크에서 능가하는 결과를 기록했습니다.
학습 필요 시 (Training-required):
ReSum-GRPO 를 적용하면 추가적으로 **8.2%**의 성능 향상이 이루어져 총 12.7% 이상의 개선 효과를 보였습니다.
데이터 효율성: 단 1,000 개의 학습 샘플만으로도 10,000 개 이상의 샘플로 학습된 기존 오픈소스 모델들과 경쟁 가능한 성능을 달성했습니다.
비교: MEM1-GRPO 와 비교 시, MEM1 은 더 높은 성능을 보였으나 토큰 소비량이 ReSum 의 약 3 배에 달해 효율성이 낮았습니다. 반면 ReSum 은 높은 성능과 낮은 리소스 소모 사이의 균형을 이루었습니다.
5. 의의 및 결론 (Significance)
실용성: ReSum 은 에이전트의 아키텍처를 변경하거나 대규모 재학습 없이도 복잡한 정보 검색 작업을 해결할 수 있는 비용 효율적인 솔루션을 제공합니다.
확장성: 문맥 창이 큰 모델 (128k 등) 이 사용되더라도 ReSum 은 여전히 성능 향상을 가져와, 정보 검색의 본질적 난이도가 문맥 크기 이상의 '탐색 범위' 문제임을 시사합니다.
미래 방향: 규칙 기반의 외부 요약에서 에이전트 스스로 요소를 결정하는 자율적 메커니즘으로 발전시킬 수 있는 기반을 마련했습니다.
이 논문은 LLM 에이전트의 '기억'과 '탐색' 한계를 극복하기 위해, 지능적인 요약과 강화학습 기반의 적응을 결합한 새로운 접근법을 제시했다는 점에서 의의가 큽니다.