HyMem: Hierarchical Context Management for Long-Horizon Agents via Information Isolation
HyMem은 고수준 계획을 실행 흔적으로부터 격리하고 구조화된 요약을 사용하여 집중도와 정확도를 유지함으로써 장기적 관점의 LLM 에이전트 성능을 향상시키는 계층적 컨텍스트 관리 프레임워크로, GAIA 및 Browsecomp-plus 벤치마크에서 최첨단(SOTA) 결과를 달성했습니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
놀라운 능력을 갖춘, 인터넷을 검색하고 추론하며 복잡한 문제를 해결할 수 있는 유능한 비서가 있다고 상상해 보십시오. 수년 동안 과학자들은 이 디지털 조력자들이 과학적 탐사 계획을 세우거나 특정 역사적 사실을 찾기 위해 웹사이트를 탐색하는 것과 같은 복잡하고 다단계적인 과제를 수행할 수 있기를 기대하며 대규모 언어 모델을 사용하여 이들을 구축해 왔습니다. 그러나 하나의 지속적인 문제가 이들의 발목을 잡았습니다. 바로 이 조력자들이 작업을 오래 수행하고 더 많은 정보를 수집할수록, 그들의 '기억'이 엉망진창이 된다는 점입니다. 조력자는 자신이 수행한 모든 검색 결과의 원문, 모든 실패한 시도, 그리고 모든 중간 단계의 생각들과 같은 자신의 행동에 대한 세부 정보 속에 잠겨, 원래 도달하고자 했던 목표를 잊어버리기 시작합니다. 이는 마치 단 한 권의 책을 찾으려던 사서가 자신이 넘겼던 모든 페이지의 산더미에 파묻혀, 정작 찾고 있던 제목을 놓쳐버리는 것과 같습니다.
중국과학원 자동화연구소의 연구진은 이 문제를 해결하기 위해 디지털 메모리를 조직하는 새로운 방법을 제안했습니다. 그들은 이 시스템을 HyMem이라고 부르며, 서로 다른 유형의 정보를 엄격하게 분리함으로써 장기적인 과제를 궤도에서 벗어나지 않게 유지하도록 설계된 방법입니다. 모든 데이터를 하나의 긴 목록으로 섞어 놓는 대신, HyMem은 고차원적인 계획은 깨끗하고 조용한 방에서 이루어지고, 검색과 테스트라는 시끄럽고 무질서한 작업은 별도의 격리된 공간에서 이루어지는 구조를 구축합니다. 이러한 접근 방식은 조력자가 자신의 일상적인 작업이라는 소음 때문에 주의가 분산되지 않고 거시적인 관점에 집중할 수 있게 해줍니다.
이 연구의 핵심 아이디어는 모든 정보가 동일한 가치를 지니지는 않는다는 것입니다. 에이전트가 긴 과제를 수행할 때, 두 가지 매우 다른 종류의 데이터를 생성합니다. 한 유형은 전략적 계획, 즉 목표, 검증된 사실, 그리고 일을 끝내기 위해 필요한 단계들입니다. 다른 유형은 실행 흔적(execution trace)으로, 도구를 사용하거나 웹사이트를 탐색하거나 세부 사항을 확인하는 과정에서 발생하는 원시적이고 종종 반복적이며 때로는 실패한 시도들입니다. 기존 시스템에서는 이 두 유형의 정보가 하나의 스트림에 뒤섞여 있었습니다. 과제가 진행됨에 따라, 무질서한 실행 흔적의 엄청난 양이 희소하고 결정적인 계획 신호를 압도하게 됩니다. 조서은 자신의 역사의 소음 속에서 중요한 목표와 이를 구분하지 못하고 길을 잃게 됩니다.
이를 해결하기 위해 연구진은 정보의 엄격한 문지기 역할을 하는 프레임워크를 설계했습니다. 그들은 주요 전략을 보유하는 '플래너(Planner)' 계층과 실제 도구 사용 작업을 처리하는 별도의 '익스큐터(Executor, 실행자)' 계층을 만들었습니다. 플래너가 사실을 확인하거나 검색을 실행해야 할 때, 플래너는 익스큐터에게 구체적인 지침을 보냅니다. 익스큐터는 가서 작업을 수행하며 모든 원시 데이터를 수집하지만, 그 원시 데이터를 플래너의 메인 메모리로 다시 쏟아붓지는 않습니다. 대신, 익스큐터는 정보를 처리하고 노이즈를 걸러내어, 찾아낸 내용에 대한 깨끗하고 구조화된 요약본만을 반환합니다. 이 요약본은 플래너의 메모리에 추가되는 반면, 무질서한 세부 사항들은 폐기됩니다.
또한 이 시스템은 특히 까다로운 하위 문제들을 위한 특별한 '격리된 추론(Isolated Reasoning)' 모듈을 포함하고 있습니다. 만약 어떤 과제가 깊은 사고나 상충하는 증거를 확인하는 것을 필요로 한다면, 플래너는 해당 특정 문제를 이 격리된 모듈로 보냅니다. 이 모듈은 독자적으로 문제를 풀어나가며, 자신의 내부적인 생각과 중간 단계들을 메인 플래너로부터 숨긴 채 작업합니다. 모듈이 결론에 도달하면, 그 결론과 핵심 증거만을 보낼 뿐, 그곳에 도달하기까지 거친 길고 긴 경로를 메인 플래너의 메모리에 남기지 않습니다. 이를 통해 주요 의사 결정권자가 위임된 하위 작업의 복잡성에 휩쓸리지 않도록 보장합니다.
시스템이 장기간 원활하게 작동하도록 하기 위해, HyMem은 서류 보관함처럼 구조화된 메모리 시스템을 사용합니다. 이 시스템은 과거의 사건, 현재의 목표, 그리고 도구 사용법에 대해 배운 교훈들을 깔끔하고 압축된 요약본으로 정리합니다. 시스템이 자신이 수행한 일을 기억해야 할 때, 모든 세부 사항을 하나하나 떠올리는 대신 이 정리된 파일들을 참조합니다. 이를 통해 조력자는 많은 시간의 작업 후에도 기억이 관리 가능한 수준으로 커지지 않으면서, 진행 상황과 연속성을 명확하게 유지할 수 있습니다.
연구진은 이 새로운 접근 방식을 두 가지 도전적인 과제 세트에 대해 테스트했습니다. 하나는 일반적인 추론 및 도구 사용을 포함하는 것이었고, 다른 하나는 인터넷 전반에서 특정 사실을 찾아내는 깊이 있는 연구 질문에 초점을 맞춘 것이었습니다. 그들은 이 시스템을 대화 기록 전체를 짧은 요약본으로 압축하려고 시도했던 기존의 여러 방법들과 비교했습니다. 결과는 계획과 실행을 분리함으로써 HyMem 시스템이 훨씬 더 성공적이었다는 것을 보여주었습니다. 일반 추론 과제에서 약 66.7%의 문제를 정확히 해결했으며, 심층 연구 과제에서는 61.3%를 해결했습니다. 이 수치들은 과제가 길어지고 복잡해짐에 따라 집중력을 유지하는 데 어려움을 겪었던 기존의 최고 성능 대안 방법들보다 눈에 띄게 높았습니다.
연구진은 또한 시스템이 답에 도달하기 위해 얼마나 많은 정보를 처리해야 했는지도 조사했습니다. 연구진은 HyMem 시스템이 단순히 더 많은 컴퓨팅 파워를 사용하거나 더 많은 텍ек스트를 읽어서 문제를 해결한 것이 아님을 발견했습니다. 대신, 이 시스템은 중요한 정보에만 주의를 기울임으로써 더 효율적으로 문제를 해결했습니다. 메인 계획 메모리는 목표에 집중하며 매우 느리게 성장한 반면, 격리된 공간들이 무거운 작업들을 처리했습니다. 이는 길고 어려운 문제를 해결하는 열쇠가 단순히 더 큰 메모리를 갖는 것이 아니라, 그것을 조직하는 더 똑똑한 방법을 갖는 것임을 시사합니다.
결과는 유망하지만, 연구진은 이 시스템이 엄격한 지침을 따르고 잘 조직된 요약본을 생성할 수 있는 기초적인 인공지능 능력에 의존한다는 점을 언급했습니다. 만약 모델이 이러한 규칙을 따를 수 없다면, 시스템의 이점은 나타나지 않을 수 있습니다. 그러나 지속적인 주의력과 복잡한 정보를 오랜 시간 동안 탐색하는 능력을 요구하는 과제의 경우, 이 계층적 접근 방식은 명확한 길을 제시합니다. 신호와 소음을 분리함으로써, HyMem은 작업이 매우 복잡하더라도 디지털 에이전트가 명확하게 생각할 수 있도록 해줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.