← 최신 논문
🤖 AI

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

이 논문은 필수적인 시각적 증거를 보존하면서 멀티모달 거대 언어 모델 에이전트의 중복된 추론 텍스트를 효과적으로 제거하여, 장기적 멀티모달 도구 사용 시나리오에서 작업 정확도를 향상시키고 "텍스트 부채(textual debt)" 문제를 완화하는 KL 가이드 기반 프레임워크인 SPARE를 소개한다.

원저자: Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

게시일 2026-08-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급속도로 발전하는 인공지능 분야에서, 보고 생각할 수 있는 디지털 비서 역할을 수행하는 특정 유형의 컴퓨터 프로그램이 등장했습니다. 멀티모달 거대 언어 모델(multimodal large language models)로 알려진 이 시스템들은 이미지를 보고, 그에 대한 질문을 이해하며, 답을 찾기 위해 외부 도구를 사용하도록 설계되었습니다. 복잡한 문제를 해결하기 위해 이들은 단순히 추측하는 것이 아니라, 과업을 일련의 단계로 나누고 진행 과정에서 자신의 생각과 계획을 글로 써 내려갑니다. 이러한 추론 과정을 기록하는 작업은 마치 사람이 퍼즐을 풀 때 메모를 적는 것처럼, 시스템이 체계적으로 조직을 유지하고 다양한 행동을 조율하는 데 도움을 줍니다. 그러나 이 디지털 비서들이 길고 어려운 과업을 수행함에 따라, 생성된 텍스트가 쌓이기 시작합니다. 이렇게 스스로 작성한 노트가 축적되면 결국 원래의 이미지와 도구가 제공하는 새로운 시각적 단서들을 밀어내게 되며, 이로 인해 시스템은 눈앞의 신선한 증거보다는 자신이 과거에 쓴 단어들에 지나치게 의존하게 됩니다.

홍콩 과학기술대학교의 연구진은 이러한 현상을 '텍스트 부채(textual debt)'라고 명명했습니다. 이는 대화의 이력이 에이전트가 분석해야 할 시각적 현실을 압도해 버리는 상태를 의미합니다. 에이전트가 초기의 잘못된 생각에 갇히게 되면, 그 생각을 강화하는 방대한 양의 텍isk가 새로운 정보에 대한 눈을 멀게 하여 실수를 유발할 수 있습니다. 이를 해결하기 위해 연구팀은 에이전트의 기억을 위한 선택적 편집기 역할을 하는 SPARE라는 방법론을 개발했습니다. SPARE는 단순히 오래된 텍스트를 삭제하거나 이미지를 압축하는 대신, 에이전트의 과거 추론을 신중하게 검토하여 무엇이 여전히 유용하고 무엇이 불필요해졌는지 결정합니다. 이 방식은 다음과 같은 간단한 질문을 던집/니다. "만약 에이전트가 현재 상황을 몇 문장으로 요약한다면, 다음 단계를 이해하기 위해 이전에 썼던 특정 추론 단락을 여전히 읽어야 할 필요가 있는가?"

이 과정은 시스템이 자신의 사고 과정을 두 가지 버전으로 비교하는 영리한 진단 검사를 포함합니다. 한 버전에서 에이전트는 자신의 생각과 행동의 전체 이력을 읽습니다. 다른 버전에서는 동일한 이력을 읽되, 현재 과업 상태에 대한 간결한 요약본을 함께 읽습니다. 그 후 시스템은 해당 요약의 존재가 다음 단어에 대한 에이전트의 예측을 얼마나 변화시키는지 측정합니다. 만약 요약본이 에이전트의 사고를 크게 변화시킨다면, 이는 기존 단락이 요약에서 놓친 독특하고 결정적인 세부 정보를 포함하고 있다는 뜻이므로 해당 단락을 유지합니다. 반면, 요약본이 거의 아무런 변화를 일으키지 않는다면, 이는 기존 단락이 이미 요약에 담긴 정보를 반복하고 있을 뿐이라는 의미이므로 삭제해도 안전하다고 판단합니다. 이를 통해 시스템은 과업에 필수적인 좌표나 이미지 내 텍스트와 같은 구체적인 시각적 세부 사항은 보존하면서도, 맥락을 어지럽히는 '오래된(stale)' 텍스트를 솎아낼 수 있습니다.

이러한 가지치기를 더욱 효과적으로 만들기 위해, 연구진은 시스템이 더 훌륭하고 포괄적인 요약을 작성하도록 훈련시켰습니다. 에이전트가 자신의 과업 상태를 더 효율적으로 응축하도록 가르침으로써, 프루닝(pruning) 도구가 중요한 정보를 잃지 않으면서도 중복된 텍스트를 훨씬 더 많이 제거할 수 있게 했습니다. 이미지 편집, 도구 사용, 시각적 탐색을 포함한 여러 도전적인 벤치마크에서 테스트했을 때, 이 접근 방식은 매우 성공적이었습니다. 시스템은 에이전트가 스스로에게 쓴 단어들인 '추론 토큰'을 37.89%에서 64.58% 사이로 제거하면서도 오히려 과업의 정확도를 향상시켰습니다. 많은 경우, 가지치기를 거친 에이전트가 전체 이력을 유지한 에이전트보다 더 나은 성능을 보였는데, 이는 텍스트 노이즈를 줄이는 것이 시각적 증거에 더 날카롭게 집중하는 데 도움이 되었음을 시사합니다.

이러한 결과는 에이전트가 성공하기 위해 자신의 모든 추론 단계를 기억해야 한다는 일반적인 가설에 도전합니다. 대신, 본 연구는 길고 복 복잡한 과업을 수행할 때는 관련 없는 부분을 잊는 능력이 추론하는 능력만큼이나 중요하다는 점을 시사합니다. 텍스트 부채를 청산함으로써, 시스템은 자신의 과거 가정에 갇히는 대신 이미지와 도구가 제공하는 새로운 데이터에 주의를 기울일 수 있는 능력을 회복합니다. 이 연구는 인공지능이 시각적 과업에서 진정으로 효과적인 장기적 파트너가 되기 위해서는, 어떻게 생각할 것인가뿐만 아니라, 목표에 더 이상 도움이 되지 않는 생각을 어떻게 놓아줄 것인가도 배워야 함을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →