← 최신 논문
🤖 AI

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

이 논문은 LLM 에이전트의 지속적 저장 공간 흔적이 작업 정확도와 무관하게 프레임워크 및 구성에 따라 극적으로 달라짐을 밝히는 벤치마크인 AgentFootprint를 소개하며, 콘텐츠 주소 지정 저장 방식이 데이터 재구성 가능성을 저해하지 않으면서도 이러한 오버헤드를 크게 줄일 수 있음을 입증한다.

원저자: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

게시일 2026-07-14
📖 5 분 읽기🧠 심층 분석

원저자: Chenglin Yu, Hongquan Gui, Ying Yu, Hongxia Yang, Ming Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 천재적인 로봇 탐정이 미스터리를 해결하는 모습을 지켜보고 있다고 상상해 보세요. 이 로봇은 단서를 읽고, 질문을 던지고, 최종 답안을 작성합니다. 탐정이 정답을 맞히면 모두가 환호하며, 얼마나 빨리 생각했는지와 실행 비용이 얼마였는지를 확인합니다. 하지만 아무도 탐정이 바닥에 남긴 엉망진창인 흔적에는 관심을 두지 않습니다.

*The Hidden Footprint(숨겨진 발자국)*라고 불리는 이 논문은 마치 관리인의 보고서와 같습니다. 이 논문은 다음과 같이 묻습니다. "탐정이 일을 마쳤을 때, 방 안에 얼마나 많은 쓰레기를 남겨두는가?"

놀라운 발견: 쓰레기가 엄청나다

주요 결과는 충격적입니다: 두 명의 탐정이 정확히 똑같은 미스터리를 완벽하게 해결할 수 있지만, 한 명은 다른 한 명보다 15.7배 더 큰 쓰레기 더미를 남깁니다.

이렇게 생각해 보세요: 당신과 친구가 둘 다 완벽한 초콜릿 케이크를 구웠습니다. 당신은 케이크(결과물)를 건네줍니다. 하지만 당신은 조리대를 닦기만 한 반면, 친구는 15개의 그릇, 30개의 밀가루 컵, 그리고 끈적한 포장지 산을 남겨두었습니다. 케이크는 똑같아 보이지만, 친구의 주방은 난장판이 된 것입니다.

현실 세계에서 이 "쓰레기"는 단순한 종이가 아니라 하드 드라이브에 저장되는 디지털 바이트입니다. 연구진은 단 하나의 작업을 위해 어떤 프레임워크는 131 MB의 데이터를 남기는 반면, 실제 정답(전달된 케이크)은 고작 2.6 MB뿐이라는 것을 발견했습니다. 즉, 프레임워크의 "잔여물"이 원래 해야 할 작업보다 24,033배나 더 컸던 것입니다!

"보이지 않는" 중복 계산의 함정

여기 까다로운 부분이 있습니다. 만약 당신이 컴퓨터의 파일 개수만 센다면, 쓰레기가 그렇게 심각하지 않다고 생각할 수도 있습니다. 이 논문은 표준적인 계산 방식이 함정이라고 주장합니다.

당신이 종이에 "Hello"라는 단어를 썼다고 상상해 보세요. 그다음 그 종이를 복사기로 복사하는데, 복사기가 모든 복사본에 아주 작은 "투명 잉크" 도장을 찍는다고 가정해 봅시다. 종이의 개수만 센다면 당신은 종이가 한 장이라고 보게 될 것입니다. 하지만 잉크를 들여다본다면, "Hello"라는 단어가 12번 적혀 있는 것을 보게 될 것입니다.

연구진은 컴퓨터가 데이터를 저장하는 방식(SQLite 페이지나 JSON 이스케이핑 등) 때문에 동일한 정보가 시스템 내부에 반복해서 숨겨져 저장된다는 것을 발견했습니다.

  • **단순한 계산(Naive counting)**은 "오, 중복이 별로 없네"라고 말했습니다.
  • 논문의 스마트한 계산은 "사실, 동일한 내용이 12.1배나 중복 저장되어 있다!"라고 말했습니다.

그들은 만약 "투명 잉크" 내부를 들여다보지 않는다면, 실제 쓰레기의 크기를 엄청난 차이로 놓치게 된다는 것을 증명했습니다.

"성장" 문제

논문은 또한 탐정이 같은 단서를 200번 확인해야 할 때 어떤 일이 벌어지는지도 테스트했습니다.

  • LangGraphAutoGen 같은 일부 프레임워크는 절대 잊지 않는 다람쥐처럼 행동합니다. 단서를 확인할 때마다 전체 기록을 다시 써 내려갑니다. 이로 인해 저장 공간은 **초선형적(superlinearly)**으로(점점 더 빠르게) 증가합니다. 200라운드 후에 이들은 단 하나의 작은 파일을 위해 323 MB의 데이터를 남겼습니다.
  • 반면 OpenAI Agents 같은 다른 프레임워크는 똑똑한 기록관처럼 행동합니다. 새로운 내용만 적습니다. 이들의 저장 공간은 거의 직선에 가깝게 완만하게 성장했습니다.

논문은 이 성장률( α\alpha 라고 불림)을 측정했으며, 그 범위가 0.73(줄어드는 경우!)부터 1.95(폭발적으로 증가하는 경우)까지임을 발견했습니다.

쓰레기가 많으면 더 똑똑한 탐정인가?

당신은 이렇게 생각할지도 모릅니다. "어쩌면 지저한 탐정이 더 조심스럽게 행동하느라 그런 것이고, 그래서 더 똑똑한 것 아닐까?"
논문은 다음과 같이 말합니다: 아닙니다.

연구진은 유명한 코딩 챌린지인 SWE-bench의 108개 실제 제출 사례를 조사했습니다. 그들은 이 시스템들이 내보내는 데이터의 양이 1,617배(작은 파일부터 거대한 파일까지) 차이 난다는 것을 발견했습니다. 하지만 핵심은 이것입니다: 데이터의 양과 시스템이 문제를 해결하는 능력 사이에는 아무런 연관성이 없었습니다.

사실, 상관관계는 거의 제로에 가까울 정도로 약했습니다. 어떤 시스템은 산더미 같은 데이터를 남기고도 실패할 수 있고, 아주 작은 흔적만 남기고도 성공할 수 있습니다. 이 논문은 "더 많은 저장 공간 = 더 나은 성능"이라는 아이디어를 명시적으로 배제합니다.

"마법 지우개" (하지만 아직 구매하지 마세요)

연구진은 단순히 문제점을 지적하는 데 그치지 않고 해결 방법을 제시했지만, 이것이 완성된 제품이 아닌 **개념 증명(proof of concept)**임을 주의 깊게 밝히고 있습니다.

그들은 "콘텐츠 주소 지정 저장소(content-addressed store)"를 구축했습니다. 도서관에서 책을 선반에 꽂는 대신, 책의 고유한 지문을 사진으로 찍는다고 상상해 보세요. 만약 두 권의 책이 동일하다면, 사진 한 장과 "이것은 저것과 같다"라는 메모만 남깁니다.

이 "마법 지우개"를 지저분한 프레임워크들에 적용했을 때:

  • 저장 공간이 4.8배에서 32.7배까지 줄어들었습니다.
  • 결정적으로, 이 모든 데이터를 제거한 후에도 전체 대화 기록을 완벽하게 재구성할 수 있음을 증격했습니다. 탐정의 생각을 재생할 수 있는 "점수"는 정확히 동일하게 유지되었습니다.

이 논문이 부정하는 것들

  • 논문은 "저장 비용이 싸니까" 그냥 무시해도 된다는 생각을 부정합니다. 논문은 저장 공간이 AI를 실행하는 비용(작업이 끝나면 사라지는 비용)과 달리, 시간이 흐르며 축적되는 "지속적인 부채"라고 주장합니다.
  • 표준 파일 카운터가 정확하다는 생각을 부정합니다. 단순한 카운팅은 시스템 코드 내부에 숨겨진 중복을 놓친다는 것을 보여주었습니다.
  • 더 큰 데이터 흔적이 더 나은 결과를 가져온다는 생각을 부정합니다. 데이터는 크기와 성공 사이의 연결 고리가 없음을 보여줍니다.

얼마나 확실한가?

저자들은 자신들이 측정한 측정값에 대해 매우 확신하고 있습니다. 그들은 외부의 간섭이 없는 격리되고 깨끗한 컴퓨터 환경(샌드박스)에서 1,061번의 실험을 수행했습니다. 또한 8가지 서로 다른 프레임워크(LangGraph, CrewAI, AutoGen 등)를 사용하여 동일한 모델과 과제를 테스트했습니다.

그들은 단순히 추측한 것이 아니라 측정했습니다. 동일한 조건 하에서, 가장 잘하는 모델과 가장 못하는 모델 사이의 데이터 잔여량 차이가 15.7배에 달한다는 것을 측정했습니다. 또한 이러한 차이가 시스템이 문제를 해결하는 능력이 더 똑똑해서가 아니라, 데이터를 저장하도록 설계된 방식 때문이라는 점을 입증했습니다.

요약

이 논문은 우리가 AI 에이전트의 속도나 비용을 측정하는 것처럼, 그들의 "발자국(footprint)"도 측정하기 시작해야 한다고 결론짓습니다. 현재 우리는 어떤 시스템이 엄청난 양의 디지털 쓰레기를 남기는 동안 다른 시스템은 거의 남기지 않는 상황을 방치하고 있으며, 결과적으로 지저분한 시스템이 더 똑똑한 것도 아니라는 사실이 밝혀졌습니다.

저자들은 만약 우리가 이 에이전트들을 대규모로 운영하고자 한다면(예: 하루에 10,000대의 로봇 군단), "깨끗한" 프레임워크와 "지저분한" 프레임워크의 차이가 매일 3 GB의 저장 공간을 쓸 것인지, 아니면 51 GB를 쓸 것인지의 차이를 만들 수 있다고 제언합니다. 이는 로봇을 더 똑똑하게 만들지도 않으면서 발생하는 엄청난 차이입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →