Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems
이 논문은 세 가지 에이전트 메모리 시스템의 서빙 비용과 정확도를 표준 전략들과 벤치마킹하여, 비용이 대화 길이뿐만 아니라 내부 시스템 동작에 의해 결정되며, 백본과 시스템에 따라 크게 달라지고, 단일 솔루션이 비용과 정확도 모두를 최적화할 수 없는 트레이드오프 관계가 존재함을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 아주 똑똑하지만 약간 건망증이 있는 로봇 친구와 대화하고 있다고 상상해 보세요. 당신은 몇 주 동안 이야기를 나누며 추억, 계획, 그리고 비밀들을 공유해 왔습니다. 이제 당신은 "우리 3주 전에 이야기했던 그 피자 가게 기억나?"라고 묻고 싶습니다. 만약 로봇에게 기억력이 없다면, 당신은 질문 하나를 던질 때마다 첫날부터 시작된 당신의 우정 전체 이야기를 매번 다시 들려줘야 합니다. 이것은 마치 질문 하나를 하기 위해 지금까지 당신이 했던 모든 말을 담은 거대하고 무거운 배낭을 메고 가는 것과 같습니다. 이 방식이 작동은 하겠지만, 매우 무겁고 느리며 비용이 많이 들게 됩니다.
이를 해결하기 위해 엔지니어들은 이 로봇들을 위한 "메모리 시스템"을 만들었습니다. 로봇은 무거운 배낭을 통째로 들고 다니는 대신, 특별한 노트에 작은 메모, 사실, 또는 요약본을 적어둡니다. 당신이 질문을 하면, 로봇은 그저 알맞은 페이지를 넘겨 메모를 읽기만 하면 됩니다. 이것은 완벽해 보입니다. 더 가볍고, 빠르고, 저렴하니까요. 하지만 여기 함정이 있습니다. 메모를 쓰고, 정리하고, 알맞은 페이지를 찾는 데도 작업이 필요합니다. 여기서 중요한 질문은, 로봇이 노트를 사용하는 것으로 돈을 아끼게 될까요, 아니면 노트를 관리하는 비용이 단순히 무거운 배카를 메고 다니는 것보다 더 비싸지게 될까요? 이 논문은 이 메모리 기술들이 실제로 그만한 가치가 있는지 확인하기 위해, 실질적인 비용을 측정하며 이 미스터리를 파헤칩니다.
위대한 메모리 비용의 대결
이 연구에서 연구진은 챗봇의 기억을 유지하는 데 실제로 얼마나 많은 비용이 드는지 알아보기 위해 거대한 경주를 설정했습니다. 그들은 단순히 추측한 것이 아니라, 세 가지 서로 다른 "메모리 시스템"(노트를 정리하는 세 가지 다른 방식이라고 생각하세요)인 Mem0, Hindsight, Mastra Observational Memory를 사용하여 통제된 실험을 수행했습니다.
테스트의 공정성을 보장하기 위해, 이들은 두 가지 극단적인 전략과 비교했습니다:
- "롤링 윈도우(Rolling Window)" (저렴한 기준점): 이것은 마치 당신이 말한 마지막 10가지만 기억하는 것과 같습니다. 매우 저렴하지만 그 외의 모든 것은 잊어버립니다.
- "전체 대화 기록(Full Transcript)" (비싼 기준점): 이것은 "무거운 배낭" 방식입니다. 당신이 질문을 할 때마다, 로봇은 첫 단어부터 시작된 대화의 전체 역사를 다시 읽습니다.
그들은 이 시스템들을 최대 400턴(즉, 400번의 주고받는 메시지)의 대화에 적용하여 실행했으며, 로봇이 정말로 올바른 것들을 기억하는지 확인하기 위해 665개의 특정 질문을 테스트했습니다. 또한, 로봇의 "두뇌(백본 모델)" 유형에 따라 비용이 달라지는지 확인하기 위해 두 가지 서로 다른 "두뇌"를 테스트했습니다.
놀라운 발견: 가격표를 예측할 수 없다
첫 번째 큰 발견은, 대화의 길이 나 메시지의 크기만 보고 비용을 예측할 수 없다는 것입니다. 연구진은 대화 길이와 메시지 크이를 바탕으로 비용을 예측하는 간단한 수학 공식을 만들어 보려고 시도했습니다.
- "전체 대화 기록" 및 "롤링 윈도우" 전략의 경우, 수학적 계산이 완벽하게 들어맞았습니다. 당신이 몇 단어를 보냈는지 알면 정확히 비용이 얼마인지 알 수 있습니다.
- 메모리 시스템의 경우, 수학적 계산이 처참하게 실패했습니다. 공식은 실제 비용을 18%에서 69%까지 놓쳤습니다.
왜 그럴까요? 메모리 시스템의 비용은 단순히 당신이 얼마나 많이 말하느냐에 달려 있는 것이 아니라, 당신이 말하는 동안 시스템이 내부적으로 무엇을 하고 있느냐에 달려 있기 때문입니다. 어떤 때는 시스템이 긴 요약본을 작성하기로 결정하고, 어떤 때는 짧은 사실 하나만 가져옵니다. 어떤 때는 노트 전체를 재정리하기도 합니다. 이러한 내부적인 결정은 단순히 메시지의 길이가 아니라 대화의 '내용'에 의해 유도됩니다. 이는 마치 운전자가 맛있는 점심을 먹으러 들를지 아니면 그냥 그래놀라 바 하나를 집어 먹을지 모르는 상태에서, 지도만 보고 자동차 여행 비용을 예측하려고 하는 것과 같습니다. "점심 식사"(내부 처리)는 매우 다양하게 변하기 때문에, 총 청구 금액은 예측 불가능합니다.
"손익분기점": 언제 노트가 효과를 발휘하는가?
연구진은 결정적인 질문을 던졌습니다: 어느 시점이 되어야 메모리 시스템을 사용하는 것이 전체 기록을 다시 읽는 것보다 저렴해질까요?
답은 이렇습니다: 그것은 전적으로 시스템과 로봇의 두뇌에 달려 있습니다.
- Mastra Observational Memory는 속도형이었습니다. 어떤 경우에는 첫 번째 턴(Turn 0)부터 "전체 대화 기록" 방식보다 저렴했습니다.
- Mem0는 조금 더 시간이 걸렸는데, 보통 메시지가 어느 정도 길 때 82번째 턴(Turn 82) 즈음에 손익분기점에 도달했습니다.
- Hindsight는 가장 느렸습니다. 많은 경우, 400턴이 지나도 "전체 대화 기록" 방식보다 저렴해지지 않았습니다. 실제로 일부 설정에서는 테스트가 끝날 때까지도 여전히 더 비쌌습니다.
이는 만약 대화가 짧다면, 복잡한 메모리 시스템을 사용하는 것이 단순히 전체 대화 기록을 다시 보내는 것보다 오히려 더 많은 비용이 들 수 있음을 의미합니다. 메모리 시스템이 돈을 아껴주기 시작하려면 반드시 일정 시간 동안 대화를 나누어야 하는 "손익분기점"을 지나야 합니다.
정확도 vs 비용: 공짜 점심은 없다
연구진은 또한 메모리 시스템이 질문에 답변하는 능력이 실제로 좋은지도 확인했습니다. 결과는 넓은 범위의 성능을 보여주었습니다:
- 정확도는 21%에서 54% 사이였습니다.
- Mem0는 정확도의 변동 폭이 가장 컸는데, 어떤 로봇 두뇌에서는 잘 작동했지만 다른 두뇌에서는 성능이 저조했습니다.
- Hindsight는 일반적으로 가장 정확했지만(종종 50% 이상), 실행 비용도 가장 높았습니다.
- Mastra는 중간 정도의 성능을 보였지만, 정답 개수를 고려했을 때 종종 가장 가성비가 좋았습니다.
연구진은 로봇의 "두뇌(백본 모델)" 선택이 메모리 시스템의 선택만큼이나 중요하다는 것을 발견했습니다. 한 로봇 두뇌에서는 저렴했던 메모리 시스템이 다른 로보 두뇌에서는 비쌀 수 있었습니다.
최종 결론
이 논문은 단 하나의 "최고의" 메모리 시스템은 존재하지 않는다고 결론짓습니다.
- 특정 로봇 두뇌에 대해 정답 하나당 가장 저렴한 옵션을 원한다면, gpt-oss-20b 두뇌를 사용하는 Mastra가 승자였습니다 (100턴 기준 정답당 약 $0.028 소요).
- 만약 다른 로봇 두뇌(Gemma 4 26B A4B)를 사용한다면, Mem0가 가장 저렴한 옵션이 됩니다.
- Hindsight는 정확하긴 하지만, 대화가 매우 길지 않은 이상 사용하기에는 너무 비싼 경우가 많습니다.
주요 교훈은, 단순히 멋져 보인다고 해서 메모리 시스템을 고르면 안 된다는 것입니다. 당신의 구체적인 상황을 살펴봐야 합니다: 대화가 얼마나 길어질 것인가? 메시지의 크기는 어느 정도인가? 그리고 어떤 로봇 두뇌를 사용하고 있는가? 그래야만 메모리 시스템이 돈을 아껴줄지, 아니면 청구서에 비용을 더할지 알 수 있습니다. 메모리 시스템의 "완전한 회상"에는 비용이 따르며, 그 비용은 단순히 당신이 입력하는 단어 수를 세는 것보다 훨씬 더 복잡합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.