← 최신 논문
💻 computer science

Tessera: Lossless-First, Vendor-Free Session Compression for Long-Horizon Agent Harnesses

Tessera는 3단계 메모리 시스템을 채택하여 대화 기록을 결정론적으로 재작성하는 동시에 모델 컨텍스트 프로토콜(Model Context Protocol)을 통해 원본 데이터에 대한 검증 가능한 접근을 보존함으로써, 장기적 관점의 LLM 에이전트를 위한 토큰 비용과 지연 시간을 줄여주는 벤더 종속성이 없는 무손실 우선 세션 압축 프록시입니다.

원저자: Mohammad Mosafer

게시일 2026-09-14
📖 6 분 읽기🧠 심층 분석

원저자: Mohammad Mosafer

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 에이전트라고 불리는 특정한 종류의 소프트웨어는 디지털 노동자로서 역할을 수행합니다. 이 에이전트들은 단순히 채팅을 하는 것이 아니라, 도구를 사용하고, 파일을 읽고, 명령어를 실행함으로써 작업을 수행합니다. 이를 위해 그들은 인간의 언어를 이해하고 생성하는 강력한 컴퓨터 프로그램인 대규모 언어 모델에 의존합니다. 그러나 이러한 모델들은 메모리 제한을 가지고 있습니다. 에이전트가 단계를 밟을 때마다, 모델이 지금까지 일어난 일을 알 수 있도록 전체 대화 기록을 모델로 다시 보내야 합니다. 수십 개의 파일과 수백 개의 명령어가 포함된 세션이 길어짐에 따라, 이 기록은 방대해집니다. 이 모든 것을 매번 보내는 것은 느리고 비용이 많이 듭니다.

이를 해결하기 위해 엔지니어들은 두 가지 주요 기술을 시도해 왔습니다. 첫 번째는 가장 오래된 대화 부분을 단순히 잘라내어 가장 최근의 메시지만 유지하는 것입니다. 이는 공간을 절약하지만, 에이전트가 나중에 필요할 수도 있는 비밀번호나 파일 위치와 같은 중요한 사실을 삭제할 위험이 있습니다. 두 번째 기술은 모델에게 오래된 부분들을 더 짧은 이야기로 요약하도록 요청하는 것입니다. 이 또한 위험한데, 요약 과정에서 중요한 세부 사항을 놓치거나 새로운 내용을 지어낼 수 있으며, 그 요약이 정확한지 확인할 방법이 없기 때문입니다. 두 방법 모두 비용을 아낄 것인지 아니면 진실을 유지할 것인지에 대한 선택을 강요합니다.

모하마드 모사페르(Mohammad Mosafer)라는 연구자는 이러한 선택을 거부하는 다른 접근 방식을 제안했습니다. 그는 에이전트와 모델 사이에서 스마트한 중개자 역할을 하는 테세라(Tessera)라는 시스템을 구축했습니다. 테세라는 대화를 삭제하거나 짧은 이야기로 다시 쓰는 대신, 정확한 복사본과 유사한 중복 항목을 찾아 제거함으로써 대화를 압축합니다. 이 시스템은 원본 텍text를 별도의 저장 공간에 안전하게 보관하고, 메인 대화에서는 반복되는 부분을 작고 정밀한 포인터로 대체합니다. 만약 에이전트가 이전의 텍스트를 다시 보고 싶다면, 시스템은 즉시 원본을 검색하여 가져올 수 있습니다. 이 방식은 에이전트가 사실을 잃거나 특정 회사의 기술에 의존하지 않고도 훨씬 짧은 대화 기록을 가지고 작업할 수 있게 해줍니다.

문제의 핵심은 이러한 에이전트들이 작동하는 방식에 있습니다. 에이전트가 명령을 실행하면 그 결과값을 얻습니다. 만약 동일한 명령을 다시 실행한다면, 종종 정확히 똑같은 결과를 얻게 됩니다. 긴 세션 동안 에이전트는 동일한 로그 파일을 여러 번 읽거나 동일한 상태를 반복해서 확인할 수 있습니다. 에이전트는 전체 기록을 매번 전송하기 때문에, 동일한 큰 텍스트 블록을 계속해서 반복해서 보내게 됩니다. 테세라는 이러한 반복을 감지합니다. 테세라는 대화 기록을 스캔하여 텍스트 조각이 이전에 보냈던 것과 동일한지 식별합니다. 텍스트 전체를 다시 보내는 대신, "이것은 세 단계 전의 텍스트와 동일함"이라고 말하는 짧은 표식을 보냅니다. 모델은 여전히 이 표식을 읽고 문맥을 이해할 수 있지만, 전송되는 데이터의 양은 획기적으로 줄어듭니다.

테세라는 단순히 똑같은 복사본을 찾는 것에 그치지 않습니다. 또한 몇 단어만 바뀐 로그 파일처럼 거의 동일한 텍스트도 찾아냅니다. 이러한 유사 중복 항목을 발견하면, 전체 파일을 보내는 대신 변경된 부분만을 설명하는 작은 노트를 보냅니다. 또한 긴 숫자 리스트나 코드와 같은 대규모 데이터 블록의 경우, 불필요한 서식을 제거하고 필수적인 구조만을 유지하여 처리합니다. 이 모든 과정은 대규모 언어 모델을 사용하여 의사결정을 내리지 않고 이루어집니다. 시스템은 단순하고 결정론적인 규칙을 사용하며, 이는 동일한 입력에 대해 항상 동일한 결과를 생성함을 의미합니다. 이는 프로세스를 빠르고 신뢰할 수 있게 만들며, 메시지를 보내는 데 걸리는 시간에 단 몇 밀리초만을 추가합니다.

이 시스템이 실제로 작동하는지 테스트하기 위해, 연구자는 통제된 환경을 구축했습니다. 그는 JSON 응답, 서비스 로그, 명령어 출력값 등 현실적인 데이터로 가득 찬 가짜 에이전트 세션을 생성하는 생성기를 만들었습니다. 그리고 이 세션들 속에 무작위 위치에 무작위 코드나 특정 설정값과 같은 구체적이고 고유한 사실들을 심어 놓았습니다. 그 후 세션을 테세라를 통해 실행하고, 이 심어진 사실들이 압축된 기록 속에 얼마나 살아남았는지 측정했습니다. 그는 이를 단순히 오래된 메시지를 잘라내거나 가장 최근의 메시지만 유지하는 다른 방법들과 비교했습니다. 결과는 명확했습니다. 시스템이 대화를 원래 크기의 약 29%로 압축했을 때, 메인 기록 속에 61.8%의 사실이 유지되었습니다. 반면, 동일한 공간을 유지하도록 강제된 다른 방법들은 약 26~30%의 사실만을 유지했습니다.

이 시스템에는 정보가 필요할 때 누락된 정보를 다시 가져오는 방법도 포함되어 있습니다. 이것을 '리콜 티어(recall tier)'라고 부릅니다. 만약 에이전트가 대화의 오래된 부분에 대해 구체적인 질문을 던지면, 시스템은 원본 텍스트의 안전한 저장소를 검색하여 정확한 구절을 가져올 수 있습니다. 이 기능이 사용될 때, 시스템은 메인 압축 기록에는 없었음에도 불구하고 99.5%의 사실을 복구할 수 있습니다. 이는 에이전트가 매우 작고 효율적인 기록을 가지고 작업하면서도 필요할 때는 언제든 상세한 내용을 확인할 수 있음을 의미합니다. 연구자들은 이 복구가 과거 사건의 문맥을 기억하고 있을 때 가장 잘 작동하지만, 모호한 질문을 통해서도 잘 작동한다는 것을 발견했습니다.

연구는 또한 서로 다른 유형의 에이전트들이 어떻게 행동하는지도 살펴보았습니다. 소프트웨어 버그를 수정하도록 설계된 일부 에이전트들은 명령을 반복하고 동일한 결과를 보는 경향이 있습니다. 이러한 에이전트들의 경우, 시스템은 대화의 거의 15%가 정확한 중복임을 발견했습니다. 다른 모델을 사용하는 에이면서 반복이 드문 에이전트들도 있었습니다. 시스템은 두 상황 모두에 적응하여, 반복이 많든 적든 상관없이 작동한다는 것을 증명했습니다. 시스템은 단순히 존재하는 것을 제거할 뿐입니다. 데이터를 압축하는 데 걸리는 시간은 무시할 수 있는 수준으로, 요청당 8밀리초 미만이 소요되었으며, 이는 모델이 응답을 생성하는 데 걸리는 시간보다 훨씬 짧습니다.

가장 중요한 발견 중 중 하나는 이 방법이 정확성을 포기할 필요가 없다는 점입니다. 요약과 달리, 요약은 세부 사항을 놓치거나 의미를 바꿀 수 있지만, 테세라는 모든 원본 바이트를 안전하게 보관합니다. 만약 공간을 절약하기 위해 어떤 사실이 메인 뷰에서 제거되었다 하더라도, 그것은 사라진 것이 아닙니다. 단지 언제든 열 수 있는 핸들 뒤에 숨겨져 있을 뿐입니다. 이는 시스템을 완전히 감사 가능하게 만듭니다. 엔지니어는 압축된 기록을 보고 무엇이 제거되었고 원본을 어디에서 찾을 수 있는지 정확히 알 수 있습니다. 이는 모델이 무엇이 중요한지 추측하도록 만드는 현재의 방식과는 확연히 다른, 검증 가능한 변화입니다.

연구자들은 이 시스템을 여러 가지 메모리 관리 방식과 비교 테스트했습니다. 그들은 가장 최근의 메시지만 유지하는 방식(일반적인 관행)이 사실을 유지하는 데 가장 효과가 낮다는 것을 발견했습니다. 무작위로 메시지를 유지하는 방식이 오래된 메시지를 잘라내는 것보다는 성능이 좋았지만, 여전히 테세라의 정밀함을 따라잡을 수 없었습니다. 테세라의 성공 비결은 메시지 전체를 버리는 것이 아니라, 메시지 내부의 '군더더기'를 쳐내어 긴 텍스트의 머리와 꼬리는 남기고 중간 부분을 포인터로 대체하는 데 있습니다. 이를 통해 에이전트는 대화의 문맥을 유지하면서도 데이터의 부피를 줄일 수 있습니다.

연구는 또한 시스템 설정에 얼마나 민감한지도 조사했습니다. 연구자들은 무엇을 중복으로 간주할지, 그리고 얼마나 많은 최근 메시지를 압축으로부터 보호할지에 대한 규칙을 조정했습니다. 그들은 시스템이 견고하다는 것을 발견했습니다. 규칙을 약간 변경해도 성능이 급락하지 않았습니다. 시스템은 약 70%의 데이터를 지속적으로 절약하면서도 중요한 사실의 대부분을 유지했습니다. 이러한 안정성은 이 시스템이 지속적인 조정 없이도 실제 애플리케이션에서 사용될 수 있음을 시사합니다.

결론적으로, 이 연구는 진실을 잃지 않으면서도 에이전트의 대화를 훨씬 짧게 만드는 것이 가능하다는 것을 보여줍니다. 대화 기록을 요약하거나 잘라내야 하는 '이야기'로 취급하는 대신, 압축하고 검색할 수 있는 '데이터의 집합'으로 취급함으로써, 시스템은 이전에는 트레이드오프(절충)가 필요하다고 여겨졌던 수준의 효율성을 달 achieve 했습니다. 에이전트는 메모리가 부족해지거나 과도한 데이터 전송 비용을 지불하지 않고도 훨씬 더 길고 복잡한 작업을 수행할 수 있습니다. 또한 이 시스템은 특정 모델 제공자에 종depent하지 않으므로, 이러한 에이전트들의 표준 언어를 사용하는 어떤 도구와도 함께 사용할 수 있습니다.

연구자들은 이 테스트가 합성 데이터, 즉 실제 인간의 사용 기록이 아닌 컴퓨터에 의해 생성된 세션으로 수행되었음을 인정합니다. 그들은 실제 환경에서 시스템이 어떻게 작동하는지 확인하기 위해 실제 에이전트 궤적(trajectories)에 대한 테스트를 계획하고 있습니다. 또한 현재 시스템은 중복을 제거하는 데는 탁ex월하지만, 대화의 더 깊은 의미를 이해하는 단계는 아직 갖추지 못했다고 언급했습니다. 향러 버전에서는 수행 중인 작업에 따라 어떤 부분이 가장 중요한지 식별하는 계층을 추가할 수 있습니다. 그러나 현재의 시스템은 견고한 토대를 제공합니다. 이는 세심한 엔지니어링을 통해 에이전트 작업의 전체 기록을 유지하면서도 데이터의 극히 일부만을 전송하여, 어떤 사실도 결코 잃어버리지 않도록 할 수 있음을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →