← 최신 논문
🤖 AI

Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay

이 논문은 가공되지 않은 화면 활동을 압축되고 감사 가능한 메모리 블록으로 컴파일하여, 에이전트가 LLM 요약보다 훨씬 높은 정확도로 과거 사용자 행동에 관한 질문에 답할 수 있게 함과 동시에, 에이전트 위임 비용을 최적화하기 위한 일상적인 오버헤드와 재발성에 대한 첫 번째 실증적 측정을 제공하는 결정론적 제로 모델 파이프라인인 "Activity Frames"를 소개한다.

원저자: Nossa Iyamu

게시일 2026-08-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nossa Iyamu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 당신의 일상을 돕도록 똑똑한 로봇 비서에게 가르치고 있다고 상상해 보세요. 당신은 로봇이 단순히 당신의 음성 명령, 예를 들어 "이메일 보내줘"나 "내 일정 확인해줘" 같은 말을 듣기만 하면 된다고 생각할 수도 있습니다. 하지만 큰 문제가 하나 있습니다. 로봇은 당신이 '말하는 것'은 들을 수 있지만, 당신이 실제로 '무엇을 하는지'는 알 수 없다는 점입니다. 만약 당신이 세 시간 동안 스프레드시트를 쳐다보고, 20개의 서로 다른 웹사이트를 오가며, 미친 듯이 타이핑을 했다면, 당신이 직접 말해주지 않는 한 로봇은 그런 일이 일어났다는 사실을 전혀 알 수 없습니다. 이것이 바로 "AI 에이전트(AI agents)"의 세계입니다. 즉, 인간처럼 행동하도록 설계된 컴퓨터 프로그램이죠. 이 에이전트들이 진정으로 도움이 되려면 "에피소드 기억(episodic memory)"이 필요합니다. 이는 단지 무엇이, 언제, 무엇을 보며 일어났는지에 대한 기록이라는 뜻입니다. 이것이 없다면, 로봇은 당신의 대화는 기억하지만 당신의 실제 삶에 대해서는 기억상실증에 걸린 친구와 같습니다.

연구자들이 던지는 핵심 질문은 이것입니다: 어떻게 하면 로봇을 혼란스럽게 만들거나, 비용을 많이 들게 하거나, 신뢰할 수 없게 만들지 않으면서 당신의 화면 활동에 대한 기억을 갖게 할 수 있을까? 현재 일부 방식은 다른 AI 모델을 사용하여 당신의 하루를 요약하려고 시도하지만, 그러한 요약본은 엉망이 되거나, 물을 때마다 내용이 바뀌거나, 심지어 없는 사실을 지어내기도 합니다. 또 다른 방식은 방대한 양의 가공되지 않은 데이터를 쏟아붓는데, 이는 로봇이 읽기에 너무 거대합니다. 우리는 중간 지점을 찾아야 합니다. 즉, 당신의 혼란스러운 화면 시간을 로봇이 실제로 사용할 수 있는 깨끗하고, 신뢰할 수 있으며, 아주 작은 요약본으로 바꾸는 방법 말입니다.

이 논문은 "액티비티 프레임(Activity Frames)"이라는 영리한 해결책을 소개합니다. 이것은 당신의 화면을 지켜보는 매우 체계적인 사서라고 생각하면 됩니다. 다만, 이 사서는 무엇을 하고 있는지 추측하기 위해 뇌를 사용하는 대신, 엄격하고 변하지 않는 규칙 세트를 사용하여 당신의 하루를 분류합니다. 연구진은 하루 치의 화면 스냅샷을 가져와 이를 깔끔하고 구조화된 이야기로 엮어내는 시스템을 구축했습니다. 이 시스템은 무슨 일이 일어났는지 '생각'하기 위해 AI를 사용하지 않고, 그저 레시피를 따를 뿐입니다. 레시피를 따르기 때문에, 동일한 과정을 두 번 실행한다면 결과는 항상 정확히 일치합니다. 이 덕분에 결과물은 저장하기 안전하고, 검증하기 쉬우며, 로봇의 주머니에 쏙 들어갈 만큼 작습니다.

연구팀은 자신의 컴퓨터를 통해 51일 동안 이를 테스트했습니다. 그들은 이 "결정론적(deterministic)" 방식(즉, 추측이 개입되지 않는 방식)이 하루 치의 원시 데이터를 원래 크기보다 86배 더 작게 줄인다는 것을 발견했으며, 이 과정은 눈 깜빡임보다 빠른 단 68밀리초 만에 이루어졌습니다. 이 새로운 "액티비티 프레임" 기억을 사용하여 AI 에이전트에게 하루에 대한 질문에 답하도록 요청했을 때, 에이전트는 **98.4%**의 확률로 정답을 맞혔습니다. 이와 대조적으로, 에이전트가 다른 AI가 작성한 요약본을 읽으려고 했을 때는 정답률이 66%에서 80% 사이였습니다. 이 새로운 방식은 매우 훌륭해서, 더 작고 저렴한 AI 모델이 이 깨끗한 기억을 제공받았을 때 거대하고 비싼 모델만큼이나 잘 답변할 수 있었습니다.

또한 이 논문은 이 시스템을 사용하여 "루틴 오버헤드 비율(Routine Overhead Ratio)"이라는 것을 측정합니다. 로봇에게 이미 백 번이나 해본 일을 시킨다고 가정해 봅시다. 만약 로봇이 매번 모든 클릭과 키 입력 하나하나를 처음부터 다시 파악해야 한다면, 엄청난 양의 에너지와 비용을 낭비하게 될 것입니다. 연구진은 이 컴파일된 기억을 사용하여 이러한 루틴을 재현함으로써, 로봇이 엄청난 노력을 아낄 수 있다는 것을 발견했습니다. 그들은 루틴을 처음부터 다시 도출하는 비용이 기록된 스크립트를 단순히 재생하는 것보다 약 60배에서 343배 더 많이 든다고 계산했습니다. 또한, 사람이 컴퓨터에서 취하는 행동 중 약 **9%**가 로봇에게 맡겨져 자동으로 처리될 수 있는 반복 가능한 루틴의 일부라는 점도 측정했습니다.

하지만 이 논문은 이것이 무엇이 아닌지에 대해서도 주의 깊게 명시하고 있습니다. 이 시스템은 당신이 '왜' 그런 행동을 했는지(당신의 의도)를 알려고 하는 것이 아니라, 단지 '무엇을' 했는지만을 압니다. 또한, 데이터가 단 한 사람의 컴퓨터에서 나왔기 때문에, 이것은 최종적인 보편적 규칙이라기보다는 하나의 개념 증명(proof of concept)임을 인정합니다. "재생(replay)" 부분은 통제된 환경에서 테스트되었으며, 화면이 완전히 동일할 때는 완벽하게 작동하지만, 웹사이트의 레이아웃이 변경되면 실수할 수 있음을 보여주었습니다. 연구진은 이것이 모든 AI 문제를 해결하는 마법 지팡이가 아니라, 혼란스러운 화면 데이터를 AI가 신뢰하고 사용할 수 있는 형태로 바꿔주는 견고하고, 단순하며, 신뢰할 수 있는 도구라는 점을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →