← 최신 논문
💬 NLP

Learning What to Share and What to Personalize: Hierarchical Strategy Co-Evolution for Agent Memory

이 논문은 전역적으로 공유되는 메모리 전략과 사용자별 적응형 규칙을 함께 진화시켜, 개인화된 상호작용을 위해 에이전트가 어떤 정보를 유지하거나 폐기할지를 동적으로 최적화하는 계층적 프레임워크인 HiPS를 제안한다.

원저자: Yupeng Han, Shuochen Liu, Kai Zhang, Ze Liu, Zhihong Pan, Xianquan Wang

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yupeng Han, Shuochen Liu, Kai Zhang, Ze Liu, Zhihong Pan, Xianquan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 발전하는 세상에서, 연구자들은 컴퓨터 프로그램이 긴 대화를 나누고 대화 상대방에 대한 세부 사항을 기억할 수 있는 개인 비서 역할을 수행하도록 가르치고 있습니다. 이러한 디지털 에이전트가 진정으로 도움이 되기 위해서는 단순히 현재 나누는 말을 처리하는 것을 넘어, 사용자의 과거 선호도, 감정 상태, 그리고 삶의 사건들을 기억하는 지속적인 프로필을 구축해야 합니다. 그러나 인간의 대화는 수천 번의 차례로 이어질 수 있으며, 이는 어떤 컴퓨터도 한 번에 즉각적인 메모리에 담을 수 없는 방대한 양의 정보를 생성합니다. 과제는 무엇을 남기고 무엇을 잊을 것인지 결정하는 데 있습니다. 만약 에이전트가 너무 적게 기억하면 망각이 심하고 일반적인 수준에 머물게 되며, 너무 많이 기억하면 무관한 세부 사항에 압도되어 중요한 것에 집중하는 능력을 잃게 됩니다. 목표는 에이전트가 대화가 아무리 길게 이어지더라도 일관성과 배려를 가지고 응답할 수 있도록, 한 사람의 역사를 압축적이고 유용한 요약본으로 큐레이션하는 방법을 찾는 것입니다.

오랫동안 이 문제에 대한 표준적인 접근 방식은 모든 사람에게 동일한 단일하고 경직된 규칙 세트를 적용하는 것이었습니다. 마치 사서가 일반 독자든 연구 학자든 상관없이 모든 이용자에게 똑같은 분류 체계를 사용하는 것과 같습니다. 이 "원사이즈-핏-올(one-size-fits-all)" 방식은 흔한 상황에서는 잘 작동하지만, 사용자가 독특한 요구 사항을 갖거나 시간이 흐름에 따라 행동이 변할 때는 실패합니다. 이러한 시스템을 더 똑똑하게 만들기 위한 최근의 시도들은 경험으로부터 배우도록 가르치는 것을 포함했지만, 심지어 이러한 고급 방법들조차 학습이 시작되기 전에 고정된 전략을 설정하거나 모든 사용자를 완전히 동일하게 취급하는 경우가 많았습니다. 그 결과는 종종 평균적인 사용자에게는 만족스럽지만, 대화를 개인적인 느낌이 들게 만드는 미묘한 뉘앙스를 놓쳐 다소 어색하게 느껴지는 응답을 남기는 타협점이 되곤 했습니다.

중국과학기술대학교의 한 연구팀은 이를 해결하기 위한 새로운 방법인 HiPS 프레임워크를 제안했습니다. 모든 사용자를 하나의 틀에 강제로 맞추는 대신, 이들의 시스템은 메모리 관리 작업을 두 부분으로 나눕니다. 즉, 모두에게 적용되는 공유된 기초와 개인에게 특화되어 적응하는 유연한 계층으로 분리하는 것입니다. 이것은 마치 모든 사람이 말하는 보편적인 문법과 당신만이 사용하는 개인적인 방언이 결합된 것과 같습니다. 공유된 부분은 상충하는 사실을 처리하거나 긴 이야기를 요약하는 방법과 같이 정보를 효과적으로 조직하는 방법에 대한 일반적인 원칙을 학습합니다. 그러나 개인적인 부분은 대중과 다르게 행동하는 사용자들을 관찰합니다. 만약 어떤 사용자가 일반적인 규칙이 잘 포착하지 못하는 특정한 상호작용 방식을 가지고 있다면, 시스템은 오직 그 사람만을 위한 맞춤형 지침을 생성합니다.

이 접근 방식이 차별화되는 점은 이러한 규칙들이 정적인 상태가 아니라 에이전트의 성능과 함께 진화한다는 것입니다. 시스템은 에이전트가 자신의 직무를 얼마나 잘 수행하는지 관찰함으로써 자신의 전략을 끊임없이 테스트합니다. 만약 어떤 규칙이 에이전트가 더 나은 답변을 제공하는 데 도움이 된다면, 그 규칙은 더 강력해지고 사용될 가능성이 높아집니다. 만약 어떤 규칙이 혼란이나 오류를 야기한다면, 그 규칙은 약화되거나 폐기됩니다. 이는 공유된 규칙과 개인적인 규칙이 서로 영향을 주고받는 개선의 순환을 만듭니다. 때때로 한 사용자를 위한 개인적인 특이점으로 시작된 규칙이 매우 유용하다고 판단되면, 시스템은 이를 모든 사람이 사용할 수 있는 공유 기초로 승격시킵니다. 반대로, 일반적인 규칙이 특정 유형의 사용자에게 해로운 것으로 드러나면, 시스템은 그 사람을 위한 맞춤형 대안으로 이를 교체합니다. 이러한 역동적인 조정을 통해 메모리 시스템은 효율적이면서도 깊이 있게 개인화된 상태를 유지합니다.

연구진은 다양한 유형의 사용자와 함께하는 길고 복잡한 대화를 시뮬레이션하는 여러 도전적인 벤치마크를 사용하여 이 방법을 기존 시스템들과 비교 테스트했습니다. 이 테스트에서 새로운 프레임워크는 특히 매우 긴 기록이나 소음이 섞인 방해 요소가 있는 상황에서 기존의 다른 방식들을 일관되게 능가했습니다. 128,000 단어의 대화 기록이 포함된 특정 테스트에서, 새 시스템은 62.01의 정확도 점수를 기록하며, 그다음으로 높은 점수인 55.37을 기록한 차순위 방식보다 유의미하게 높은 성과를 냈습니다. 이러한 향상은 시스템이 매우 다양한 성격을 가진 사용자들을 처리해야 할 때 더욱 두드러졌습니다. 예를 들어, 금융 애호가를 대상으로 한 테스트에서 개인화된 계층은 에이전트가 일반적인 시스템이라면 요약해 버렸을 구체적인 투자 세부 사항을 기억하도록 도와, 해당 사용자에 대해 18.6 퍼센트 포인트의 성능 향상을 이끌어냈습니다. 한편, 일반적인 규칙에 의해 요구 사항이 이미 충분히 충족된 사용자들에 대해서는, 시스템은 불필요한 복잡성을 추가하지 않음으로써 성능이 떨어지는 것을 방지했습니다.

이 연구는 또한 시스템이 견고하고 적응력이 높다는 것을 보여주었습니다. 학습된 규칙들은 특정 컴퓨터 모델에 묶여 있지 않고 서로 다른 기반 기술로 전이될 수 있었으며, 이는 발견된 원칙들이 메모리가 어떻게 작동해야 하는지에 대한 근본적인 것임을 시사합니다. 또한, 시스템은 대화이 길어짐에 따라 메모리 크기를 효과적으로 제어하여, 신호를 잃지 않으면서도 노이즈를 효과적으로 걸러낼 수 있음을 증명했습니다. 연구진은 가장 큰 이득이 보편적으로 모든 사용자에게 참인 것과 개인에게 특수한 것을 구별하는 능력에서 온다는 것을 발견했습니다. 이 두 가지 문제를 분리하고 이들이 함께 진화하도록 함으로써, 시스템은 너무 경직되거나 너무 혼란스러운 함정을 피할 수 있었습니다.

결과가 유망하기는 하지만, 연구진은 자신들의 작업이 주로 영어 대화와 특정 유형의 과업에 초점을 맞추고 있다는 점을 언급했습니다. 그들은 이러한 시스템이 며칠이 아닌 몇 년 동안 사용자와 상호작용함에 따라, 한 사람의 성격의 근본적인 본질이 더욱 정교한 업데이트를 필요로 하는 방식으로 변화할 수 있음을 인정합니다. 그럼에도 불구하고, 이 연구는 당신이 누구인지를 진정으로 기억하고, 당신의 이야기를 미리 만들어진 템플릿에 맞추는 것이 아니라 당신의 고유한 이야기에 맞춰 메모리를 적응시키는 에이전트를 구축하기 위한 명확한 경로를 제공합니다. 이 발견은 개인화된 AI의 미래가 모든 것을 암기하는 것이 아니라, 무엇을 공유하고 무엇을 자신을 위해 남겨둘지를 정확히 배우는 데 있다는 것을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →