← 최신 논문
🤖 AI

Authorization Before Context: A Model-Neutral Audience Boundary Against Cross-Audience Memory Leakage in Agentic Systems

이 논문은 모델의 행동이나 오염된 입력과 관계없이 더 좁은 범위의 청중을 위해 기록된 사실이 더 넓은 범위의 청중에게 노출되지 않도록 보장하기 위해, 메모리에서 컨텍스트로 전환되는 시점에 엄격한 청중 멤버십 규칙을 강제함으로써 에이전트 시스템 내에서의 교차 청중 메모리 유출을 방지하는 모델 중립적 보안 불변량인 "컨텍스트 전 권한 부여(authorization before context)"를 제안한다.

원저자: Sibo Liu

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sibo Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

절대로 잊는 법이 없는 개인 비서를 상상해 보십시오. 이 디지털 조력자는 당신의 사적인 대화를 경청하고, 친구들과의 단체 채팅방을 기억하며, 업무 회의의 세부 사항을 저장합니다. 이 비서는 적절한 정보를 적시에 불러와 메시지 초안을 작성하거나 질문에 답할 수 있도록 설계되어 매우 유용합니다. 하지만 바로 이 강점이 위험한 약점을 만들어냅니다. 만약 비서가 당신과 친구가 단둘이 있을 때 들은 비밀을 학습한다면, 나중에 상사가 그 정보가 필요해 보이는 질문을 하더라도 그 비밀을 실수로 상사에게 속삭여서는 안 됩니다. 위험은 비서가 생각을 구축하는 방식에 있습니다. 비서가 말을 하기 전, 비서는 자신의 뇌에 입력할 메모와 기억의 모음을 수집합니다. 만약 비서가 당신과 친구 사이의 사적인 메모를 가져와 상사에게 보내는 메시지에 슬쩍 끼워 넣는다면, 비밀은 새 나가게 됩니다. 피해는 비서가 문장을 형성하기도 전, 즉 그 메모가 포함되는 순간 이미 발생합니다.

이것이 바로 한 새로운 연구가 다루고 있는 구체적인 문제입니다. 즉, 스마트 비서가 실수로 사적인 기억을 엉뚱한 사람에게 공유하는 것을 어떻게 막을 것인가 하는 점입니다. 연구진은 비서가 메모를 수집하는 바로 그 순간에 집중합니다. 그들은 정보가 비서의 작업 기억(working memory)에 들어오기 전, 입구에서 역할을 하는 단순하고 엄격한 규칙을 제안합니다. "이 메모가 도움이 되는가?" 또는 "질문과 일치하는가?"라고 묻는 대신, 시스템은 단 하나의 단호한 질문을 던집니다. "이 메시지가 처음 작성되었을 때, 이 메시지를 듣고 있던 모든 사람이 현재 대화에 참여하고 있는가?" 만약 답이 '예'라면, 그 메모는 허용됩니다. 만약 현재 대화에 참여 중인 사람 중 단 한 명이라도 메모가 생성될 당시 그 자리에 없었다면, 그 메모는 즉시 차단됩니다. 이 규칙은 파티가 시작되기도 전에 게스트 리스트를 확인하는 보안 요원처럼 작동하여, 사적인 정보가 속하지 않은 곳으로 넘어가는 것을 원천 봉쇄합니다.

연구진은 실제 세상의 혼란과 속임수를 모방하도록 설계된 컴퓨터 시뮬레이션을 사용하여 이 아이디어를 테스트했습니다. 그들은 단순한 일대일 채팅부터 참가자가 불분명하거나 변동되는 복잡한 그룹 대화에 이르기까지 79가지의 서로 다른 상황을 만들었습니다. 모든 경우에 대해, 그들은 시스템이 비밀을 유출하도록 유도하는 시도를 했습니다. 예를 들어, 두 사람 사이의 사적인 채팅에서 작성된 메모를 세 사람이 참여하는 그룹 채팅에서 사용하도록 시도했습니다. 또한 악의적인 행위자가 사적인 대화 속에 가짜 메모를 심어 넣어 그것이 나중에 공개적인 장소에 나타나도록 유도하는 시나리오도 시뮬레이션했습니다. 79번의 시도 모두에서 엄격한 규칙은 견고하게 유지되었습니다. 단 하나의 금지된 사실도 비서의 작업 메모에 들어가지 못했습니다. 시스템은 모든 승인되지 않은 정보를 성공적으로 차단했으며, 이는 이 규칙이 운이 아니라 설계에 의해 작동함을 증명했습니다.

이 접근 방식이 다른 점은 인공지능의 '주의력'에 의존하지 않는다는 것입니다. 현재의 많은 시스템은 AI가 실수를 인지하고 사적인 내용을 말하기를 거부하거나, 최종 답변에서 민감한 단어를 삭제하도록 수정하는 방식으로 사후 처리를 시도합니다. 하지만 연구진은 이것이 너무 늦다고 주장합니다. 이미 사적인 정보가 AI의 뇌에 노출되었기 때문입니다. 그들의 방법은 AI가 금지된 메모를 보기도 전에 유출을 차단합니다. 그들은 비서의 기억을 잠긴 상자들의 집합으로 취급하며, 각 상자에는 그 내용물이 담길 당시 현장에 있었던 특정 그룹이 라벨로 붙어 있습니다. 시스템은 현재의 그룹이 라벨과 정확히 일치할 때만 상자를 엽니다. 만약 그룹이 더 크거나 다르다면, 상자는 닫힌 상태로 유지됩니다. 이를 통해 작은 집단에서 공유된 비밀이 실수로 더 큰 군중에게 흘러나가는 것을 방지하며, 사적인 대화에 심어진 가짜 메모가 공적인 대화로 퍼지는 것도 막아줍니다.

또한 연구는 시스템이 누가 듣고 있는지 확신하지 못할 때 어떤 일이 발생하는지도 조사했습니다. 현실 세계에서는 기술이 대화에 참여 중인 인원을 정확히 식별하지 못하는 경우가 종의 있습니다. 연구진은 이러한 순간에 시스템이 극도로 신중하도록 프로그래밍했습니다. 만약 시스템이 현재의 청중을 명확히 식별할 수 없다면, 최악의 시나리오를 가정합니다. 즉, 청중이 '모두'라고 간주하는 것입니다. 이는 시스템이 오직 전 세계에 공개된 정보만을 보여주게 함으로써 모든 사적인 메모를 숨기게 만듭니다. 이러한 '페일 세이프(fail-safe)' 동작은 불확실성이 유출로 이어지지 않도록 보장합니다. 연구진은 이 규칙이 메모가 단순한 목록이든, 요약본이든, 혹은 복잡한 연결망 형태이든 상관없이 다양한 유형의 메모 저장 방식에서도 일관되게 작동함을 확인했습니다. 모든 경우에 있어, 규칙은 일관된 장벽 역할을 하며 승인되지 않은 정보가 비서의 시야에 들어오는 것을 방지했습니다.

결과는 유망하지만, 연구진은 자신들의 결과가 통제된 합성 환경에서 도출된 것임을 주의 깊게 언급합니다. 그들은 실제 인간 사용자가 참여하는 실제 비서나 실시간 대화를 대상으로 테스트하지 않았습니다. 테스트는 규칙이 완벽하게 준수되는 디지털 실험장이었습니다. 이 시스템이 실제의 무질서하고 예측 불가능한 현실 세계에서도 완벽하게 작동하는지, 혹은 발생 가능한 모든 종류의 기만술을 처리할 수 있는지는 아직 입증되지 않았습니다. 그러나 핵심 아이디어, 즉 정보를 수집하기 전에 권한을 확인하는 규칙을 바꿈으로써 설계 단계에서부터 메모 유출을 막을 수 있다는 점은 그들이 시도한 모든 시나리오에서 입증되었습니다. 이 연구는 문제가 발생한 후 수정하는 것이 아니라, 정보를 수집하기 전의 권한 확인 방식을 변경함으로써, 사적인 기억을 원래 있어야 할 곳에 정확히 머물게 하는, '기본 설정으로서의 프라이버시'를 존중하는 비서를 구축할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →