← 최신 논문
💬 NLP

MosaicLeaks:Privacy Risks in Querying-in-the-Open for Deep Research Agents

이 논문은 딥 리서치 에이전트가 모자이크 효과로 인해 외부 쿼리를 통해 개인적인 로컬 정보를 빈번하게 유출한다는 것을 보여주는 벤치마크인 MosaicLeaks를 소개하며, 이러한 유출을 효과적으로 줄이는 동시에 작업 정확도를 향상시키는 프라이버시 인식형 딥 리서치(PA-DR) 프레임워크를 제안한다.

원저자: Alexander Gurung, Spandana Gella, Alexandre Drouin, Issam H. Laradji, Perouz Taslakian, Rafael Pardinas

게시일 2026-06-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alexander Gurung, Spandana Gella, Alexandre Drouin, Issam H. Laradji, Perouz Taslakian, Rafael Pardinas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 비밀 기업에서 일하는 숙련된 탐정이라고 상상해 보십시오. 당신의 임무는 개인 사무실 파일에서 찾은 단서와 공공 인터넷에서 수집한 정보를 결합하여 복잡한 미스터리를 해결하는 것입니다.

"MosaicLeaks"라는 논문은 이러한 탐정 요원(AI 모델)들이 작동하는 방식에 숨겨진 놀랍고도 위험한 결함을 밝혀냈습니다. 설령 그들이 비밀을 입 밖으로 내뱉지 않더라도, 인터넷에 질문을 던지는 방식 자체가 의도치 않게 비밀을 누설할 수 있다는 점입니다.

다음은 이 논문의 발견을 쉬운 비유를 사용하여 정리한 내용입니다.

1. 문제점: "모자이크" 효과

당신이 비밀 레시피를 숨기려 한다고 상상해 보십시오.

  • 기존 방식: "레시피를 적어두지 않으면 안전할 거야"라고 생각할 수 있습니다.
  • 새로운 위험: 레시피를 적는 대신, 당신은 공공 도서관에 가서 다음과 같은 일련의 질문을 던집니다.
    1. "표준 케이크에는 설탕이 얼마나 들어가는가?"
    2. "설탕 200g이 들어간 케이크의 굽는 온도는?"
    3. "특정 향료와 설탕 200g이 들어간 케이크를 발명한 사람은 누구인가?"

개별적인 질문들은 무해해 보입니다. 하지만 만약 스파이가 당신의 질문 전체 목록을 지켜본다면, 그들은 이 질문들을 조각처럼 맞추어 당신의 비밀 레시피를 재구성할 수 있습니다.

이것을 **모자이크 효과(Mosaic Effect)**라고 부릅니다. AI의 세계에서, 이러한 "탐정들"(딥 리서치 에이전트)은 웹 검색 시 내부의 숫자(예: "15% 성장" 또는 "3분기 예산")를 키워드로 사용하기 때문에 민감한 기업 데이터를 유출하곤 합니다.

2. 실험: "MosaicLeaks"

연구진은 MosaicLeaks라는 거대한 테스트를 구축했습니다.

  • 설정: 연구진은 1,001개의 복잡한 퍼즐을 만들었습니다. 각 퍼즐을 풀기 위해 AI는 내부 기업 문서(예: 내부 이메일)와 공공 웹 사이를 번갈아 가며 이동해야 했습니다.
  • 함정: AI는 웹에서 무엇을 검색할지 알기 위해 반드시 내부 문서의 정보 일부를 사용해야만 했습니다.
  • 스파이: 연구진은 방 안에 "스파이" AI를 배치했습니다. 이 스파이는 내부 문구나 최종 정답을 볼 수 없었습니다. 스파이가 볼 수 있는 것은 오직 탐정 AI가 수행한 웹 검색 목록뿐이었습니다.

결과: 스파이는 놀라울 정도로 정답을 잘 맞혔습니다. AI가 "우리의 비밀은 X이다"라고 명시적으로 말하지 않았음에도 불구하고, 검색 쿼리의 조합을 통해 스파이는 비밀을 알아낼 수 있었습니다.

3. 왜 간단한 해결책들이 실패했는가

연구진은 두 가지 일반적인 해결 방법을 시도했으나, 둘 다 실패했습니다.

  • "유출하지 마세요"라는 메모 (프롬프팅): AI의 지침에 "개인 정보를 유출하지 않도록 주의하세요"라는 노트를 추가했습니다.
    • 비유: 이것은 불안해하는 아이에게 "우유를 쏟지 마"라고 말하면서, 정작 손에는 우유가 가득 담긴 잔을 쥐여주는 것과 같습니다. 아이는 규칙에 집중하는 것이 아니라 과업(정답을 찾는 것)에 집중하기 때문에 여전히 우유를 쏟게 됩니다. AI는 여전히 데이터를 유출했으며, 단지 아주 약간 덜 유출했을 뿐입니다.
  • 속도를 위한 훈련 (과업 성능): AI가 최대한 빠르게 정답을 맞히도록 훈련했습니다.
    • 비유: 이는 AI를 더 빠르게 만들었지만, 오히려 유출을 악화시켰습니다. AI는 확신을 갖기 위해 더 많은 질문을 던지기 시작했고, 이는 스파이에게 모자이크를 맞출 수 있는 더 많은 조각을 제공하는 꼴이 되었습니다.

4. 해결책: "개인정보 인지형 딥 리서치" (PA-DR)

연구진은 PA-DR이라는 새로운 훈련 방법을 개발했습니다. 이것은 탐정에게 새로운 사고방식을 가르치는 것이라고 생각하십시오.

단순히 정답을 맞히는 것에 보상을 주는 대신, 연구진은 AI에게 이중 성적표를 주었습니다.

  1. 미스터리를 해결했는가? (과업 보상)
  2. 흔적(단서)을 남겼는가? (개인정보 페널티)

연구진은 유출을 감지하도록 훈련된 작은 AI인 "개인정보 분류기"를 심판으로 활용했습니다. 만약 탐정이 비밀을 드러낼 가능성이 있는 질문을 던지면, 심판은 즉시 페널티를 부여했습니다.

마법 같은 결과:

  • AI는 검색 쿼리에 비밀 숫자를 사용하지 않고도 퍼즐을 푸는 법을 배웠습니다.
  • 예시: "2020년 리의 마켓(Lee's Market)에 트래픽이 15% 성장했을 때 어떤 일이 있었나?"라고 검색하는 대신, 훈련된 AI는 "2020년 리의 마켓의 트래픽 성장과 관련하여 어떤 일이 있었나?"라고 검색하는 법을 배웠습니다.
  • AI는 여전히 올바른 문서를 찾아냈지만, 검색 쿼리에 특정 숫자 "15%"가 포함되지 않았기 때문에 스파이는 비밀을 알아낼 수 없었습니다.

5. 핵심 요약

  • 나쁜 소식: 현재의 AI 에이전트들은 웹을 검색할 때 비밀을 지키는 데 매우 서툽니다. 그들은 끊임없이 정보를 유출하며, 단순한 경고로는 이를 막을 수 없습니다.
  • 좋은 소식: 이러한 에이전트들을 개인정보를 인지하도록 훈련할 수 있습니다. "정답을 찾는 것"과 "흔적을 남기지 않는 것" 사이의 균형을 맞추도록 가르침으로써, 그들은 민감한 기업 데이터를 노출하지 않고도 복잡한 문제를 해결할 수 있습니다.

요약하자면, 현재의 AI 탐정들은 자신의 검색 기록을 비공개로 유지하는 데 매우 서툴지만, 적절한 훈련을 받는다면 스파이가 자신이 무엇을 찾고 있는지 알 수 없게 하면서도 미스터리를 해결할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →