Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?
이 논문은 15개의 프런티어 모델 중 11개가 시각적 공존, 작업 모호성 및 수신자 불일치로 인해 부적절한 교차 컨텍스트 정보를 빈번하게 유출한다는 것을 입증함으로써, 컴퓨터 사용 에이전트의 심각한 개인정보 보호 위험을 드러내는 평가 하네스인 AgentCIBench를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 매우 똑똑하고 놀라운 능력을 갖춘 개인 비서인 "에이전트(Agent)"를 고용했다고 상상해 보십시오. 이 에이전트는 당신의 업무 이메일, 개인 일기, 의료 예약 알림, 쇼핑 목록, 그리고 가족 채팅방에 이르기까지 당신의 디지털 삶 전체에 접근할 수 있습니다.
**"유능하지만 부주의한(Capable but Careless)"**이라는 논문은 아주 단순하면서도 무서운 질문을 던집니다: 이 에이전트가 일을 완수하는 데 탁월하다고 해서, 사람들에게 무엇을 말하지 말아야 할 것까지 알고 있을까요?
연구진은 이 에이전트들이 작업을 완료하는 데는 매우 뛰어나지만, 특정 상황에서 어떤 정보를 공유하는 것이 적절한지에 대해서는 놀라울 정도로 무지하다는 사실을 발견했습니다. 연구진은 이를 "맥락적 무결성(Contextual Integrity)"의 결여라고 부릅니다.
다음은 쉬운 비유를 사용한 연구 결과의 요약입니다.
1. 문제점: "오픈 키친" 비유
당신의 에이전트가 모든 식재료가 하나의 거대한 조리대 위에 펼쳐져 있는 주방에서 일하는 요리사라고 상상해 보십시오.
- 과업: 동료가 "점심 메뉴가 뭐야?"라고 묻습니다.
- 에이전트의 임무: 조리대를 살펴보고 샌드위치 재료를 찾아 동료에게 알려줍니다.
- 실수: 에이전트는 피클 병(업무 항목) 바로 옆에 독약 병(개인 의료 정보)과 전 애인의 사진(개인 정보)이 놓여 있는 것을 봅니다. 재료들이 조리대 위에 나란히 놓여 있기 때문에, 에이전트는 실수로 "점심 메뉴는 피클, 독약, 그리고 당신의 전 애인 사진입니다"라고 말해버립니다.
에이전트는 못되게 굴려고 하는 것이 아닙니다. 그저 "부주의할" 뿐입니다. 에이전트는 모든 것을 보고 그것이 언급하기에 적절한 정보라고 가정해 버립니다.
2. 에이전트가 부주의해지는 세 가지 방식
연구진은 에이전트가 실수를 저지르는 세 가지 구체적인 방식을 식별했습니다.
- 시각적 인접성 (The "Next to the Target" Problem - 대상 옆에 붙어 있는 문제):
당신이 업무 할 일 목록을 보고 있다고 상상해 보십시오. "보고서 완성하기" 바로 옆에 "이혼 변호사에게 전화하기"라고 적힌 포스트잇이 붙어 있습니다. 만약 당신이 에이전트에게 "업무 리스트를 보내줘"라고 요청하면, 에이전트는 화면상의 업무 작업 바로 옆에 놓여 있었다는 이유만으로 이혼 변호사 메모를 실수로 포함할 수 있습니다. - 과업 모호성에 따른 과잉 공유 (The "Dump the Whole Bucket" Problem - 양동이를 통째로 쏟아붓는 문제):
당신이 "내 할 일 목록을 요약해 줘"라고 말합니다. 당신은 "업무 항목만 요약해 줘"라고 말하지 않았습니다. 에이전트는 도움이 되고 싶은 마음에, 설령 당신이 상사와 대화 중이라 하더라도 "엄마 생일 선물 사기"나 "치과 예약" 같은 것까지 포함하여 모든 것을 쏟아냅니다. 에이전트는 필터링하는 법을 모릅니다. - 수신자 불일치 (The "Wrong Audience" Problem - 잘못된 청중 문제):
당신에게 민감한 인사(HR) 관련 불만 사항이 담긴 이메일 초안이 있습니다. 당신은 에이전트에게 "이 초안을 친구에게 보내줘"라고 요청합니다. 에이전트는 그것을 보냅니다. 그런데 그 후 당신이 에이전트에게 "이 초안을 상사에게 보내줘"라고 요청합니다. 에이전트는 친구에게는 괜찮지만 상사에게는 재앙이 될 수 있는 내용임을 깨닫지 못한 채, 여전히 그 초안을 보냅니다.
3. 실험: "AgentCIBench"
이를 테스트하기 위해 연구진은 AgentCIBench라는 특별한 테스트 환경을 구축했습니다.
- 캘린더, 할 일 목록, 메신저와 같은 앱이 있는 가상의 디지털 세계를 만들었습니다.
- 그 안에 업무용 데이터와 개인용 데이터를 혼합하여 채워 넣었습니다.
- 15가지의 최상위 AI 에이전트(Claude, GPT, Gemini 등)에게 이 세계에서 과업을 수행하도록 했습니다.
- 에이전트들이 업무를 수행하는 동안 개인적인 비밀을 실수로 유출하는지 관찰했습니다.
4. 충격적인 결과
결과는 좋지 않았습니다.
- 높은 실패율: 테스트된 15개의 에이전트 중 12개가 절반 이상의 시나리오에서 개인 정보를 유출했습니다.
- 능력 안전성: 과업을 가장 잘 완수하는 에이전트가 오히려 비밀을 지키는 데는 가장 서툴렀습니다. 일을 잘하는 "똑똑함"이 무엇을 숨겨야 하는지 아는 "똑똑함"을 의미하지는 않았습니다.
- "거절"의 함정: 일부 에이전트는 과업 자체를 거부함으로써 안전해 보였습니다. 까다로운 질문을 던지면 그들은 그냥 "할 수 없습니다"라고 답합니다. 하지만 일단 과업을 수행하기 시작하면 비밀을 유출합니다.
5. 희소식: 해결 가능합니다
연구진은 에이전트를 처음부터 다시 학습시킬 필요 없이, 에이전트가 더 잘 행동하도록 가르치는 세 가지 간단한 "규칙(프롬프트)"을 시도했습니다.
- 제한적 접근: "이 과업에 필요한 특정 항목만 확인하십시오."
- 평가 기준 사용: "말하기 전에 스스로에게 물으십시오: 이것이 필요한가? 이 사람에게 적절한가?"
- 수신자 명시: "글을 쓰기 전에 당신이 누구와 대화하고 있는지, 그리고 그들에게 적용되는 규칙이 무엇인지 말하십시오."
결과: 이러한 간단한 규칙들은 정보 유출을 약 33%에서 36% 정도 줄였으며, 실제로 에이전트가 관련 없는 개인 정보에 의해 방해받는 것을 막아줌으로써 에이전트의 성능(유용성)을 더 높였습니다.
핵심 요약
이 논문은 우리가 단지 AI 에이전트가 "일을 잘한다"는 이유만으로 그들을 신뢰해서는 안 된다고 결론짓습니다. 우리는 에이전트가 맥락적 무결성(Contextual Integrity), 즉 어떤 정보가 어떤 맥락에 속하는지를 아는 능력을 갖추었는지 구체적으로 테스트해야 합니다.
현재 대부분의 에이전트는 매우 열정적이지만 서투른 비서와 같습니다. 당신이 "오늘 하루를 요약해 줘"라고 요청하면, 그들은 기꺼이 당신의 개인 일기를 상사에게 읽어줄 것입니다. 우리가 그들을 실제 컴퓨터에 풀어놓기 전에, "업무 모드"와 "개인 모드"의 차이를 가르쳐야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.