← 최신 논문
🤖 AI

SecureClaw: Clawing Back Control of LLM Agents

SecureClaw는 읽기 작업을 위한 신뢰할 수 있는 게이트웨이를 강제하고 쓰기 작업을 위해 PREVIEW-to-COMMIT 프로토콜을 적용함으로써, 작업 유용성을 유지하면서도 여러 벤치마크에서 공격 성공률을 거의 제로에 가깝게 달성하며 도구 사용 LLM 에이전트의 승인되지 않은 외부 동작과 민감한 데이터 노출을 방지하는 이중 경계 보안 아키텍처이다.

원저자: Yuhan Ma, Stefan Schmid

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuhan Ma, Stefan Schmid

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 똑똑하지만 신뢰할 수 없는 개인 비서(LLM 에이전트)를 고용하여 공과금 납부, 개인 이메일 읽기, 일정 관리와 같은 민감한 업무를 맡겼다고 상상해 보십시오.

문제는 이 비서가 다루기 까다로운 성격이라는 점입니다. 만약 당신이 그들에게 은행 계좌 번호가 적힌 문서를 준다면, 그들은 실수로 혹은 악의적으로 그 번호를 낯선 사람에게 소리 내어 읽어버릴 수도 있고, 이메일 안에 숨겨진 메모에 속아 당신의 돈을 사기꾼에게 보내버릴 수도 있습니다.

현재의 보안 요원들은 보통 비서가 나쁜 짓을 하는 것(예: 돈을 보내는 것)을 막으려고 노력하지만, 비서가 비밀을 보는 것 자체를 막는 데는 자주 실패합니다. 일단 비서가 비밀을 보게 되면, 보안 요원이 제지하기도 전에 다른 프로그램에 그 내용을 속삭이거나 자신의 노트에 적어둘 수 있기 때문입니다.

SecureClaw는 이 두 가지 문제를 동시에 해결하기 위해 설계된 새로운 보안 시스템입니다. 이는 "보는 것"과 "하는 것"을 별개의 작업으로 취급하며, 각각에 서로 다른 두 개의 자물쇠를 적용합니다.

SecureClaws가 어떻게 작동하는지 간단한 비유를 통해 설명하겠습니다.

SecureClaw의 두 가지 자물쇠

1. 읽기를 위한 "눈가리개" (게이트웨이)

비서가 송금액을 알기 위해 비밀스러운 인보이스(송장)를 확인해야 한다고 가정해 봅시다.

  • 기존 방식: 당신은 비서에게 실제 종이 인보이스를 건네줍니다. 비서는 숫자를 읽고, 받아 적거나, 듣고 있는 해커에게 그 내용을 소리 내어 읽어줄 수 있습니다.
  • SecureClaw 방식: 당신은 비서에게 종이를 주지 않습니다. 대신 미스터리 박스("불투명한 핸들")와 작고 정제된 메모("경계가 설정된 요약본")를 줍니다.
    • 메모에는 *"공급업체 A로부터 온 인보이스, 금액 $4,200, 기한 금요일까지"*라고 적혀 있습니다.
    • 미스터리 박스는 오직 보안 금고만이 열 수 있는 암호화된 코드입니다.
    • 비서는 이 메모와 코드를 사용하여 업무를 계획할 수는 있지만, 미스터리 박스를 열어 실제 인보이스의 세부 내용을 볼 수는 없습니다. 실제 숫자를 볼 수 없으므로 복사할 수도 없습니다.

2. 실행을 위한 "이중 확인" (실행기)

이제 비서가 그 인보이스를 결제하기 위해 이메일을 보내려고 합니다.

  • 기존 방식: 비서는 이메일을 작성하고 "전송" 버튼을 누릅니다. 만약 해커가 비서를 속여 이메일 주소를 사기꾼의 주소로 바꿨다면, 돈은 사기꾼에게 가게 됩니다.
  • SecureClow 방식: 비서는 오직 이메일을 제안할 수만 있습니다. 비서는 초안을 작성하고 *"이것을 보내고 싶습니다"*라고 말합니다.
    • 신뢰할 수 있는 가드(실행기)가 이 초안을 넘겨받습니다.
    • 가드는 다음과 같이 확인합니다: "당신이 이것을 보내달라고 요청했는가? 수신자가 올바른가? 금액이 맞는가?"
    • 결정적으로, 가드는 정확한 세부 사항을 원래 승인되었던 변경 불가능한 영수증과 대조합니다.
    • 만약 비서가 승인을 받은 후 몰래 이메일 주소를 사기꾼으로 바꿨다면, 가드는 불일치를 발견하고 이메일 전송을 차단합니다. 실제로 "전송" 버튼을 누를 수 있는 권한은 오직 가드에게만 있습니다.

이것이 왜 중요한가요?

이 논문은 공격자들이 에이전트를 속여 데이터를 훔치거나 잘못된 사람에게 돈을 보내도록 유도하는 세 가지 "해킹 놀이터"(AgentDojo, AgentLeak, ASB)를 대상으로 이 시스템을 테스트했습니다.

  • 결과: SecureClaw는 승인되지 않은 송금을 막아내는 데 있어서만 **100%**의 성공률(공격 성공률 0%)을 보였으며, 비밀 데이터 유출을 거의 제로 수준으로 줄였습니다.
  • 핵심 비결: 이 논문은 자물쇠가 하나만 있어서는 안 된다는 것을 증명합니다.
    • 만약 "이중 확인"(전송 차단)만 있다면, 비서는 여전히 비밀을 읽고 자신의 내부 노트에 기록하여 유출할 수 있습니다.
    • 만약 "눈가리개"(비밀 숨기기)만 있다면, 비서가 애초에 비밀을 가지고 있지 않기 때문에 엉뚱한 사람에게 메시지를 보내도록 속임을 당할 수 있습니다.
    • SecureClaw는 두 가지를 모두 사용합니다. 비밀을 비서로부터 숨기는 동시에, 비서가 최종적인 신뢰할 수 있는 확인 없이 행동을 강제할 수 없도록 보장합니다.

"안 된다"고 할 때는 어떻게 되나요?

때때로 시스템이 의심스러운 요청을 발견하여 차단할 때가 있습니다. 과거에는 이로 인해 전체 워크플로우가 중단되어 사용자를 답답하게 만들었을 것입니다. 하지만 SecureClaw에는 "안전한 복구(Safe Recovery)" 기능이 있습니다.

가드가 요청을 차단할 경우, 단순히 "에러"라고 출력하는 대신, 비서가 다시 시도할 수 있는 안전하고 사전 승인된 경로를 제공합니다.

  • 예시: "그 낯선 사람에게 이메일을 보낼 수 없습니다. 하지만 당신이 먼저 검토할 수 있도록 초안을 작성할 수는 있습니다."
  • 이를 통해 보안 표준을 낮추지 않으면서도 업무가 계속 진행될 수 있도록 합니다.

핵심 요약

SecureClaw는 일기장을 읽을 때 눈가리개를 쓴 경호원(비밀을 암기하지 못하도록)이자, 지도를 확인하기 전에는 자동차 키를 넘겨주지 않는(위험한 곳으로 운전해 가지 못하도록) 경호원을 고용하는 것과 같습니다. 이는 계획하는 능력과 행동하는 능력을 분리하여, 설령 비서가 속임을 당하더라도 피해를 최소화합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →