← 최신 논문
💻 computer science

Runtime Compliance Verification for AI Agents

이 논문은 규제 요구사항을 형식적 술어(formal predicates)로 표현하고, 실행 트레이스를 모니터링하여 비준수 동작을 차단하며, 여러 사례 연구를 통해 공격으로 유발된 위반을 완화하는 데 높은 효과성을 입증함으로써 AI 에이전트의 GDPR 준수를 강제하는 런타임 검증 프레임워크인 C-Trace를 소개한다.

원저자: Nafiseh Kahani, Masoud Barati, Diana Addae

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Nafiseh Kahani, Masoud Barati, Diana Addae

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 삶을 관리할 수 있도록 돕는 매우 똑똑하고 수다스러운 개인 비서를 고용했다고 상상해 보십시오. 이 비서는 전화를 걸거나, 이메일을 보내고, 당신의 은행 세부 정보를 조회하거나, 심지어 당신의 기록을 삭제할 수도 있습니다. 하지만 이 비서는 AI로 구동되기 때문에, 항상 프라이버시 규칙을 "알고 있는" 것은 아닙니다. 실수로 낯선 사람에게 당신의 주소를 알려주거나, 당신이 "예"라고 말한 적도 없는데 마케팅 이메일을 보낼 수도 있습니다.

이 논문은 C-Trace(Compliance Trace-based Runtime Agent Conformance Enforcement)라고 불리는 시스템을 소개합니다. C-Trace를 새로운 비서가 아니라, AI 비서 바로 옆에 서서 비서가 내뱉는 모든 단어와 취하는 모든 행동을 실시간으로 감시하는 엄격하고 매우 경계심 강한 보안 요원이라고 생각하십시오.

시스템이 어떻게 작동하는지 간단한 개념으로 나누어 설명하겠습니다.

1. 문제점: "건망증"이 있는 비서

현재 이러한 AI 비서를 테스트하는 방식은 비서가 일을 시작하기 전에 퀴즈를 주는 것과 같습니다. "규칙을 준-수할 것입니까?"라고 물으면 그들은 "네"라고 대답합니다. 하지만 일단 실제로 업무를 수행하며 사람들과 대화하기 시작하면, 그들은 규칙을 잊어버릴 수 있습니다.

  • 문제: AI는 한 대화에서는 규정을 준수할 수 있지만, 사용자가 무엇을 요청하느냐에 따라 다음 대화에서는 규칙을 어길 수 있습니다.
  • 공백: 기존의 안전 도구들은 입구에서 신분증만 확인하는 경비원(정적 검사)과 같습니다. 그들은 당신이 밤중에 이미 파티를 일찍 떠나겠다고 약속했다는 사실을 알지 못합니다. 그들은 전체 대화의 맥락을 놓칩니다.

2. 해결책: "보안 요원" (C-Trace)

C-Trace는 AI와 외부 세계 사이에 위치합니다. C-Trace는 대화 전체(trace)를 지켜봅니다. 단순히 문장 하나를 보는 것이 아니라, 전체 이야기를 기억합니다.

C-Trace는 네 가지 주요 "프라이버시 법률"(GDPR 기반)을 집행하며 필터 역할을 합니다.

  • "동의" 확인 (P1): AI가 마케팅 이메일을 보내는 등의 행동을 하기 전에, 보안 요원은 다음과 같이 확인합니다: "사용자가 이전에 이것에 대해 명시적으로 '예'라고 말했는가?" 만약 사용자가 그저 "상관없어요"라고만 말했을 뿐 공식적인 "예"를 클릭하지 않았다면, 보안 요원은 그 행동을 차단합니다.
  • "목적" 확인 (P2): AI는 고장 난 주문을 해결하는 것과 같은 특정 업무를 위해 고용되었습니다. 만약 사용자가 그 주문 데이터를 사용하여 다른 회사를 위한 프로필을 만들라고 요청한다면, 보안 요원은 이렇게 말합니다: "아니요, 그것은 다른 업무입니다. 당신은 그 일을 위해 고용되지 않았습니다."
  • "최소 데이터" 확인 (P3): AI가 주문을 확인해야 한다면, 주문 번호와 이메일만 있으면 됩니다. 만약 AI가 주문을 확인하기 위해 사용자의 생년월일이나 정부 발행 ID까지 가져오려 한다면, 보안 요원은 이렇게 말합니다: "그것은 너무 많은 정보입니다. 기본적인 것들만 필요합니다."
  • "삭제" 확인 (P4): 만약 사용자가 "내 데이터를 삭제해 주세요"라고 말한다면, 보안 요원은 해당 사용자를 "삭제됨"으로 표시합니다. 만약 AI가 나중에 다시 그 사용자에 대해 이야기하려고 하면, 보안 요원은 문을 쾅 닫으며 말합니다: "이 사람은 우리 시스템에 더 이상 존재하지 않습니다. 이 사람에 대해 언급할 수 없습니다."

3. 테스트 방법: "레드팀(Red Team)" 게임

이 보안 요원이 실제로 작동하는지 확인하기 위해, 연구원들은 "고양이와 쥐" 게임을 수행했습니다.

  • 공격자: 연구진은 AI가 규칙을 어기도록 유도하기 위해 설계된 수백 개의 까다롭고 혼란스럽거나 공격적인 대화들을 생성하는 특수 프로그램(DSPy)을 사용했습니다. 또한 다른 보안 테스트에서 사용된 실제 "탈옥(jailbreak)" 프롬프트도 사용했습니다.
  • 테스트: 연구진은 보안 요원이 있을 때와 없을 때를 비교하여 AI가 이러한 까다로운 대화들을 처리하도록 했습니다.
  • 결과: 보안 요원이 없으면 AI는 규칙을 끊임없이 어겼습니다(때로는 100%의 확률로). C-Trace 보안 요원이 있으면 AI는 거의 매번 차단되었습니다. 보안 요원이 문장 속의 데이터를 "추측"해야 하는 상황에서도(인간의 언어를 완벽하게 읽는 것은 어렵기 때문), 여에서도 대다수의 위반 사항을 잡아냈습니다.

4. "세 갈래" 검증

보안 요원이 단순히 근거 없는 판단을 내리는 것이 아님을 확인하기 위해, 연구진은 동일한 규칙 책을 세 가지 다른 언어(Python 코드, Rego라는 정책 언어, 그리고 MFOTL이라는 논리 언어)로 구축했습니다.

  • 비유: 세 명의 서로 다른 판사가 동일한 대본을 읽는다고 상상해 보십시오. 만약 그들이 모두 누구에게 유죄인지 똑같이 판결한다면, 그 판결은 확실하다고 볼 수 있습니다. 이 논문에서 세 명의 "판사"는 모든 테스트 케이스에 대해 완벽하게 일치하는 결과를 보여주었습니다.

5. 결론

논문은 C-Trace가 효과가 있다고 주장합니다.

  • 실시간으로 AI가 프라이버시 규칙을 어기는 것을 방지합니다.
  • AI의 속도를 크게 늦추지 않습니다(프로세스에 아주 미세한 시간만을 추가합니다).
  • 보안 요원이 내린 모든 결정에 대한 "감사 로그(audit log, 기록)"를 생성하여, 나중에 인간이 검토할 수 있도록 합니다.

요약하자면: 민감한 데이터를 다루는 AI 비서를 보유하고 있다면, C-Trace는 그 비서가 실수로 당신의 비밀을 누설하거나, 데이터를 잘못된 사람에게 팔거나, 혹은 잊혀지기를 바라는 당신의 요청을 무시하지 않도록 보장하는 시스템입니다. 이는 비서의 모든 움직임을 지켜보고, 규칙을 어기려는 순간 즉시 차단함으로써 이를 실현합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →