AgentBound: Verifiable Behavioral Governance for Autonomous AI Agents
AgentBound는 자율형 AI 에이전트의 제안된 행동을 위임된 권한, 소유자가 서명한 헌법 및 사이트 계약에 따라 평가함으로써 독립적인 검증과 책임성을 가능하게 하는 암호학적으로 감사 가능한 영수증을 생성하여, 자율형 AI 에이전트에 대한 검증 가능한 행동 감독을 보장하는 런타임 거버넌스 프레임워크입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 사업을 운영하기 위해 매우 똑똑하고 유능한 로봇 비서를 고용했다고 상상해 보십시오. 당신은 로봇에게 건물에 출입할 수 있는 키카드(신원 확인)와 들어갈 수 있는 방의 목록(권한 부여)을 줍니다.
문제점:
키카드와 방 목록이 있더라도, 로봇은 여전히 어리석거나 위험한 행동을 할 수 있습니다. 예를 들어, 로봇은 "재무실"에 들어가서 "환불 기계"를 사용할 권한이 있지만, 이상한 메시지 때문에 혼란을 느껴 새벽 3시에 모르는 사람에게 백만 달러를 환불해 버리기로 결정할 수도 있습니다. 로봇은 자신이 갈 수 있는 '장소'에 대한 규칙은 어기지 않았지만, 당신이 준 지침의 '정신'을 위반한 것입니다.
현재의 보안 시스템은 키카드와 방 목록만을 확인합니다. 이 시스템은 "지금 이 행동이 적절한가?"라고 묻지 않습니다.
해결책: AgentBound
이 논문은 로봇과 행동 사이에 서 있는 똑똑한 "스마트 문지기"인 AgentBound를 소개합니다. 이것은 로봇을 더 똑똑하게 가르치려는 것이 아니라, 단지 로봇이 하려는 모든 움직임을 실행되기 전에 확인하는 역할을 합니다.
작동 방식은 다음과 같은 창의적인 비유를 통해 설명할 수 있습니다.
세 명의 판사
로봇이 어떤 동작(예: 이메일 전송 또는 송금)을 하고 싶을 때, AgentBound는 요청을 세 명의 서로 다른 "판사"에게 보내 투표를 받습니다.
- 게이트키퍼 (위임된 권한 부여): 이 판사는 신원을 확인합니다. "너는 올바른 열쇠를 가지고 있는가? 이 기계를 만질 권한이 있는가?" 만약 대답이 '아니오'라면, 동작은 즉시 중단됩니다.
- 주인의 의지 (행동 헌법): 이것은 당신(인간 상사)이 서명한 디지털 문서입니다. 여기에는 "나에게 묻지 않고 500달러 이상의 돈을 보내지 마라" 또는 "주말에는 뉴스를 게시하지 마라"와 같은 내용이 담겨 있습니다. 이 판사는 "이 행동이 실제로 상사가 원하는 바와 일치하는가?"를 묻습니다.
- 사이트 수호자 (사이트 액션 계약): 이 판사는 로봇이 사용하려는 특정 기계나 웹사이트를 살펴봅니다. 이 판사는 "이 동작이 이 특정 시스템에 안전한가? 되돌릴 수 있는 작업인가? 이 특정 웹사이트의 규칙을 위반하는가?"를 묻습니다.
판결
이 세 명의 판사는 독립적으로 투표합니다. AgentBound는 이들의 투표를 결합하기 위해 엄격한 규칙집을 사용합니다.
- 어느 한 명이라도 "아니오"(거부)라고 하면, 그 동작은 차단됩니다.
- 게이트키퍼는 "예"라고 했지만 주인의 의지가 "인간의 승인을 기다려라"라고 한다면, 로봇은 잠시 멈추고 당신의 승인을 기다려야 합니다.
- 세 판사 모두가 안전하고 허용된다고 동의했을 때만 로봇은 행동을 수행할 수 있는 초록불을 받습니다.
"마법 영수증" (거버넌스 영수증)
이것이 가장 중요한 부분입니다. 과거에는 무언가 잘못되었을 때, 단순히 "로봇이 새벽 3시에 돈을 보냄"이라고 적힌 로그북을 보아야 했습니다. 왜 그런 일이 일어났는지 알 수 없었습니다.
AgentBound는 거버넌스 영수증을 생성합니다. 이것은 디지털 공증 도장과 같습니다. 로봇이 행동할 때마다, 다음과 같은 내용을 증명하는 영수증을 받게 됩니다:
- 정확히 어떤 규칙들이 확인되었는지.
- 당신의 "주인의 의지" 중 어떤 버전이 사용되었는지.
- 세 명의 판사가 실제로 투표했는지.
- 그 행동이 승인되었는지.
이 영수증은 암호학적으로 서명됩니다. 즉, 아무도 이를 조작할 수 없으며 나중에 내용을 변경할 수 없습니다. 만약 로봇이 잘못된 행동을 했다면, 당신은 영수증을 보고 이렇게 말할 수 있습니다. "아, 게이트키퍼는 '예'라고 했지만, 주인의 의지는 '아니오'라고 했구나. 시스템이 막지 못했네." 또는 "시스템이 완벽하게 작동했고, 영수증이 그 모든 것을 확인했음을 증명하고 있구나."라고 말할 수 있습니다.
"상시 위임" (잠들지 않는 로봇을 위하여)
어떤 로봇들은 당신이 잠든 동안에도 결정을 내리며 24시간 내내 작동합니다. 보통 로봇의 규칙을 바꾸고 싶다면, 로봇을 깨워서 열쇠를 다시 발급해야 합니다.
AgentBound는 **상시 위임(Standing Delegation)**을 사용합니다. 로봇에게 1년 동안 유효한 "마스터 키"를 주되, 그 키로는 단 10분 동안만 유효한 "작업 문" 열쇠만 열 수 있다고 가정해 봅시다.
- 매 10분마다 로봇은 새로운 "작업 문" 열쇠를 요청합니다.
- 요청할 때, 시스템은 당신의 현재 규칙을 확인합니다. 만약 당신이 어제 마음을 바꿔 "월요일에는 환불 불가"라고 설정했다면, 새로운 10분짜리 열쇠에는 그 내용이 자동으로 반영됩니다.
- 이 방식을 통해 로봇은 당신이 계속해서 권한을 다시 부여할 필요 없이, 당신의 최신 규칙을 유지할 수 있습니다.
요약
AgentBound는 AI 에이전트에 "상식"과 "책임성"의 층을 더하는 시스템입니다.
- 과거의 방식: "열쇠가 있으니, 들어가도 좋다." (맥락을 파악하지 못함).
- AgentBound의 방식: "열쇠는 있지만, 규칙을 확인했는가? 상사가 승인했는가? 기계에 안전한가? 여기 그 모든 것을 확인했다는 서명된 영수증이 있다."
이것은 AI 거버넌스를 단순히 "신뢰"해야 하는 대상에서, 당신이 검증할 수 있는 대상으로 바꿉니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.