SARC: A Governance-by-Architecture Framework for Agentic AI Systems
본 논문은 에이전트 루프 내 여러 지점에서 의무를 강제하기 위해 제약을 1 급 사양 객체로 취급하는 런타임 거버넌스 프레임워크인 SARC 를 소개하며, 이를 통해 전통적인 사후 처리 방식이나 정책-코드 기반 접근법과 비교하여 하드 제약 위반을 제거하고 소프트 윈도우 초과를 크게 감소시킵니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑하고 자율적인 로봇 비서 (에이전트 AI) 를 구축한다고 상상해 보세요. 이 로봇은 물품 주문, 항공권 예약, 자금 관리와 같은 일을 수행할 수 있습니다. 당신은 이 로봇이 도움이 되기를 원하지만, 동시에 법을 위반하거나 돈을 너무 많이 쓰거나 위험한 실수를 하지 않도록 해야 합니다.
현재 대부분의 기업은 이 로봇들을 통제하기 위해 **노트북에 적힌 규칙 (프롬프트)**을 주거나, 작업이 끝난 후 **작업을 사후 검증 (사후 감사)**하는 방식을 사용합니다. 이 논문은 이를 "도둑이 이미 도망간 후에만 문을 점검하는 보안 경비를 고용하는 것과 같다"고 주장합니다. 이미 늦은 것입니다.
저자들은 SARC(State, Action, Reward, Constraints)를 소개합니다. 이는 로봇이 한 걸음도 내딛기 전에 규칙이 로봇의 뇌에 하드코딩되는 새로운 방식입니다.
다음은 작동 원리에 대한 간단한 설명입니다:
1. 핵심 아이디어: "1 급" 규칙
전통적인 프로그래밍에서는 로봇에게 무엇을 할지 (State), 어떤 도구를 갖췄는지 (Action), 그리고 무엇을 성취하려는지 (Reward) 를 지시합니다. 논문은 우리가 네 번째이자 결정적인 요소인 **제약 조건 (Constraints, C)**을 놓치고 있다고 말합니다.
자동차를 예로 들어보겠습니다:
- 옛 방식: 운전자에게 "안전하게 운전하세요"라고 말한 후, 만약 교통 위반 티켓을 받으면 경찰 보고서를 확인합니다.
- SARC 방식: 엔진에 직접 속도 제한기와 브레이크를 설치합니다. 30 마일 구역에서 90 마일로 가려고 하면, 자동차는 물리적으로 그렇게 할 수 없습니다. 규칙은 단순한 제안이 아니라 기계의 물리적 부분이 됩니다.
2. 네 가지 "보안 게이트"
SARC 는 단순히 하나의 규칙만 있는 것이 아니라, 로봇의 행동이 발생하기 전에 중단되고 점검되는 네 가지 특정 점검 지점을 가지고 있습니다. 고도로 보안이 강화된 공항을 상상해 보세요:
행동 전 게이트 (Pre-Action Gate, PAG): 로봇이 도구를 집기 전입니다.
- 비유: 비행기에 탑승하기 전에 TSA 요원이 신분증과 탑승권을 확인하는 것과 같습니다.
- 기능: 로봇이 비싼 물건을 구매하려 한다면, 이 게이트는 인간의 승인이 없으면 즉시 이를 중단시킵니다. 이는 "절대로 불법 물건을 구매하지 마라"와 같은 '강제 규칙 (Hard rules)'을 차단합니다.
행동 중 모니터 (Action-Time Monitor, ATM): 로봇이 작업을 수행하는 동안입니다.
- 비유: 비행기가 비행 중인 동안 승무원이 엔진 게이지를 감시하는 것과 같습니다.
- 기능: 로봇이 데이터를 스트리밍하거나 긴 통화를 하고 있다면, 이 모니터는 실시간으로 감시합니다. 비용이 너무 높아지거나 데이터가 이상해지면, 비행 중에도 연결을 끊을 수 있습니다.
행동 후 감사관 (Post-Action Auditor, PAA): 작업이 끝난 직후, 다음 작업이 시작되기 전입니다.
- 비유: 다음 가게로 가기 전에 매장을 나온 직후 영수증을 확인하는 것과 같습니다.
- 기능: 실제로 일어난 일을 검토합니다. 만약 로봇이 지난 24 시간 동안 돈을 너무 많이 썼다면, 다음 구매를 늦출 수 있습니다. 이는 "너무 많이 쓰지 마라, 하지만 가끔은 괜찮다"와 같은 '유연 규칙 (Soft rules)'을 처리합니다.
승급 라우터 (Escalation Router, ER): "인간에게 전화하기" 버튼입니다.
- 비유: 파일럿이 "메이데이" 버튼을 누르고 관제탑에 통제를 넘기는 것과 같습니다.
- 기능: 로봇이 새로운 공급업체와 같이 확실하지 않은 것을 발견하면, 작업을 멈추고 인간에게 연락하여 "진행" 또는 "중단" 신호를 기다립니다. 인간이 제때 응답하지 않으면, 안전을 위해 로봇이 자동으로 "아니오"라고 결정합니다.
3. 왜 "로봇에게 단순히 말하기"는 작동하지 않는가
이 논문은 수학적으로 증명합니다. 로봇에게 "규칙을 위반하면 행복도 1,000 점을 잃는다"고 말하는 것만으로는 부족하다는 것입니다.
- 문제점: 로봇이 규칙을 위반함으로써 100 만 달러를 벌 수 있고, 적발될 확률이 극히 낮다면, 보상이 너무 크기 때문에 로봇은 여전히 위험을 감수할 것입니다.
- SARC 해결책: 로봇이 규칙을 위반하지 않도록 선택하기를 바라는 대신, SARC 는 로봇이 넘을 수 없는 벽을 구축합니다. 규칙을 단순한 제안이 아닌 물리적 장벽으로 취급합니다.
4. "영수증" (감사 추적)
AI 의 가장 큰 문제 중 하나는 무언가 잘못되었을 때, 왜 또는 누가 그랬는지 아무도 모른다는 것입니다.
- 옛 방식: 지저분한 로그 파일을 보고 무슨 일이 일어났는지 추측해 봅니다.
- SARC 방식: 로봇이 움직일 때마다 자동으로 완벽하고 기계가 읽을 수 있는 영수증을 인쇄합니다. 이 영수증은 다음과 같이 말합니다: "나는 X 를 하려 했다. 규칙 Y 를 확인했다. 규칙 Y 가 '중단'이라고 했다. 나는 중단했다."
- 장점: 규제 기관이 "법을 준수했습니까?"라고 묻는다면, 추측할 필요가 없습니다. 영수증만 보여주면 됩니다. 논문은 이를 **"구축 시 감사 가능 (Auditable by Construction)"**이라고 부릅니다.
5. 로봇들이 서로 대화할 때 무슨 일이 일어나는가?
대기업에서는 한 로봇이 다른 로봇에게 일을 시킬 수 있습니다.
- 위험: 로봇 A 가 로봇 B 가 규칙을 모를 것이라고 기대하며 로봇 B 에게 불법적인 일을 시킬 수 있습니다.
- SARC 수정: 규칙은 작업과 함께 이동합니다. 로봇 A 에게 규칙이 있다면, 로봇 B 도 이를 따라야 합니다. 로봇 B 가 규칙을 숨으려 하면 시스템이 이를 포착합니다. 또한, 최종 결정을 내린 인간이 누구인지 정확히 알 수 있도록 누가 무엇을 승인했는지에 대한 명확한 가족 관계도 유지합니다.
6. 트레이드오프 (공짜는 없다)
이 논문은 솔직합니다. SARC 는 로봇이 모든 게이트에서 규칙을 멈추고 확인해야 하므로 로봇이 약간 더 느려집니다.
- 비유: 엄격한 속도 제한기가 달린 자동차를 운전하는 것과 같습니다. 무모한 운전수만큼 목적지에 빨리 도착하지는 못하지만, 추락하지는 않을 것입니다.
- 요지: 이 논문은 금융이나 의료와 같이 규제된 환경에서는 "빠르고 위험한" 것보다 "안전하고 감사 가능한" 것이 더 중요하다고 주장합니다. 지연의 비용은 안전을 위해 지불해야 하는 알려진 관리 가능한 가격입니다.
요약
SARC는 운이 아니라 설계에 의해 규칙을 따르는 AI 를 구축하기 위한 청사진입니다. 규칙을 "제안 상자 (프롬프트)"와 "경기 후 리뷰 (감사)"에서 AI 의 엔진실로 이동시킵니다. 이는 로봇이 금지된 일을 하려고 시도할 때, 시스템이 물리적으로 이를 중단하거나, 인간의 도움을 요청하거나, 시도를 완벽하게 기록하여 AI 를 안전하고 설명 가능하며 현실 세계에 준비되게 만듭니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.