← 최신 논문
🤖 AI

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

본 논문은 계획 단계에서의 에이전트 자율성은 보존하되, 고위험 행동의 실행은 의도와 암호학적으로 결합되고 권위 있는 출처에 의해 독립적으로 증명되며 결정론적 정책에 의해 검증된 경우로 제한하는 자율 AI 시스템을 위한 거버넌스 모델을 제안한다.

원저자: Jakob Salfeld-Nebgen

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jakob Salfeld-Nebgen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 운전자를 관찰하지 말고, 열쇠를 확인하라

당신에게 아주 똑똑한 자율주행 자동차(즉, AI 에이전트)가 있다고 상상해 보세요. 이 차는 복잡한 경로를 계획하고, 다른 차들과 대화하며, 심지어 스스로 식료품점에 가기로 결정할 수도 있습니다.

현재 대부분의 안전 시스템은 운전자의 뇌를 감시하려고 합니다. 그들은 이렇게 묻습니다. "운전자가 사고를 낼 생각을 하고 있는가? 적절한 단어를 사용하고 있는가?" 이 논문은 이것이 잘못된 접근 방식이라고 주장합니다. 대신, 우리는 행위(Action) 그 자체를 보아야 합니다.

이 논문은 새로운 규칙을 제안합니다: 운전자의 생각을 통제하려 하지 말고, 시동을 걸기 전에 그들이 올바른 열쇠와 허가증을 가지고 있는지 확인하라.

문제점: "블랙박스" 운전자

현재 AI 에이전트는 인간이 모든 단계를 일일이 확인하지 않아도 위험한 행동(예: 소프트웨어 코드 배포 또는 약 처방)을 할 수 있습니다.

  • 기존 방식: 우리는 AI의 "두뇌"를 지켜보며 그것이 제대로 행동하는지 확인하려 합니다. 하지만 AI가 매우 똑똑하다면, 어떤 사실을 놓쳤음에도 불구하고(예: "환자의 알레르기 여부를 확인하지 않았다" 또는 "소프트웨어 빌드가 실패했는지 확인하지 않았다") 마치 제대로 행동하고 있는 것처럼 보일 수 있습니다.
  • 결함: AI는 적절한 도구들과 대화하고 있을지 모르지만, 실제로 세상이 안전한지 알지 못할 수 있습니다. 이는 도로가 비어 있다고 생각하지만, 정작 교통 신호는 확인하지 않은 운전자와 같습니다.

해결책: "컨시어지(Concierge)" 모델

이 논문은 인류가 수 세기 동안 사용해 온 제도(병원이나 은행 같은 기관)에서 아이디어를 빌려올 것을 제안합니다. 사람을 감시하는 대신, 행동이 일어나기 전에 독립적인 증거를 요구하는 것입니다.

AI를 메신저(또는 쿠리어)라고 한다면, **거버넌스 허브(Governance Hub)**라는 새로운 시스템은 엄격한 컨시어지 역할을 합니다.

프로세스는 다음과 같이 단계별로 진행됩니다:

1. 메신저가 요청을 생성함 (의도 선언)

AI(메신저)가 허브에 말합니다: "라이브 웹사이트에 이 소프트웨어 코드를 배포하고 싶습니다."

  • 허브는 아직 "예" 또는 "아니오"라고 답하지 않습니다.
  • 대신, 허브는 메신저에게 고유한 일회용 티켓(이를 Intent ID라고 부름)을 줍니다. 이 티켓은 특정 요청에만 딱 들어맞는 특정한 자물쇠와 같습니다.

2. 메신저가 "봉인된 봉투"를 수집함 (애테스테이션/증명)

메신저는 단순히 "코드를 확인했고 괜찮습니다"라고 말할 수 없습니다. 메신저는 세 명의 서로 다른 독립적인 전문가(오라클/Oracle)를 찾아가서 봉인되고 서명된 봉투를 받아와야 합니다.

  • 오라클 1 (코드 검토자): 코드를 검토하고 "코드 검토 통과"라고 적힌 봉투에 서명합니다.
  • 오라클 2 (보안 스캐너): 바이러스를 검사하고 "바이러스 발견되지 않음"이라고 적힌 봉투에 서명합니다.
  • 오라클 3 (테스트 실행기): 테스트 통과 여부를 확인하고 "테스트 통과"라고 적힌 봉투에 서명합니다.

핵심 규칙: 메신저는 이 봉투들을 직접 작성할 수 없습니다. 오직 수집만 할 수 있습니다. 봉투에는 그 내용이 가짜가 아니라 실제 전문가로부터 왔음을 증명하는 특별한 디지털 인장이 찍혀 있습니다.

3. "티켓"과 "봉투"가 일치해야 함 (바인딩/결합)

메신저는 봉투를 가지고 허브로 돌아옵 옵니다. 허브는 두 가지를 확인합니다:

  1. 인장: 서명이 진짜인가? 전문가들이 실제로 서명했는가?
  2. 티켓: 봉투 안에 있는 고유한 티켓이 처음에 허브가 발행했던 티켓과 일치하는가?
    • 이것이 중요한 이유: 이를 통해 메신저가 어제의 성공적인 테스트 결과가 담긴 오래된 봉투를 가져와 오늘 실패한 테스트를 통과시키는 행위를 막을 수 있습니다. 티켓은 증거가 신선하며 바로 '이 특정 행동'에 속해 있음을 보장합니다.

4. 허브가 결정을 내림 (결정론적 정책)

허브는 규칙(정책)을 살펴봅니다. 예를 들어: "만약 코드가 통과되었고, 바이러스가 없으며, 테스트를 통과했다면, 배포를 허용한다."

  • 봉투가 규칙과 일치하면, 허브는 **"진행(GO)"**이라고 말하며 최종 허가증에 서명합니다.
  • 무언가 누락되었거나 만료되었다면, 허브는 **"중단(STOP)"**이라고 말합니다.

왜 이것이 더 나은가 (비유)

1. "공증인" 비유
당신이 집을 팔려고 한다고 가정해 봅시다. 당신은 판매자에게 "이 집은 안전한가요?"라고 묻지 않습니다. 대신 공증인을 찾아갑니다. 공증인은 판매자를 개인적으로 알지 못하며, 단지 서류를 확인할 뿐입니다.

  • 이 AI 모델에서 허브는 공증인입니다.
  • 오라클은 독립적인 조사관(배관공, 전기 기사, 구조 엔지니어)입니다.
  • AI는 단지 서류를 들고 있는 사람일 뿐입니다. AI는 조사관의 서명을 위조할 수 없습니다.

2. "은행 금고" 비유
보안이 철저한 은행 금고를 열려면 하나의 열쇠만으로는 부족합니다. 세 명의 서로 다른 사람이 동시에 세 개의 열쇠를 돌려야 합니다.

  • AI는 금고 앞에 서 있는 사람입니다.
  • 오라클은 세 명의 은행 직원입니다.
  • AI는 세 명의 직원이 모두 특정 거래에 대해 독립적으로 승인하기 전까지는 금고를 열 수 없습니다.

이 모델이 하는 것 (그리고 하지 않는 것)

이 모델이 하는 것:

  • 사실 보장: 위험한 행동이 일어나기 전에 독립적인 전문가들이 사실을 검증했는지(예: "약물 상호작용이 확인되었는가", "빌드가 통과되었는가")를 보장합니다.
  • 조작 방지: AI는 서명 키를 가지고 있지 않으므로 결과를 조작할 수 없습니다.
  • 기록 생성: 모든 결정은 영구적이고 변경 불가능한 로그(블랙박스 기록 장치와 같은)에 기록되어, 나중에 누구나 "정말로 약물 상호작용을 확인했는가?"를 확인할 수 있습니다.

이 모델이 하지 않는 것:

  • AI의 "생각"을 판단하지 않음: 만약 AI가 이상하거나 해로운 이유로 약을 처방하기로 결정했는데, 그 과정이 기술적으로 모든 규칙을 따랐다면(상호작용을 확인하고, 면허를 확인했다면), 이 시스템은 여전히 그 행동을 허용할 것입니다. 이 시스템은 '동기'가 아니라 '과정'을 체크합니다.
  • AI의 계획을 막지 않음: AI는 여전히 자유롭게 생각하고, 계획하고, 대화할 수 있습니다. 다만 고위험 요소에 대해 '서류 작업' 없이 행동할 수는 없을 뿐입니다.

결론

이 논문은 우리가 AI 에이전트가 무엇을 생각하는지 감시하기 위해 "마인드 폴리스(생각 감시 경찰)"를 구축해서는 안 된다고 주장합니다. 대신 "게이트키퍼(문지기)" 시스템을 구축해야 합니다.

외과의사가 환자의 동의서와 확인된 환자 ID 없이 수술할 수 없는 것처럼, AI 역시 독립적이고 서명된 증거를 통해 조건이 안전하다는 것이 입증되지 않는 한 코드를 배포하거나 약을 처방할 수 없습니다. AI는 메신저이고, 증거는 열쇠이며, 허브는 자물쇠입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →