← 최신 논문
🤖 AI

The Two Boundaries: Why Behavioral AI Governance Fails Structurally

본 논문은 행동 기반 AI 거버넌스가 리스 정리 (Rice's theorem) 에 따라 임의의 프로그램 효과를 정책과 대비하여 검증하는 것이 결정 불가능하기 때문에 구조적으로 실패한다고 주장하며, 역량과 정책의 불일치로 인해 발생하는 불가피한 위험과 비효율을 제거할 유일한 해결책으로 연산과 효과를 구조적으로 분리하고 거버넌스를 실행 파이프라인에 내장하는 '동시 종료 거버넌스 (coterminous governance)'라는 아키텍처를 제안한다.

원저자: Alan L. McCann

게시일 2026-05-01
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alan L. McCann

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"행동적 AI 거버넌스가 구조적으로 실패하는 이유"라는 논문에 대한 설명을 쉬운 언어와 일상적인 비유로 정리합니다.

핵심 문제: "두 가지 경계"의 불일치

거의 모든 것을 할 수 있는 매우 강력한 로봇을 상상해 보세요. 이메일을 보내거나, 자금을 이동시키거나, 데이터베이스 기록을 변경할 수 있습니다. 이를 안전하게 만들기 위해 로봇이 무엇을 할 수 있는지 알려주는 울타리 (거버넌스) 를 설치합니다.

이 논문은 오늘날 구축된 거의 모든 AI 시스템에는 서로 맞지 않는 두 가지 다른 울타리가 존재한다고 주장합니다.

  1. 능력 울타리 (로봇이 할 수 있는 것): 이는 로봇의 도구와 코드에 의해 결정됩니다. 로봇에 이메일을 보내는 도구가 있다면, 로봇은 이메일을 보낼 수 있습니다.
  2. 규칙 울타리 (로봇이 허용된 것): 이는 작성한 안전 규칙과 필터에 의해 결정됩니다.

문제점: 이 두 울타리는 거의 항상 크기와 모양이 다릅니다.

  • "위험 구역" (거버넌스되지 않은 능력): 때로는 로봇이 사용할 수 있는 도구가 있지만, 규칙이 그 특정 도구를 다루지 않는 경우가 있습니다. 마치 보안 요원이 모르는 로봇의 비밀 뒷문이 있는 것과 같습니다. 로봇이 그 사이로 빠져나가 나쁜 일이 발생합니다.
  • "연극 구역" (거버넌스 연극): 때로는 규칙이 로봇이 할 수 없는 것에 대해 매우 엄격하게 적용됩니다. 마치 로봇에게 날개가 없는데도 "비행"을 금지하는 보안 요원을 두는 것과 같습니다. 불가능한 일을 단속하는 데 에너지를 낭비하는 동안, 실제 위험 (뒷문) 은 열려 있습니다.

논문에 따르면, 더 많은 경비원이나 더 많은 규칙을 추가하여 이를 해결하려는 시도는 "연극"을 더 크게 만들고 "위험"을 약간 줄일 뿐, 그 격차를 결코 해결하지는 못합니다.

왜 로봇을 단순히 "감시"할 수 없는가 (수학적 문제)

"왜 로봇이 나쁜 일을 하면 막아주는 초지능 감시 장치를 만들지 않는가?"라고 생각할 수 있습니다.

이 논문은 **라이스 정리 (Rice's Theorem)**라는 유명한 수학 법칙을 사용하여, 유연하고 똑똑한 AI 에 대해 이것이 불가능한 이유를 설명합니다.

  • 비유: 스크립트만 보고 영화의 결말을 예측한다고 상상해 보세요. 영화가 짧고 단순하다면 결말을 추측할 수 있습니다. 하지만 영화가 관객에 따라 변하는 무한하고 복잡한 이야기라면, 영화가 상영되기 전에 어떤 알고리즘도 100% 확률로 결말을 예측할 수 없습니다.
  • 결과: AI 는 매우 유연하기 때문에 (자신의 코드를 작성하고 도구를 새로운 방식으로 결합할 수 있음), 특정 행동이 안전할 것이라고 사전에 수학적으로 증명할 수 없습니다. 오직 추측할 뿐입니다. 그리고 추측만 가능하기 때문에, 감시 장치가 보지 못한 나쁜 일을 로봇이 할 가능성은 항상 존재합니다.

해결책: "주문 받기" 대 "요리사"

이 논문은 구조적 해결책을 제안합니다. 로봇을 감시하여 나쁜 일을 막으려 하기보다는, 로봇이 어떻게 구축되는지 바꾸는 것입니다.

구식 방식 (행동적 거버넌스):
로봇은 가스레인지, 칼, 가스 등에 직접 접근할 수 있는 요리사입니다. 당신은 옆에 서서 클립보드를 들고, 잘못된 재료를 집으려 하면 "멈춰!"라고 외칩니다.

  • 결함: 요리사가 당신이 외치기 전에 가스를 잡거나, 클립보드에 적지 않은 새로운 조리법을 찾을 수 있습니다.

신규 방식 (구조적 거버넌스 / 동시적 거버넌스):
요리사부엌과 분리합니다.

  1. 요리사 (계산): AI 는 오직 생각하고 레시피 (명령어) 를 작성하는 것만 허용됩니다. 가스레인지, 칼, 가스를 만질 수 없습니다. 물리적인 손이 없습니다.
  2. 주문 받기 (거버넌스 경계): 별도의 엄격한 시스템이 레시피를 받습니다. "이 레시피에 올바른 재료가 들어있나요? 안전한가요?"를 확인합니다.
    • 만약 안전하다면, 주문 받기 담당자가 부엌에 들어가 식사를 조리합니다.
    • 만약 안전하지 않다면, 주문 받기 담당자가 레시피를 폐기합니다.

이것이 작동하는 이유:

  • AI 는 실제로 세상을 건드릴 도구가 없기 때문에 나쁜 일을 할 수 없습니다.
  • 모든 행동은 주문 받기 담당자를 거쳐야 합니다.
  • AI 에게 비밀 뒷문이 없기 때문에 "위험 구역"이 존재하지 않습니다.
  • 주문 받기 담당자는 실제로 조리 가능한 레시피만 확인하므로 "연극 구역"이 존재하지 않습니다.

왜 "모니터링"만으로는 부족한가

이 논문은 단순히 AI 가 무엇을 하는지 "로그"하거나 "기록"하는 것만으로는 거버넌스로 간주되지 않는 이유도 설명합니다.

  • 비유: 은행에 보안 카메라가 있다고 상상해 보세요. 카메라가 강도를 발견하면 범죄를 기록합니다. 하지만 카메라는 강도를 막지 못했습니다.
  • 수학: 카메라가 강도 사건의 99% 를 잡는다고 가정해 보세요. 이는 훌륭해 보입니다. 하지만 은행에서 하루에 1,000 건의 거래가 발생한다면, 1% 의 간극을 통해 최소 한 건의 강도 사건이 빠져나갈 확률은 거의 100% 에 가깝습니다.
  • 핵심: 행동이 일어난 후 기록하는 것이 아니라, 행동이 발생하기 전에 막아야 합니다.

결론

이 논문은 AI 를 진정으로 거버넌스하려면 기존 시스템 위에 더 많은 필터나 규칙을 추가해서는 안 된다고 결론 내립니다. AI 가 무언가를 요청할 수 있게 하고, 별도의 엄격한 문지기가 그 요청이 이루어질지 결정하도록 시스템을 재건해야 합니다.

  • 경계가 일치하면: AI 는 설계 단계에서부터 안전합니다 (구조적 거버넌스).
  • 경계가 일치하지 않으면: 규칙을 얼마나 많이 추가하든 항상 일부 위험과 일부 낭비가 존재합니다 (행동적 거버넌스).

저자들은 컴퓨터 코드 (Coq) 를 사용하여 수학적으로 증명했습니다. 모든 행위가 거버넌스되도록 보장하는 유일한 방법은 이 "주문 받기" 접근법이라는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →