← 최신 논문
🤖 AI

Governed Metaprogramming for Intelligent Systems: Reclassifying Eval as a Governed Effect

본 논문은 기호 형태를 실행 가능한 코드로 구체화하기 전에 구조적 검사와 정책 준수를 요구하는 통제된 효과로 제한 없는 `eval` 원시 연산자를 재분류하여 자기 수정형 AI 시스템의 안전성과 권한 제어를 보장하는 언어 설계인 "통제된 메타프로그래밍"을 제안한다.

원저자: Alan L. McCann

게시일 2026-05-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alan L. McCann

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑한 로봇 비서가 있는데, 이 로봇은 자신의 지시문을 스스로 작성할 수 있습니다. 이 로봇은 문제를 바라보고, 그 문제를 생각한 다음, 스스로 따를 새로운 규칙 세트를 타이핑해 낼 수 있습니다.

과거의 프로그래밍 세계에서는, 이 로봇이 새로운 규칙 세트를 작성하면 컴퓨터는 단순히 "좋아, 지금 바로 실행할게"라고 말했을 뿐입니다. "잠깐, 이 규칙들은 안전한가? 은행 비밀번호를 훔치려 하는가? 파일을 삭제하려 하는가?"라고 묻지 않았습니다. 컴퓨터는 쓰여진 단어를 행동으로 전환하는 행위를 항상 작동하는 마법 버튼처럼 취급했습니다.

이 논문은 스스로를 다시 작성할 수 있는 AI 시스템에 대해 그 '마법 버튼'은 위험하다고 주장합니다. 저자 앨런 L. 맥캔 (Alan L. McCann) 은 이를 처리하는 새로운 방법인 **통제된 메타프로그래밍 (Governed Metaprogramming)**을 제안합니다.

여기서 핵심 아이디어를 간단한 비유로 분해해 보겠습니다:

1. 문제: '마법 버튼'은 고장 났습니다

컴퓨터 프로그램을 레시피라고 생각해 보세요.

  • 코드: 쓰여진 레시피 (재료와 단계).
  • 실행: 요리를 하는 행위.

전통적인 시스템에서는, 종이에 새로운 레시피를 쓰면 즉시 그 종이를 셰프에게 건네고 셰프는 요리를 시작합니다. 종이에서 요리로 전환되는 과정은 즉시적이고 제한이 없습니다.

하지만 현대 AI 에서는 '셰프'(AI) 가 요리하는 도중에 새로운 레시피를 작성할 수 있습니다. 만약 AI 가 "부엌 전체를 먹어치워라"라고 적힌 레시피를 작성하고, 시스템이 즉시 요리를 하도록 허용한다면 재앙이 발생합니다. 이 논문은 이 전환 과정을 **권한 증폭 (Authority Amplification)**이라고 부릅니다. 이는 한 장의 종이 (데이터) 가 갑자기 현실 세계를 변경할 수 있는 힘 (실행) 을 얻는 순간입니다.

2. 해결책: 레시피를 위한 '경비원'

이 논문은 레시피를 요리로 전환하는 행위를 단순한 컴퓨터 함수로 취급하는 것을 멈추고, 대신 **통제된 효과 (governed effect)**로 취급할 것을 제안합니다. 즉, 보안 경비원의 승인이 필요한 특별한 행동으로 간주하는 것입니다.

이 시스템은 **머신 폼 (Machine Forms)**이라는 새로운 개념을 도입합니다.

  • 머신 폼은 레시피의 청사진이나 도면과 같습니다. 이들은 단순히 데이터일 뿐입니다. 요리를 할 수도, 전화번호를 걸 수도 없습니다. 이들은 단지 지시사항의 그림일 뿐입니다.
  • 청사진 조작하기(그림을 그리거나, 선을 지우거나, 두 개의 청사진을 합치는 것) 는 안전합니다. 이는 아이가 레고 블록으로 노는 것과 같습니다. 플라스틱 블록을 옮기는 것만으로는 현실 세계에 실제 피해가 발생할 수 없습니다.

3. 결정적 단계: '구체화 (Materialization)'

위험한 순간은 구체화라고 불립니다. 이는 청사진을 들고 "좋아, 이것을 지어라"라고 말하는 순간입니다.

이 새로운 시스템에서는 단순히 "이것을 지어라"라고 말할 수 없습니다. 청사진을 **거버넌스 시스템 (경비원)**에게 건네야 합니다. 경비원은 셰프가 요리를 하도록 허용하기 전에 세 가지 일을 수행합니다:

  1. 청사진 검사: 이 레시피가 금지된 재료 (위험한 AI 모델 등) 를 사용하려 하는가?
  2. 규칙 확인: 이 레시피가 예산 범위 내에 있는가? 접근해서는 안 되는 파일에 접근하려 하는가?
  3. 결정: 통과되면 경비원은 '승인' 신호를 보냅니다. 실패하면 청사진은 쓰레기통에 버려집니다.

4. 자기 개선형 AI 에게 이것이 중요한 이유

스스로 더 똑똑해지기를 원하는 AI 를 상상해 보세요. AI 는 자신의 코드를 살펴보고 수학 실력이 부족하다는 것을 깨닫고, 수학 실력이 더 뛰어난 자신의 새로운 버전을 작성합니다.

  • 이 시스템이 없을 때: AI 는 새로운 코드를 작성하고 '실행'을 누르면, 갑자기 그 새로운 코드가 완전한 권한을 갖게 됩니다. AI 가 실수를 하거나 속임을 당했다면, 실수로 모든 것을 삭제할 수 있는 권한을 스스로에게 부여할 수도 있습니다.
  • 이 시스템이 있을 때: AI 는 새로운 코드 (청사진) 를 작성합니다. 그런 다음 경비원에게 "내가 이 새로운 버전이 될 수 있을까?"라고 물어봐야 합니다. 경비원은 새로운 코드를 검사합니다. 만약 새로운 코드가 AI 가 허용되지 않은 일 (비밀 데이터베이스 접근 등) 을 하려 한다면, 경비원은 "아니오"라고 말합니다. AI 는 스스로 코드를 작성했더라도 경비원을 우회할 수 없습니다.

핵심 교훈

이 논문은 eval(코드를 행동으로 전환하는 명령) 이 단순한 도구가 아니라 **권한 부여 (power grant)**라고 주장합니다.

이를 '통제된 효과'로 재분류함으로써, 시스템은 다음을 보장합니다:

  1. 코드 작성하기(청사진 조작) 는 안전하고 순수합니다.
  2. 코드 실행하기(청사진을 행동으로 전환) 는 항상 검문소를 통과해야 합니다.
  3. 우회할 수단이 없습니다. 위험한 프로그램을 정상적인 계산 안에 숨겨 경비원을 속여 넘길 수 없습니다.

저자는 이를 MashinTalk이라는 시스템에 구현하여 454 개의 형식적 정리를 사용하여 수학적으로 증명했습니다. 즉, 이 보안 경비원을 우회하는 것은 불가능하다는 것입니다. 이는 AI 가 새로운 자신의 버전을 만들 수 있지만, 오직 그 새로운 버전들이 엄격한 안전 검사를 통과했을 때만 가능하게 하는 세상을 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →