Formalizing Kantian Ethics: Formula of the Universal Law Logic (FULL)
이 논문은 인공지능의 도덕적 직관을 사전에 정의하는 대신 칸트의 정언명령을 형식화한 '보편법칙 논리 (FULL)'를 제안하여, 에이전트의 목적과 배경 지식을 바탕으로 행위의 도덕성을 추론할 수 있는 새로운 윤리적 에이전트 프레임워크를 제시합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
1. 문제점: 왜 기존 AI 는 도덕적으로 약할까?
지금까지 인공지능 (AI) 에게 도덕을 가르치는 방식은 마치 어린이에게 "나쁜 짓은 하지 마"라고 외우게 하는 것과 비슷했습니다.
- 기존 방식: "사람을 해치지 마", "거짓말 하지 마", "남을 도와줘" 같은 규칙들을 데이터로 입력합니다.
- 한계점:
- 동기를 모릅니다: "왜" 그 행동을 하는지 모릅니다. 예를 들어, "환자를 수술해서 다치게 했다"는 사실만 보면 AI 는 수술을 '나쁜 짓'으로 판단할 수 있습니다. 하지만 환자의 생명을 구하기 위한 '의도'를 고려하지 못하죠.
- 예외를 못 봅니다: 모든 상황을 미리 다 예측해서 규칙을 정할 수 없습니다. "도둑질은 나쁘다"는 규칙이 있어도, 굶주린 아이를 위해 빵을 훔치는 상황에서는 어떻게 해야 할지 AI 는 혼란에 빠집니다.
2. 해결책: 칸트의 '보편 법칙'을 AI 에게 심어주다
저자는 칸트 철학의 '범주적 명령 (Categorical Imperative)' 중 가장 유명한 **'보편 법칙의 공식 (Formula of Universal Law)'**을 AI 에게 적용했습니다.
핵심 비유: "만약 전 세계가 너처럼 행동하면 어떻게 될까?"
칸트는 이렇게 말합니다. "네가 하려는 행동의 이유 (동기) 를 전 세계 모든 사람이 똑같이 한다면, 그 세상은 성립할 수 있는가?" 만약 그 세상이 무너진다면, 그 행동은 도덕적으로 허용되지 않습니다.
이 논리를 컴퓨터가 계산할 수 있게 만든 것이 바로 이 논문에서 개발한 **FULL (Formula of the Universal Law Logic)**입니다.
3. FULL 이 어떻게 작동하는가? (세 가지 시나리오)
FULL 은 AI 에게 "단순히 행동 자체를 판단하지 말고, 행동의 목적과 그 결과가 전 세계에 퍼졌을 때의 효과를 시뮬레이션해보라"고 명령합니다.
사례 1: 거짓 약속 (돈을 빌려주겠다고 거짓말하기)
- 상황: 카를리가 여행을 가기 위해 친구에게 "돈 갚을게"라고 거짓말하고 돈을 빌리려 합니다.
- FULL 의 시뮬레이션:
- "만약 전 세계 모든 사람이 돈을 빌릴 때 '돈 갚을게'라고 거짓말을 한다면?"
- 결과: 아무도 거짓말을 믿지 않게 됩니다. 결국 '약속'이라는 개념 자체가 사라지고, 카를리도 돈을 빌릴 수 없게 됩니다.
- 판단: 카를리는 '돈을 빌리는 것'을 원하면서도, '약속이 통용되지 않는 세상'을 원하게 됩니다. 이는 모순입니다.
- 결론: 거짓 약속은 **불가능 (허용 불가)**합니다.
사례 2: 살인 (경쟁자를 죽여서 직장을 얻기)
- 상황: 카를리가 경쟁자를 죽여서 직장을 얻으려 합니다.
- FULL 의 시뮬레이션:
- "만약 전 세계 모든 사람이 직장을 얻기 위해 경쟁자를 죽인다면?"
- 결과: 카를리도 다른 사람에게 죽임을 당할 확률이 매우 높아집니다.
- 판단: 카를리는 '직장을 얻어 안전하게 살고 싶다'는 목적을 가지면서, 동시에 '자신이 죽을 수 있는 세상'을 만들게 됩니다. 이는 실용적 모순입니다.
- 결론: 살인은 불가능합니다.
사례 3: 남을 돕지 않기 (여유 시간을 위해)
- 상황: 카를리가 "나를 도와주는 사람이 없어도 돼"라고 생각하며 남을 돕지 않으려 합니다.
- FULL 의 시뮬레이션:
- "만약 전 세계 모든 사람이 남을 돕지 않는다면?"
- 결과: 카를리가 아플 때나 어려울 때 아무도 도와주지 않습니다. 결국 카를리는 생존할 수 없게 됩니다.
- 판단: 카를리는 '살아있고 여유를 즐기고 싶다'는 목적을 가지면서, 동시에 '자신이 죽게 되는 세상'을 만듭니다.
- 결론: 남을 전혀 돕지 않는 것은 불가능합니다. (하지만 가끔 돕는 것은 허용됩니다.)
4. 이 시스템의 놀라운 점: "의도"를 이해한다
가장 중요한 점은 이 시스템이 행동 자체가 아니라 행동의 목적을 본다는 것입니다.
- 비유: "칼로 사람을 찌른다"는 행동은 보통 나쁜 짓입니다.
- 악당: 사람을 죽이기 위해 찌른다 → 불가능 (모순 발생).
- 외과 의사: 환자를 살리기 위해 수술한다 → 가능.
- 이유: 의사의 경우, 전 세계 모든 의사가 환자를 살리기 위해 수술을 한다면 세상은 더 건강해지고, 의사 자신의 목적 (환자 구하기) 도 성취됩니다. 모순이 생기지 않기 때문입니다.
기존 AI 는 "칼로 찌르는 행위"를 보고 "나쁜 일"이라고만 판단했지만, FULL은 "왜 찌르는가?"를 분석하여 올바른 판단을 내립니다.
5. 결론: 더 똑똑하고 안전한 AI 를 위한 여정
이 논문은 인공지능에게 **"규칙을 외우게 하는 것"이 아니라 "논리적으로 생각하게 하는 것"**이 도덕적 AI 를 만드는 길임을 보여줍니다.
- 기존: "거짓말 하지 마" (규칙)
- 새로운 FULL: "네가 거짓말을 한다면 전 세계가 어떻게 변할지, 그리고 그 변화가 네 목적을 달성하는 데 방해가 되는지 스스로 계산해봐."
이처럼 AI 가 인간의 복잡한 도덕적 직관을 모두 입력받지 않아도, 이성적이고 논리적인 원칙을 통해 스스로 옳고 그름을 판단할 수 있게 된다면, 우리는 더 안전하고 신뢰할 수 있는 인공지능 시대를 맞이할 수 있을 것입니다.
한 줄 요약:
"AI 에게 '하지 말아야 할 일 목록'을 주는 대신, '만약 전 세계가 너처럼 행동하면 세상이 망하지 않을까?'라고 스스로 생각하게 만드는 논리 시스템을 만들었습니다."
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.