← 최신 논문
🤖 AI

MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents

이 논문은 심리학과 철학의 통찰을 통합하여 순차적 의사결정 에이전트의 도덕적 정렬을 평가하고 개선하기 위해 98 개의 위계적 윤리적 딜레마와 모랄리티 체인 (Morality Chains) 이라는 새로운 형식주의를 특징으로 하는 벤치마크인 MoralityGym 을 소개한다.

원저자: Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 복잡한 도시를 항해하도록 가르친다고 상상해 보세요. 단순히 A 지점에서 B 지점으로 빠르게 이동하는 것뿐만 아니라, 문제가 발생했을 때 "좋은" 선택을 하기를 원합니다. 로봇이 보행자를 치는 것과 벽에 충돌하는 것 사이에서 선택을 해야 한다면 어떻게 될까요? 이것이 바로 **AI 정렬 (AI Alignment)**의 핵심 과제입니다: 로봇이 인간의 가치와 부합하는 방식으로 행동하도록 보장하는 것입니다.

논문 **"MoralityGym"**은 이러한 까다로운 도덕적 선택을 테스트하고 훈련하기 위한 새로운 방법을 제시합니다. 간단한 비유를 사용하여 그들의 접근 방식을 살펴보겠습니다.

1. 문제: 로봇은 지도뿐만 아니라 도덕적 나침반이 필요합니다

현재의 AI 시스템은 보상 (예: 경주 완주) 을 받기 위해 지시를 따르는 데는 뛰어납니다. 하지만 모든 선택이 어떤 해를 끼치는 "도덕적 딜레마"에 직면하면 종종 혼란에 빠집니다. 그들은 "5 명을 구하고 1 명을 잃는다"와 같은 "최고의" 수학 답을 계산하려 하지만, 더 많은 생명을 구하더라도 "누군가를 밀어내는 것은 잘못되었다"는 인간의 감정을 놓칠 수 있습니다.

저자들은 인간의 도덕성이 극대화해야 할 단일 숫자가 아니라고 주장합니다. 그것은 상황에 따라 일부 규칙이 다른 규칙보다 더 중요한 계층적 규칙 목록과 더 유사합니다.

2. 해결책: "도덕적 연쇄 (Morality Chains)" (규칙집)

이를 해결하기 위해 연구자들은 Morality Chains라는 시스템을 만들었습니다. 이를 로봇을 위한 엄격하고 순위가 매겨진 규칙집으로 생각하세요.

  • 비유: 가족 저녁 식사를 상상해 보세요.
    • 규칙 #1 (최고 우선순위): "누구도 치지 마세요." (이것은 절대적인 "아니요"입니다).
    • 규칙 #2 (중간 우선순위): "음식을 낭비하지 마세요."
    • 규칙 #3 (최저 우선순위): "채소를 드세요."

음식을 낭비하는 것 (규칙 #2 위반) 과 누군가를 치는 것 (규칙 #1 위반) 사이에서 선택해야 한다면, 규칙 #1 을 안전하게 유지하기 위해 반드시 규칙 #2 를 위반해야 합니다. 절대 하위 규칙을 충족시키기 위해 최상위 규칙을 위반해서는 안 됩니다.

논문에서 이러한 규칙을 **"규범 (Norms)"**이라고 부릅니다. 연구자들은 각 규칙에 "힘"이나 가중치를 부여합니다.

  • 명시 (Prescribed): 반드시 해야 하는 일.
  • 금지 (Prohibited): 반드시 하지 말아야 하는 일.
  • 계층 (Hierarchy): 이 시스템은 고우선순위 규칙의 작은 위반이 저우선순위 규칙의 거대한 위반보다 항상 더 나쁘도록 보장합니다.

3. 테스트: "MoralityGym" (훈련 체육관)

로봇들이 실제로 이러한 연쇄를 따를 수 있는지 확인하기 위해 저자들은 MoralityGym을 구축했습니다.

  • 비유: 철학 수업의 유명한 "트롤리 문제"와 유사하게, 윤리를 테스트하기 위해 특별히 설계된 비디오 게임 레벨로 생각하세요.
  • 설정: 게임에서 로봇은 격자 위에 있습니다. runaway "트롤리" (카트) 가 사람 무리를 향해 가고 있습니다. 로봇은 다음을 할 수 있습니다.
    1. 아무것도 하지 않기 (5 명이 다친다).
    2. 스위치를 조작하기 (3 명이 다친다).
    3. 보행자를 선로 위로 밀어 넣기 (1 명이 다치지만 3 명은 구해진다).

로봇은 이 격자를 항해하고 목표를 달성하며 무엇을 할지 결정해야 합니다. "도덕적 연쇄"는 로봇에게 어떤 규칙이 가장 중요한지 알려줍니다. 예를 들어, 한 연쇄는 "수학적으로 밀어 넣는 것이 더 많은 생명을 구한다 하더라도, 사람을 직접 밀어 넣는 것이 트롤리가 간접적으로 치는 것보다 더 나쁘다"고 말할 수 있습니다.

4. 실험: 로봇들은 어떻게 했을까요?

연구자들은 이 체육관에서 PPO 와 CPO 와 같은 여러 표준 AI 훈련 방법을 테스트했습니다. 로봇들이 "도덕적 연쇄"를 따르는 법을 배울 수 있는지, 아니면 단순히 점수를 극대화하려 했는지 확인하고 싶었습니다.

  • 결과:
    • 표준 AI: 대부분의 표준 로봇은 실패했습니다. 그들은 "수학" (총 해를 최소화) 을 하려 했지만 "도덕적 규칙" (예: "사람을 밀지 마라") 을 무시했습니다. 그 결과 그들은 인간에게 차갑고 비윤리적으로 느껴지는 선택을 하게 되었습니다.
    • "형상화 (Shaped)"된 AI: 잘한 유일한 로봇은 특별한 "보상 형상화 (reward shaping)" 가이드를 받은 것이었습니다. 이 가이드는 로봇에게 명시적으로 "최상위 규칙을 위반하면 막대한 페널티를 받는다"고 말했습니다. 이 로봇은 단순한 작업 완수보다 고차원적인 도덕적 규칙을 우선시하는 법을 배웠습니다.

5. 왜 이것이 중요한가

이 논문은 현재의 AI 안전 방법만으로는 충분하지 않다고 결론 내립니다. 로봇에게 "사람을 해치지 마라"고 말하고 그것이 어떻게 해치는지에 대한 미묘한 차이를 이해하기를 기대할 수는 없습니다.

도덕적 연쇄를 사용하면 로봇을 단순히 "작업을 끝냈는가?"가 아니라 "우리의 복잡하고 층화된 도덕적 가치를 존중하는 방식으로 작업을 끝냈는가?"에 따라 평가하는 시스템을 구축할 수 있습니다.

간단히 말해: 이 논문은 로봇을 위한 "도덕적 운전 시험"을 구축했습니다. 엄격하고 순위가 매겨진 규칙집 (도덕적 연쇄) 없이는 로봇이 목적지에 도달하기 위해 무모하게 운전할 것이라고 보여주었습니다. 규칙집이 있으면 로봇은 가장 어려운 교통 체증에서도 안전하고 윤리적으로 운전하는 법을 배울 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →