The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback
이 논문은 인간의 피드백을 사용하여 자율주행 자동차를 학습시키는 강화 학습 프레임워크인 윤리적 결정 헤드(Ethical Decision Head)를 소개하며, 에이전트가 전체 사상자 수를 최소화하려는 이론적 공리주의 목표보다 자기희생을 선호하는 인간 평가자의 선호도를 우선시하도록 학습되는 데서 나타나는 결정적인 차이를 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
자율주행 자동차의 앞날은 더 이상 단순히 사고를 피하는 것에 그치지 않습니다. 그것은 사고가 불가피할 때 어떤 선택을 하느냐에 관한 문제입니다. 기계가 인간의 도움 없이 스스로 운전할 수 있을 정도로 성숙해짐에 따라, 이들은 필연적으로 충돌이 확실시되는 상황, 즉 누구를 다치게 할 것인가라는 질문만이 남은 상황에 직면하게 될 것입니다. 이것은 두 가지 나쁜 결과 사이에서 결정을 내려야 하는 고전적인 철학적 난제인 '트롤리 문제'의 현대적 버전입니다. 수십 년 동안 철학자들은 서로 다른 생명의 가치를 저울질하고, 행동을 취하는 것과 아무것도 하지 않는 것의 도덕성을 따지며, 그러한 순간에 사람이 어떻게 행동해야 하는지에 대해 논쟁해 왔습니다. 이제 엔지니어들은 컴퓨터에게 이러한 선택을 하도록 가르치려 노력하고 있습니다. 과제는 단순히 일련의 엄격한 규칙을 따르는 컴퓨터 프로그램을 작성하는 것이 아니라, 때로는 무질서하고 일관성이 없으며 깊이 감정적인 인간의 가치를 이해하도록 기계를 가르치는 것입니다.
스토니브룩 대학교의 연구팀은 기계가 고정된 지침을 프로그래밍받는 대신, 사람으로부터 직접 복잡한 인간의 가치를 학습할 수 있는지 테스트하기 위해 연구를 시작했습니다. 그들은 자율주행차가 임박한 충돌에 직면했을 때 개입하도록 설계된 특수 소프트웨어 계층인 '윤리적 결정 헤드(Ethical Decision Head)'라고 불리는 시스템을 구축했습니다. 이 찰나의 순간에 자동차는 경로를 유지할지, 왼쪽으로 피할지, 아니면 오른쪽으로 피할지를 결정해야 합니다. 연구진은 강화 학습(reinforcement learning from human feedback)이라는 방법을 사용하여 이 시스템을 훈련할 수 있는지 확인하고자 했습니다. 컴퓨터에게 정확히 무엇을 해야 하는지 알려주는 대신, 200가지의 충돌 시나리오를 보여주고 두 명의 자원봉사자에게 두 가지 선택지 중 더 나은 결과를 선택하도록 요청했습니다. 그런 다음 컴퓨터는 이러한 인간의 선택을 모방하여 그 이면에 담긴 도덕적 논리를 내면화하기를 기대하며 학습했습니다.
이 아이디어를 테스트하기 위해 연구진은 컴퓨터가 따라야 할 두 가지 서로 다른 규칙 세트를 만들었습니다. 첫 번째는 전체 생명을 가장 많이 구하는 행동이 옳은 행동이라고 말하는 공리주의에 기반했습니다. 두 번째는 인간을 타인을 구하기 위한 도구로 사용하는 것과 같이 결과와 상관없이 어떤 행동은 잘못되었다고 주장한 임마누엘 칸트의 사상에 기반했습니다. 연구진은 이 시스템이 두 가지 접근 방식 모두를 학습하도록 훈련했습니다. 칸트의 규칙에 따라 시스템을 테스트했을 때, 결과는 완벽했습니다. 컴퓨터는 어떤 상황에서도 보행자 쪽으로 핸들을 꺾지 않는 것만이 유일하게 올바른 움직임임을 빠르게 학습했고, 이 규칙을 예외 없이 고수했습니다. 이 성공은 훈련 시스템 자체가 제대로 작동하고 있으며, 컴퓨터가 엄격한 도덕적 규칙을 학습할 능력이 있음을 증명했습니다.
그러나 연구진이 공리주의 규칙으로 전환했을 때, 결과는 놀라울 정도로 달랐습니다. 그들은 컴퓨터가 모든 시나리오에서 수학적으로 올-바른 선택을 함으로써 총 부상자 수를 최소화하는 법을 배울 것이라고 예상했습니다. 하지만 컴퓨터는 전혀 다른 것을 배웠습니다. 200가지의 다양한 충돌 시나리오를 분석한 후, 시스템은 거의 절반의 사례에서 생명을 구하는 선택을 하는 데 실패했습니다. 피해를 최소화하는 대신, 시스템은 보행자를 능동적으로 치는 것을 피하기 위해 자신이나 승객을 희생시키는 행동 패턴을 선호하기 시작했습니다. 이는 피드백을 제공한 인간 자원봉사자들이 철학자들의 규칙이 제시하는 것처럼 생명을 구하는 선택을 실제로 자주 하지 않았기 때문입니다. 사람들은 수학적 규칙보다 차라리 아무것도 하지 않거나 자신을 희생하는 것을 선호하는 경향을 보였습니다. 그들은 능동적으로 사람을 향해 조향하는 것이 사고로 인해 비극이 발생하는 것보다 더 나쁘다고 느꼈던 것인데, 이는 '부작위 편향(omission bias)'이라고 알려진 심리적 경향입니다. 특히 이번 연구에서는 일반 대학생 집단에서 모집된 단 두 명의 평가자만을 사용했다는 점이 결과의 일반화에 중요한 제한 요소가 되었습니다.
이 연구는 사람들이 이론적으로 믿는 바와 실제로 보상하는 바 사이에 깊은 간극이 있음을 드러냈습니다. 연구진이 인간의 피드백을 제거하고 오직 생명을 구한다는 엄격한 수학적 목표에 따라 컴퓨터를 훈련했을 때, 컴퓨터는 즉시 매우 정확해졌으며 90% 이상의 사례에서 생명을 구하는 경로를 올바르게 선택했습니다. 이는 컴퓨터가 공리주의 철학을 학습할 능력이 있었지만, 인간의 피드백이 그 목표로부터 컴퓨터를 끌어내렸음을 입了 증명합니다. 기계는 윤리를 배우는 데 실패한 것이 아니라, 인간의 모순과 감정적 편향을 포함한 인간의 윤리를 정확하게 배운 것입니다. 연구진은 우리가 사람들에게 무엇을 선호하는지 물어봄으로써 기계에게 도덕성을 가르치려 할 때, 실제 결과보다 우리의 감정을 우선시하는 일관성 없는 방식을 가르치게 될 수도 있다는 것을 발견했습니다.
이 발견은 단순히 사람들이 원하는 것을 묻는 것만으로는 진정으로 윤리적인 자율주행차를 만드는 데 충분하지 않을 수 있음을 시사합니다. 만약 목표가 일관되게 가장 많은 생명을 구하는 시스템을 만드는 것이라면, 인간의 피드백에 의존하는 것은 오히려 자동차를 덜 안전하게 만들 수 있습니다. 왜냐하면 인간은 종데 전체적인 결과보다 순간적으로 옳다고 느껴지는 행동을 선호하는 경우가 많기 때문입니다. 이 연구는 기계에 도덕성을 프로그래밍하는 방법이 해결되었다고 주장하는 것이 아니라, 그 경로가 단순히 인간의 선택을 복제하는 것보다 훨씬 더 복잡하다는 것을 보여줍니다. 이는 근본적인 긴장 상태를 강조합니다. 우리가 윤리에 대해 생각할 때 머릿속에 품고 있는 가치는 실제 상황을 판단할 때 내리는 선택과 항상 일치하지는 않습니다. 기계가 생사가 걸린 결정을 내리는 미래로 나아가면서, 우리는 기계가 우리의 불완전한 인간적 본능을 따르기를 원하는지, 아니면 더 엄격하고 일관된 원칙을 따르기를 원하는지 결정해야 할 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.