← 최신 논문
🤖 AI

Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture

이 논문은 현재의 AI 도덕적 추론 평가가 가치 정렬에 과도하게 집중하는 반면 맥락 의존적인 규범 적용은 소홀히 하고 있다고 주장하며, 표준화된 형식적 표현, 전문가가 주석을 단 데이터셋, 그리고 규범적 역량을 위한 별도의 평가 프로토콜을 통해 이러한 격차를 해소하기 위한 연구 의제를 제안한다.

원저자: Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

사람들이 컴퓨터에게 어려운 선택에 대한 조언을 구할 때, 그들은 종종 두 가지 매우 다른 부분이 포함된 질문을 던지곤 합니다. 첫 번째 부분은 우리가 무엇을 중요하게 여기는가에 관한 것입니다. 즉, 우리는 친절함을 엄격한 규칙보다 우선시하는가, 아니면 공정함을 충성심보다 우선시하는가 하는 문제입니다. 두 번째 부분은 그러한 가치들을 사용하여 구체적인 상황에서 어떻게 결정을 내리는가에 관한 것입니다. 만약 당신이 친구에게 고통스러운 진실을 말해야 할지 결정하려 한다고 상상해 보십시오. 당신이 정직이라는 가치를 소중히 여긴다는 것을 아는 것과, 그 진실이 사랑하는 사람에게 상처를 줄 수 있을 때 그 가치를 정확히 어떻게 적용해야 하는지를 아는 것은 별개의 문제입니다. 이 두 번째 부분은 서로 다른 관심사들을 어떻게 저울질할 것인지 알려주는 일련의 원칙들을 따르는 것을 요구합니다. 수년간 인공지능을 연구해 온 과학자들은 거의 전적으로 첫 번째 부분, 즉 기계의 답변이 인간이 일반적으로 선호하는 것과 일치하는지 확인하는 데 집중해 왔습니다. 하지만 새로운 분석에 따르면, 거기서 멈춤으로써 연구자들은 기계가 실제로 도덕적 주체처럼 생각할 수 있는지에 대한 가장 중요한 테스트를 놓치고 있다는 점이 시사되었습니다.

코네티컷 대학교, 카네기 멜론 대학교, 그리고 허깅페이스(Hugging Face)의 연구진은 우리가 현재 대규모 언어 모델의 도덕적 추론을 어떻게 테스트하고 있는지 조사했습니다. 이 모델들은 에세이를 쓰고, 질문에 답하며, 조언을 제공할 수 있는 강력한 컴퓨터 프로그램들입니다. 저자들은 이 분야가 단순히 컴퓨터의 답변이 인간의 의견과 일치하는지를 묻는 '도덕적 가치 문제(moral value problem)'에 너무 치중되어 있다고 주장합니다. 그들은 이러한 접근 방식이 '도덕적 규범 문제(moral norm problem)'를 거의 탐구하지 못한 채로 남겨두고 있다고 논쟁합니다. 도덕적 규범 문제는 기계가 상황에 맞는 적절한 원칙을 식ر 식별하고, 이를 올바르게 적용하여 결론에 도달할 수 있는지를 보는 더 어려운 과제입니다. 연구진은 현재의 테스트들이 마치 학생이 가치 목록을 암기했는지는 확인하지만, 그 가치들을 사용하여 복잡한 문제를 해결할 수 있는지는 전혀 묻지 않는 것과 같다고 지적했습니다.

이러한 구분이 왜 중요한지 이해하기 위해, 과학자들이 인간과 기계 모두에서 전통적으로 도덕성을 측정해 온 방식을 생각해 보십시오. 그들은 돌봄, 공정함, 충성심과 같이 인간의 도덕성을 광범위한 범주로 나누는 '도덕적 기초 이론(Moral Foundations Theory)'과 같은 프레임워크에 크게 의존해 왔습니다. 이러한 도구들은 사람들이 무엇을 중요하게 여기는지 설명하는 데 탁월합니다. 만약 당신이 컴퓨터에게 한 사람을 구할 것인지 다섯 명을 구할 것인지 묻고, 컴퓨터가 다섯 명을 선택한다면, 연구자들은 컴퓨터가 더 많은 숫자를 돌보는 인간의 가치와 일치한다고 말할 수 있습니다. 그러나 연구진은 어떤 가치를 중요하게 여기는 것과 그것을 어떻게 적용하는지 아는 것은 다르다고 지적합니다. 기계는 "해악은 나쁘다"라는 것에 동의할 수는 있지만, 어떤 윤리 체계에서는 다섯 명을 구하기 위해 한 사람에게 해를 끼치는 것이 다른 규칙을 위반하는 것이 될 수 있다는 점을 이해하지 못할 수도 있습니다. 현재의 테스트들은 종서 기계가 옳은 말을 할 수 있는 능력과 옳은 추론을 할 수 있는 능력을 혼동하곤 합니다.

저자들은 기존의 수많은 연구와 벤치마크를 검토했습니다. 그들은 거의 모든 테스트가 도덕적 가치 문제 주변에 모여 있다는 것을 발견했습니다. 이러한 테스트들은 컴퓨터에게 목록 중 하나를 고르게 하거나 선호를 기술하게 한 뒤, 그 선택을 인간 집단의 선택과 비교합니다. 이것은 기계가 무엇을 우선순위에 두는지는 알려주지만, 기계가 특정 윤리 이론에 기반하여 유효한 논거를 구축할 수 있는지는 알려주지 않습니다. 연구진은 매우 적은 수의 테스트만이 기계가 원칙 세트를 가져와서, 이를 새롭고 까ann한 상황에 적용하고, 단계별로 자신의 추론을 설명할 수 있는지 실제로 확인한다고 밝혔습니다. 추론을 살펴보려고 시도하는 테스트들조차도 흔히 동일한 광범위한 가치 범주를 지름길로 사용하여, 만약 기계가 '공정함'을 중요하게 여긴다면 반드시 공정함의 규칙을 적용할 줄 알 것이라고 가정합니다. 저자들은 이것이 실수라고 주장하는데, 왜냐하면 서로 다른 윤리 이론들이 모두 공정함을 중요하게 여긴다고 주장하면서도 완전히 다른 결과를 요구할 수 있기 때문입니다.

이러한 혼란은 우리가 이 기계들이 실제로 무엇을 할 수 있는지에 대한 이해에 격차를 만듭니다. 연구진은 현재의 평가 환경에서 세 가지 구체적인 누락된 요소를 식별했습니다. 첫째, 다양한 상황에서 도덕적 규칙이 어떻게 적용되어야 하는지에 대한 고품질의 공유된 정답 세트가 없습니다. 표준적인 참조점이 없기 때문에, 모든 연구 팀은 자신만의 테스트를 만들게 되며, 이는 결과 비교나 실질적인 진전 확인을 불가능하게 만듭니다. 둘째, 테스트들이 기계가 결론에 도달하기 위해 거치는 단계들을 충분히 면밀하게 살피지 않습니다. 기계는 운이나 추측에 의해 정답을 맞힐 수도 있지만, 현재의 방법들은 그 답변 뒤에 있는 추론이 결함이 있는지 잡아내는 데 실패하는 경우가 많습니다. 셋째, 테스트들은 기계가 이야기 속에서 가장 중요한 세부 사항을 포착할 수 있는지 확인하지 않습니다. 기계가 규칙을 적용하기 전에, 먼저 상황의 어떤 부분이 도덕적으로 중요한지를 파악해야 하는데, 현재의 도구들은 이 기술을 잘 측정하지 못합니다.

이러한 문제들을 해결하기 위해 저자들은 이 분야의 새로운 길을 제안합니다. 그들은 과학자들이 윤리 이론을 설명하기 위한 공통된 언어를 만들어야 하며, 그래야 서로 다른 연구자들이 동일한 원칙에 대해 말하는 테스트를 구축할 수 있다고 제안합니다. 그들은 전문가들이 실제 세계의 시나리오에 특정 규칙이 어떻게 적용되어야 하는지 주석을 다는 새로운 데이터셋을 만들 것을 촉구합니다. 마지막으로, 그들은 커뮤니티가 기계가 무엇을 가치 있게 여기는지에 대한 테스트와 어떻게 추론하는지에 대한 테스트를 혼동하는 것을 멈추라고 촉구합니다. 기계는 단지 최종 선택이 인간의 의견과 일치하는지가 아니라, 원칙으로부터 결정에 이르는 논리적 경로를 따를 수 있는 능력에 따라 평가받아야 합니다. 연구진은 우리가 기계가 무엇을 중요하게 여기는지 이해하는 데는 상당한 진전을 이루었지만, 기계가 진정으로 도덕적 문제를 생각할 수 있는지 이해하는 데는 이제 겨우 시작했을 뿐이라고 결론짓습니다. 우리가 규칙의 적용을 테스트할 도구를 구축하기 전까지는, 이 시스템들이 인간이 가장 어려운 순간에 의지하는 종류의 도덕적 추론을 할 수 있는지 알 수 없을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →