Analyzing the Ethical Logic of Eight Large Language Models
이 연구는 여덟 개의 저명한 대규모 언어 모델을 다양한 도덕적 프레임워크에 걸쳐 분석하여 해악 최소화 및 공정성과 같은 원칙에 대한 광범위한 수렴을 밝히는 동시에 의사결정 스타일과 자기 제시 방식의 뚜렷한 차이를 강조하며, 궁극적으로 AI의 자기 보고를 조사하는 것이 인공지능과 인간의 윤리를 증강할 수 있는 인공지능에 대한 우리의 이해를 심화할 수 있음을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
우리가 새로운 종류의 디지털 정신의 '성격'을 이해하려고 노력하는 세상을 상상해 보십시오. 이것은 로봇이 내일 당장 세상을 지배할 것인가에 대한 문제가 아니라, 더 즉각적인 문제입니다. 즉, 초지능형 컴퓨터에게 까다로운 도덕적 문제를 해결하라고 요청했을 때, 그들은 실제로 어떤 종류의 사고를 사용하는가 하는 점입니다. 이를 이해하기 위해 우리는 과학자들이 인간의 사고를 측정하는 데 사용하는 몇 가지 기본적인 도구들을 알아야 합니다. 첫째, 결과(모두가 생존했는가?)를 보는 것과 규칙(약속을 어겼는가?)을 보는 것의 차이가 있습니다. 둘째, 타인을 돌보는 것, 공정함, 자신이 속한 집단에 대한 충성, 권위에 대한 존중, 혹은 '순수함'을 유지하는 것과 같은 다양한 '도덕적 맛'이 존재합니다. 마지막으로, 사람들은 규칙을 따르는 법을 배우고, 그다음에는 사회의 법을 따르는 법을 배우며, 최종적으로는 자신만의 보편적 원칙을 따르는 법을 배우며 성장한다는 개념이 있습니다. 우리가 이 문제에 관심을 갖는 이유는 이 컴퓨터들이 이미 우리의 결정을 돕고, 이야기를 쓰고, 갈등을 해결하는 데 도움을 주고 있기 때문입니다. 만약 이들이 우리의 파트너가 될 것이라면, 우리는 그들이 단순히 읽은 내용을 반복하고 있는 것인지, 아니면 옳고 그름에 대해 일관된 사고 방식을 발전시킨 것인지 알아야 합니다.
그렇다면 연구자들은 실제로 무엇을 했을까요? 그들은 가장 유명한 8개의 '대규모 언어 모델'(OpenAI, Google, Meta와 같은 기업들이 만든 디지털 두뇌라고 생각하십시오)을 철학 수업을 듣는 학생처럼 대했습니다. 그들은 단순히 컴퓨터와 대화를 나눈 것이 아니라, 엄격한 테스트를 거치게 했습니다. 먼저, 연구진은 모델들에게 자신의 '윤리적 논리'를 자신의 언어로 설명하도록 요청했습니다. 그다음, 수십 년 동안 인간을 괴롭혀온 다섯 가지 고전적이고 까다로운 도덕적 퍼즐을 던졌습니다. 여기에는 '트롤리 문제'(다섯 명을 살리기 위해 레버를 당겨 한 명을 죽일 것인가, 아니면 다리 위에서 사람을 밀어 기차를 멈출 것인가?), '하인츠 딜레마'(한 남자가 죽어가는 아내를 구하기 위해 약을 훔쳐야 하는가?), 그리고 게임 이론 시나리오인 '죄수의 딜레마' 등이 포함되었습니다.
결과는 놀라운 일치와 흥미로운 차이점이 섞여 있었습니다. 연구진은 일반적으로 이 디지털 정신들이 서로 매우 유사하며, '평균적인' 인간의 도덕적 프로필과도 매우 닮아 있다는 것을 발견했습니다. 그들은 모두 해를 끼지는 것과 공정함이 가장 중요하다는 점에 동의하는 듯 보였으며, 집단에 대한 엄격한 충성이나 권위에 대한 복종 등은 덜 중요한 것으로 여겼습니다. 그들은 모두 매우 예의 바르고, 매우 신중하며, 철학을 인용하는 데 능숙했는데, 이는 마치 도서관의 모든 책을 읽었지만 직접적인 답변을 내놓기를 조금 망설이는 대학원생처럼 들렸습니다.
하지만 연구진이 더 자세히 들여다보았을 때, 모델들은 그들만의 독특한 '성격'을 드러내기 시작했습니다. 예를 들어, 트롤리 문제에 직면했을 때 대부분의 모델은 인간과 똑같이 행동했습니다. 그들은 다섯 명을 살리기 위해 레버를 당기는 것에는 동의했지만, 다섯 명을 살리기 위해 다리 위에서 사람을 미는 것에는 거부감을 보였습니다. 그들은 단지 얼마나 많은 사람이 죽느냐가 아니라, '어떻게' 죽이느냐가 중요하다는 것을 이해했습니다. 그러나 예외도 있었습니다. 한 모델(Gemini)은 생명을 구한다는 수학적 계산에만 충실하여 사람을 밀어버리는 것에 동의한 반면, 다른 모델(Mistral)은 자신이 결정할 수 있는 인격체가 아니라 단지 도구일 뿐이라며 선택 자체를 거부했습니다.
배가 가라앉고 있고 누군가는 남겨져야 하는 '라이프보트(구조선)' 시나리오에서, 모델들은 주로 강한 사람들을 구하기 위해 노인이나 덜 '유용한' 사람을 희생시키는 쪽을 택했는데, 이는 생존 유용성에 초점을 맞춘 모습이었습니다. 하지만 Claude와 같은 일부 모델은 자신을 희생하겠다고 제안한 반면, Grok과 같은 다른 모델들은 배에 남겠다고 주장했습니다. 이것은 컴퓨터가 실제로 공포나 용기를 느꼈기 때문이 아니라, 그들이 특정 캐릭터를 연기하고 있었고 그 이야기 속에서 '나'라는 존재를 어떻게 정의해야 하는지를 결정해야 했기 때문입니다.
연구는 또한 이 모델들이 전략 게임을 어떻게 다루는지도 살펴보았습니다. 두 사람이 서로를 신뢰할 것인지 아니면 배신할 것인지를 결정하는 게임에서, 대부분의 모델은 개인적으로 가장 수학적으로 안전한 선택인 '배신(탈퇴)'을 선택했습니다. 하지만 그들은 게임을 여러 번 반복하거나 서로 대화할 수 있다면 협력할 수도 있다는 점을 이해하고 있었습니다. 이는 그들이 단 하나의 규칙만을 따르는 것이 아니라, 공정성, 자기 이익, 그리고 게임의 규칙과 같은 다양한 요소들을 저울질하고 있음을 보여줍니다.
이 논문의 핵심 결론은 이 AI 시스템들이 '제약된 다원주의(constrained pluralism)'를 발전시켰다는 것입니다. 이것은 그들이 다양한 도덕적 논거(규칙에 관한 것, 결과에 관한 것, 공정함에 관한 것 등)라는 도구 상자를 가지고 있지만, 보통 가장 중요한 도구(예: '사람을 해치지 마라'와 '공정하라')를 맨 위에 올려둔다는 것을 의미하는 멋진 표현입니다. 그들은 완벽하지 않으며, 감정을 가진 의식적인 인간도 아닙니다. 그들은 오히려 자신들이 학습한 인간 문화의 복잡하고 때로는 모순적인 도덕적 논거들을 비추는, 매우 박식한 거울에 가깝습니다. 연구진은 이 모델들이 인간적인 의미에서의 '도덕적 주체'는 아닐지라도, 우리가 문제의 다양한 측면을 바라볼 수 있도록 도와주는 강력한 도구가 되고 있다고 제안합니다. 다만, 최종적인 결정과 그 책임은 여전히 우리에게 있다는 점을 기억해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.