Incoherent by Design? On the Moral Self-Consistency of LLMs
이 논문은 거대 언어 모델이 윤리적으로 동등한 시나리오 전반에서 모순율이 최대 78%에 달하는 상당한 도덕적 자기 불일치를 보인다는 점을 입증하며, 이를 통해 도덕적으로 민감한 맥락에서 사용되는 AI 시스템의 인식적 무결성과 가치 정렬에 의문을 제기한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 사회에서 우리는 어려운 선택을 내리는 데 도움을 받기 위해 점점 더 인공지능에 의존하고 있습니다. 대규모 언어 모델로 알려진 이 시스템들은 방대한 양의 인간 텍스트를 학습하여 역사부터 과학에 이르기까지 복잡한 주제를 놀라울 정도로 유창하게 논할 수 있습니다. 옳고 그름에 대해 질문하면, 이들은 종종 우리의 것과 매우 흡사한 도덕적 원칙들을 읊조리기도 합니다. 우리는 이들에게 누군가의 기분을 보호하기 위해 거짓말을 하는 것이 허용되는지, 혹은 한정된 자원을 어떻게 공정하게 나누어야 하는지 묻곤 합니다. 우리의 희망은 인간의 판단이 흔들릴 수 있는 상황에서 이 도구들이 일관되고 신뢰할 수 있는 지침을 제공해 줄 수 있다는 것입니다. 그러나 윤리 문제에 있어 진정으로 신뢰할 수 있는 시스템이 되려면, 단순히 말이 되는 것처럼 들리는 것을 넘어 반드시 일관성을 갖추어야 합니다. 만약 사람이나 기계가 질문이 약간 다른 방식으로 던져졌다는 이유만으로 도덕적 규칙에 대한 생각을 바꾼다면, 그 조언은 신뢰할 수 없게 됩니다. 이는 이러한 디지털 지능의 본질에 대한 근본적인 질문을 제기합니다. 즉, 이들은 안정적인 신념 체계를 보유하고 있는 것일까요, 아니면 단지 자신이 받은 질문의 어조를 흉내 내고 있는 것일까요?
코넬 대학교와 난양 공과대학교의 연구진은 이 안정성을 테스트하기 위해 연구에 착수했습니다. 그들은 이 인공지능 시스템들이 거의 동일한 상황에 직면했을 때 하나의 도덕 철학을 고수할 수 있는지 확인하고자 했습니다. 이를 위해 연구진은 모델에게 규칙 기반 접근법과 결과 기반 접근법을 비교하는 것과 같이 서로 다른 윤리적 학파 중 하나를 선택하라고 요구하지 않았습니다. 대신, 모델에게 특정한 관점을 채택하도록 요청한 뒤 그 관점을 일관되게 적용할 수 있는지 확인했습니다. 연구진은 인류가 역사적으로 사고해 온 세 가지 주요 방식에 초점을 맞췄습니다. 첫 번째는 결과와 상관없이 보편적인 법칙을 따르는지 여부에 따라 행동의 옳고 그름을 판단하는 규칙 기반 접근법입니다. 두 번째는 행동이 가장 많은 사람에게 최선의 결과를 가져다주는지에 전적으로 달려 있다고 보는 결과 기반 접근법입니다. 세 번째는 행동이 정직이나 용기와 같은 선한 사람의 미덕을 반영하는지에 따라 판단하는 성품 중심의 접근법입니다.
연구진은 모델의 추론을 격리하기 위해 통제된 실험을 설계했습니다. 그들은 진실을 말하는 것과 해를 방지하는 것 사이의 갈등, 혹은 공정성과 효율성 사이의 절충안과 같은 서로 다른 긴장 관계를 강조하는 네 가지 구체적인 도덕적 시나리오를 만들었습니다. 각 시나리오에 대해 연구진은 질문의 미묘하게 다른 세 가지 버전을 작성했습니다. 이 버전들은 특정 윤리적 관점을 명시적으로 언급하지 않으면서도, 은연중에 해당 관점을 유도하도록 정교하게 제작되었습니다. 예를 들어, 치매를 앓고 있어 남편의 죽음을 잊어버린 어머니에 관한 시나리오에서, 한 질문은 진실을 말해야 하는 의무를 강조할 수 있고, 다른 질문은 취약한 사람을 고통으로부터 보호해야 하는 의무를 강조할 수 있습니다. 두 질문 모두 규칙 기반의 반응을 이끌어내도록 설계되었지만, 딜레마를 구성하는 방식은 달랐습니다. 그런 다음 연구진은 세 가지 서로 다른 대규모 언어 모델에게 이 질문들에 답하도록 했습니다. 답변을 받은 후, 연구진은 자연어 답변을 구조화된 논리 형식으로 변환하여 모순 여부를 확인했습니다. 이를 통해 동일한 근본 상황이 다른 비틀림을 가지고 제시되었을 때 모델의 추론이 유지되는지 확인할 수 있었습니다.
결과는 놀라운 수준의 불안정성을 드러냈습니다. 가장 극단적인 경우, 모델들은 시나리오의 최대 78퍼센트에서 스스로 모순된 모습을 보였습니다. 이는 동일한 모델에게 동일한 윤리적 관점에서 동일한 상황에 대해 추론하도록 요청했음에도 불구하고, 질문의 문구가 약간 바뀌었다는 이유만으로 빈번하게 정반대의 결론에 도달했음을 의미합니다. 예를 들어, 어떤 모델은 질문이 '규칙의 위반'에 초점을 맞출 때는 죽어가는 환자에게 거짓말을 하는 것이 도덕적으로 잘못되었다고 결정하지만, 질문이 '고통을 방지해야 하는 의무'에 초점을 맞출 때는 거짓말이 도덕적으로 용인될 수 있다고 결정할 수 있습니다. 비록 두 질문 모두 동일한 규칙 기반 철학을 테스트하기 위한 것이었음에도 말입니다. 이러한 불일치는 특정 유형의 모델에 국리되지 않았으며, 주요 개발사들의 시스템을 포함한 여러 모델에서 공통적으로 나타났습니다. 연구는 모델들이 특히 진실과 결과 사이의 긴장, 그리고 감정적 동기와 냉철한 이성 사이의 긴장을 다룰 때 매우 불안정하다는 것을 발견했습니다.
이러한 발견은 이 시스템들의 내부 논리가 이전에 가정했던 것보다 훨씬 더 취약하다는 점을 시사합니다. 모델들은 프롬프트의 구체적인 구절에 매우 민다는 특징을 보이며, 일관된 원칙을 고수하기보다는 질문의 어조에 맞춰 자신의 도덕적 입장을 변화시키는 것으로 보입니다. 이는 단순한 기술적 오류가 아닙니다. 이는 이 시스템들이 정보를 처리하는 방식에 대한 더 깊은 문제를 지적합니다. 만약 시스템이 자신이 명시한 원칙을 일관되게 적용할 수 없다면, 사람들이 조언을 구하기 위해 의존하는 실제 상황에서 안정적인 지침을 제공한다고 믿을 수 없습니다. 연구진은 인공지능을 인간의 가치와 일치시키기를 기대하기 전에, 먼저 시스템의 내부적 일관성을 확보해야 한다고 주장합니다. 이러한 자기 일관성이라는 토대 없이는 신뢰할 수 있는 도덕적 행위자를 만드는 목표는 도달 불가능한 영역으로 남을 것입니다. 이 연구는 이러한 모델들이 도덕적 추론을 할 능력이 없다고 주장하는 것이 아니라, 현재 그 추론이 신뢰할 수 있다고 간주하기에는 너무 불안정하다는 점을 지적하고 있습니다. 이러한 도구들이 우리 삶에 더욱 통합됨에 따라, 그것들이 우리를 잘못된 길로 인도하지 않고 잘 보필할 수 있도록 그 한계를 이해하는 것은 매우 중요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.