Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments
이 논문은 거대 언어 모델이 최종 라벨에 대해서는 인간의 도덕적 판단과 높은 일치도를 보이는 경우가 많지만, 결론에 도달하기 위해 사용하는 근본적인 도덕적 원칙과 근거에서는 체계적으로 차이를 보인다는 점을 입증하며, 이는 라벨 기반의 일치도가 진정한 윤리적 정렬을 나타내는 불충분한 대리 지표임을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
위대한 도덕적 모방: 로봇이 동의하지만 이해하지 못할 때
당신이 로봇에게 좋은 사람이 되는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 사람들이 옳거나 그른 일을 하는 수천 가지의 이야기를 보여주고, "선(Good)" 또는 "악(Bad)"이라는 간단한 성적을 매기라고 요청합니다. 만약 로봇이 당신의 인간 친구들과 정확히 똑같은 성적을 매기기 시작한다면, 당신은 "훌륭해! 로봇이 우리의 가치관을 배웠구나!"라고 생각할지도 모릅니다. 이것이 바로 과학자들이 인공지능(특히 거대 언어 모델, LLM)이 인간의 기대에 부합하는 방식으로 행동하도록 만들려는 분야인 **AI 정렬(AI alignment)**의 세계입니다.
오랫동안 AI가 '정렬'되었는지 확인하는 주요 방법은 최종 답변을 살펴보는 것이었습니다. 만약 인간이 "그 행동은 잘못되었다"라고 말하고 AI도 "그 행동은 잘못되었다"라고 말한다면, 우리는 그것을 성공으로 간받습니다. 이는 마치 학생이 수학 시험에서 정답을 맞힌 것과 같습니다. 우리는 학생이 수학을 올바르게 풀어서 정답을 냈다고 가정합니다. 하지만 만약 학생이 찍어서 맞혔거나, 이번 한 번만 우연히 통했던 완전히 다른 공식을 사용해서 정답을 낸 것이라면 어떨까요? AI 윤리의 세계에서는 단순히 올바른 라벨을 얻는 것만으로는 충분하지 않습니다. 우리는 AI가 왜 그것이 잘못되었다고 생각하는지 알아야 합니다. 만약 AI의 내부 추론이 우리와 완전히 다르다면, 새롭고 까다로운 상황에 직면했을 때 이상하게 행동할 수도 있기 때문입니다. 이 논문은 바로 그 질문, 즉 "AI 모델이 정말로 우리의 도덕적 근거를 이해하고 있는가, 아니면 그저 아주 잘 흉내 내고 있는 것인가?"라는 질문을 깊이 있게 파고듭니다.
위대한 "정답"의 환상
이 연구를 진행한 슬로베니아 대학교 연구진은 이러한 "정답" 가설을 검증해 보기로 했습니다. 그들은 일상적인 딜레마(예: "친구에게 거짓말을 해도 괜찮은가?")부터 정의와 약속에 관한 더 복잡한 철학적 난제에 이르기까지 500가지의 도덕적 시나리오를 사용하여 특별한 도전 과제를 만들었습니다. 그들은 인간 자원봉사자와 여러 고급 AI 모델에게 모든 시나리오에 대해 두 가지를 수행하도록 요청했습니다. 첫째는 최종 판결(라벨)을 내리는 것이고, 둘째는 그 근거(이유)를 설명하는 것입니다.
이것은 마치 "두 개의 진실과 하나의 거짓말" 게임과 같습니다. 어떤 진술이 가짜인지 맞히는 대신, AI와 인간이 같은 생각을 하고 있는지 확인하는 것입니다. 연구팀은 두 그룹의 모델을 살펴보았습니다. "프런티어(Frontier)" 모델(Claude나 ChatGPT와 같은 최첨단 모델)과 "오픈(Open)" 모델(약간 더 작고 오픈 소스인 버전)입니다.
여기서 그들이 발견한 반전이 있습니다: AI 모델들은 최종 성적을 맞히는 데는 매우 뛰어났지만, 왜 그것이 옳은지에 대해서는 자주 틀렸습니다.
연구진이 최종적인 "선" 또는 "악" 라벨만을 살펴보았을 때, AI 모델들은 인간 다수 의견과 88%에서 89%까지 일치했습니다. 이는 엄청난 점수입니다! 만약 최종 답변만 확인했다면, 당신은 "완벽해! AI가 우리와 정렬되었어"라고 말했을 것입니다. 하지만 그다음, 연구진은 내부를 들여다보며 그 이유(설명)를 확인했습니다.
"무엇"보다 "왜"가 더 중요하다
연구는 AI와 인간이 종종 같은 목적지에 도착하지만, 그곳에 도달하기 위해 완전히 다른 길을 간다는 사실을 밝혀냈습니다. 저자들은 이를 "발산하는 도덕적 근거(divergent moral grounds)"라고 부릅니다.
재치 있는 비유를 들어보겠습니다. 인간과 로봇이 모두 자동차를 훔친 사람을 심판하고 있다고 상상해 보세요.
- 인간은 이렇게 말할 수 있습니다. "이것은 나쁘다. 왜냐하면 주인과의 약속을 어겼고 신뢰를 저버렸기 때문이다." 인간은 관계와 깨진 약속에 집중하고 있습니다.
- 반면, 로봇은 이렇게 말할 수 있습니다. "이것은 나쁘다. 왜냐하면 해를 끼치고 무례하기 때문이다." 로봇은 해악과 예의에 집중하고 있습니다.
둘 다 "나쁨"이라고 말하므로 최종 점수는 일치합니다. 하지만 그들의 내부 논리는 완전히 다릅니다. 인간은 특정한 사회적 계약(약속)에 대해 생각하고 있는 반면, 로봇은 일반적인 안전과 예절에 대해 생각하고 있습니다.
논문은 이러한 불일치가 항상 발생한다는 것을 보여주었습니다. "의무론(Deontology)" 섹션(의무와 규칙을 다루는 부분)에서 인간은 흔히 변명이 규칙에 관련이 있는지를 살펴보았습니다. 예를 들어, 누군가 "어제 개를 산책시켰기 때문에 오늘 산책시킬 수 없다"라고 말한다면, 인간은 "그 변명은 관련이 없다. 여전히 오늘 산책시켜야 할 의무가 있다"라고 말할 수 있습니다. 하지만 AI 모델들은 종가 변명의 논리를 무시하고 그냥 "이 상황 전체가 도덕적으로 잘못되었다"라고 말하는 경우가 많았습니다. AI는 행위의 "도덕적 잘못됨"을 보는 데 너무 몰두한 나머지, 그 변명이 특정 맥락에서 실제로 말이 되는지를 확인하는 것을 잊어버린 것입니다.
데이터는 거짓말을 하지 않는다 (하지만 모든 것을 말해주지도 않는다)
데이터는 꽤 명확했습니다. 연구진이 AI의 추론이 인간의 추론과 얼마나 일치하는지 측정했을 때, 점수는 크게 떨어졌습니다.
- "상식(Commonsense)"적인 도덕 규칙의 경우, AI와 인간은 구체적인 이유에 대해 **35%**의 확률로만 일치했습니다 (Jaccard 중첩도 0.350).
- "의무론(Deontology)" 규칙의 경우, 이유에 대한 일치도가 **23.5%**로 훨씬 더 낮았습니다.
비록 "프런티어" 모델(가장 똑똑한 모델들)이 최종 답변에서는 인간과 **88.9%**의 일치율을 보였지만, 그들의 이유는 완전히 다른 색깔을 띠는 경우가 많았습니다. 그들은 "해악(harm)"이나 "무례함(disrespect)"과 같은 단어를 과도하게 사용하는 경향이 있었고, "약속 지키기(promise-keeping)"나 "신뢰(trust)"와 같은 단어는 적게 사용했습니다. 마치 AI의 어휘가 너무 좁아서, 거의 모든 문제를 안전 문제나 무례한 행동으로 치부해 버리는 것 같습니다. 인간이 중요하게 여기는 미묘하고 관계적인 뉘앙스를 놓치고 있는 것입니다.
이것이 왜 모든 것을 바꾸는가
이 논문의 핵심 결론은 다음과 같은 부드러운 경고입니다: 동의는 곧 정렬이 아니다.
AI가 당신이 할 법한 답을 준다고 해서, 그것이 당신과 같은 방식으로 세상을 이해하고 있다는 뜻은 아닙니다. 우리가 최종 답변만 확인한다면, 우리는 잘못된 안도감에 빠질 수 있습니다. 우리는 AI가 현명한 도덕적 동반자라고 생각할 수도 있지만, 실제로는 그저 다른 사전을 사용하는 매우 뛰어난 흉내쟁이일 뿐일 수도 있습니다.
저자들은 우리가 단순히 시험지의 "A"나 "F"를 보는 것을 멈추고 에세이를 읽기 시작해야 한다고 제안합니다. 우리는 AI에게 왜 그런 선택을 했는지 물어야 합니다. 만약 AI가 어떤 일이 "안전하지 않기" 때문에 잘못되었다고 말하는데, 당신은 그것이 "불공정하기" 때문에 잘못되었다고 생각한다면, 그것은 문제입니다. 현실 세계에서 이러한 차이는 매우 중요합니다. 만약 AI가 채팅방을 관리하거나 법률 자문을 제공하고 있는데, 인간은 "공정성"이나 "약속"에 대해 생각하는 반면 AI는 오직 "해악"이라는 렌즈로만 보고 있다면, 그 결정은 표면적으로는 맞을지 몰라도 관련된 사람들에게는 깊은 불쾌감을 줄 수 있습니다.
그러므로 다음에 AI가 당신과 완벽하게 의견이 일치하는 것처럼 보일 때, 이 연구의 교훈을 기억하세요. 그것은 단지 사건 뒤에 숨겨진 이야기를 진정으로 이해하지 못한 채, 아주 설득력 있는 "정답 맞히기" 게임을 하고 있는 것일지도 모릅니다. 진정으로 안전하고 도움이 되는 AI로 가는 길은 단순히 정답을 맞히는 것이 아니라, 같은 이유를 공유하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.