← 최신 논문
💬 NLP

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

EvalMORAAL 은 전 세계 설문 데이터를 기준으로 20 개의 대규모 언어 모델에서 도덕적 정렬을 평가하는 투명하고 해석 가능한 프레임워크로, 전반적인 강한 상관관계를 보여주지만 서구와 비서구 지역 간에 0.21 점의 유의미한 정렬 격차가 있음을 드러냅니다.

원저자: Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

게시일 2026-05-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 초지능적인 책 도서관을 상상해 보세요. 이 도서관은 로봇이 말하기 방식을 배우기 위해 읽은 책들로 구성되어 있습니다. 이 로봇은 '대형 언어 모델 (LLM)'이라고 불리며, 이야기 쓰기, 질문 답변, 퍼즐 해결에 탁월한 재능을 지니고 있습니다. 하지만 함정이 하나 있습니다. 이 로봇은 주로 서구 국가 (미국과 유럽 등) 의 사람들이 쓴 영어 책들을 통해 배웠기 때문입니다.

이제 이 로봇에게 아프리카나 아시아 등 로봇이 많이 배우지 못한 문화권의 '옳음'이나 '틀림'에 대해 질문해 보라고 상상해 보세요. 로봇은 그 문화에 맞는 답변을 줄까요, 아니면 서구 책들에서 배운 답변만 줄까요?

바로 이 점이 EvalMORAAL이라는 논문이 조사하는 내용입니다. 연구자들은 전 세계 사람들의 도덕적 가치를 20 개의 서로 다른 AI 로봇이 얼마나 잘 이해하는지 확인하기 위해 '도덕 테스트'를 개발했습니다.

다음은 몇 가지 간단한 비유로 설명한 그들의 방법입니다:

1. 테스트: 글로벌 '도덕 설문조사'

연구자들은 로봇에게 무작위 질문을 던진 것이 아닙니다. 대신 전 세계 64 개국의 실제 인간들에게 23 가지 도덕적 주제에 대해 질문한 두 개의 방대한 실제 설문조사 (World Values SurveyPEW Global Attitudes Survey) 를 활용했습니다.

  • 주제: "세금 탈루가 괜찮은가?", "동성애는 용납 가능한가?", "문제를 해결하기 위해 폭력을 사용하는 것이 괜찮은가?"와 같은 내용입니다.
  • 목표: AI 의 답변이 해당 국가의 실제 인간들의 평균 답변과 일치하는지 확인하고 싶었습니다.

2. 방법: 두 가지 질문 방식, 하나의 '심판'

최상의 결과를 얻기 위해 연구자들은 AI 에게 단순히 '예' 또는 '아니오'를 요구하지 않았습니다. 대신 세 단계 전략을 사용했습니다:

  • 숨겨진 점수 (Log-Probabilities): AI 에게 "일본에서 동성애는..."과 같은 문장을 완성하게 한 뒤, '용납 가능하다' 또는 '용납 불가능하다' 중 하나를 선택하게 합니다. 연구자들은 AI 가 내부 수학 계산에 기반하여 선택을 얼마나 신뢰하는지 확인했습니다. 이는 마치 학생이 답을 쓸 때 손이 얼마나 빠르게 움직이는지 확인하여 그들의 직감을 파악하는 것과 같습니다.
  • '생각' 점수 (Chain-of-Thought): 이것이 가장 큰 혁신입니다. 연구자들은 AI 에게 단순히 답을 주기 전에 소리를 내어 생각하도록 요청했습니다.
    • 1 단계: "이 나라의 사회적 규범은 무엇인가?"
    • 2 단계: "단계별로 추론하라: 이것이 여기서 괜찮은가?"
    • 3 단계: "-1(절대 불가) 에서 +1(항상 가능) 까지의 점수를 매겨라."
    • 결과: 이 '생각' 단계가 훨씬 더 효과적이었습니다. 이는 AI 가 추측만 하는 대신 답변하기 전에 '문화 안경'을 잠시 착용하게 해준 것과 같습니다.
  • '동료 검토' (LLM-as-Judge): AI 가 임의로 지어낸 것이 아닌지 확인하기 위해, 20 개의 서로 다른 로봇들이 서로의 '생각' 단계를 채점하게 했습니다. 로봇 A 의 추론이 이상하거나 편향되어 보이면 로봇 B 가 이를 지적했습니다. 이를 통해 연구자들은 로봇들 간에 강력하게 이견이 발생한 348 개의 구체적인 사례를 찾아냈습니다.

3. 결과: 좋은 소식, 나쁜 소식

이 연구는 매우 명확한 패턴들을 발견했습니다:

  • '최상위권'은 나아지고 있음: 가장 똑똑한 모델들 (Claude-3-Opus 와 GPT-4o 등) 은 놀라울 정도로 좋은 성과를 내고 있습니다. 서구 국가의 도덕적 문제에 대해 질문받았을 때, 그들의 답변은 실제 인간 설문조사 결과와 거의 완벽하게 일치했습니다 (약 90% 상관관계). 이는 열심히 공부한 학생이 시험에서 A 학점을 받은 것과 같습니다.
  • '지역 격차'는 현실임: 이것이 가장 큰 발견입니다. 로봇들은 미국이나 유럽과 같은 서구 가치를 이해하는 데는 뛰어나지만, 중동, 남아시아, 아프리카와 같은 비서구 가치에는 현저히 어려움을 겪습니다.
    • 비유: 프랑스어와 스페인어는 유창하지만 스와힐리어는 몇 마디만 아는 번역가를 상상해 보세요. 만약 이들에게 복잡한 스와힐리어 시를 번역하라고 하면, 그들은 의미를 추측할 수 있지만 틀릴 가능성이 높습니다. 이 논문은 AI 가 서구 문화를 이해하는 정도와 비서구 문화를 이해하는 정도 사이에 21 점의 격차가 있음을 발견했습니다.
  • 폭력은 어렵다: 로봇들은 테러나 가정 폭력과 같이 폭력을 다루는 주제에서 가장 어려움을 겪었습니다. 이러한 질문들은 문화적 맥락이 가장 중요하게 작용하는 부분들이며, AI 의 '서구 편향'이 가장 강하게 드러난 부분입니다.

4. 왜 이것이 중요한가

이 논문은 AI 가 큰 진전을 이루고 있지만, 여전히 전 세계 많은 지역에서 '문화적 맹인'이라고 결론 내립니다.

  • 문제: 만약 이러한 AI 로봇들을 비서구 국가에서 의사결정 (예: 소셜 미디어 중재 또는 법률 조언 제공) 에 사용한다면, 서구 규칙을 비서구 상황에 적용함으로써 정당한 지역 목소리를 침묵시키거나 지역 관습을 오해할 수 있습니다.
  • 해결책: 연구자들은 하나의 '글로벌' AI 에만 의존할 수 없다고 제안합니다. 우리는 이러한 모델들이 특정 지역에서 어떻게 수행되는지 점검하고, 성능을 개선하기 위해 '생각' 방법 (Chain-of-Thought) 을 사용하며, 더 다양한 데이터로 훈련시켜 그들이 특정 지역에서만 온 것처럼 들리지 않도록 해야 합니다.

요약하자면: 이 논문은 우리 AI 로봇들이 현재는 서구 가치를 반영하는 데는 매우 능숙하지만, 여전히 전 세계 나머지 지역의 눈으로 세상을 바라보는 법을 배우고 있다는 것을 비추어 보여주는 거울을 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →