← 최신 논문
💬 NLP

Learning Moral Diversity: Modelling Individual Perspectives in Moral Classification of Texts

본 논문은 사전 학습된 언어 모델에 주석가별 특징을 확장함으로써 도덕적 텍스트 분류에서 개별 주석가의 관점을 모델링하는 방법을 제안하며, 주관적 불일치를 고려하는 것이 레이블을 단일한 정답으로 집계하는 전통적인 방식보다 더 정확한 예측과 깊은 통찰력을 제공한다는 것을 입증한다.

원저자: Yi Ren, Lewis Mitchell, Matthew Roughan

게시일 2026-06-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yi Ren, Lewis Mitchell, Matthew Roughan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 특정 뉴스 기사나 트윗에 대해 사람들이 어떻게 느끼는지 이해하려고 노력하고 있다고 상상해 보세요. 당신은 23명의 서로 다른 친구들에게 그 글을 읽고, 각자의 도덕적 잣대에 따라 그것이 "좋음", "나쁨", 또는 "중립"인지 말해달라고 요청합니다.

과거에 연구자들은 이 23개의 답변을 모두 모아 하나로 뭉뚱그린 뒤, "좋아, 다수가 '나쁘다'고 했으니 그것이 진실이다"라고 말하곤 했습니다. 그들은 친구들 사이의 의견 불일치를 단순히 무시해야 할 "노이즈"나 실수로 취급했습니다.

이 논문은 불일치를 무시하는 것이 바로 진짜 실수라고 주장합니다.

연구진이 수행한 작업을 일상적인 비유를 사용하여 간단히 정리하면 다음과 같습니다.

1. 문제점: "평균적인" 친구란 존재하지 않는다

연구진은 많은 사람이 도덕적 가치(예: "공정성", "충성심", "순결함")로 라벨을 붙인 방대한 트윗 모음집을 살펴보았습니다. 그들은 사람들이 종종 격렬하게 의견을 달리한다는 점을 발견했습니다. 어떤 사람은 트윗을 "권위"에 대한 위반으로 보는 반면, 다른 사람은 이를 "공정성"의 옹호로 볼 수 있습니다.

표준 AI 모델은 하나의 "평균적인" 답을 찾으려고 노력했습니다. 연구진은 이것이 복잡한 그림을 설명하기 위해 모든 픽셀의 평균 색상만을 살펴보는 것과 같다고 말합니다. 그렇게 하면 화가의 세부적인 묘사, 질감, 그리고 특정한 의도를 놓치게 됩니다. 하나의 "정답(ground truth)"을 강요함으로써, AI는 인간이 실제로 생각하는 풍부하고 복잡한 현실을 놓치게 됩니다.

2. 해결책: AI에게 "개성"을 부여하기

연구팀은 새로운 유형의 AI 모델을 구축했습니다. 표준 AI 모델을 하나의 보편적인 언어를 구사하는 범용 번역기라고 생각한다면,

그들의 새로운 모델은 23개의 서로 다른 "성격" 또는 "가면"을 가진 번역기와 같습니다.

  • 그들은 이미 텍스트를 읽는 데 능숙한 강력한 사전 학습 AI(BERT)를 가져왔습니다.
  • 그 위에 특별한 "어노테이터 레이어(Annotator Layer)"를 추가했습니다.
  • 이 레이어는 각 23명의 친구를 위한 개별적인 필터 역할을 합니다. 이 레이어는 "친구 #5"는 "순결함"에 매우 엄격하고, "친구 #12"는 "배려"에 매우 민감하다는 것을 학습합니다.

"이 트윗의 진정한 도덕적 가치는 무엇인가?"라고 묻는 대신, 모델은 "친구 #5라면 이 트윗에 대해 뭐라고 할까?" 그리고 "친구 #12라면 뭐라고 할까?"라고 묻습니다.

3. 결과: 더 나은 예측과 새로운 통찰력

이 새로운 모델을 테스트했을 때 다음과 같은 결과가 나타났습니다:

  • 개별 의견을 더 잘 예측하게 되었습니다: 이 모델은 기존의 "평균" 모델과 비교했을 때, 특정 인물이 트윗에 부여할 라벨을 예측하는 정확도가 약 10% 향arly 높아지며 훨씬 더 정확해졌습니다.
  • 숨겨진 패턴을 드러냈습니다: 모델이 어노테이터(주석 작성자)의 "개성"을 학습했기 때문에, 연구진은 데이터를 통해 "아, 이 그룹의 친구들은 항상 트윗을 '도덕적 위반'으로 보는구나, 반면 저 그룹은 매우 신중해서 도덕적이라고 라벨을 거의 붙이지 않는구나"와 같은 사실을 확인할 수 있었습니다.
  • "집계"의 함정: 연구진이 이 고도로 개인화된 모델에게 (기존 방식처럼) 단 하나의 "평균적인" 답을 내놓도록 강제했을 때, 모델의 성능은 오히려 하락했습니다. 이는 사람들이 단순히 세상을 다르게 본다는 사실을 기존의 라벨 평균 방식이 숨기고 있었다는 것을 증명했습니다. "평균적인" 답은 반드시 "최선의" 답이 아니라, 단지 뉘앙스를 잃어버린 타협안일 뿐이었습니다.

4. 핵심 요약

이 논문은 **불일치는 버그가 아니라 특징(feature)**이라고 결론짓습니다.

도덕적 판단의 세계에서 사람들은 단순히 실수를 하는 것이 아니라, 서로 다른 관점을 가지고 있습니다. 개별적인 관점을 존중하고 학습하는 AI를 구축함으로써, 우리는 인간의 도덕성에 대해 훨씬 더 명확한 그림을 얻을 수 있습니다. 연구진은 미래의 AI가 단순히 "하나의 정답"을 찾는 것이 아니라, 사람들이 세상을 해석하는 다양한 방식들을 이해하는 법을 배워야 한다고 제안합니다.

요약하자면: 그들은 AI에게 모든 사람이 똑같이 생각하는 척하는 것을 멈추고, 대신 각 특정 개인이 어떻게 생각하는지를 학습하도록 가르쳤습니다. 그 결과, 인간 의견의 복잡한 현실을 이해하는 더 똑똑하고 정직한 모델을 얻을 수 있었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →