← 최신 논문
💬 NLP

Not All Subjectivity Is the Same! Defining Desiderata for the Evaluation of Subjectivity in NLP

이 논문은 NLP 에서 주관성을 반영하는 모델의 평가 기준을 정립하기 위해 7 가지 요구사항을 제안하고, 60 편의 논문을 분석하여 현재 평가 관행이 다원적 관점과 소수 목소리를 제대로 반영하지 못하는 여러 간극을 드러냈습니다.

원저자: Urja Khurana, Michiel van der Meer, Enrico Liscio, Antske Fokkens, Pradeep K. Murukannaiah

게시일 2026-03-31
📖 4 분 읽기☕ 가벼운 읽기

원저자: Urja Khurana, Michiel van der Meer, Enrico Liscio, Antske Fokkens, Pradeep K. Murukannaiah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"자연어 처리 (NLP) 모델이 인간의 주관적인 판단을 다룰 때, 우리는 어떻게 그 성능을 제대로 평가해야 할까?"**라는 중요한 질문에서 시작합니다.

기존의 AI 평가 방식은 마치 **"수학 문제"**를 푸는 것처럼, 정답이 하나만 있다고 가정합니다. 하지만 인간의 언어와 생각은 수학 공식처럼 명확하지 않습니다. "이 댓글이 모욕적인가?"라는 질문에 대해 사람마다, 문화마다, 상황에 따라 답이 다를 수 있죠.

이 논문은 이러한 **주관성 (Subjectivity)**을 가진 AI 모델을 평가하기 위해 **7 가지 새로운 기준 (Desiderata)**을 제안하고, 현재 연구들이 이 기준들을 얼마나 잘 충족하고 있는지 분석했습니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


🎭 비유: "다양한 취향을 가진 요리 평단"

AI 모델을 요리사라고 상상해 보세요. 그리고 우리는 그 요리사의 실력을 평가하는 **평단 (평가자)**입니다.

  1. 기존의 문제 (단일 정답의 함정):
    과거에는 요리사가 "김치찌개"를 만들 때, 평단 100 명이 다 같은 맛을 느껴야만 "완벽한 요리사"로 인정받았습니다. 만약 어떤 사람은 "매우 매운 것"을 원하고, 어떤 사람은 "부드러운 것"을 원한다면, 기존 방식은 "요리사가 실패했다"거나 "평단 중 일부가 틀렸다"고 판단했습니다.
    하지만 현실은 다릅니다. 모든 사람의 입맛은 다릅니다. AI 도 마찬가지입니다.

  2. 이 논문이 말하는 새로운 시각:
    "주관적인 문제 (예: 이 글이 혐오 표현인가?) 에는 정답이 하나가 아니라, 여러 가지 정답이 공존할 수 있다"는 것입니다. AI 는 이 다양한 목소리 (소수 의견 포함) 를 모두 듣고, 상황에 맞게 답변해야 합니다.


🌟 제안된 7 가지 평가 기준 (요리사를 평가하는 7 가지 방법)

이 논문은 AI 가 주관적인 문제를 다룰 때 지켜야 할 7 가지 원칙을 제시합니다.

  1. 언제 주관적인지 알아채기 (Recognize when):
    • 비유: 요리사가 "소금 몇 그램 넣을까?" (사실 문제) 와 "이 요리가 감동적인가?" (주관 문제) 를 구분해야 합니다. AI 도 "이건 객관적 사실이고, 이건 사람마다 생각이 다를 수 있는 주제다"라고 먼저 구별해야 합니다.
  2. 어떤 종류의 주관성인지 구별하기 (Recognize which):
    • 비유: 의견이 다른 이유가 "정보가 부족해서"인지, 아니면 "본래 취향이 다르기 때문"인지 알아야 합니다.
      • 모호함 (Ambiguity): "이 문장의 '그'가 누구를 가리키는지 모르겠다" (정보 부족).
      • 다성 (Polyphony): "이 노래는 내게는 감동적이지만, 너에게는 지루할 수 있다" (본래 취향 차이).
    • AI 는 이 두 가지를 혼동하지 않고 다르게 대처해야 합니다.
  3. 왜 의견이 갈리는지 이해하기 (Recognize why):
    • 비유: "왜 이 요리를 싫어했어?"라고 물어보고, "매운 걸 못 먹어서"인지 "고기를 안 먹어서"인지 이유를 파악해야 합니다. AI 도 "왜 사람들이 이 글에 대해 다르게 생각하는지" 그 이유 (문화, 성별, 경험 등) 를 이해해야 합니다.
  4. 주관성을 정확히 예측하기 (Predict):
    • 비유: "이 요리를 좋아하는 사람의 비율이 70% 였고, 싫어하는 사람이 30% 였다"라고 정확히 예측할 수 있어야 합니다. 단순히 "좋다/싫다" 중 하나만 고르는 게 아니라, 분포를 이해해야 합니다.
  5. 예측과 실제의 일치 (Calibrate):
    • 비유: 요리사가 "내가 이 요리를 90% 확신한다"고 말했을 때, 실제로도 90% 의 사람들이 그 맛을 좋아해야 합니다. AI 의 자신감 (확률) 이 실제 인간의 반응과 맞아야 합니다.
  6. 모든 목소리 대표하기 (Represent all):
    • 비유: 평단 100 명 중 90 명이 "매운 걸 좋아한다"고 해도, 나머지 10 명이 "매운 걸 싫어한다"고 한다면, 그 10 명의 목소리도 무시하면 안 됩니다. AI 는 다수 의견뿐만 아니라 소수 의견도 함께 반영해야 합니다.
  7. 사용자에게 잘 전달하기 (Express):
    • 비유: 요리사가 "이 요리는 90% 가 좋아하지만, 10% 는 싫어해요. 그 이유는..."라고 설명할 때, 너무 길게 설명해서 사용자가 지치면 안 됩니다. 사용자가 이해하기 쉽게, 하지만 핵심은 빠뜨리지 않고 다양한 의견을 전달해야 합니다.

🔍 현재 연구들의 현황 (현실 진단)

저희는 60 편의 관련 논문을 분석해 보았습니다. 결과는 다음과 같습니다.

  • 잘하는 점: AI 가 "주관적인지 아닌지"를 구분하거나 (1 번), "어떤 의견이 더 많은지"를 예측하는 (4 번) 데는 꽤 잘하고 있습니다.
  • 아쉬운 점 (Gap):
    • 혼동: "정보 부족으로 인한 모호함"과 "본래 취향 차이"를 구분하는 연구 (2 번, 3 번) 는 거의 없습니다. 마치 "배가 고파서 짜증을 내는 것"과 "기분이 안 좋아서 짜증을 내는 것"을 구분하지 못하는 것과 같습니다.
    • 소외된 목소리: 소수 의견 (6 번) 을 얼마나 잘 반영하는지, 그리고 그걸 사용자에게 어떻게 설명할지 (7 번) 에 대한 연구는 거의 없습니다.
    • 연결 고리 부재: 각 기준들이 서로 어떻게 영향을 미치는지 (예: 이유를 잘 모르면 예측도 틀릴까?) 에 대한 연구가 부족합니다.

💡 결론 및 제언

이 논문은 **"AI 가 인간의 복잡한 생각과 감정을 다룰 때, 우리는 단순히 '정답'을 맞추는지 아닌지로만 평가하면 안 된다"**고 말합니다.

대신, AI 가 다양한 목소리를 얼마나 잘 듣고, 그 이유를 이해하며, 사용자에게 어떻게 전달하는지를 종합적으로 평가해야 합니다.

미래를 위한 제안:

  • 다양한 데이터: 다양한 배경을 가진 사람들이 데이터를 만들고 평가해야 합니다.
  • 새로운 평가 도구: 단순히 점수를 매기는 것을 넘어, AI 가 "왜" 그렇게 생각했는지 설명하는 능력을 평가하는 도구가 필요합니다.
  • 학제 간 협력: 컴퓨터 과학자뿐만 아니라 사회학자, 심리학자 등 다른 분야의 전문가들과 손잡고 AI 가 인간의 다양성을 존중하도록 만들어야 합니다.

결국 이 논문은 AI 가 더 인간적이고, 공정하며, 다양한 세상을 반영하는 도구가 되길 바라는 마음에서 시작되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →