← 최신 논문
💬 NLP

Multiperspectivity as a Resource for Narrative Similarity Prediction

이 논문은 단일 정답을 전제하는 기존 평가의 한계를 극복하기 위해 다양한 해석적 관점을 가진 31 개의 LLM 페르소나 앙상블을 구축하여 서사 유사성 예측을 수행하고, 해석적 다원성을 시스템 의사결정 과정에 통합할 때의 효과와 한계를 분석했습니다.

원저자: Max Upravitelev, Veronika Solopova, Jing Yang, Charlott Jakob, Premtim Sahitaj, Ariana Sahitaj, Vera Schmitt

게시일 2026-03-24
📖 3 분 읽기☕ 가벼운 읽기

원저자: Max Upravitelev, Veronika Solopova, Jing Yang, Charlott Jakob, Premtim Sahitaj, Ariana Sahitaj, Vera Schmitt

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍽️ 핵심 비유: "요리 평가단"의 실험

상상해 보세요. 어떤 식당에서 두 가지 새로운 요리 (A 와 B) 를 내놓았습니다. 그리고 이 중 어느 것이 '기본 메뉴 (앵커)'와 더 비슷한지 평가해야 합니다.

기존의 인공지능 (AI) 연구들은 보통 **"가장 똑똑한 한 명의 요리사 (전문가)"**에게만 평가하게 했습니다. 하지만 이 논문은 **"31 명의 다양한 요리사들"**을 모아서 평가하게 했습니다.

1. 실험의 구성: 다양한 '요리사'들

연구진은 31 명의 AI 캐릭터 (페르소나) 를 만들었습니다. 이들은 크게 두 부류로 나뉩니다.

  • 전문가들 (Practitioners): 비평가, 사회학자, 페미니스트, 포스트식민주의 이론가 등.
    • 특징: "이 요리는 가부장적 구조를 반영하고 있네", "여주인공의 역할이 중요해"처럼 깊이 있고 복잡한 이론으로 맛을 분석합니다.
  • 일반인들 (Lay People): 고등학생, 축구 선수, 바텐더, 택시 기사 등.
    • 특징: "음, 이거 좀 더 맛있어 보이네", "이야기 흐름이 자연스러워"처럼 직관적이고 일상적인 느낌으로 평가합니다.

2. 실험 결과: "혼자보다 함께가 낫다"

이 31 명이 각각 점수를 매긴 후, **다수결 (여럿이서 투표)**로 최종 답을 냈습니다. 결과는 놀라웠습니다.

  • 혼자 할 때: 일반인 (고등학생, 택시 기사 등) 이 전문가보다 점수가 더 높았습니다.
  • 함께 할 때 (다수결): 전문가들이 모여서 의견을 모았을 때, 일반인들만 모인 경우보다 정답률이 더 높아졌습니다.

🔍 왜 그럴까요? (오류의 다양성)

  • 일반인들: 의견이 비슷합니다. "이건 비슷해"라고 다들 같은 이유로 맞히거나, 같은 이유로 틀립니다. (오류가 겹침)
  • 전문가들: 각자 다른 이론을 가지고 있어서, 틀릴 때도 서로 다른 이유로 틀립니다. (오류가 섞임)
  • 결론: 서로 다른 이유로 틀리는 사람들이 모여 다수결을 하면, 서로의 오류를 상쇄시켜 정답에 더 가까워집니다. 마치 다양한 각도에서 문제를 바라보면 실수를 줄일 수 있는 것과 같습니다.

3. 의외의 발견: "여성과 관련된 단어"의 함정

가장 흥미로운 부분은 페미니스트 비평가성별 분석가 같은 캐릭터들의 결과였습니다.

  • 이 캐릭터들이 답변할 때 "여주인공", "가부장제", "성 역할" 같은 단어를 많이 썼을수록, 정답을 맞힐 확률이 떨어졌습니다.
  • 왜일까요? 두 가지 가능성이 있습니다.
    1. 해석의 차이: 이 단어들을 쓰는 것은 훌륭한 해석일 수 있지만, 이 실험의 '정답지 (Ground Truth)'에는 그런 관점이 반영되어 있지 않았을 수 있습니다. (예: 정답지는 "줄거리가 비슷하다"고 했지만, 페미니스트 비평가는 "여성의 역할이 비슷하다"고 봐서 틀린 것으로 판정됨)
    2. 주의 분산: 성별 문제에 집중하다 보니, 이야기의 전체적인 흐름을 놓쳤을 수 있습니다.

이는 **"진짜 중요한 해석이 정답지에 없을 수도 있다"**는 것을 시사합니다.

💡 이 연구가 우리에게 주는 메시지

  1. 정답은 하나일 수 없다: 이야기의 의미를 파악할 때, 한 가지 관점 (예: 오직 줄거리만) 으로만 평가하는 것은 불완전합니다. 다양한 관점 (전문가 + 일반인) 을 섞는 것이 더 현명한 판단을 내리게 합니다.
  2. 다양성이 힘이다: 똑똑한 사람 한 명보다, 서로 다른 생각을 가진 여러 사람이 모인 집단이 더 똑똑한 결정을 내릴 수 있습니다.
  3. 평가 기준의 재고: 만약 AI 가 "페미니즘 관점"으로 분석했을 때 정답이 아니라고 나온다면, 그건 AI 가 틀린 게 아니라 우리가 정답을 너무 좁게 정의했을 가능성이 있습니다.

📝 한 줄 요약

"이야기의 유사성을 판단할 때, 똑똑한 전문가 한 명보다 다양한 배경을 가진 31 명의 '요리사'들이 모여 투표하는 것이, 오히려 더 정확한 맛을 찾아내는 지름길이다."

이 연구는 앞으로 AI 가 글을 읽고 이해할 때, 단순한 정답 맞추기를 넘어 다양한 해석을 존중하는 시스템으로 발전해야 함을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →