← 최신 논문
💬 NLP

On the Importance and Evaluation of Narrativity in Natural Language AI Explanations

이 논문은 기계 학습 모델의 예측을 설명하는 데 내러티브의 중요성을 강조하고, 기존 NLP 지표의 한계를 지적하며 내러티브의 네 가지 특성을 정량화하는 새로운 자동 평가 지표와 생성 규칙을 제안합니다.

원저자: Mateusz Cedro, David Martens

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Mateusz Cedro, David Martens

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎬 1. 문제: "레시피 나열" vs "요리사 이야기"

지금까지의 AI 설명 방식은 마치 요리 레시피의 재료 목록을 읽는 것과 비슷했습니다.

  • 기존 방식 (기술적 설명): "소금 10g, 후추 5g, 양파 2 개를 넣었습니다. 그래서 맛있는 요리가 나왔습니다."

    • 이 설명은 '무엇 (What)'이 들어갔는지는 알려주지만, '왜 (Why)' 그렇게 했는지는 설명하지 않습니다. "왜 소금이 10g 인가요? 왜 양파가 2 개인가요?"라는 질문에는 답이 없습니다.
  • 이 논문이 제안하는 방식 (서사적 설명): "우선 양파 2 개를 넣어 향을 내고, 그다음 소금 10g 으로 간을 맞췄습니다. 그런데 후추는 5g 만 넣었는데, 너무 매콤해지지 않도록 조절했기 때문입니다. 그래서 이 요리는 균형 잡힌 맛이 납니다."

    • 이는 **이야기 (Narrative)**처럼, 사건과 이유를 연결하여 "왜 이런 결과가 나왔는지"를 자연스럽게 설명합니다.

저자들은 AI 가 내린 결정도 단순한 데이터 나열이 아니라, 사람들이 이해하기 쉬운 '이야기' 형태로 전달되어야 한다고 말합니다.

📏 2. 새로운 측정 도구: "이야기 감지기"

그런데 어떻게 AI 가 만든 글이 진짜 '이야기'인지, 아니면 그냥 꾸며낸 '재미없는 나열'인지 구별할 수 있을까요?

기존에 쓰이던 컴퓨터 평가 도구 (NLP 지표) 는 허점이 있었습니다.

  • 비유: "이 글은 문법도 맞고, 단어 수도 많고, 반복도 없으니 100 점!"이라고 점수를 매겨도, 그 글이 **"비유하자면, 비유하자면, 비유하자면..."**처럼 의미 없는 말장난일 수도 있다는 겁니다.
  • 문제점: 기존 도구는 글이 얼마나 '자연스러운지'만 보고, 글 속에 **인과관계 (A 때문에 B 가 되었다)**나 흐름이 있는지까지 제대로 보지 못했습니다.

그래서 연구팀은 7 가지 새로운 자동 측정 지표를 개발했습니다. 이는 글의 '이야기성'을 4 가지 핵심 요소로 나누어 평가합니다.

  1. 연결성 (Continuous Structure): 문장들이 서로 끊어지지 않고 이어져 있는가? (문장을 뒤섞으면 글이 망가져야 진짜 이야기다.)
  2. 인과관계 (Cause-Effect): "왜?"라는 질문에 답하는 '원인과 결과'가 명확한가?
  3. 유창함 (Linguistic Fluency): 같은 말을 반복하지 않고 자연스럽게 읽히는가?
  4. 단어 다양성 (Lexical Diversity): 다양한 동사와 표현을 써서 생동감 있게 전달하는가?

이 도구들은 **"의미 없는 반복"**이나 **"단순한 나열"**은 점수를 낮게 매기지만, **"진짜 이야기"**는 높은 점수를 주도록 설계되었습니다.

🧪 3. 실험 결과: "이야기"가 승리하다

연구팀은 다양한 AI 설명 생성 도구 (XAIstories, Explingo 등) 를 테스트했습니다.

  • 결과: 기존 도구들은 대부분 단순한 나열 (Descriptive) 형태를 만들었습니다. "이게 중요해요, 저게 중요해요"라고 나열만 했을 뿐입니다.
  • 발견: 연구팀이 만든 **'이야기 생성 규칙 (Narrative Rules)'**을 AI 에게 적용하자, AI 가 만든 글이 확실히 달라졌습니다.
    • 비유: 마치 로봇이 기계적으로 나열하던 것을, 인간이 감정을 담아 이야기를 하듯 바뀐 것입니다.
    • 특히, 기존에 "이야기"를 강조하지 않았던 도구 (Explingo) 에 이 규칙을 적용하자, 설명의 질이 비약적으로 향상되었습니다.

💡 4. 결론: 왜 이것이 중요한가요?

이 연구는 AI 에게 "결과만 알려주지 말고, 그 과정과 이유를 이야기하라고" 가르치는 방법을 제시합니다.

  • 기존: "이 사람은 대출 거절당했습니다. 이유는 소득이 낮고, 나이가 젊고, 거주지가 불안정해서입니다." (나열)
  • 새로운 방식: "이분은 대출을 신청하셨지만, 먼저 소득이 낮다는 점이 우려를 자아냈습니다. 하지만 젊은 나이는 잠재력을 보여줄 수 있었죠. 그럼에도 불구하고 거주지 불안정성이 소득 부족을 상쇄하지 못해, 최종적으로 거절되었습니다." (이야기)

핵심 메시지:
사람은 복잡한 데이터를 나열하는 것보다 이야기로 들을 때 훨씬 잘 이해하고 신뢰합니다. 이 논문은 AI 가 인간과 소통할 때, 단순한 '데이터 리포터'가 아니라 '이야기꾼'이 되어야 한다고 말합니다. 그리고 이제 우리는 AI 가 진짜 좋은 이야기를 했는지, 아니면 가짜 이야기를 했는지 과학적으로 측정할 수 있는 도구를 갖게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →