← 최신 논문
💬 NLP

SwanNLP at SemEval-2026 Task 5: An LLM-based Framework for Plausibility Scoring in Narrative Word Sense Disambiguation

이 논문은 구조화된 추론 메커니즘을 활용한 LLM 기반 프레임워크를 제안하여 SemEval-2026 태스크 5 의 서사적 단어 의미 분해 작업에서 인간과 유사한 타당성 점수를 산출하고, 동적 퓨샷 프롬프팅을 적용한 대형 모델과 앙상블 기법이 인간 평가자 간의 합의 패턴을 효과적으로 모방함을 입증했습니다.

원저자: Deshan Sumanathilaka, Nicholas Micallef, Julian Hough, Saman Jayasinghe

게시일 2026-04-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Deshan Sumanathilaka, Nicholas Micallef, Julian Hough, Saman Jayasinghe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🍽️ 핵심 주제: "이 요리, 먹어도 될까?" (플러시빌리티 점수)

상상해 보세요. 어떤 요리사가 **"닭"**이라는 재료를 썼다고 합니다.
하지만 이 '닭'이 실제 닭고기를 의미할까요, 아니면 **비행기 (닭이 날다)**를 의미할까요? 문맥에 따라 뜻이 완전히 달라지는 '중의성' 문제입니다.

이 논문은 AI 가 짧은 이야기를 읽었을 때, **"이 문장에서 '닭'이 닭고기일 확률이 얼마나 높을까?"**를 인간이 느끼는 것처럼 점수 (1~5 점) 로 매겨주는 기술을 연구했습니다.

🧩 문제점: 기존 AI 는 '한 문장'만 보고 판단했어요

기존의 AI 들은 문장 하나만 보고 "아, 이 단어는 이 뜻이겠지!"라고 추측하는 데 능했습니다. 하지만 실제 인간은 **이야기의 흐름 (전체 맥락)**을 보고 판단합니다.

  • 예: "그는 을 잡았다." (한 문장만 보면 닭을 잡았을 수도, 비행기를 잡았을 수도 있음)
  • 예: "그는 을 잡았다. 그리고는 요리를 시작했다." (이야기 흐름을 보면 '닭고기'임이 확실함)

기존 AI 는 이런 이야기 전체의 흐름을 놓치고, 문장 하나만 보고 헷갈려 하곤 했습니다.

🚀 해결책: 세 가지 '요리 기술'을 개발했습니다

연구팀은 AI 가 인간처럼 판단하도록 돕기 위해 세 가지 방법을 시도했습니다.

1. 작은 요리사 훈련하기 (저사양 모델 미세 조정)

  • 비유: 요리 실력이 아직 부족한 '인턴 요리사 (작은 AI 모델)'에게 수많은 레시피를 보여주며 훈련시킨 것입니다.
  • 방법: AI 에게 "이 이야기는 쉬운 문제야, 어려운 문제야?"라고 먼저 분류하게 한 뒤, 그 난이도에 맞춰 점수를 매기게 했습니다.
  • 결과: 인턴 요리사도 '난이도'를 알면 훨씬 잘 먹습니다. 특히 Qwen이라는 모델이 Gemma보다 더 맛있게 요리했습니다.

2. 유명 셰프에게 힌트 주기 (대규모 모델 + 동적 Few-shot)

  • 비유: 실력 있는 **유명 셰프 (GPT-4o 같은 큰 AI)**에게 "이런 비슷한 요리 사례가 있었어, 참고해 봐!"라고 힌트를 주는 방식입니다.
  • 방법: AI 가 문제를 풀기 전에, **비슷한 상황의 예시 (과거의 요리 사례)**를 1 개나 3 개 정도 보여주고 "이렇게 해봐"라고 유도했습니다.
  • 결과: 유명 셰프는 힌트만 받아도 인간의 취향을 거의 완벽하게 따라 했습니다. 특히 1 개의 예시만 보여줘도 테스트에서 가장 좋은 성적을 냈습니다.

3. 요리 팀 구성하기 (모델 앙상블)

  • 비유: 한 명의 요리사에게 맡기는 대신, **5 명의 요리사 (5 개의 AI 모델)**를 모아서 의견을 모았습니다.
  • 방법: 5 명이 각각 점수를 매긴 뒤, 그중 가장 많은 의견 (다수결) 이나 평균을 내어 최종 점수를 결정했습니다.
  • 결과: 한 명만 판단할 때보다 5 명이 모여서 합의하는 방식이 인간의 의견 수렴 과정과 더 비슷해져서 점수가 더 정확해졌습니다.

🏆 최종 결과: 10 위 달성!

이 팀은 대회에서 전체 10 위를 차지했습니다.

  • 성공 요인: AI 가 단순히 단어를 맞추는 게 아니라, **"이야기의 흐름을 읽고 인간처럼 고민하는 과정 (추론)"**을 거치게 했기 때문입니다.
  • 한계점: 하지만 여전히 AI 는 인간처럼 **모호한 상황 (어떤 뜻이든 다 가능할 때)**에서 완벽하게 일관된 판단을 내리지는 못했습니다. 인간은 "음... 이거는 좀 애매하네"라고 느끼지만, AI 는 여전히 확신을 가지고 틀린 답을 내놓기도 합니다.

💡 한 줄 요약

"AI 에게 단순히 정답을 외우게 하는 게 아니라, '이야기 흐름을 읽고 인간처럼 고민하는 법'을 가르쳤더니, 인간의 말맛을 훨씬 잘 이해하게 되었다!"

이 연구는 앞으로 AI 가 인간의 복잡한 감정과 맥락을 더 잘 이해하는 데 중요한 발걸음이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →