← 최신 논문
💬 NLP

Surprisal and Metaphor Novelty Judgments: Moderate Correlations and Divergent Scaling Effects Revealed by Corpus-Based and Synthetic Datasets

이 연구는 언어 모델의 서프라이절(surprisal)이 은유의 참신함 주석과 중간 정도의 상관관계를 보이지만, 코퍼스 기반 데이터에서는 모델이 커질수록 예측력이 감소하고 합성 데이터에서는 증가하는 상이한 스케일링 동작을 보인다는 점을 입증하며, 이는 언어적 창의성을 위한 포괄적인 지표로서 서프라이절이 갖는 한계를 강조한다.

원저자: Omar Momen, Emilie Sitter, Berenike Herrmann, Sina Zarrieß

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Omar Momen, Emilie Sitter, Berenike Herrmann, Sina Zarrieß

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 문장에서 다음에 올 단어를 추측하려고 한다고 상상해 보세요. 만약 문장이 "고양이가 매트 위에..."라면, 당신의 뇌(그리고 컴퓨터 프로그램)는 쉽게 "앉았다"를 예측할 수 있습니다. 그것은 예측하기 쉬웠으므로 그리 놀랍지 않았습니다. 하지만 문장이 "고양이가 ... 해파리 위에 앉았다"라면, 당신의 뇌는 움찔하게 됩니다. 그 단어는 예측하기 어려웠기에 "놀라움(surprisal)"이 높았습니다.

이 논문은 다음과 같은 간단한 질문을 던집 지릅니다. 이 "놀라움"이라는 느낌이 진부하고 오래된 은유와 새롭고 창의적인 은유를 구별하는 데 도움이 될 수 있을까?

핵심 아이디어: 예측 가능성 대 창의성

은유는 정신적인 다리와 같습니다. 때때로 그 다리는 모두가 알고 있는 잘 닦인 길과 같습니다. 예를 들어 "그의 논리에 공격했다"라고 말하는 경우입니다. 우리는 누구나 무기를 사용해 연설을 공격하지 않는다는 것을 알고 있으며, 이는 표준적인 표현입니다. 이것이 **관습적 은유(conventional metaphor)**입니다.

다른 경우에는 그 다리가 완전히 새롭고 흔들거립니다. 예를 들어 "체포된 물"이라고 말하는 경우입니다. 당신은 멈춰서 생각해야 합니다. 어떻게 물이 체포될 수 있지? 사전에는 그런 말이 없습니다. 이것이 **새로운 은유(novel metaphor)**입니다.

연구진들은 컴퓨터 프로그램(언어 모델이라 불리는)이 이 새로운 창의적 다리를 포착하기 위해 그들의 "놀라움 측정기"를 사용할 수 있는지 알아보고자 했습니다. 이론은 다음과 같았습니다: 만약 어떤 단어가 예측하기 어렵다면, 그것은 아마도 창의적인 은유일 것이다.

실험: 두 가지 서로 다른 세상

연구팀은 두 가지 매우 다른 유형의 데이터를 사용하여 이 아이디어를 테스트했으며, 결과는 마치 두 도시의 이야기와 같았습니다:

1. "현실 세계" 도시 (코퍼스 기반 데이터)
그들은 책, 뉴스, 대화에서 가져온 실제 문장들을 살펴보았습니다.

  • 결과: 여기서 "놀라움 측정기"는 괜찮게 작동했지만, 반전이 있었습니다. 작고 단순한 컴퓨터 모델들이 거대하고 초지능적인 모델들보다 오히려 창의적인 은유를 더 잘 찾아냈습니다.
  • 비유: 동네를 잘 아는 작고 지역적인 형사를 상상해 보세요. 그들은 과하게 깊이 생각하지 않기 때문에 생소하고 새로운 것들을 더 잘 알아차립니다. 거대한 형사(거대 AI)는 너무 많은 데이터를 보았기 때문에 모든 곳에서 이상한 것을 예상하기 시작하며, 이로 인해 특정 문장에서 무엇이 실제로 "새로운지"에 대한 민감도가 떨어집니다. 모델이 커질수록, 이 특정 작업에서는 성능이 더 나빠졌습니다.

2. "장난감 공장" 도시 (합성 데이터)
그들은 또한 실험실(또는 다른 AI)에서 정교하게 만들어진, 은유가 오래되었는지 혹은 새로운지의 차이만 존재하는 문장들을 사용했습니다.

  • 결의: 여기서는 규칙이 뒤집혔습니다. 더 크고 똑똑한 모델들이 창의적인 은유를 훨씬 더 잘 찾아냈습니다.
  • 비유: 통제된 장난감 공장에서는 거대한 형사가 빛을 발합니다. 장난감들이 완벽하고 규칙이 엄격하기 때문에, 거대한 뇌는 자신의 강력한 힘을 사용하여 작은 형사가 놓치는 미세한 차이를 포착할 수 있습니다.

"클로즈(Cloze)" 기법: 양방향으로 보기

연구진은 또한 새로운 기술을 시도했습니다. 표준적인 "놀라움"은 대상 단어의 에 오는 단어들만을 봅니다 (마치 왼쪽에서 오른쪽으로 문장을 읽는 것처럼). 하지만 은유를 이해하려면 종종 그 단어의 에 오는 내용도 필요합니다.

그들은 "클로즈" 방식(빈칸 채우기 게임과 같은)을 만들었습니다. 은유적인 단어를 숨기고, 모델에게 전체 문장(끝부분까지 포함하여)을 보여준 뒤, "여기에 어떤 단어가 들어갈까요?"라고 물었습니다.

  • 결과: 이 "양방향 보기" 접근 방식은 일반적으로 컴퓨터가 은유를 포착하는 데 더 똑똑하게 만들었습니다. 그것은 마치 형사에게 코너에 서 있는 모습만 보여주는 것이 아니라 거리 전체의 지도를 주는 것과 같았습니다. 그러나 이 기술은 "현실 세계" 문장에서는 가장 잘 작동했지만, "장난감 공장" 문장에서는 때때로 모델들을 혼란스럽게 만들기도 했습니다.

AI에게 인간처럼 말하도록 가르치는 것에 대하여?

연구팀은 또한 "지시 튜닝된(Instruction-Tuned)" 모델(인간의 지시를 따르고 친절하게 대화하도록 학습된 AI)을 사용해 보았습니다.

  • 결과: 놀랍게도, AI가 더 인간처럼 말하도록 만드는 것이 창의적인 은표를 포착하는 데 도움을 주지는 못했습니다. 사실, 일부 모델의 경우, 이 특정 수학적 문제에 있어서는 성능을 더 떨어뜨리기도 했습니다. "수다스러운" 것이 "창의적"이 되는 데 도움을 주지는 못했습니다.

결론

이 논문은 "놀라움(surprisal, 단어가 얼마나 예상 밖인가)"이 창의적인 은유를 찾는 데 괜찮은 도구이지만, 마법의 지팡이는 아니라고 결론짓습니다.

  • 그것은 약 40~50%의 상관관계를 보이며 적당히 잘 작동하는데, 이는 도움이 되긴 하지만 완벽과는 거리가 멀다는 것을 의미합니다.
  • 맥락이 중요합니다: AI가 무질서한 현실 세계의 텍스트를 보느냐, 깨끗한 실험실의 텍텍스트를 보느냐에 따라 모든 것이 달라집니다.
  • 크기가 중요합니다: 무조건 큰 것이 좋은 것은 아닙니다. 데이터에 따라 때로는 더 작은 모델이 더 예리할 수 있습니다.

요약하자면, 컴퓨터는 "얼마나 놀라운가"를 측정함으로써 인간의 창의성을 어느 정도 짐작할 수는 있지만, 진정으로 새로운 은유의 마법을 온전히 파악하는 데는 여전히 어려움을 겪고 있습니다. 그들에게는 언어의 예술을 이해하기 위해 단순한 놀라움 측정기 이상의 것이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →