← 최신 논문
💬 NLP

lmfaoooo at SemEval-2026 Task 1: Humor Is an Audience. Preference Modeling for Constrained Humor Generation

이 논문은 절대적인 재미 점수가 아닌 인간의 쌍체 비교 판단을 통해 학습된 선호도 모델으로 다양한 후보군을 순위 매기는 "다수 생성 후 최적안 선택(generate-many, select-best)" 전략을 채택하여 유머의 청중 의존적 특성을 해결한 SemEval-2026 Task 1 (MWAHAHA) 1위 수상 시스템을 제시한다.

원저자: Alexey Tikhonov, Alexey Ivanov

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Alexey Tikhonov, Alexey Ivanov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 오늘 밤 공연을 위해 가장 웃긴 농담을 골라야 하는 코미디 클럽 운영자라고 상상해 보세요. 당신에게는 초고속 로봇이 작성한 천 개의 농담이 있지만, 당신은 어떤 농담이 한 사람을 웃게 만들 수도 있는 반면 다른 사람에게는 눈총을 받게 만들 수도 있다는 것을 알고 있습니다. 당신이 읽고 있는 종이는 이 문제를 해결하기 위해 개발자들이 SemEval-2026 Task 1(별칭 MWAHAHA)이라는 컴퓨터 과학 경진 대회를 위해 구축한 시스템에 대한 보고서입니다.

다음은 그들이 이 문제를 어떻게 해결했는지 단계별로 쉽게 풀어낸 이야기입니다.

1. 문제점: "유머"는 보는 사람의 눈에 달려 있다

저자들은 컴퓨터에게 유머를 가르치는 것이 어려운 이유는 컴퓨터가 단어를 쓸 수 없어서가 아니라, "유머"가 주관적이기 때문이라고 지적합니다.

  • 관객의 문제: 베를린에서 터지는 농담이 베이징에서는 썰렁할 수 있습니다. 인간조차도 무엇이 웃긴지에 대해 합의하지 못합니다. 만약 10명에게 농담의 점수를 매겨달라고 한다면, 그들은 10개의 서로 다른 점수를 줄 것입니다.
  • 로봇의 문제: 컴퓨터는 암기에 능숙합니다. 만약 로봇에게 농담을 해달라고 요청하면, 로봇은 흔히 자신이 외우고 있는 똑같은 25개의 농담을 마치 유행어를 반복하는 앵무새처럼 그대로 반복하곤 합니다. 로봇은 진정으로 새로운 것을 만들어내는 데 어려움을 겪습니다.

2. 전략: "다트를 던진 후, 과녁의 정중앙을 고른다"

저자들은 컴퓨터가 한 번에 완벽한 농담을 쓰도록 만드는 대신, 두 단계의 전략인 **"많이 생성한 다음, 최선의 것을 선택한다"**는 방식을 사용했습니다.

  • 1단계: "농담 공장" (생성)
    그들은 하나의 프롬프트(지시어)마다 50개의 서로 다른 농담을 뽑아내는 공장을 세웠습니다. 그들은 다양한 AI 모델들을 혼합하여 사용했고(마치 서로 다른 코미디언 팀처럼), 로봇이 기존의 농담을 단순히 복사해서 붙여넣지 않도록 창의성을 강제했습니다. 또한, 농담이 특정 단어를 포함하거나 특정 길이를 유지하는 등의 규칙을 따르도록 만들었습니다.

    • 비유: 50명의 서로 다른 요리사에게 버거를 만들어 달라고 요청한다고 상상해 보세요. 어떤 이는 매운 맛을, 어떤 이는 단 맛을, 어떤 이는 이상한 맛을 낼 것입니다. 이제 당신 앞에는 거대한 버거 더미가 생겼습니다.
  • 2단계: "맛 테스터" (선택)
    이제 그 50개의 농담 더미에서 승자를 골라내야 했습니다. 인간이 실시간으로 모든 농담을 판단할 수는 없기 때문에, 그들은 **선호도 모델(Preference Model)**을 구축했습니다.

    • 그들은 컴퓨터에게 "이 농담이 웃긴가?"라고 묻는 대신(이 질문은 모호하고 혼란스럽습니다), "농담 A와 농담 B 중에서 어느 것이 더 나은가?"라고 물었습니다.
    • 이 모델은 사람들이 두 개의 농담을 비교하여 승자를 선택한 약 2,500건의 인간 투표를 바탕으로 학습되었습니다. 이것은 심판에게 수천 번의 "A 대 B" 맞대결을 보여주며 심판이 관객의 취향을 배우도록 훈련시키는 것과 같습니다.

3. 비법: "유머 레시피 북"

그들의 "맛 테스터"를 더 똑똑하고 이해하기 쉽게 만들기 위해, 저자들은 단순히 컴퓨터가 추측하게 두지 않았습니다. 그들은 17가지의 구체적인 "유머 풍미"로 구성된 짧은 목록인 **"유머 기초(Humor Basis)"**를 만들었습니다.

  • 이것은 향신료 선반과 같습니다. 풍미에는 "블랙 유머", "언어유희", "과장", 또는 "예상치 못한 반전" 등이 포함될 수 있습니다.
  • 컴퓨터가 농담을 볼 때, 단순히 "좋음" 또는 "나쁨"이라고 말하는 것이 아닙니다. 컴퓨터는 향신료 선반을 대조하며 확인합니다: 이 농담에 강력한 반전이 있는가? 언어유희를 사용하고 있는가? 너무 어두운가?
  • 이 방식은 시스템을 "해석 가능(interpretable)"하게 만듭니다. 즉, 인간이 결과를 보고 컴퓨터가 왜 특정 농담을 선택했는지(예: "비록 짧았지만, 멋진 반전이 있었기 때문에 이 농담을 골랐다") 이해할 수 있게 해줍니다.

4. 결과: 경진 대회 우승

그들은 이 시스템을 세 가지 다른 유형의 데이터(레딧 농담, 전문적인 농담, 그리고 자신들이 새로 만든 데이터셋)로 테스트했습니다.

  • 우승: 그들의 "두 농담 비교하기" 방식은 단순히 컴퓨터에게 하나의 농담에 점수를 매기라고 하는 것보다 훨씬 더 효과적이었습니다. 또한, 다른 방법들보다 다양한 언어와 문화를 다루는 데 더 뛰어났습니다.
  • 트로피: 실제 경진 대회(MWAHAHA)에서 그들의 시스템은 영어와 중국어에서 1위를 차지했으며, 스페인어에서는 2위를 차지했습니다.

5. 핵심 결론

이 논문은 컴퓨터 유머의 미래가 로봇이 처음부터 더 나은 농담을 쓰는 것에 있지 않다고 결론짓습니다. 로봇은 이미 많은 농담을 쓰는 데 능숙합니다. 진짜 과제는 올바른 것을 선택하는 것입니다.

저자들은 우리가 컴퓨터가 웃기기를 원한다면, 유머를 단 하나의 숫자로 측정하려고 노력하는 것을 멈추고, 우리가 어떤 영화를 볼지 혹은 어떤 노래를 들을지 결정할 때처럼 선호도—즉, 옵션을 비교함으로써 특정 관객이 무엇을 좋아하는지 이해하는 것—에 집중해야 한다고 주장합니다.

요약하자면: 그들은 거대한 농담 뷔페를 생성하고, 스마트하게 훈련된 "맛 테스터"를 사용하여 관객이 가장 좋아할 만한 요리를 골라내는 시스템을 구축했습니다. 그들은 유머가 농담 자체보다는 관객의 선호도에 달려 있다는 점을 이해함으로써 경진 대회에서 우승했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →