← 최신 논문
💬 NLP

RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation

RaguTeam 의 SemEval-2026 태스크 8 우승 시스템은 GPT-4o-mini 판정자가 최상의 응답을 선택하도록 조정된 7 개의 이질적 LLM 앙상블을 활용하여 가장 강력한 베이스라인을 크게 능가하며 1 위를 차지했고, 동시에 비용 효율적인 Meno-Lite-0.1 모델을 도입하고 태스크의 주석 한계를 비판했습니다.

원저자: Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov

게시일 2026-05-07
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문 설명을 일상적인 언어와 창의적인 비유를 섞어 번역한 것입니다.

전체적인 그림: AI 를 위한 '재능 쇼'

당신이 까다로운 질문에 대한 최선의 답을 찾기 위해 재능 쇼를 주최한다고 상상해 보세요. 당신은 각자 독특한 스타일, 강점, 약점을 가진 일곱 명의 심사위원 (AI 모델) 패널을 보유하고 있습니다. 어떤 이들은 거대하고 초지능적인 거인이고, 다른 이들은 작고 전문화된 전문가들입니다.

노보시비르스크 주립대학교의 RaguTeam 팀은 단순히 '가장 똑똑한' 심사위원을 선택하지 않았습니다. 대신, 일곱 명의 심사위원 모두 답을 작성하게 하고, 그 다음 수석 심사위원(GPT-4o-mini 라는 경량 AI) 이 모든 일곱 개의 답을 읽어 해당 질문에 대한 가장 좋은 답 하나를 선택하는 시스템을 구축했습니다.

이 시스템은 AI 가 긴 대화 중에도 오직 제공된 문서만을 기반으로 질문에 얼마나 잘 답할 수 있는지 테스트하는 SemEval-2026 Task 8(구체적으로 Task B) 대회에 출전하여 26 개 팀 중 1 위를 차지했습니다.

문제: '할루시네이션' 함정

실제 세계에서는 AI 가 종종 지나치게 도움이 되려고 합니다. 답을 모를 경우, 자신감 있게 들리게 하기 위해 무언가를 지어낼 수 있습니다 (할루시네이션). 이는 AI 가 사실 확인자 역할을 해야 할 때 위험합니다.

대회 과제는 다음과 같은 이유로 까다로웠습니다:

  1. 다중 턴 대화: AI 는 채팅에서 이전에 언급된 내용을 기억해야 합니다.
  2. 엄격한 규칙: AI 는 제공된 '참조 문단'만을 사용해야 합니다 (닫힌 책 시험과 같습니다).
  3. '모릅니다' 테스트: 때로는 문서에 답이 없는 경우가 있습니다. AI 는 추측하기보다 "모릅니다"라고 말해야 합니다.

그들이 이긴 방법: '스위스 아미 나이프' 전략

1. 다양한 팀 (앙상블)

그들은 하나의 슈퍼컴퓨터에 의존하는 대신 일곱 개의 서로 다른 AI 모델 팀을 활용했습니다.

  • 거인들: 백과사전 같은 거대 모델들 (3,570 억 개의 파라미터를 가진 GLM-4.6 등) 을 포함했습니다.
  • 전문가들: Meno-Lite-0.1이라는 맞춤형 소형 모델을 포함했습니다. 이는 '창작 작가'가 아니라 '사실 확인자'로 특별히 훈련된 70 억 파라미터 모델이라고 생각하세요. 이는 정보가 누락되었을 때 매우 잘 찾아내는 작고 민첩한 탐정 같은 것입니다.
  • 혼합: 그들은 구글, 메타, 마이크로소프트 등 다양한 회사의 모델과 다양한 크기의 모델을 사용했습니다. 한 모델이 실수를 하면 다른 모델이 올바르게 답할 수 있다는 아이디어입니다.

2. 두 가지 프롬프트 스타일

그들은 모델들에게 단순히 같은 방식으로 질문하지 않았습니다. 두 가지 다른 '지시 스타일'을 사용했습니다:

  • 스타일 A (규칙집): AI 에게 제공된 텍스트에만 엄격하게 따르도록 하는 엄격한 규칙 세트입니다.
  • 스타일 B (예시): 문서가 없거나 대화 기록이 비어있는 경우와 같이 까다로운 상황을 처리하는 방법을 몇 가지 예시로 AI 에게 제시했습니다. 이는 실제 시험 전에 학생에게 연습 문제를 보여주는 것과 같습니다.

3. 수석 심사위원 (선택)

이것이 비결입니다. 모든 질문에 대해 일곱 개의 모델이 모두 답을 생성했습니다. 그런 다음 수석 심사위원(GPT-4o-mini) 이 모든 답을 읽고 질문했습니다: "이 답들 중 어떤 것이 문서에 가장 충실합니까?"

  • 문서가 비어 있으면 시스템은 자동으로 "모릅니다"라고 답했습니다 (안전하고 완벽한 수입니다).
  • 문서에 답이 있으면, 수석 심사위원은 사실을 지어내지 않은 답을 선택했습니다.

주요 발견 (아하! 순간들)

  • 다양성 > 크기: 우승 팀은 가장 크고 비싼 모델 하나만 갖는 것보다 다양한 모델의 혼합이 더 낫다는 것을 증명했습니다. '팀'은 단일 최강 거대 모델 (GLM-4.6) 을 압도적인 차이로 이겼습니다. 더 넓은 범위를 커버했기 때문에 릴레이 팀이 개인 주자를 이긴 것과 같습니다.
  • 예시가 규칙을 이긴다: '모릅니다' 상황을 처리하는 방법에 대한 구체적인 예시 (퓨샷 프롬프팅) 를 AI 에게 제시했을 때, 추상적인 규칙만 제시했을 때보다 훨씬 더 잘 수행했습니다. 이는 아이에게 "착하게 행동해"라고 말하는 대신, 누군가가 나누는 모습을 보여주는 비디오로 가르치는 것과 같습니다.
  • 소형 모델의 역할: 맞춤형 7B 모델 (Meno-Lite-0.1) 은 가장 많은 표를 얻지는 못했지만, 선택되었을 때는 종종 완벽한 답이었습니다. 이는 특정 상황에서 구원자가 되는 '전문가'였으며, 모든 작업에 거대한 두뇌가 항상 필요한 것은 아님을 증명했습니다.

비판: 게임이 약간 조작되었습니다

저자들은 또한 대회 자체의 결함도 지적했습니다.

  • '빈 상자' 단축키: 테스트에서 질문이 '답할 수 없는' 경우, 제공된 문서는 완전히 비어 있었습니다. 이는 AI 가 이기기 너무 쉬웠습니다. 단순히 '빈 상자'를 감지하고 "모릅니다"라고 말하면 되었기 때문입니다.
  • 실생활은 더 어렵다: 실제 세계에서는 답할 수 없는 질문은 보통 관련 없는 문서 (방해 요소) 와 함께 제공됩니다. 저자들은 향후 테스트에는 AI 가 더 열심히 일하고 단순히 빈 공간을 찾는 것이 아니라 실제로 텍스트를 이해하는지 증명하기 위해 이러한 '방해 요소'를 포함해야 한다고 주장합니다.

요약

RaguTeam 은 AI 생성을 재능 쇼처럼 취급함으로써 우승했습니다. 그들은 다양한 캐릭터 (서로 다른 AI 모델) 를 모으고, 다른 준비 방법 (프롬프트) 을 제공하며, 매 라운드마다 승자를 선택할 똑같은 심판 (수석 심사위원) 을 고용했습니다. 그들은 잘 조율된 다양한 AI 팀이 혼자 일하는 어떤 단일 AI 보다 더 똑똑하고 신뢰할 수 있음을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →