← 최신 논문
💬 NLP

Diverse LLMs or Diverse Question Interpretations? That is the Ensembling Question

본 논문은 LLM 을 이용한 이진 질문 응답에서 단일 모델의 다양한 질문 해석을 앙상블하는 것이 다수결 투표 시 여러 다른 모델을 앙상블하는 것보다 일관되게 더 나은 성능을 보임을 입증한다.

원저자: Rafael Rosales, Santiago Miret

게시일 2026-05-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rafael Rosales, Santiago Miret

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

어떤 까다로운 수수께끼를 풀려고 한다고 상상해 보세요. 예를 들어 "우량계의 크기가 중요할까요?"라는 질문이 있습니다. 이 질문을 매우 똑똑한 친구 한 명에게 물어볼 수도 있고, 친구 여러 명에게 물어볼 수도 있습니다. 이 논문이 제기하는 핵심 질문은 다음과 같습니다: 수수께끼를 세 가지 다른 방식으로 생각하도록 한 친구 한 명에게 물어보는 것이 더 나을까요, 아니면 똑같은 방식으로 수수께끼를 생각하도록 세 명의 다른 친구에게 물어보는 것이 더 나을까요?

저자인 인텔 랩스의 연구원들은 ChatGPT 같은 도구의 기반이 되는 AI 두뇌인 대규모 언어 모델 (LLM) 을 이용해 이 답을 찾으려 했습니다. 그들은 이를 "앙상블 질문 (Ensembling Question)"이라고 부릅니다.

두 가지 전략

이 논문은 "다양성 (서로 다른 관점)"을 활용하여 더 나은 답변을 얻는 두 가지 방식을 비교합니다:

1. "많은 친구" 접근법 (모델 다양성)
세 명의 서로 다른 친구, 즉 앨리스, 밥, 찰리가 있다고 상상해 보세요. 그들은 모두 서로 다른 성격과 사고 방식을 가지고 있습니다. 여러분은 그들에게 모두 똑같은 질문을 합니다: "우량계의 크기가 중요할까요?"

  • 목표: 앨리스가 틀렸다면 밥이나 찰리가 맞히기를 바라는 것입니다.
  • 결과: 논문에 따르면, 이는 종종 평균적인 답변만 제공합니다. 앨리스는 뛰어나고 밥은 보통이며 찰리는 형편없다면, 그룹 투표는 대개 중간쯤에 위치하게 됩니다. 이는 그룹을 개별적으로 가장 뛰어난 친구보다 더 똑똑하게 만들어 주지 않습니다.

2. "한 친구, 세 가지 모자" 접근법 (질문 해석 다양성)
이제 한 명의 친구 (예를 들어, GPT-3.5 라는 매우 똑똑한 AI) 에게만 질문한다고 상상해 보세요. 하지만 그들이 답변하기 전에, 질문을 바라보기 위해 세 가지 다른 "모자"나 렌즈를 쓰도록 요청합니다.

  • 모자 1 (과학자): "이것이 강우 측정의 정확도에 어떤 영향을 미칠까요?"
  • 모자 2 (엔지니어): "이것이 우량계의 비용과 설계에 어떤 영향을 미칠까요?"
  • 모자 3 (환경운동가): "이것이 자연에 대한 강우의 영향에 대한 우리의 이해를 어떻게 바꿀까요?"
    친구는 각 모자에 맞춰 세 번 질문을 답변합니다. 그런 다음 세 가지 답변에 대해 투표를 합니다.
  • 목표: AI 가 질문을 다양한 각도에서 바라보도록 강제함으로써, 단일하고 직선적인 읽기 방식으로는 놓칠 수 있는 뉘앙스를 발견하는 것입니다.
  • 결과: 이 접근법이 일관되게 승리했습니다. "한 친구, 세 가지 모자" 방식은 세 명의 다른 친구에게 같은 질문을 하는 것보다 더 나은 답변을 산출했습니다.

왜 "한 친구" 접근법이 승리했을까요?

논문에 따르면, 세 가지 다른 모델 (즉, "많은 친구" 접근법) 에게 질문하는 문제점은 그들이 종종 같은 실수를 저지른다는 것입니다. 비록 서로 다른 모델이라 하더라도, 그들은 유사한 데이터로 훈련되었고 유사한 "맹점"을 공유합니다. 만약 그들이 모두 같은 방식으로 질문을 오해한다면, 그들의 답변에 투표하는 것은 도움이 되지 않습니다.

반면, 하나의 모델에게 질문을 다양한 방식으로 해석하도록 요청하면, 기존의 사고 패턴에서 벗어나도록 강제하는 것입니다. 이는 본질적으로 "질문에 답하기만 하지 말고, 그 질문이 무엇일 수 있는지 생각해보라"는 것입니다. 이는 올바른 내용을 더 잘 포괄할 가능성이 높은 다양한 답변을 만들어냅니다.

"투표" 메커니즘

최종 답변을 결정하기 위해 연구원들은 간단한 다수결 투표를 사용했습니다.

  • 만약 "과학자"가 "예"라고 하고, "엔지니어"가 "예"라고 하고, "환경운동가"가 "아니오"라고 한다면, 최종 답변은 "예"가 됩니다.
  • 논문은 이 투표 시스템이 서로 다른 모델에서 온 입력보다는 동일한 질문의 서로 다른 해석에서 온 입력일 때 훨씬 더 잘 작동한다는 것을 발견했습니다.

결론

이 논문은 간단한 "예/아니오" 질문에 답하는 경우, 서로 다른 AI 들의 무리를 모아 한 가지 방식으로 생각하게 하는 것보다, 하나의 AI 의 두뇌를 여러 가지 방식으로 생각하도록 확장하는 것이 더 낫다고 결론 내립니다.

어두운 방에서 분실된 열쇠를 찾는 것과 같습니다:

  • 모델 다양성은 세 명의 서로 다른 사람을 고용해 방을 수색하게 하는 것이지만, 모두 지시받은 대로 정확히 같은 구석만 찾는 것과 같습니다.
  • 질문 해석 다양성은 한 사람을 고용해 방을 수색하게 하되, 열쇠를 장난감인 것처럼, 그다음 도구인 것처럼, 마지막으로 보석인 것처럼 찾아보라고 지시하는 것입니다. 이는 그들이 방 전체를 더 철저히 스캔하도록 강제하며, 열쇠를 찾을 확률이 훨씬 높아집니다.

연구원들은 이 방법을 일반 상식, 전략, 의학 과학에 관한 세 가지 다른 질문 세트에 대해 테스트했고, "한 친구, 세 가지 모자" 방식이 "많은 친구" 방식을 일관되게 능가한다는 것을 발견했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →