← 최신 논문
💬 NLP

Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

이 논문은 16개의 언어 모델이 심리치료 사례에 대해 어떻게 다양한 해석을 생성하는지 분석하기 위해 모델별 이견 기여도 지표를 도입하며, 모델의 정체성이 이러한 이견을 유의미하게 구조화하는 반면, 결과적인 분산은 표준적인 모델 범주나 사례의 의도된 해석적 개방성보다는 임상적 내용과 특정 앙상블 구성에 의해 더 많이 유발된다는 점을 밝힌다.

원저자: Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi

게시일 2026-08-04
📖 5 분 읽기🧠 심층 분석

원저자: Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 까다로운 퍼즐을 풀려고 노력 중이라고 상상해 보세요. 대신 친구 한 명에게만 묻는 대신, 방 안 가득 모인 수많은 친구에게 질문을 던집니다. 당신은 그들이 모두 서로 다른 사람들이기에, 훨씬 더 다양하고 창의적인 해결책들을 제시해 줄 것이라 기대합니다. 이것이 바로 "앙상블(ensembles)" AI 모델을 사용하는 기본 개념입니다. 컴퓨터 과학의 세계에서 앙상블이란 단순히 문제를 해결하기 위해 함께 작동하는 서로 다른 AI 프로그램들의 집합을 의미합니다. 큰 기대는, 많은 "목소리"를 모음으로써 단 하나의 모델로부터 얻는 것보다 더 풍부하고 다양한 답변을 얻는 것입니다.

하지만 여기 함정이 있습니다. 방 안에 사람들이 가득하다고 해서 그들이 모두 서로 다른 말을 한다는 뜻은 아닙니다. 만약 그들이 모두 같은 학교를 다니고, 같은 책을 읽었으며, 같은 규칙을 배웠다면, 그들은 단지 단어만 조금 다르게 사용할 뿐 결국 똑같은 답을 내놓게 될 수도 있습니다. 이 논문은 "다양성 측정(diversity measurement)"이라는 AI 연구의 특정 영역을 깊이 있게 파고듭니다. 이 논문은 단순하지만 심오한 질문을 던집니다. 우리가 AI들에게 정답이 하나로 정해져 있지 않은 문제(예를 들어, 복잡한 인간의 감정을 해석하는 일)를 풀라고 요청했을 때, 그들은 실제로 다르게 생각할까요? 아니면 그저 서로를 메아리처럼 따라 하고 있는 것일까요? 연구자들은 우리가 다양한 관점을 얻고 있다고 믿고 있지만, 실제로는 단지 복제된 군중의 목소리를 듣고 있는 것이라면, 잘못된 안전감에 기반해 잘못된 결정을 내릴 수도 있기 때문에 이 점을 중요하게 여깁니다.

거대한 AI 에코 체임버 (The Great AI Echo Chamber)

이 연구에서 연구진은 AI 모델 그룹이 실제로 얼마나 많은 "노이즈"를 만들어내는지 확인하기 위해 대규모 실험을 설계했습니다. 그들은 10개의 서로 다른 계열(AI의 브랜드나 혈통이라고 생각하면 됩니다)에서 온 16개의 서로 다른 AI 모델을 모았습니다. 그리고 이 모델들에게 숙련된 상담사처럼 행동하며 가상의 환자에 대한 사례 연구를 작성하도록 요청했습니다. 환자의 이야기는 매우 모호하게 설정되어, 단 하나의 "정답"이 존재하지 않았습니다. 훌륭한 상담사라면 동일한 이야기를 보고도 여러 가지 각도로 해석할 수 있을 정도였습니다.

연구팀은 모델들 사이의 "불일치(dissent)" 또는 의견 차이를 측정하고자 했습니다. 그들은 **벤디 스코어(Vendi Score)**라는 특별한 수학적 도구를 사용했습니다. 여러 사람이 답을 외치는 상황을 상상해 보세요. 만약 모두가 똑같은 단어를 외친다면 벤디 스코어는 낮습니다(1과 같이). 만약 모두가 완전히 다른 단어를 외친다면 스코어는 높습니다(16과 같이). 연구진은 자신들의 16개 모델이 16명의 독특한 개인처럼 행동할지, 아니면 하나의 지루한 목소리로 붕괴될지를 확인하고 싶었습니다.

충격적인 결과: 두 개 미만의 목소리

결과는 다소 충격적이었습니다. 16개의 서로 다른 모델10개의 서로 다른 계열을 모았음에도 불구하고, 이 그룹은 평균적으로 마치 1.69개의 뚜렷한 목소리만 있는 것처럼 행동했습니다.

이해를 돕기 위해, 연구진은 단일 AI 모델에게 동일한 질문을 스스로 16번 반복해서 던지는 테스트도 진행했습니다. 단 하나의 모델조차도 기분이 약간 변하는 것(과학자들이 말하는 '확률적 변동')만으로도 1.43개의 서로 다른 버전의 답을 만들어냈습니다. 즉, 16개의 모델 전체를 합쳐도 단일 모델이 스스로 만들어낼 수 있는 다양성보다 고작 0.25 정도의 "목소리"만을 더 추가했을 뿐입니다.

이는 마치 16명의 가수를 10개의 서로 다른 음악 학교에서 초빙하여 독특한 스타일의 교향곡을 기대했으나, 결국 그들이 모두 한 사람이 약간 음이 이탈된 채로 흥얼거리는 노래를 부르는 것과 같습니다. 이 논문은 단순히 더 많은 모델을 그룹에 추가한다고 해서 자동으로 더 많은 다양성이 생성되는 것이 아님을 명시적으로 밝히고 있습니다. 사실, 이 연구는 패널에 더 많은 모델을 추가하는 것이 더 많은 관점을 얻기 위한 좋은 방법이 아님을 보여줍니다.

누가 반항아인가? (그리고 그것은 군중에 달려 있다)

연구진은 또한 다음과 같은 질문을 던졌습니다: "모두와 의견이 다른, 즉 항상 반항아 역할을 하는 특정 모델이 존재하는가?" 그들은 매 실험 회차마다 어떤 모델이 "가장 이질적인지(most divergent)"를 추적했습니다.

여기서 반전이 있습니다: 반항아의 정체는 그 방에 누가 함께 있느냐에 따라 바뀌었습니다.

단 세 개의 모델만 참여한 작은 실험에서는 특정 모델(GPT-4o)이 대부분의 경우 반항아 역할을 했습니다. 하지만 팀이 그룹을 16개 모델로 확장하자, 그 모델은 3위로 밀려났습니다. 대신 Ministral 14B나 Llama 3.3 70B와 같은 새로운 "반항아"들이 등장하여 그룹과 의견을 달리하는 주도권을 잡았습니다.

이는 "아웃라이어(outlier, 특이치)"가 특정 AI의 영구적인 성격 특성이 아님을 증명합니다. 그것은 관계입니다. 어떤 모델이 매우 다르게 보이는 이유는 단지 다른 모델들이 서로 매우 유사하기 때문일 수 있습니다. 그룹을 교체하면, 그 "반항아"는 갑자기 "순응자"처럼 보일 수도 있습니다. 이는 만약 어떤 시스템이 의사결정을 돕기 위해 "이질적인 목소리"를 보여준다면, 그 목소리는 해당 AI 모델 자체에 대한 정보라기보다 현재 그 자리에 있는 특정 AI 그룹에 대한 정보를 말해주고 있다는 뜻입니다.

규모나 브랜드가 중요한가?

연구팀은 사람들이 흔히 갖는 두 가지 가정에 대해서도 테스트했습니다:

  1. 규모가 크면 더 다른가? 그들은 동일한 계열 내에서 "작은" 모델과 "큰" 모델을 비교했습니다. 결과는 혼란스러웠습니다. 때로는 작은 모델이 반항아였고, 때로는 큰 모델이 반항아였습니다. 일관된 규칙은 없었습니다.
  2. 가문의 이름이 중요한가? 그들은 같은 "계열"(예: 같은 브랜드의 다른 버전들)에 속한 모델들을 살펴보았습니다. 같은 계열의 모델들은 낯선 모델들에 비해서는 서로 다소 유사한 경향이 있었지만, 비교할 쌍이 적었기 때문에 그 증거는 미약했습니다.

논문은 AI의 "이질성"을 단순히 모델의 크기나 브랜드 이름만 보고 예측할 수는 없다고 결론짓습니다. 실제로 사용하는 구체적인 맥락 속에서 직접 측정해야 합니다.

AI는 실제로 무엇에 대해 이견을 보이는가?

마지막으로, 연구진은 모델들이 다양한 해석이 가능하도록 설계된 사례들에 대해 더 많이 이견을 보이는지 확인했습니다. 그들은 환자의 이야기를 세 가지 유형으로 분류했습니다: 하나의 명확한 해석이 가능한 이야기, 공유되지만 효과적이지 않은 해석이 가능한 이야기, 그리고 진정으로 구별되는 해석이 가능한 이야기입니다.

그들은 "열린(open)" 이야기들에 대해 모델들이 가장 많이 이견을 보일 것이라고 예상했습니다. 하지만 그렇지 않았습니다. 모델들은 "열린" 이야기에서도 다른 이야기들과 마찬가지로, 혹은 오히려 약간 더 적게 이견을 보였습니다. 대신, 이견의 정도는 이야기의 **임상적 내용(clinical content)**에 의해 결정되었습니다. 예를 들어, "우울증"에 관한 이야기는 "트라우마"에 관한 이야기보다 더 많은 이견을 불러일으켰습니다.

이는 AI 모델들이 인간이 그러하듯 문제의 "개방성"에 민감하게 반응하는 것이 아니라, 상황의 철학적 복잡성보다는 이야기의 구체적인 세부 사항(예: 언급된 질병의 종류)에 반응하고 있음을 시사합니다.

핵심 요점

이 연구는 AI가 쓸모없다고 말하는 것이 아닙니다. 다만 우리는 AI의 큰 그룹이 자동으로 스마트하고 다양한 그룹이라고 가정하는 것을 멈춰야 한다고 말합니다. 16개의 모델을 한 방에 넣는다고 해서 반드시 두 명의 지혜만을 얻게 되는 것은 아닙니다. 당신이 얻는 "다양성"은 단순히 더 많은 모델을 추가함으로써 살 수 있는 고정된 숫자가 아닙니다. 그것은 모델의 특정 조합과 그 모델이 해결하고 있는 특정 문제에 따라 달라지는 취약한 것입니다.

가장 중요한 교훈은, 만약 당신이 어려운 결정을 내리기 위해 AI 그룹을 사용하고 있다면, 단순히 모델의 개수만 세지 말라는 것입니다. 그들이 실제로 얼마나 다른지를 측정해야 합니다. 왜냐하면 당신이 보고 있는 "아웃라이어"의 목소리는 그 기계의 깊은 통찰력이 아니라, 단지 그 테이블에 앉아 있는 이들이 누구인지에 따른 일시적인 효과일 수 있기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →