← 최신 논문
💬 NLP

More Is Not More: What Matters for Diversity in LLM Opinions?

이 논문은 LLM의 의견 다양성을 높이는 것이 페르소나의 상세함이나 온도(temperature)와 같은 단일 요인을 확장하는 데 덜 의존하며, 오히려 서로 다른 상호작용 아키텍처를 전략적으로 결합하고 과도한 페르소나 정교화에 따른 수확 체감의 법칙을 인식하는 데 더 의존한다는 것을 입증하기 위해 요인 실험(factorial experiment)을 채택한다.

원저자: Qiyang Yao

게시일 2026-07-24✓ Author reviewed
📖 4 분 읽기☕ 가벼운 읽기

원저자: Qiyang Yao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 모든 손님이 각자 고유한 생각, 기억, 의견을 가진 서로 다른 사람인 거대한 가상 저녁 파티를 주최한다고 상상해 보세요. 당신은 정치에 대한 매운맛 발언부터 미래에 대한 기묘한 이론까지, 온갖 와일드한 아이디어의 혼합을 듣고 싶어 합니다. 하지만 여기 함정이 있습니다. 당신은 실제 인간을 초대하는 것이 아니라, 대규모 언어 모델(LLM)이라고 불리는 초지능형 컴퓨터 프로그램에게 이 손님들을 연기해 달라고 요청하는 것입니다. 이 모델들은 인터넷 전체를 읽고 인간의 말투를 완벽하게 흉내 낼 수 있는 아주 뛰어난 배우와 같습니다. 하지만 당신이 그들에게 군중 역할을 맡기면, 그들은 종종 모두 똑같이 들리기 시작합니다. 서로 너무 많이 동의하고, 같은 문구를 사용하며, 결국 지루하고 단조로운 대화로 끝나버립니다. 이것은 문제입니다. 왜냐만에 진짜 사람들이 무엇을 생각하는지 이해하고 싶다면, 단순히 합창단이 완벽한 화음으로 노래하는 것이 아니라, 실제로 '군중'처럼 들리는 군중이 필요하기 때문입니다.

과학자들은 이 "지루한 파티" 문제를 해결하기 위해 노력해 왔습니다. 그들은 컴퓨터에게 자신이 연기할 인물에 대해 더 많은 세부 정보(예: "당신은 45세의 교사 사라입니다")를 제공하거나, 컴퓨터가 서로 대화하는 방식(예: 한 명씩 대답하는 대신 그룹 내에서 논쟁하게 만들기)을 바꾸는 등의 시도를 해왔습니다. 또한 컴퓨터가 더 무작위적이고 다양해지도록 "창의성 다이얼"을 높이는 시도도 했습니다. 하지만 지금까지는 어떤 기술이 실제로 가장 잘 작동하는지에 대한 명확한 지도가 없었습니다. 그것은 마치 밀가루, 달걀, 혹은 오븐의 온도가 케이크의 맛을 결정하는 것인지 알지 못한 채, 모든 재료를 한꺼번에 섞어서 운 좋게 맛있어지기를 바라는 마음으로 케이크를 굽는 것과 같았습니다.

"More Is Not More"라는 제목의 이 논문은 마침내 어떤 재료가 정말 중요한지를 구분해 내는 거대한 과학적 '맛 테스트'와 같습니다. 연구진은 100개의 서로 다른 질문과 7개의 서로 다른 컴퓨터 모델을 사용하여 대규모 실험을 설계했습니다. 그들은 의견의 다양성을 높이기 위해 두 가지 주요 방법, 즉 입력 컨디셔닝(컴퓨터에게 자신이 누구인지 얼마나 자세히 설명할 것인가)과 상호작용 아키텍처(컴퓨터 손님들이 서로 어떻게 대화할 것인가)를 테스트했습니다. 또한 "다양해져라"라고 명령하거나 무작위성 노브를 높이는 것과 같이 사람들이 흔히 시도하는 "저렴한 속임수"들도 테스트했습니다.

그들이 발견한 내용은 다음과 같으며, 그 답은 다소 놀랍습니다:

1. "세부 정보의 함정"
많은 이들은 컴퓨터에게 더 많은 배경 이야기를 제공할수록 더 독특한 의견이 나올 것이라고 생각했습니다. 당신은 "당신은 애틀랜타에 살며 교회에 다니고 연봉이 78,000달러인 34세의 흑인 여성 사라입니다"라고 말하면 컴퓨터가 매우 독특하게 행동할 것이라고 생각할 수도 있습니다! 하지만 연구 결과, 이것은 사실이 아니었습니다. 다양성의 가장 큰 도약은 "당신은 학교 선생님입니다"와 같이 아주 적은 정보만을 주었을 때 일어났습니다. 그 한 문장을 추가하자마면 컴퓨터는 사람처럼 행동하기 시작했습니다. 그 외의 모든 세부 정보(나이, 인종, 소득, 취미 등)를 추가하는 것은 큰 도움이 되지 않았습니다. 사실, 일부 모델의 경우 너무 많은 세부 정보를 주는 것이 오히려 의견을 덜 다양하게 만들었는데, 이는 컴퓨터가 혼란을 겪거나 스테레오타입(고정관념)에 갇히기 시작했기 때문입니다. 이는 캐릭터를 흥미롭게 만들기 위해 10페이지짜리 전기를 써주는 것과 같습니다. 때로는 단지 직업을 아는 것만으로도 독특한 목소리를 불러일으키기에 충분하며, 나머지는 그저 대본을 어지럽힐 뿐입니다.

2. "그룹 채팅의 힘"
연구진은 컴퓨터 손님들이 어떻게 상호작용하는지도 살펴보았습니다. 그들은 세 가지 스타일을 비교했습니다:

  • 솔로 아티스트: 컴퓨터가 질문에 한 번 대답하고 떠납니다.
  • 심층 인터뷰: 컴퓨터가 대답하면 후속 질문을 받고, 또 다른 질문을 받으며 자신과 긴 대화를 이어갑니다.
  • 포커스 그룹: 다섯 명의 서로 다른 컴퓨터 "사람들"이 그룹 채팅에서 대화합니다.

결과는 "심층 인터뷰"와 "포커스 그룹" 모두 "솔로 아티스트"보다 훨씬 더 다양한 의견을 만들어냈음을 보여주었습니다. 하지만 핵심은 이들이 단순히 똑같은 의견을 더 좋게 만든 것이 아니라, 완전히 다른 사고의 세계를 탐구했다는 점입니다. "심층 인터뷰" 스타일은 개인적이고 내성적인 각도를 깊게 파고들었고, "포커스 그룹" 스타일은 더 비교적인 각도를 찾아냈습니다. 이 연구는 만약 당신이 가장 넓은 범위의 의견을 얻고 싶다면, 단 하나의 "최선의" 방법을 선택해서는 안 된다고 제안합니다. 대신, 두 가지 방법을 모두 실행하고 그 답변들을 결합해야 합니다. 그것은 마치 솔로 시인과 토론 팀이 동일한 주제에 대해 글을 쓰는 것과 같습니다. 그들의 답변은 서로 크게 겹치지 않을 것이므로, 양쪽을 모두 읽음으로써 훨씬 더 풍부한 아이디어의 모음을 얻을 수 있습니다.

3. "저렴한 속임수는 통하지 않는다"
마지막으로, 연구진은 사람들이 흔히 먼저 시도하는 낮은 노력의 해킹 기술들을 테스트했습니다. 그들은 "온도(temperature)"를 높이거나(컴퓨터를 더 무작위적이고 예측 불가능하게 만드는 설정), "다양한 관점을 제시해 주세요"와 같은 지시어를 추가하는 것을 시도했습니다. 결과는 어땠을까요? 이러한 속임수들은 거의 영향을 미치지 못했습니다. 무작위성을 높이는 것은 새로운 아이디어를 만들어내는 것이 아니라, 기존의 아이디어를 그저 조금 더 혼란스럽게 만들 뿐이었습니다. "다양해져라"라고 말하는 것은 수줍음이 많은 사람에게 "재밌게 해봐"라고 말하는 것과 같았습니다. 그것은 실제로 성격을 바꾸지 못했습니다. 연구 결과, 단순한 한 문장의 직업 묘사(예: "당신은 선생님입니다")가 최고의 "저렴한 속임수"보다 다양한 의견을 만들어내는 데 2.5배 더 효과적이었습니다.

결론
이 논문의 핵심 메시지는 다양성이란 똑같은 일을 더 많이 하는 것이 아니라는 점입니다. 그것은 더 긴 전기를 쓰거나 무작위성 다이얼을 높이는 것이 아닙니다. 대신, 그것은 당신이 질문을 던지는 구조에 관한 것입니다. 컴퓨터로부터 진정으로 다양한 의견을 얻으려면, 시작할 때 단순한 정체성을 부여한 다음, 그것이 주제를 다양한 방식으로 탐구하게 해야 합니다. 예를 들어, 긴 인터뷰를 통해 스스로와 대화하게 하는 것과 친구들과 채팅하게 하는 것을 병행하는 식입니다. 만약 당신이 인간의 의견을 제대로 시뮬레이션하고 싶다면, 더 많은 양의 지시 사항이 아니라 전략의 혼합이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →