← 최신 논문
🤖 AI

Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble

이 논문은 민감한 인구통계학적 정보나 미세 조정(fine-tuning) 없이도 타겟 인구 데이터를 일치시키기 위해 다양한 LL로 된 에이전트 풀을 구축하고 이들을 L1 정규화 회귀를 통해 집계함으로써, 사회과학 연구에서 인간의 선호도를 모사하는 비용 효율적인 2단계 프레임워크인 Prompts to Proxies (P2P)를 소개한다.

원저자: Bingchen Wang, Zi-Yu Khoo, Jingtan Wang

게시일 2026-01-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bingchen Wang, Zi-Yu Khoo, Jingtan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 만약 "공원을 더 지어야 하는가?" 또는 "과학자를 얼마나 신뢰하는가?"와 같은 특정 주제에 대해 한 나라 전체가 어떻게 생각하는지 알고 싶다고 가정해 봅시다. 보통은 수천 명의 실제 사람들에게 전화를 걸어야 하는데, 이는 비용이 많이 들고 느리며, 새로운 아이디어를 빠르게 테스트해야 할 때는 불가능할 때도 있습니다.

이 논문은 실제 사람들을 대신하기 위해 인공지능(AI)을 사용하는 영리한 방법을 소개합니다. 그들은 이 방법을 **Prompts to Proxies (P2P)**라고 부릅니다.

다음은 일상적인 비유를 사용한 이 방법의 간단한 설명입니다.

문제점: "평균적인" AI는 지루하다

만약 당신이 표준적인 AI 챗봇에게 "미국인들은 공원에 대해 어떻게 생각하나요?"라고 묻는다면, AI는 매우 안전하고 중간적인 답변을 내놓을 것입니다. 이는 마치 한 사람이 군중 전체를 대변하도록 요청하는 것과 같습니다. 그들은 대개 "평균적인" 의견만을 말합니다. 하지만 실제 군중은 복잡합니다! 공원을 사랑하는 사람도 있고, 싫어하는 사람도 있으며, 관심이 없는 사람도 있고, 공원이 너무 비싸다고 생각하는 사람도 있습니다. 단일 AI 챗봇은 이러한 다양성을 모두 뭉뚱그려 버리기 때문에, 실제 설문 조사를 대신하기에는 부적절합니다.

해결책: "테이스팅 패널" 접근법

저자들은 하나의 완벽한 AI를 만드는 대신, 다양한 AI 캐릭터들의 팀을 만들고 그들의 답변을 혼합하는 시스템을 구축했습니다.

이것을 와인 테이스팅 패널에 비유해 보겠습니다.

  • 목표: 특정 빈티지의 와인(실제 인간 인구의 의견)이 가진 정확한 풍미 프로필을 재현하는 것입니다.
  • 실수: 단 하나의 포도가 와인 한 병 전체의 맛과 똑같기를 기대하는 것입니다. (다른 방법들이 시도하는 방식이며, 대개 실패합니다.)
  • P2P 방식: 다양한 종류의 포도(서로 다른 AI 캐릭터들)를 모읍니다. 어떤 것은 달콤하고, 어떤 것은 시며, 어떤 것은 과일 향이 나고, 어떤 것은 흙 내음이 납니다. 그런 다음 이들을 특정 비율로 섞어서 완벽한 빈티지의 풍미를 재현합니다.

P2P의 작동 방식 (2단계 프로세스)

논문은 이를 두 단계의 과정으로 설명합니다.

1단계: "다양한 팀" 구축하기 (Active Endowment Generation)

먼저, 시스템은 다양한 AI 캐릭터의 큰 풀(pool)을 만들어야 합니다.

  • 비결: 단순히 AI에게 "무작위로 행동하라"고 요청하는 대신, 시스템은 **엔트로피 기반 적응형 샘플링(entropy-based adaptive sampling)**이라는 스마트한 전략을 사용합니다.
  • 비유: 요리사가 모든 맛을 아우르는 메뉴를 만들려고 한다고 상상해 보세요. 만약 그들이 사람들이 이미 좋아하는 음식(예: 평범한 빵)만 계속 만든다면, 새로운 것을 배우지 못할 것입니다. 따라서 요리사는 사람들이 서로 의견이 일치하지 않았던 부분(낮은 엔트로피)을 살펴보고, 그 간극을 메우기 위해 주방에 새로운 변형을 만들어내라고 구체적으로 요청합니다.
  • 결과: 결과적으로 300개의 서로 다른 "페르소나"(예: 중서부 지역의 은퇴한 교사, 도시의 젊은 기술직 노동자, 인플레이션을 걱정하는 농부 등)가 만들어집니다. 이들은 단순히 무작위가 아니라, 가능한 가장 넓은 범위의 의견을 포괄하도록 정교하게 선택되었습니다.

2단계: "믹솔로지스트(조주사)" (Regression-Based Aggregation)

이제 다양한 AI 캐릭터 팀을 갖추었으니, 실제 인간 데이터와 일치시키기 위해 각 캐릭터를 얼마나 사용할지 결정해야 합니다.

  • 비유: 당신에게 실제 수프의 레시피(실제 사람들의 설문 결과)가 있다고 상상해 보세요. 당신에게는 300가지의 서로 다른 재료(당신의 AI 캐릭터들)가 가득 찬 팬트리가 있습니다. 300개를 모두 사용할 필요는 없습니다. 실제 수프와 똑같은 맛을 내기 위해 필요한 완벽하고 작은 한 줌의 재료를 찾아야 합니다.
  • 수학: 시스템은 수학적 도구인 **L1 정규화 회귀(L1-regularized regression)**를 사용하여 믹솔로지스트 역할을 수행합니다. 시스템은 실제 설문 데이터를 보고 다음과 같이 판단합니다: "좋아, 이 결과를 얻으려면 '은퇴한 교사'의 목소리는 10%, '기술직 노동자'의 목소리는 5%, '농부'의 목소리는 0%가 필요해."
  • 마법: 이 과정은 실제 사람들의 민감한 개인 정보(정확한 소득이나 인종 등)를 알 필요 없이 수행됩니다. 시스템은 단지 사람들이 낸 답변을 보고, 어떤 AI 목소리의 조합이 그 답변들과 가장 잘 일치하는지를 파악합니다.

이것이 왜 중요한가?

  1. 저렴하고 빠릅니다: 거대하고 비싼 AI 모델을 처음부터 학습시킬 필요가 없습니다. 기존 AI 모델을 사용하기만 하면 되며, 시뮬레이션을 실행하는 데 드는 비용은 매우 저렴합니다(설문당 약 0.80달러).
  2. 정확합니다: 연구진이 미국(American Trends Panel)과 전 세계(World Values Survey)의 실제 설문 조사와 비교 테스트했을 때, 이들의 "AI 혼합물"은 일반적인 AI나 다른 흔한 방법들을 사용했을 때보다 실제 인간의 의견에 훨씬 더 가까웠습니다.
  3. 적은 데이터로도 작동합니다: 다른 방법들이 사용하는 데이터의 3% 미만인 아주 적은 양의 실제 인간 데이터만 가지고도, 이 시스템은 매우 뛰어난 성능을 보여주었습니다.

결론

이 논문은 인간 사회를 이해하기 위해 하나의 "슈퍼 AI"가 필요한 것이 아니라고 주장합니다. 대신, 다양한 AI 배우들의 캐스트가 필요하며, 그들의 합쳐진 연기가 실제 관객의 목소리와 똑같이 들리도록 하는 스마트한 연출이 필요합니다. 이를 통해 연구자들은 수천 명의 실제 사람을 인터뷰하거나 그들의 개인 정보에 접근할 필요 없이, 공공의 의견을 빠르고 저렴하며 정확하게 시뮬레이션할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →