← 최신 논문
🤖 AI

Personalization, Personas, and Forecasting in Value Alignment

본 연구는 프롬프트 프레이밍, 즉 모델에게 개인화, 역할 수행, 또는 제3자 관점의 예측을 요청하는지 여부가 인간 집단과의 문화적 가치 정렬에 유의미한 변화를 일으킨다는 것을 입증하며, 특히 제3자 예측이 다양한 언어와 가치 차원에 걸쳐 일반적으로 가장 안정적이고 정확한 결과를 산출한다는 점을 보여준다.

원저자: James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: James Wedgwood, Pratiksha Thaker, Neil Kale, Virginia Smith

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 거의 모든 책을 읽은 초지능 로봇과 대화하고 있다고 상상해 보세요. 당신은 이 로봇이 인간처럼 하나의 고정된 신념을 가진 단일한 성격을 가지고 있을 것이라고 생각할지도 모릅니다. 하지만 인공지능의 세계에서 이 로봇들은 카멜레온과 같습니다. 이들은 당신이 어떻게 질문하느냐에 따라 자신의 "목소리"와 "의견"을 바꿀 수 있습니다. 이 연구 분야는 **가치 정렬(value alignment)**이라고 불리는데, 이는 단순히 "이 로봇의 답변이 실제 인간이 생각하는 것과 일치하는가?"를 묻는 멋진 표현입니다.

이를 이해하려면 우리가 이 로봇들에게 말하는 세 가지 방법을 알아야 합니다. 첫째, **개인화(Personalization)**는 로봇에게 "헤이, 나는 브라질에서 온 사람이야. 너는 어떻게 생각해?"라고 말하는 것과 같습니다. 로봇은 당신에게 도움이 되는 친구가 되려고 노력합니다. 둘째, 역할극(Role-playing) 또는 **페르소나(Personas)**는 코스튬을 입는 것과 같습니다. 당신이 "브라질 사람인 것처럼 행동해 줘"라고 말하면, 로봇은 그 역할을 수행합니다. 셋-째, **예측(Forecasting)**은 탐정이 되는 것과 같습니다. 당신은 로봇에게 그 사람이 되어달라고 요청하지 않고, "브라질 사람은 뭐라고 답할까?"라고 묻습니다. 오랫동안 과학자들은 이 세 가지 대화 방식이 기본적으로 동일한 것인지 궁금해했습니다. 만약 당신이 로봇에게 브라질 사람이 되어달라고 하든, 브라질 사람에게 말을 걸라고 하든, 혹은 브라질 사람이 무엇을 생각하는지 추측하라고 하든, 로봇이 똑같은 답변을 내놓아야 하는 것일까요?

한 연구팀은 이 아이디어를 테스트하기 위해 종교, 노동, 사회에 대한 믿음에 대해 전 세계 수백만 명의 사람들에게 질문하는 거대하고 실제적인 설문 조사인 '세계 가치 조사(World Values Survey)'를 사용하기로 했습니다. 그들은 세계에서 가장 똑똑한 네 대의 AI 로봇에게 13개의 서로 다른 언어와 국가를 사용하여 101개의 설문 문항에 답하도록 했습니다. 그들은 이 세 가지 방법(사용자에게 말하기, 역할극 하기, 예측하기)을 모두 시도하여, 어떤 방식이 실제 인간 데이터와 가장 잘 일치하는지를 확인했습니다.

여기서 반전이 발견되었습니다: 질문을 어떻게 하느냐에 따라 답변이 달라집다는 것입니다. 연구진은 이 세 가지 방법이 서로 대체 가능한 것이 아님을 발견했습니다. 사실, 프롬프트를 구성하는 방식은 로봇이 해당 국가의 실제 사람처럼 들리는지 여부에 있어 매우 중요한 요소였습니다.

가장 놀라운 발견은 **예측(forecasting)**이 확실한 승자였다는 점입니다. 연구진이 로봇에게 "[국가 X]의 사람이라면 뭐라고 말할까?"라고 물었을 때, 로봇은 그 사람이 "되어" 달라고 하거나 그 사람에게 "말을 걸" 때보다 실제 인간의 답변에 훨씬 더 가까워졌습니다. 마치 로봇이 누군가가 되어 연기하는 것보다, 타인이 무엇을 생각하는지 추측하는 똑똑한 관찰자가 되는 것에 더 능숙한 것과 같습니다. 테스트한 네 대의 로봇 중 세 대에서, 이 "추측" 방식이 문화적으로 정확한 답변을 얻는 데 가장 강력한 방법이었습니다.

하지만 로봇이 모든 것을 맞춘 것은 아니었습니다. 연구진은 로봇이 종교의 중요성이나 성 역할에 대한 견해와 같이 크고 명백한 문화적 차이를 포착하는 데는 뛰어났다는 것을 발견했습니다. 그러나 정부에 대한 신뢰, 민주주의, 또는 제도가 얼마나 잘 작동하는지와 같은 더 까다롭고 복잡한 주제에 있어서는 어려움을 겪었습니다. 심지어 예측하려고 노력할 때조차, 그들은 미묘한 문제들에 대해서는 종종 빗나갔습니다.

또한 이 연구는 로봇이 단순히 무작위로 답변을 바꾸는 것이 아니라, 특정한 방향으로 움직인다는 것을 보여주었습니다. 예를 들어, 종교에 관한 질문의 경우 로봇의 답변은 실제 인간의 데이터 쪽으로 강하게 이동했습니다. 하지만 부패나 정치적 신뢰에 관한 질문의 경우, 답변은 로봇의 기본 "글로벌" 모드에 머물러 있거나 심지어 실제 인간이 생각하는 것과는 반대 방향으로 움직이기도 했습니다.

그렇다면 이것은 무엇을 의미할까요? 이는 만약 당신이 AI가 특정 문화를 이해하기를 원한다면, 단순히 그 지역 사람처럼 "행동하라"고 말해서는 안 된다는 것을 시사합니다. 대신 현지인이 무엇을 생각할지 "예측"하라고 요청하는 것이 더 나은 결과를 가져올 수 있습니다. 그럼에도 불구하고, 로봇은 인류의 완벽한 거울은 아닙니다. 로봇은 조용하고 복잡한 신호보다는 크고 명확한 문화적 신호를 포착하는 데 더 능숙합니다. 연구진은 결론적으로, 우리가 이러한 질문을 던지는 방식은 단순한 외형적인 선택이 아니라, 로봇이 말하는 내용과 그것이 실제 세상과 얼마나 잘 일치하는지를 근본적으로 변화시킨다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →