What Do People Actually Want From AI? Mapping Preference Plurality
75개국에 걸친 1,500개의 개방형 응답을 분석함으로써, 본 논문은 "진실성"과 같이 널리 갈망되는 특성조차 서로 다른 사용자들에 의해 상이하고 종종 양립 불가능한 방식으로 정의된다는 사실에서 입증되듯, RLHF와 같은 현재의 AI 정렬 방식이 인간 선호도의 심오한 다원성과 맥락적 뉘앙스를 포착하는 데 실패하고 있음을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 전 세계 모든 사람에게 완벽한 맛을 선사할 거대한 케이크 하나를 굽는다고 상상해 보세요. 당신은 75개국 1,500명의 사람들에게 각자의 조각에 무엇을 담고 싶은지 물었습니다. 그러자 산더미 같은 답변들이 돌아왔습니다. 어떤 이들은 달콤한 것을 원했고, 어떤 이들은 매콤한 것을 원했으며, 어떤 이들은 꽃 모양이기를 바랐고, 또 다른 이들은 로봇 모양이기를 바랐습니다.
이제, 제빵사(AI 기업)가 이 개별적인 의견들을 무시하기로 결정했다고 상상해 보세요. 대신 그들은 "다수결"을 통해 모든 상충하는 욕구들을 하나의 단일한 맛 프로필로 버무려 거대한 케이크 하나를 굽습니다. 그들은 이것을 "정렬(alignment)"이라 부릅니다. 즉, AI가 인간의 가치와 일치하도록 만드는 과정입니다.
이 논문, **"사람들은 실제로 AI로부터 무엇을 원하는가? 선호의 다원성 매핑(What Do People Actually Want From AI? Mapping Preference Plurality)"**은 이러한 "하나의 사이즈로 모두를 맞추려는(one-size-fits-all)" 방식의 케이크가 재앙이 될 것이라고 주장합니다. 저자인 줄리아 세풀베다 코엘료(Julia Sepulveda Coelho)와 스콧 A. 헤일(Scott A. Hale)은 사람들이 실제로 무엇을 원하는지 알아보기 위해 실제 열린 대화 내용을 조사했으며, 현재의 AI 케이크를 굽는 방식이 근본적으로 잘못되었다는 것을 발견했습니다.
그들의 연구 결과를 쉬운 비유를 통해 정리하면 다음과 같습니다.
1. "진실"의 함정: 모두가 원하지만, 정작 그것이 무엇인지에 대해서는 아무도 동의하지 않는다
사람들이 가장 많이 요구한 것은 **"진실성(Truthfulness)"**이었습니다. 응답자의 약 절반이 "AI가 진실을 말하기를 원한다"라고 답했습니다.
- 논문의 발견: "진실"이라는 단어는 카멜레온과 같습니다. 어떤 이들에게 진실은 "교과서에 나온 사실을 알려주는 것"을 의미합니다. 다른 이들에게는 "설령 인기가 없는 의견이라 할지라도 모든 측면의 논쟁을 보여주는 것"을 의미합니다. 또 다른 이들에게는 "저널리스트처럼 출처를 밝히는 것"을, 또 다른 이들에게는 단순히 "편향이 없는 것"을 의미합니다.
- 비유: 모든 사람이 "신선한 과일"을 원한다고 합의했다고 가정해 봅시다. 하지만 "그것이 무엇을 의미하는지" 묻는다면, 한 사람은 사과를 원하고, 다른 사람은 망고를 원하며, 세 번째 사람은 과일 샐러드를 원할 수 있습니다. 만약 제빵사가 어떤 과일인지 묻지도 않고 레시피에 그냥 "과일"이라고만 적는다면, 그 결과물은 엉망이 될 것입니다. 논문은 AI 기업들이 "진실"을 단일하고 단순한 지침으로 취급하기 때문에, 사람들이 무엇을 진실이라고 간주하는지에 대한 정의가 완전히 다르다는 사실을 놓치고 있다고 주장합니다.
2. "인간성"에 대한 논쟁: 누군가는 친구를 원하고, 누군가는 도구를 원한다
AI가 인간처럼 행동해야 하는지에 대해서는 큰 논쟁이 있었습니다.
- 분열: 약 33%의 사람들은 "안 됩니다! 인간처럼 행동하지 마세요. 나는 명확하고 로봇 같은 도구를 원합니다"라고 말했습니다. 반면 57%는 "네! 따뜻하고 친절하며 공감 능력이 있어야 합니다. 차가운 기계처럼 들리지 마세요"라고 답했습니다.
- 비유: 이는 그룹에게 투어 가이드가 농담을 던지는 수다스럽고 친절한 현지인이 되길 원하는지, 아니면 길만 가리키는 조용하고 효율적인 로봇이 되길 원하는지 묻는 것과 같습니다. 현재의 AI "제빵사"는 이 두 가지를 동시에 하려고 노력하며, 그 결과 종종 가식적이거나, 기괴하거나, 혹은 지나치게 아첨하는(상대방에게 잘 보이기 위해 무조건 동조하는) 느낌을 줍니다.
3. "가드레일" 문제: 안전인가, 검열인가
사람들은 AI가 얼마나 "통제"되거나 제한되어야 하는지에 대해서도 의견이 갈렸습니다 해로운 내용이나 불쾌한 내용을 말하지 못하도록 엄격한 가드레일을 원하는 사람들이 있는가 하면, 이러한 가드레일이 그저 "검열"일 뿐이며, 설령 논란이 될지라도 불편한 진실을 말할 수 있어야 한다고 느끼는 사람들도 있었습니다.
- 비유: 도서관을 상상해 보세요. 한 그룹은 "나쁜 아이디어"가 담긴 책을 빌려가지 못하게 막는 사서를 원합니다. 다른 그룹은 위험한 책이라도 읽을 수 있도록 사서가 전혀 없는 도서관을 원합니다. 논문은 AI 기업들이 이러한 견해들을 평균화할 때, 결국 누군가에게는 지나치게 조심스럽고, 다른 누군가에게는 위험할 정도로 제한적인 시스템을 만들게 된다는 것을 발견했습니다.
4. "평균"은 거짓이다
저자들이 식별한 가장 큰 문제는 **RLHF(인간 피드백 기반 강화 학습)**라고 불리는 현재의 AI 훈련 방식입니다.
- 현재 작동 방식: AI에게 두 가지 답변(A와 B)을 보여주고 인간이 승자를 선택합니다. AI는 그 "평균적인" 승자를 선택하는 법을 배웁니다.
- 결함: 논문은 인간의 가치를 평균 낼 수 없다고 주장합니다. 만약 50%의 사람들이 "소수 의견"을 원하고 50%가 "안전"을 원한다면, 그 평균은 완벽한 균형이 아니라, 그 누구도 만족시키지 못하는 모호하고 혼란스러운 신호가 됩니다.
- 결과: AI가 환각(hallucination, 사실이 아닌 것을 지어내는 것)을 일으키거나 지나치게 조심스러워지는 이유는 시스템이 고장 나서가 아니라, 주어진 지침 자체가 상충하는 욕구들의 혼란스러운 혼합물이기 때문입니다. 저자들은 이를 **"인식론적 폭력(epistemic violence)"**이라고 부릅니다. 즉, 사람들의 독특하고 복잡한 관점을 하나의 단순한 상자에 강제로 밀어 넣음으로써, 사람들이 실제로 중요하게 생각하는 미묘한 차이를 지워버린다는 뜻입니다.
5. 맥락이 중요하다 ("상황에 따라 다르다"는 요소)
사람들은 자주 이렇게 말했습니다. "친절하게 행동하되, 내가 심층적인 법률 분석을 요청할 때는 제외해 줘", 또는 "엄격하게 행동하되, 내가 이야기를 하고 있을 때는 제외해 줘".
- 문제: 현재의 AI 훈련 방식은 이진법적인 스위치(On/Off)와 같습니다. 이들은 인간 맥락의 "디머 스위치(밝기 조절 스위치)"를 이해하는 데 어려움을 겪습니다. 규칙이 "기본적으로" 적용되어야 하지만 "요청 시"에는 꺼져야 한다는 것을 쉽게 학습하지 못합니다.
결론
이 논문은 기술 산업이 정치적이고 문화적인 문제를 수학적인 문제로 해결하려 하고 있다고 결론짓습니다. 그들은 모두를 대변하는 "보편적인" AI를 만들려고 노력하지만, 그 과정에서 자신들이 대표한다고 주장하는 바로 그 다양성을 침묵시키고 있습니다.
요약하자면: 우리는 소수의 대표성이 부족한 집단에게 단일한 규칙에 대해 투표하게 함으로써 글로벌 AI를 구축하려 하고 있습니다. 그 결과, 현실 세계에는 존재하지 않는 "중간 지점"을 선택하도록 강요받은 탓에, 그 누구의 의도도 진정으로 이해하지 못하는 AI가 만들어지고 있습니다. 저자들은 이제 하나의 완벽한 AI를 모두를 위해 만드는 것을 멈추고, 서로 다른 집단이 각자의 가치에 맞는 자신들만의 버전을 가질 수 있는 방법을 고민해야 한다고 제안합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.