← 최신 논문
📊 statistics

Provable Pluralistic Alignment: Multi-Party RLHF under Offline Human Feedback

이 논문은 저계수 선형 모델 하에서 정파별 보상을 공동으로 추정하고 내쉬, 공리주의, 및 평등주의 목적 함수를 위해 정책을 최적화하는 동시에, 비관적 폰 노이만 승자(von Neumann winner)를 통해 일반적인 순환적 선호 문제를 해결하며, 이 모든 과정에서 확립된 비점근적 성능 보장을 제공하는 다원적 정렬을 위한 통합 오프라인 RLHF 프레임워크를 제안한다.

원저자: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

게시일 2026-09-09
📖 5 분 읽기🧠 심층 분석

원저자: Huiying Zhong, Tianwei Gao, Zhiwei Steven Wu, Linjun Zhang, Weijie J. Su, Zhun Deng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서는 기계가 단 하나의 인간적 목소리로 말하지 않는다는 인식이 확산되고 있습니다. 우리가 컴퓨터에게 이야기를 써달라고 하거나, 뉴스 기사를 요약하거나, 조언을 구할 때, 사람마다 원하는 바가 다를 수 있기 때문입니다. 어떤 사람은 간결함과 직설적인 태도를 중시하는 반면, 다른 사람은 미묘한 차이와 정서적 깊이를 선호할 수 있습니다. 또 다른 이는 무엇보다 안전을 우선시할 수도 있고, 네 번째 사람은 창의성을 추구할 수도 있습니다. 오랫동안 이러한 기계들을 가르치는 표준적인 방식은, 이 다양한 의견들을 모두 모아 하나의 커다란 더미로 섞은 뒤 시스템이 그 평균을 만족시키도록 훈련시키는 것이었습니다. 이 접근법은 인간의 불일치를 그저 노이즈, 즉 데이터를 충분히 수집하기만 하면 사라질 일시적인 혼란으로 간주합니다. 하지만 실제로 이러한 차이들은 종종 깊고, 지속적이며, 근본적입니다. 그것들은 단순한 무작위 오류가 아니라, 가치관의 진정한 충돌을 나타냅니다. 과학자들의 과제는 이제 단순히 다수에게 즐거움을 주는 기계를 만드는 것이 아니라, 서로 구별되면서도 때로는 대립하는 다양한 관점들로부터 학습하여, 그 불일치의 구조를 존중하면서도 하나의 공정한 결정을 내릴 수 있는 기계를 구축하는 것입니다.

이것이 바로 MIT, 노스캐롤라이나 대학교, 카네기 멜런 대학교 등의 기관에 속한 연구진이 다루고 있는 핵심 문제입니다. 그들은 머신러닝 분야에서 "다원적 정렬(pluralistic alignment)"이라고 알려진 특정 퍼즐을 해결하고자 했습니다. 여러 사람이 하나의 행동 방침을 결정하려고 노력하지만, 무엇이 최선의 결과인지에 대해 합의하지 못하는 상황을 상상해 보십시오. 과거에 컴퓨터 과학자들은 단순히 모든 가능한 선택지에 대해 사람들에게 투표하게 하고, 표를 세어 승자를 뽑았습니다. 이 논문에서 설명하는 새로운 접근법은 이 방법이 너무 많은 정보를 버린다고 주장합니다. 만약 매운 음식을 좋아하는 집단과 매운 음식을 싫어하는 집단의 투표를 섞어버린다면, 결국 누구도 만족시키지 못하는 밋밋하고 불만족스러운 타협안이 나올 수 있습니다. 대신, 연구진은 학습하는 동안 각 집단을 분리하여 유지하고, 각 집단이 정확히 무엇을 원하는지 이해한 다음, 그 욕구를 하나의 최종 결정으로 결합하기 위해 특정한 투명한 규칙을 적용하는 방법을 제안합니다.

연구진은 컴퓨터가 "오프라인" 데이터로부터 학습하는 설정에 집중했습니다. 이는 기계가 실시간으로 사람들과 대화하는 것이 아니라, 이미 존재하는 방대한 기록의 집합을 살펴보는 것을 의미합니다. 이 기록들 속에서 사람들은 두 가지 서로 다른 옵션을 비교하고 어느 쪽을 더 선호하는지 밝혔습니다. 결정적으로, 연구진은 데이터가 각 비교를 수행한 주체가 누구인지를 추적하도록 했습니다. 그들은 단순히 "옵션 A가 옵션 B보다 낫다"라고 기록한 것이 아니라, "그룹 A는 옵션 A를 선호했고, 그룹 B는 옵션 B를 선호했다"라고 기록했습니다. 이러한 정체성을 보존함으로써, 컴퓨터는 여러 의견을 하나의 혼란스러운 평균으로 흐릿하게 만드는 대신, 각 구별되는 집단의 구체적인 선호도를 학습할 수 있었습니다.

이러한 복잡성을 처리하기 위해, 연구진은 두 가지 주요 단계로 작동하는 수학적 프레임워크를 개발했습니다. 첫째, 시스템은 각 집단의 선호를 이끄는 숨겨진 규칙을 학습합니다. 그들은 서로 다른 집단이 서로 다른 것을 원하더라도, 그들의 선호도가 마치 서로 다른 언어들이 공통된 문법을 공유하는 것처럼 흔히 공통된 기저 구조를 공유한다는 것을 발견했습니다. 이러한 공유된 구조를 인식함으로써, 컴퓨터는 각 집단의 데이터를 개별적으로 학습할 때보다 훨씬 적은 양의 데이터만으로도 다양한 집단의 구체적인 욕구를 학습할 수 있습니다. 이 단계는 특정 집단의 데이터가 희소하거나 불완전하더라도 시스템이 정확성을 유지할 수 있게 해준다는 점에서 매우 중요합니다.

시스템이 각 집단이 무엇을 원하는지 이해하고 나면, 두 번째 단계인 최종 결정 단계로 넘어갑니다. 여기서 연구진은 공정성에 대한 서로 다른 개념을 나타내는 세 가지 결합 방식을 테스트했습니다. "공리주의(Utilitarian)"라고 불리는 한 방법은 모든 집단의 총 행복을 합산하여 가장 큰 전체적 선을 만드는 옵션을 선택합니다. "평등주의(Egalitarian)"라고 불리는 다른 방법은 가장 만족도가 낮은 집단에 전적으로 집중하여, 가장 처지가 좋지 않은 집단을 최대한 행복하게 만드는 데 주력합니다. "내쉬(Nash)"로 알려진 세 번째 방법은 모든 이의 만족도의 곱을 최대화하는 균형을 추구하며, 이는 특정 집단이 완전히 무시되는 것을 방지하면서도 전반적인 발전에 보상을 주는 효과가 있습니다. 연구진은 데이터가 충분하다면 그들의 방법이 이러한 모든 정의에 따라 잘 작동하는 단일 정책을 찾을 수 있음을 수학적으로 증명했습니다.

이 연구의 핵심적인 발견은 모든 데이터를 하나로 묶어 누가 무엇을 말했는지 무시하는 것이 좋지 못한 결과를 초래한다는 점입니다. 연구진이 세 개의 뚜렷한 집단이 있는 시나리오를 시뮬레이션했을 때, 전통적인 "풀링(pooled)" 방식은 공정한 타협안을 찾아내는 데 실패했습니다. 이 방식은 종-종 한 집단에게는 사랑받지만 다른 집단에게는 미움받는 옵션을 선택하여, 인구의 절반을 완전히 불만족스럽게 만들곤 했습니다. 반면, 학습 단계에서 집단을 별도로 유지했던 그들의 새로운 방식은 모든 이에게 적절한 수준의 만족을 제공하는 중간 지점의 옵션을 성공적으로 식별해 냈습니다. 이는 인공지능을 정렬하는 데 있어 어려움이 단지 충분한 데이터의 문제가 아니라, 명확하고 의도적인 선택을 내리기 전까지 인간의 불일치 구조를 보존하는 데 있다는 것을 입증했습니다.

또한 연구진은 인간의 선호가 간단한 점수나 순위로 쉽게 환원될 수 없는 더 어려운 시나리오를 탐구했습니다. 때때로 사람들의 선택은 일관적이지 않습니다. 예를 들어, A보다 B를 선호하고, B보다 C를 선호하지만, 다시 C보다 A를 선호할 수도 있습니다. 이런 경우, 모든 옵션에 단일 숫자를 부여하는 표준적인 방식은 무너집니다. 이를 처리하기 위해 팀은 "폰 노이만 승자(von Neumann winner)" 개념에 기반한 새로운 전략을 개발했습니다. 이는 시스템이 단 하나의 최선인 옵션을 찾는 것이 아니라, 다른 어떤 전략과도 정면 대결했을 때 패배할 가능성이 낮은 전략을 찾는 확률론적 접근 방식입니다. 그들은 데이터가 충분히 세심하게 수집된다면, 이러한 혼란스럽고 일관성 없는 상황에서도 그들의 방법이 모든 당사자의 선호를 존중하는 안정적이고 공정한 솔루션을 찾을 수 있음을 증명했습니다.

컴퓨터 시뮬레이션을 통해 연구진은 자신들의 접근법이 기존 방식들보다 일관되게 우수한 성능을 보임을 입증했습니다. 다양한 인원수와 다양한 합의 수준을 가진 합성 데이터로 알고리즘을 테스트했을 때, 새로운 방식은 모든 집단에 대해 이상적인 결과에 더 가까운 결정을 내렸습니다. 시뮬레이션은 집단의 정체성을 유지하고 공유된 학습 구조를 사용함으로써 시스템이 더 효율적으로 학습하고 더 공정한 선택을 할 수 있음을 확인해 주었습니다. 이 결과는 목표가 평균 행복을 극대화하는 것이든, 가장 취약한 집단을 보호하는 것이든, 혹은 균형 잡힌 타협을 찾는 것이든 상관없이 유효했습니다.

이 연구는 다양한 인간 사회와 함께 일하는 인공지능을 훈련하는 방식에 있어 중요한 진전을 의미합니다. 이는 기계가 발견해야 할 단 하나의 "정답"이 존재한다는 생각에서 벗어나, 인간 의견의 다양성을 수정해야 할 오류가 아니라 관리해야 할 특징으로 취급합니다. 서로 다른 관점을 결합하는 과정을 명시적이고 수학적으로 엄밀하게 만듦으로써, 연구진은 갈등을 없애지 않으면서도 그 갈등을 만들어내는 독특한 목소리들을 존중하며 갈등을 헤쳐 나갈 수 있는 체계를 구축하는 청사진을 제공했습니다. 이 연구가 인간과 AI의 상호작용에 관한 모든 문제를 해결했다고 주장하는 것은 아니지만, 서로 이견이 있는 군중으로부터 학습하여 통계적으로 건전하고 윤리적으로 투명한 단일한 집단적 결정을 도출해 내는 검증되고 신뢰할 수 있는 방법을 제시하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →