← 최신 논문
🤖 AI

AI Alignment From Social Choice Perspectives

이 논문은 인간 피드백을 통한 AI 정렬에 사회적 선택 이론을 적용한 최근 연구들을 조사하며, 이러한 관점이 상충하는 인간의 판단을 집계할 때 발생하는 실패 모드를 어떻게 식별하고 이러한 불일치를 처리하기 위한 더 넓고 원칙적인 설계 공간을 어떻게 밝혀내는지 보여준다.

원저자: Daniel Halpern, Evi Micha, Ariel D. Procaccia, Benjamin Schiffer, Itai Shapira, Shirley Zhang

게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daniel Halpern, Evi Micha, Ariel D. Procaccia, Benjamin Schiffer, Itai Shapira, Shirley Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑하지만 백지 상태인 로봇에게 이야기 쓰기, 조언하기, 또는 질문에 답하는 법을 가르치려 한다고 상상해 보십시오. 모든 가능한 상황에 대해 완벽한 규칙 책을 쓸 수는 없습니다. 인간의 가치는 너무나 복잡하고 미묘하기 때문입니다. 대신, 당신은 인간 심판 그룹에게 로봇의 답변을 보여주고, "나는 저것보다 이것이 더 좋아"라고 말하게 합니다.

이 논문은 우리가 현재 그 모든 인간의 의견을 하나의 지침 세트로 결합하는 방식이 결함이 있다고 주장합니다. 이 과정은 사회 선택 이론(Social Choice Theory)—공정한 선거를 치르는 방법을 결정할 때 사용하는 것과 같은 수학—의 관점에서 바라보아야 한다고 제안합니다.

다음은 이 논문의 주요 아이디어를 쉬운 비유를 사용하여 정리한 것입니다.

1. 문제점: "일률적인" 투표

현재 인간들이 의견 차이를 보일 때(예: 어떤 사람은 농담이 재미있다고 생각하지만, 다른 사람은 무례하다고 생각할 때), 표준적인 방법(RLHF라고 불림)은 이러한 의견 차이를 "노이즈(잡음)"로 취급합니다. 그것은 단 하나의 "정답"을 찾기 위해 이들을 평균화하려고 시도합니다.

  • 비유: 어떤 마을이 새로운 공원을 조성하기로 결정한다고 상상해 보십시오. 어떤 사람들은 놀이터를 원하고, 어떤 사람들은 정원을, 또 다른 사람들은 스케이트 파크를 원합니다. 현재의 AI 방식은 모든 사람이 단 하나의 승자를 고르도록 강요하는 투표처럼 작동합니다. 만약 "놀이터"가 근소한 차이로 승리한다면, 마을은 정원을 원하는 사람들을 완전히 무시한 채 오직 놀이터만을 건설하게 됩니다. 논문은 이것이 다양한 인구 집단을 다루는 나쁜 방식이라고 말합니다. 이는 복잡한 토론을 하나의 경직된 점수로 바꾸어 버립니다.

2. 숨겨진 투표 규칙: "보다 카운트(Borda Count)"

저자들은 현재 로봇을 훈련시키는 데 사용되는 수학(브래들리-테리 모델이라 불림)이 단순한 통계적 기교가 아니라, 보다 카운트라고 알려진 특정한 유형의 투표 규칙임을 발견했습니다.

  • 비유: 보다 카운트에서는 단순히 가장 좋아하는 것을 고르는 것이 아니라, 모든 항목의 순위를 매깁니다. 만약 5개의 옵션이 있다면, 가장 좋아하는 것에는 5점을 주고, 두 번째 선택에는 4점을 주는 식입니다. 승자는 가장 높은 총점을 얻은 옵션이 됩니다.
  • 결함: 이 규칙은 "안전하고" "무난한" 옵션에 유리합니다. 모두에게 "괜찮지만" 그 누구에게도 사랑받지 못하는 답변이, 절반에게는 "최고"이지만 나머지 절반에게는 "미움"을 받는 답변보다 승리할 수 있습니다. AI는 진정으로 탁월하거나 독특해지기보다는 지루하고 논란이 없는 방향으로 학습하게 됩니다.

3. "클론(복제)" 문제: 복사본이 승자를 바꾼다

논문은 이 투표 시스템의 기이한 취약점인 **클론 민감성(Clone Sensitivity)**을 지적합니다.

  • 비규: "빨간 자동차"와 "파란 자동차" 사이의 선거를 상상해 보십시오. 빨간 자동차가 이긴다면 괜찮습니다. 하지만 만약 빨간 자동차 제조사가 갑자기 약간씩 다른 버전의 빨간 자동차 100대를 출시한다면 어떻게 될까요(빨간 자동차 1.0, 1.1, 1.2...)? 보다 카운트 방식의 투표에서는 이 "클론"들이 표를 분산시켜, 투표자들의 실제 선호도가 변하지 않았음에도 불구하고 실수로 파란 자동차가 지게 만들 수 있습니다.
  • AI에서의 적용: 대규모 언어 모델은 종종 동일한 답변의 약간씩 다른 버전(패러프레이징)을 생성합니다. 만약 훈련 데이터에 "안전한" 답변 10개와 "대담한" 답변 1개가 있다면, AI는 그 대담한 답변이 실제로 인간이 더 선호해서가 아니라, 단지 훈련 목록에 더 자주 등장한다는 이유만으로 "안전한" 답변이 객관적으로 더 낫다고 생각할 수 있습니다.

4. "선형적" 함정: 수학이 깨지는 순간

논문은 우리가 (더 빠르고 쉽게 만들기 위해) 단순화된 수학적 구조를 사용하여 AI를 학습시킬 때, 공정성의 규칙을 어길 수 있음을 보여줍니다.

  • 비유: 모든 주장을 경청해야 하는 판사가 있다고 상상해 보십시오. 하지만 만약 판사가 매우 짧고 경직된 체크리스트("선형" 모델)를 사용하도록 강요받는다면, 그는 미묘한 차이를 놓칠 수 있습니다. 방 안의 모든 사람이 옵션 A가 옵션 B보다 낫다는 것에 동의하더라도, 이 경직된 수학적 모델은 실수로 옵션 B가 더 낫다는 결론을 내릴 수 있습니다. 이는 사람의 문제가 아니라 도구의 실패입니다.

5. 해결책: 평균을 내지 말고, 게임을 하라

저자들은 게임 이론에서 영감을 얻은 더 나은 방식을 제안합니다. 모든 인간의 의견을 하나의 단일한 "점수"로 압축하려고 노력하는 대신, AI가 스스로와 게임을 하며 배우도록 해야 합니다.

  • 비유: "단 하나의 최선의 답은 무엇인가?"라고 묻는 대신, "두 가지 서로 다른 전략을 맞붙였을 때, 어떤 전략이 더 자주 이기는가?"라고 묻는 것입니다.
  • "최대 로또(Maximal Lottery)": 논문은 AI가 전략의 **혼합(mixture)**을 학습해야 한다고 제안합니다. 만약 절반의 사람들은 정원을 원하고 절반은 스케이트 파크를 원한다면, AI는 하나를 선택해서는 안 됩니다. AI는 50%의 정원과 50%의 스케이트 파크가 되어야 합니다. 이는 불일치를 보존하며 어떤 집단도 완전히 소외되지 않도록 보장합니다.
  • 이점: 이 방법(내쉬 학습이라 불림)은 우리가 가진 제한된 정보를 다루는 가장 "공정한" 방법임이 수학적으로 증명되었습니다. 이는 데이터가 부족하거나 투표자가 나뉘어 있다는 이유만으로 AI가 끔찍한 실수를 저지르지 않도록 보장합니다.

요약

이 논문은 우리가 현재 인간의 가치를 평균화하여 "타협하는 기계"로 AI를 가르치고 있으며, 이것이 종종 지루하거나 편향된 결과를 초-래한다고 주장합니다. 공정한 선거의 수학을 사용함으로써, 우리는 다음과 같은 AI 시스템을 구축할 수 있습니다.

  1. "안전함"이 항상 "최선"은 아님을 인식합니다.
  2. 투표를 왜곡하는 복사본 답변들을 무시합니다.
  3. 단 하나의 경직된 답을 강요하기보다, 다양한 관점을 보존하며 다양한 옵션을 제공합니다.

이는 "다수가 원하는 것은 무엇인가?"라고 묻는 것에서 "어떻게 하면 모든 사람의 가치를 공정하게 대변할 것인가?"로 나아가는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →