← 최신 논문
💻 computer science

Political Neutrality as Balanced Approval: A Large-Scale Human Evaluation of AI Responses

본 논문은 대립하는 정치적 집단 간의 승인을 극대화하고 균형을 맞추는 것을 기반으로 한 AI 정치적 중립성의 새로운 정의를 제시하고, 7,000 명 이상의 참가자가 참여한 대규모 인간 평가 데이터셋 (PARETO) 을 통해 이를 검증하며, 최첨단 모델이 초당파적 승인을 높게 달성할 수 있음에도 불구하고 기본 응답은 종종 진보적 편향을 보인다는 사실을 밝혀냅니다.

원저자: Jonathan Stray, David Zhai Yang, Steven Luo, Miu Nicole Takagi, Serina Chang

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jonathan Stray, David Zhai Yang, Steven Luo, Miu Nicole Takagi, Serina Chang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 명의 손님이 "레프티"와 "라이트이"라고 부르기로 합시다. 이 두 손님은 낙태나 총기 규제와 같은 주제에 대해 격렬하게 이견을 보이고 있습니다. 그들은 서로 목소리를 높여 외치며, 무엇이 "진실"인지에 대해 동의할 수 없습니다.

이제 여러분이 스마트 로봇 웨이터(AI) 를 고용하여 그들에게 요리를 서빙한다고 상상해 보세요. 여러분의 목표는 어느 한쪽을 지지하거나 누가 옳은지 말하는 것이 아닙니다. 여러분의 목표는 레프티와 라이트이 모두 그 요리를 맛있다며 동의할 수 있는 요리를 서빙하는 것입니다. 비록 그들이 조리법에 대해서는 여전히 이견을 가지고 있더라도요.

이 논문은 바로 그 로봇 웨이터에게 그 일을 어떻게 수행할지 가르치는 것에 관한 것입니다.

큰 문제: "거부"의 함정

이전에는 사람들이 이러한 로봇에게 논쟁적인 질문을 했을 때, 로봇은 대개 두 가지 중 하나의 행동을 했습니다:

  1. 한쪽을 선택했다: 그들은 레프티나 라이트이처럼 말하여 다른 한쪽을 화나게 했습니다.
  2. 답변을 거부했다: 그들은 "그것에 대해 말할 수 없다"고 말하며, 모든 사람이 무시당하는 느낌을 주었습니다.

연구자들은 궁금해했습니다: 양쪽 모두 "그래, 그 답변으로 견딜 수 있겠다"라고 말할 수 있도록 이러한 어려운 질문에 답하는 AI 를 만들 수 있을까요?

새로운 조리법: "균형 잡힌 승인"

저자들은 "중립성"에 대한 새로운 정의를 제시했습니다. 그들은 이를 균형 잡힌 승인이라고 부릅니다.

이것을 줄타기 예술가처럼 생각해보세요.

  • : 이는 최대 가능한 행복의 선입니다.
  • 목표: AI 는 레프티가 행복하고 동시에 라이트이도 행복한 줄 위에서 서 있어야 합니다.
  • 주의할 점: AI 가 너무 왼쪽으로 기울면 라이트이가 화를 내고, 너무 오른쪽으로 기울면 레프티가 화를 냅니다. "완벽한" 중립적인 답변은 양쪽이 동등하게 만족하는 줄 위의 정확한 지점입니다.

연구자들은 이를 파레토 프론티어라고 부릅니다. 쉬운 말로 표현하면, 한쪽을 더 행복하게 만들면 다른 한쪽을 불행하게 만들 수밖에 없는 "최고의 거래"입니다.

실험: 대규모 맛보기 테스트

이를 테스트하기 위해 연구자들은 로봇에게 단순히 추측하도록 하지 않았습니다. 그들은 거대한 맛보기 테스트를 설정했습니다:

  1. 메뉴: 그들은 낙태, 총기 규제, 학생 대출과 같은 20 개의 핫버튼 주제를 선정했습니다.
  2. 손님: 그들은 미국에서 7,434 명의 실제 사람들을 모집했습니다.
  3. 셰프: 그들은 5 개의 최상위 AI 모델(GPT, Claude, Gemini 등) 을 사용했습니다.
  4. 요리: 모든 질문에 대해 네 가지 유형의 답변을 만들었습니다:
    • 기본: AI 가 자연스럽게 말하는 내용.
    • "찬성" 요리: 한쪽만 옹호하는 답변.
    • "반대" 요리: 다른 한쪽만 옹호하는 답변.
    • "균형 잡힌" 요리: 양쪽 모두를 위한 짧은 단락을 제공하고 중립적으로 마무리하는 특별한 답변.

그런 다음 그들은 손님들에게 질문했습니다: "이 답변에 대해 얼마나 동의하십니까?"

그들이 발견한 것: 놀라운 결과

1. "균형 잡힌 요리"가 대중의 사랑을 받았습니다.
레프티와 라이트이가 서로의 아이디어를 싫어함에도 불구하고, 그들은 양쪽 모두 균형 잡힌 답변을 좋아했습니다.

  • 마법의 숫자: 균형 잡힌 답변은 거의 모든 주제에서 양쪽 모두로부터 높은 승인 점수 (60% 이상) 를 받았습니다.
  • 거래 조건: "내 쪽이 이기기를 원한다면 균형 잡힌 답변을 싫어할 것"이라고 생각할 수 있습니다. 하지만 연구에 따르면 "내 쪽 승리" 답변에서 "균형 잡힌" 답변으로 전환할 때 사람들은 약 10% 의 승인만 잃었습니다. 다른 쪽이 비명을 지르게 하지 않는 AI 를 위해 치르는 작은 대가입니다.

2. 대부분의 로봇은 비밀리에 "레프티"입니다.
연구자들이 로봇들이 특별한 지시 없이 자연스럽게 무엇을 말하는지 살펴봤을 때, 대부분의 로봇 (GPT, Claude, Gemini, Llama) 은 리버럴/좌파 쪽으로 기울었습니다. 그들은 라이트이보다 레프티로부터 더 많은 승인을 받았습니다.

  • 예외: 한 로봇인 Grok은 달랐습니다. 그것은 왼쪽으로 기울지 않았습니다. 때로는 주제에 따라 오른쪽으로, 때로는 왼쪽으로 기울었습니다.

3. 화난 질문은 답변하기 더 어렵습니다.
사용자들이 이미 화나거나 감정적인 질문 (예: "왜 리버럴들은 그렇게 멍청한가?") 을 로봇에게 했을 때, 로봇들의 승인 점수는 낮아졌습니다. 질문 자체가 싸움일 때는 중립을 지키는 것이 훨씬 더 어렵습니다.

4. "양쪽 모두"에 대한 신화.
일부 사람들은 "양쪽 모두"를 보여주는 것이 가짜이거나 약하다고 우려합니다. 하지만 연구는 AI 가 양쪽 모두에 대한 강력한 주장을 제시했을 때, 사람들이 실제로 그것을 더 공정하게 느꼈음을 보여주었습니다. 사람들이 균형 잡힌 답변을 싫어한 유일한 경우는 AI 가 "가짜를 연기"하거나 그들의 구체적인 우려를 무시한다고 느낄 때뿐이었습니다.

결론

이 논문은 공정한 중재자처럼 행동하는 AI 를 구축하는 것이 가능함을 증명합니다. 그것은 말을 거부하는 로봇일 필요도, 팀을 선택하는 로봇일 필요도 없습니다.

균형 잡힌 승인을 목표로 함으로써—대립하는 양쪽의 가장 많은 사람들이 자신의 의견이 경청되고 존중받는다고 느끼게 하는 답변을 찾는 것—우리는 서로 이견이 있더라도 사람들이 신뢰할 수 있는 AI 를 만들 수 있습니다. 이는 다음에 무엇을 주문할지 합의할 수 없더라도 온 가족을 만족시키는 요리를 서빙하는 로봇 웨이터와 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →