← 최신 논문
🤖 AI

Users as Annotators: LLM Preference Learning from Comparison Mode

본 논문은 비대칭 모델 응답을 통해 잠재적 사용자 품질 요인을 추론하는 기대최대화 알고리즘을 도입하여 LLM 비교 모드에서 생성된 사용자 기반 쌍별 선호 데이터를 활용하는 방법을 제안함으로써, 효과적인 데이터 필터링과 향상된 LLM 정렬을 가능하게 한다.

원저자: Zhongze Cai, Xiaocheng Li

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhongze Cai, Xiaocheng Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇(대규모 언어 모델, 또는 LLM)이 어떻게 도움이 되고 정중할 수 있는지 가르치려 한다고 상상해 보세요. 이를 위해 '좋은' 답변과 '나쁜' 답변의 예시를 보여줘야 합니다. 보통 기업들은 모든 답변을 하나씩 읽고 더 나은 것을 투표로 선정하는 전문 인간 편집자 팀을 고용합니다. 이는 비용이 많이 들고 느립니다.

이 논문은 로봇의 일반 사용자들에게 투표를 맡기는 교묘한 단축책을 제안합니다.

이를 식당에 비유해 보겠습니다. 모든 요리를 맛보기 위해 음식 평론가를 고용하는 대신, 식당은 두 가지 요리 중 고객이 더 선호하는 것에 투표하도록 요청합니다. 장점은 무엇일까요? 수천 개의 투표를 무료로 얻을 수 있다는 점입니다. 단점은요? 일부 고객은 배고프거나 산만하거나, 실제로 맛보지 않고 무작위로 요리를 선택할 수 있습니다. 이러한 '노이즈가 있는' 투표는 셰프를 혼란스럽게 만들 수 있습니다.

여기서 저자들은 통계적 마법으로 '산만한 고객' 문제를 해결하는 방법을 제시합니다.

핵심 아이디어: '비대칭' 테스트

일반적인 투표 시스템에서는 사용자에게 동일한 로봇이 생성한 두 가지 답변을 보여줄 수 있습니다. 로봇이 훌륭하다면 두 답변 모두 훌륭할 수 있어 사용자가 주의를 기울이고 있는지 판단하기 어렵습니다.

저자들의 비법은 사용자에게 서로 다른 두 로봇(또는 동일한 로봇의 두 가지 다른 버전)이 생성한 두 가지 답변을 보여주는 것입니다.

  • 로봇 A는 '스타 셰프'(매우 똑똑함)입니다.
  • 로봇 B는 '초보 셰프'(덜 똑똑함)입니다.

로봇 A 가 객관적으로 더 우수하기 때문에, 주의를 기울이는 사용자는 거의 항상 로봇 A 를 선택합니다. 반면 산만한 사용자(단순히 추측하는 사용자)는 동전 던지기처럼 로봇 A 와 로봇 B 를 50 대 50 비율로 선택할 것입니다.

탐정 작업: '동전 던지기' 찾기

이 논문은 누가 누구인지 파악하기 위한 수학적 탐정 시스템( 기대값 최대화 알고리즘이라고 함) 을 소개합니다.

  1. 가설: 시스템은 모든 사용자가 숨겨진 '주의 점수'를 가지고 있다고 가정합니다.

    • 점수 1.0: 항상 더 나은 로봇을 선택하는 초고도의 주의력을 가진 전문가입니다.
    • 점수 0.0: 무작위로 선택하는 완전한 동전 던지기입니다.
    • 점수 0.5: 그 중간 어딘가에 있는 사용자입니다.
  2. 수사: 시스템은 사용자의 이력을 살펴봅니다.

    • 사용자 X는 95% 의 확률로 스타 셰프에게 투표했습니다. 시스템은 말합니다. "아, 사용자 X 는 주의를 기울이고 있군! 그들의 투표는 금과도 같아."
    • 사용자 Y는 50% 의 확률로 스타 셰프에게 투표했습니다. 시스템은 말합니다. "사용자 Y 는 단순히 추측하고 있어. 그들의 투표는 노이즈야."
  3. 정리: 시스템이 '동전 던지기'들을 식별하면 그들의 투표는 폐기합니다. 로봇을 훈련시키기 위해 '주의를 기울이는' 사용자들의 투표만 남깁니다.

결과: 더 깨끗한 주방

저자들은 실제 데이터로 이 아이디어를 테스트했습니다. 일부 사용자는 전문가이고 일부는 산만하다는 시나리오를 시뮬레이션했습니다.

  • 필터링 없이: 동전 던지기를 포함한 모든 투표를 사용하여 로봇을 훈련시켰을 때, 로봇은 나쁜 습관들을 배우게 되었습니다.
  • 필터링 적용 시: '탐정'을 이용해 동전 던지기들을 제거하고 주의 깊은 사용자들만 대상으로 훈련했을 때, 로봇은 훨씬 더 나아졌습니다. 더 적은 총 데이터를 사용했음에도 불구하고 더 빠르게 배우고 실수를 줄였습니다.

왜 이것이 중요한가

이 논문은 단순히 "사용자 데이터를 활용하자"라고 말하는 것을 넘어, 수학적 안전망을 제공합니다. 누가 주의를 기울이고 있는지 알지 못하더라도, 옵션이 명확히 다를 때 그들이 어떻게 투표하는지 살펴봄으로써 수학적으로 이를 추론할 수 있음을 증명합니다.

간단히 말해: 이 논문은 우리가 수백만 명의 일반 사용자를 고품질의 훈련 팀으로 전환할 수 있음을 보여줍니다. 단, 추측만 하는 사용자를 걸러낼 수 있는 현명한 방법이 있다면 가능합니다. 이는 혼란스러운 군중을 단순히 마스터 셰프와 초보 셰프 사이에서 선택하도록 요청함으로써 전문가 심사 위원회로 바꾸는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →