← 최신 논문
🤖 machine learning

The Representation-Rationalizability Tradeoff in Reward Learning

이 논문은 이질적인 쌍체 선호도(pairwise preferences)로부터 발생하는 일관된 보상 학습의 사회적 선택 불가능성(social choice impossibility)을 현대 RLHF 파이프라인의 근본적인 트레이드오프 관계로 재구성하며, 응답 표현(response representations)이 풍부해질수록 표현 오차(representational error)는 줄어드는 동시에, 어떤 스칼라 보상으로도 해결할 수 없는 더 많은 불일치 비교 사례들을 노출함으로써 집계 오차(aggregation error)를 증가시킨다는 점을 입증한다.

원저자: Jing Dong, Yaoliang Yu, Pascal Pourpart

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jing Dong, Yaoliang Yu, Pascal Pourpart

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 요약: "인간의 취향" 문제

당신이 로봇 셰프를 만들려고 한다고 상상해 보세요. 어떤 음식이 "좋은" 음식인지 가르치기 위해, 1,000명의 서로 다른 사람들에게 두 가지 요리(요리 A와 요리 B)를 맛보게 하고 어느 쪽을 더 선호하는지 투표하게 합니다.

AI의 세계(특히 RLHF)에서 일어나는 일이 바로 이것입니다. 우리는 프롬프트(레시피 요청)와 두 가지 응답(요리)을 가지고 있습니다. 인간은 어떤 것이 더 나은지 투표합니다. 목표는 모든 요리에 점수를 부여하여, 이 그룹의 사람들이 무엇을 선호할지 예측하는 단일한 "점수 기록자(보상 모델)"를 만드는 것입니다.

이 논문의 핵심 통찰:
저자들은 우리가 이러한 요리들을 카테고리로 분류하는 방식(표현, representation)이 근본적인 함정을 만든다고 주장합니다. 카테고리를 너무 단순하게 만들면 세부 사항을 놓치게 됩니다. 반대로 너무 상세하게 만들면, 단 하나의 점수로는 해결할 수 없는 논리적 역설을 만들어냅니다.


비유 1: "흐릿한 렌즈 vs 초고화질 렌즈" 카메라

당신이 누가 "최고의" 무용수인지 결정하기 위해 군중의 사진을 찍는다고 상상해 보세요.

옵션 A: 흐릿한 렌즈 (단순한 표현)
매우 흐릿한 카메라를 사용합니다. 이 사진 속에서 세 명의 뚜렷한 무용수(앨리스, 밥, 찰리)는 모두 똑같은 색깔의 덩어리처럼 보입니다.

  • 결과: 당신의 점수 기록자는 그들을 동일하게 인식합니다. 그래서 그들에게 똑같은 점수를 줍니다.
  • 문제점: 정보를 잃었습니다. 앨리스는 실제로 매우 훌륭할 수도 있지만, 흐릿한 사진 속에서 밥(실력이 형편없는 사람)과 똑같이 보이기 때문에 차이를 구분할 수 없습니다. 이것이 **임베딩 손실(Embedding Loss)**입니다. 유용한 세부 정보를 버린 것입니다.

옵션 B: 4K 초고화질 렌즈 (풍부한 표현)
슈퍼 선명한 카메라로 교체합니다. 이제 모든 주근깨와 머리카락 한 올까지 볼 수 있습니다. 앨리스, 밥, 찰리는 완전히 다르게 보입니다.

  • 결과: 당신의 점수 기록자는 모든 사람을 명확하게 볼 수 있습니다.
  • 새로운 문제점: 사람들을 너무나 명확하게 볼 수 있게 되자, 군중의 투표에서 모순을 발견하게 됩니다.
    • 군중은 말합니다: "앨리스가 밥보다 낫다."
    • 군중은 말합니다: "밥이 찰리보다 낫다."
    • 군중은 또한 말합니다: "찰리가 앨리스보다 낫다."
  • 역설: 이것은 **콘도르세 순환(Condorcet Cycle)**이라고 불리는 현상입니다. 가위바위보와 같습니다. 앨리스, 밥, 찰리에게 어떤 숫자를 부여하더라도, 이 세 가지 투표를 동시에 만족시킬 수는 없습니다. 만약 앨리스에게 높은 점수를 준다면, 찰리가 더 낫다는 투표 내용과 모순됩니다.
  • 논문의 용어: 이것이 **합의 비용(Agreement Cost)**입니다. 더 많은 디테일을 보여줄수록, 단일한 점수로 해결할 수 없는 불가능한 루프들이 드러납니다.

트레이드오프(Tradeoff): "골디락스" 존

이 논문은 완벽한 점수를 얻기 위해 단순히 카메라를 점점 더 선명하게 만들기만 해서는 안 된다는 것을 증명합니다.

  1. 너무 단순함: 차이점을 놓칩니다 (높은 임베딩 손실).
  2. 너무 복잡함: 단일 점수가 해결할 수 없는 모순들을 노출합니다 (높은 합의 비용).
  3. 딱 적당함: 그 중간에 "스윗 스팟(Sweet Spot)"이 존재합니다. 무용가들을 구분할 수 있을 만큼의 디테일은 갖추되, 점수 시스템을 망가뜨리는 논리적 루프를 일으키지 않을 정도의 디테일을 가져야 합니다.

놀라운 발견:
이 논문은 "완벽한" 디테일의 양이 전적으로 당신이 질문을 던지는 특정 집단에 따라 달라진다는 것을 보여줍니다. 재즈 애호가들에게 적합한 설정이 클래식 음악 팬들에게는 실패할 수도 있습니다. 보편적인 "최적"의 설정은 없습니다.

비유 2: "그룹 프로젝트" 매니저

당신이 위원회의 피드백을 바탕으로 직원들의 순위를 매기려는 매니저라고 상상해 보세요.

  • "거친" 매니저: 직원을 "부서"별로 그룹화합니다. 당신은 위원회에 묻습니다. "마케팅 부서가 나은가요, 엔지니어링 부서가 나은가요?"

    • 장점: 결정하기 쉽습니다.
    • 단점: 최고의 마케터가 최고의 엔지니어보다 못할 수도 있다는 사실을 무시하게 됩니다. 미묘한 차이를 놓칩니다.
  • "초정밀" 매니저: 직원을 "이름, 신발 사이즈, 좋아하는 색깔"로 그룹화합니다.

    • 장점: 완벽한 데이터를 가지고 있습니다.
    • 단점: 위원회의 피드백은 엉망입니다. 그들은 "파란색을 좋아하는 존이 메리보다 낫다", "메리가 스티브보다 낫다", 하지만 "스티브가 존보다 낫다"라고 말합니다.
    • 붕괴: 당신은 모든 사람에게 단일한 성과 점수를 쓰려고 노력하지만, 할 수 없습니다. 수학적으로 깨져버립니다. 선호도가 원을 그리며 순환하기 때문입니다. 더 구체적으로 갈수록, 더 많은 원형 루프를 발견하게 됩니다.

AI 학습에 대하여 ( "공동 학습"의 함정)

현대 AI에서는 종종 "카메라(표현)"와 "점수 기록자(보상)"를 동시에 학습시켜, 시스템이 스스로 완벽한 균형을 찾기를 기대하곤 합니다.

논문의 경고:
저자들은 이러한 "공동 학습(joint training)"이 자동으로 스윗 스팟을 찾아내지 못한다는 것을 보여줍니다.

  • 줄타기를 하면서 저글링을 하는 상황을 상상해 보세요. 이 논문은 만약 당신이 줄(표현)과 저글링(보상)을 동시에 조정하려고 하면, 제자리에서 뱅글뱅글 돌거나 떨어질 뿐이라는 것을 증명합니다.
  • 시스템은 "점수 기록자"가 누구에게도 다른 점수를 주지 않고 (상수가 되어) 결국 과업을 포기해 버리는 상태에 빠질 수 있습니다. 모순이 너무 복잡하기 때문입니다.

결과 요약

  1. 분해(Decomposition): AI 보상 모델의 오류는 두 부분으로 구성됩니다.
    • 정보 손실(Information Loss): 너무 모호해서 놓친 것들.
    • 합의 비용(Agreement Cost): 단일 점수가 해결할 수 없는 모순을 드러냄으로써 발생하는 페널티.
  2. 트레이드오프: AI를 더 "똑똑하게"(더 상세하게) 만들수록, 첫 번째 오류는 줄어들지만 두 번째 오류는 늘어납니다.
  3. 결론: 단순히 더 많은 컴퓨팅 파워나 더 복잡한 모델을 문제에 투입한다고 해결되는 것이 아닙니다. 당신이 다루고 있는 특정 데이터셋에 맞는 구체적인 디테일 수준을 찾아야 합니다. 때로는 약간 "흐릿하게" 보는 것이 최종 점수를 위해서는 더 나을 수도 있습니다.

요약하자면: AI에게 인간의 선호도를 가르치는 여정에서, 더 많은 디테일이 항상 더 좋은 것은 아닙니다. 때로는 너무 명확하게 보는 것이, 단순한 점수로는 해결할 수 없는 혼란을 드러낼 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →