← 최신 논문
💬 NLP

Three Models of RLHF Annotation: Extension, Evidence, and Authority

이 논문은 모델 정렬의 각 차원에 필요한 규범적 역할에 따라 데이터 수집 및 집계 전략을 맞춤화함으로써 더 효과적인 주석 파이프라인 설계를 안내하기 위해 인간 주석자의 세 가지 개념적 모델인 확장, 증거, 권위를 구분할 것을 제안한다.

원저자: Steve Coyne

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Steve Coyne

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑한 로봇을 만들어 이야기를 쓰고, 질문에 답하고, 사람들과 대화하게 한다고 상상해 보세요. 수백만 권의 책을 먹여 로봇에게 말하기를 가르쳤지만, 이제 로봇은 조금 제멋대로입니다. 때로는 무례한 말을 하거나, 거짓말을 하거나, 나쁜 조언을 하기도 합니다. 이를 고치기 위해 인간 '편집자' 팀을 고용해 로봇에게 무엇이 좋고 무엇이 나쁜지 알려줍니다. 이 과정을 RLHF(인간 피드백을 통한 강화 학습)라고 합니다.

스티브 코인 (Steve Coyne) 의 논문은 이러한 인간 편집자를 고용할 때, 우리가 왜 그들을 고용하는지에 대해 종종 혼란을 겪는다고 주장합니다. 그들이 우리의 아이디어를 복사하기 위해 있는 것일까요? 우리가 모르는 사실을 알려주기 위한 것일까요? 아니면 우리를 대신해 최종 법을 만들기 위한 것일까요?

코인은 이러한 인간 편집자를 생각할 때 세 가지 명확한 방식이 있으며, 이들을 혼동하면 로봇이 혼란을 겪고 제대로 행동하지 못한다고 제안합니다.

다음은 간단한 비유로 설명한 세 가지 모델입니다:

1. 확장 모델: "그림자 복제"

아이디어: 이 모델에서 인간 편집자들은 로봇 설계자들을 복사하기 위해 있습니다.
비유: 셰프가 시그니처 요리를 가르치기 위해 부셰프를 고용한다고 상상해 보세요. 당신은 부셰프가 자신만의 독특한 트위스트를 추가하거나 고객들이 무엇을 좋아하는지 묻기를 원하지 않습니다. 당신은 그들이 음식을 맛보고 "네, 이 맛은 제가 만들었을 때와 정확히 같습니다"라고 말하기를 원합니다. 부셰프가 "소금이 더 필요하다고 생각합니다"라고 말하지만, 당신은 완벽하다고 생각한다면 그들을 무시합니다.
작동 방식: 편집자들은 설계 팀의 뇌의 연장선에 불과합니다. 설계자들이 모든 답변을 확인할 시간이 없을 때 그 공백을 메우기 위해 있습니다.

  • 적합한 경우: 로봇의 톤, 스타일, 또는 회사 고유의 규칙을 결정할 때.
  • 함정: 만약 당신이 그들을 이렇게 대우하면서도 그들이 '커뮤니티'와 의견이 다를 때 화를 낸다면, 당신은 혼란에 빠진 것입니다.

2. 증거 모델: "전문 증인"

아이디어: 이 모델에서 편집자들은 설계자들이 가지고 있지 않은 사실이나 데이터를 제공하기 위해 있습니다.
비유: 법정에서 판사로 일하지만 특정 희귀 어종에 대해 아무것도 모르는 상황을 상상해 보세요. 당신은 해양 생물학자를 전문 증인으로 고용합니다. 당신은 "이 물고기가 유독합니까?"라고 묻습니다. 생물학자는 "네, 제 지식에 따르면 유독합니다"라고 답합니다. 비록 당신이 개인적으로 그 물고기가 안전해 보인다고 생각하더라도, 당신은 그들을 들어야 합니다. 그들의 임무는 진실에 대한 증거를 제공하는 것입니다.
작동 방식: 편집자들은 전문가이거나 대중의 대표로서 설계자들에게 "사실은 대부분의 사람들이 이것을 불쾌하게 느낍니다" 또는 "이 사실은 잘못되었습니다"라고 말합니다. 설계자들은 의견이 다르다고 해서 그들을 무조건 무시해서는 안 됩니다. 편집자들은 데이터를 제공하고 있는 것입니다.

  • 적합한 경우: 로봇이 사실적으로 정확한지, 또는 일반적인 사회적 기준 (예: "이것이 불쾌한가?") 을 위반하는지 확인할 때.
  • 함정: 만약 당신이 그들을 전문가처럼 대우하면서도 그들의 의견이 당신의 개인적 의견과 일치하지 않는다는 이유로 그들을 해고한다면, 당신은 그들의 전문성 가치를 잃게 됩니다.

3. 권한 모델: "미니 입법부"

아이디어: 이 모델에서 편집자들은 사실적으로 '옳은지' '틀린지'와 관계없이 규칙을 만들 권한을 가집니다.
비유: 무작위로 선정된 시민 그룹이 새로운 법안에 투표하는 마을 회의를 상상해 보세요. 그들은 교통에 대한 전문가일 필요가 없습니다. 그들은 단지 대중을 대표하기만 하면 됩니다. 그들이 속도 제한을 낮추기로 투표한다면, 도시는 그들을 따르야 합니다. 시민들이 시장보다 '더 똑똑해서'가 아니라, 그들이 커뮤니티를 대신해 결정할 권한을 가지고 있기 때문입니다.
작동 방식: 편집자들은 '미니 입법부' 역할을 합니다. 그들의 임무는 진실을 찾거나 설계자를 복사하는 것이 아니라, 로봇이 무엇을 해야 할지 결정할 권리를 행사하는 것입니다. 그들의 권력은 인구 전체를 공정하게 대표하는 표본이기 때문에 나옵니다.

  • 적합한 경우: 단일한 '정답'이 없고 오직 커뮤니티가 결정하는 것만 존재하는 논쟁적인 정치적 문제나 깊은 도덕적 질문을 결정할 때.
  • 함정: 만약 당신이 그들을 입법부처럼 대우하면서도 그들의 투표가 당신의 개인적 견해와 일치하지 않는다는 이유로 무시한다면, 당신은 시스템의 '사회적 계약'을 위반하는 것입니다.

왜 이들을 혼동하면 로봇이 망가질까요?

이 논문은 대부분의 현재 AI 시스템이 이 세 가지를 모두 뒤섞은 엉성한 혼합물이며, 이로 인해 실패 모드가 발생한다고 주장합니다:

  1. 자기 패배: 대중을 대표하기 위해 편집자들을 '미니 입법부'(권한) 로 고용했다고 상상해 보세요. 하지만 그런 다음, 당신의 개인적 의견과 반대하는 편집자는 모두 해고합니다 (확장). 당신은 요구했던 바로 그 것, 즉 대표적인 목소리를 파괴한 것입니다. 지도자가 자신에게 반대하는 유권자를 해고할 수 있는 민주주의는 있을 수 없습니다.
  2. 분열: 편집자들에게 "당신들은 우리에게 사실을 제공하기 위해 여기에 있습니다"(증거) 고 말하지만, 지시가 모호하여 그들이 당신의 스타일을 복사하기만 원한다고 생각하게 만든다고 상상해 보세요. 그 결과는 일부 편집자는 전문가가 되려고 하고 다른 일부는 복제본이 되려고 하는 혼란스러운 데이터의 더미가 됩니다. 로봇은 혼란스러운 신호를 받아 아무런 유용한 것도 배우지 못합니다.
  3. 부적절한 귀속 (책임 세탁): 회사가 "우리는 로봇이 무엇을 말하는지 대중에게 결정하게 했습니다!"(권한) 고 말하지만, 실제로는 자신과 반대하는 사람은 누구든 비밀리에 해고합니다 (확장). 그들은 나쁜 로봇 행동에 대한 비난을 '대중'에게 전가하려 하면서 실제로는 모든 통제권을 유지하려 합니다.

저자의 큰 제안

스티브 코인은 모든 일을 수행하는 단 하나의 파이프라인을 만들려고 시도하는 것을 멈추고, 대신 다른 작업에 맞는 다른 파이프라인을 구축해야 한다고 제안합니다:

  • 스타일을 위해: 확장 모델을 사용하세요. 로봇이 열정적으로 들릴지 진지하게 들릴지 설계자들이 결정하게 하세요.
  • 사실을 위해: 증거 모델을 사용하세요. 로봇에게 무엇이 진실인지 알려줄 전문가들을 고용하세요.
  • 논쟁적인 가치를 위해: 권한 모델을 사용하세요. 모호한 도덕적 상황에서 로봇이 무엇을 해야 할지 투표할 대표 그룹을 선정하세요.

핵심 요약:
유용한 AI 를 구축하는 것은 단순히 기술적인 문제가 아니라 철학적인 문제입니다. 인간 편집자를 고용하기 전에 결정해야 합니다: 그들은 당신의 복제본입니까, 전문가입니까, 아니면 입법자입니까? 만약 명확하게 하나를 선택하지 않는다면, 당신의 로봇은 결국 혼란스럽고 일관성이 없으며 잠재적으로 불공정하게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →