← 최신 논문
🤖 AI

Mitigating Cognitive Bias in RLHF by Altering Rationality

본 논문은 LLM 을 심판자로 활용하여 편향된 인간 비교를 식별하고 가중치를 낮추는 방식으로 보상 학습 중 합리성 매개변수를 동적으로 조정함으로써 인간 피드백을 통한 강화 학습 (RLHF) 에서의 인지 편향을 완화하는 방법을 제안하며, 이를 통해 불완전한 데이터셋에서도 더 견고한 모델을 학습시킨다.

원저자: Tiffany Horter, Andrew Markham, Niki Trigoni, Serena Booth

게시일 2026-05-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Tiffany Horter, Andrew Markham, Niki Trigoni, Serena Booth

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 좋은 결정을 내리는 법을 가르치려 한다고 상상해 보세요. 이를 위한 표준적인 방법은 RLHF(인간 피드백을 통한 강화 학습)라고 불립니다. 로봇에게 한 질문에 대한 두 가지 다른 답변을 보여주고, 인간이 어느 것이 더 나은지 선택하게 한 뒤, 로봇이 그 선택을 모방하도록 학습시킵니다.

이 논문이 지적하는 문제는 인간은 완벽한 교사가 아니라는 점입니다. 때로는 우리의 뇌에 내재된 단축 경로인 인지 편향으로 인해 실수를 범하기도 합니다.

인지 편향을 왜곡된 안경 한 켤레라고 생각해보세요. 그 안경을 쓰면 세상을 선명하게 볼 수도 있지만, 때로는 실제로 존재하지 않는 것들을 보거나 중요한 세부 사항을 놓치기도 합니다. 유명한 예로 "린다 문제"가 있습니다. 누군가에게 린다가 페미니스트 철학 전공자라고 말해주면, 사람들은 수학적으로 두 번째 옵션이 더 확률이 높음에도 불구하고, 그녀가 단순한 "은행원"보다는 "페미니스트 은행원"일 가능성이 높다고 비합리적으로 생각할 수 있습니다. 만약 인간이 이 "왜곡된 안경"을 끼고 로봇을 가르친다면, 로봇도 그 안경을 끼게 됩니다.

구식 방식 vs 신식 방식

**구식 방식 **(고정된 안경)
전통적인 훈련에서 로봇은 인간 교사가 모든 질문에 대해 동등하게 신뢰할 수 있다고 가정합니다. 이는 학생이 집중하고 있는지 아니면 공상 중인지와 상관없이 모든 학생에게 동일한 성적을 주는 교사처럼, 모든 "이 답변이 마음에 듭니다"라는 표를 동일한 가중치로 취급합니다. 연구자들은 이를 고정된 "합리성 매개변수"(이를 베타라고 부르겠습니다) 라고 부릅니다. 이는 인간 교사가 항상 100% 정신이 맑고 집중하고 있다고 가정하는 것과 같습니다.

**신식 방식 **(동적 안경)
티파니 호터와 그녀의 팀은 더 지적인 접근법을 제안합니다. 로봇이 *"이 인간 교사가 지금 편향되었을 가능성이 있는가?"*라고 질문해야 한다고 제안하는 것입니다.

그들은 spot-check 감독관처럼 작동하는 시스템을 구축했습니다. 로봇이 인간의 선택에서 학습하기 전에, 두 번째 AI(심판 역할을 하는 LLM) 가 질문과 인간의 선택을 검토하여 인지 편향의 냄새가 나는지 확인합니다.

  • 감독관이 "아, 이건 고전적인 편향 함정처럼 보인다"고 생각하면, 로봇에게 그 인간의 피드백에 대한 볼륨을 낮추라고 지시합니다. 이는 해당 특정 수업의 중요도를 낮추기 위해 "베타" 값을 낮추는 것입니다.
  • 감독관이 "이건 견고하고 합리적인 선택처럼 보인다"고 생각하면, 볼륨을 높여 로봇이 그로부터 강하게 학습하도록 합니다.

비유: 시끄러운 교실

수학을 가르치려는 교사가 학생들 (AI) 을 가르치는 교실을 상상해 보세요.

  • 문제: 때로는 교사가 피곤하거나 산만하거나, 함정 질문에 속아넘어갈 수 있습니다. 학생들이 교사의 실수를 그대로 베끼면 시험에서 떨어집니다.
  • 구식 방법: 학생들은 교사가 칠판에 쓰는 모든 것을 복사하며, 교사는 항상 옳다고 가정합니다.
  • 신식 방법: 학생들 옆에는 똑똑한 조교가 앉아 있습니다. 교사가 답을 적을 때, 조교가 속삭입니다. "hey, 여기는 교사가 함정 질문 때문에 실수를 하고 있는 것 같아." 학생들은 그런 특정 답변은 무시하고 교사가 날카로워 보이는 답변들에 집중합니다.

그들이 시도했을 때 무슨 일이 일어났을까?

연구자들은 인간 논리를 혼란스럽게 하도록 설계된 두 세트의 까다로운 질문 (린다 문제와 의료 진단 시나리오 등) 에서 이를 테스트했습니다.

  1. 로봇이 실수를 복사하는 것을 막았습니다: 로봇이 인간이 대부분 틀린 (편향된) 데이터로 훈련되었음에도 불구하고, 새로운 방법은 로봇이 올바른 답을 찾도록 도왔습니다. 로봇은 "왜곡된 안경"을 무시하고 진실을 찾도록 학습했습니다.
  2. 로봇이 망가지지 않았습니다: 로봇이 혼란스러워지거나 다른 일을 하는 법을 잊어버리지 않았습니다. 편향을 무시하는 데 더 능숙해지면서도 일반 작업에서는 똑똑함을 유지했습니다.
  3. 결함이 있는 감독관으로도 작동했습니다: 이 시스템은 모든 편향을 찾아내는 완벽한 감독관이 필요하지 않았습니다. 감독관이 80% 만 정확하더라도, 감독관이 전혀 없는 경우보다 로봇이 더 잘 학습했습니다.

핵심 교훈

이 논문은 인간 피드백을 완벽하고 변하지 않는 신호로 취급해서는 안 된다고 주장합니다. 대신, 맥락에 따라 변하는 노이즈가 있는 신호로 취급해야 합니다. 편향될 가능성이 얼마나 높은지에 따라 인간 피드백에 부여하는 가중치를 동적으로 조정함으로써, 우리는 더 합리적이고 인간의 결함을 물려받을 가능성이 적은 AI 를 구축할 수 있습니다.

간단히 말해: 인간이 무엇을 말하는지 듣는 것뿐만 아니라, 그들이 어떻게 말하는지 듣고 그에 따라 학습을 조정하세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →