← 최신 논문
🤖 machine learning

Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization

이 논문은 레이블링 행동을 클러스터링하고 다수의 레이블과 정렬 상태를 유지하면서도 다양한 관점을 보존하기 위해 선호도 최적화를 통해 조정되는 특화된 언어 모델 에이전트들을 미세 조정함으로써 성차별 탐지에서의 주석가 간 불일치 문제를 해결하는 다중 에이전트 관점주의 선호 최적화(Multi-Agent Perspectivist Preference Optimization, MAP-PO) 프레임워크를 소개한다.

원저자: Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri, Mehdi Dastani, Masoume M. Raeissi

게시일 2026-08-06
📖 2 분 읽기☕ 가벼운 읽기

원저자: Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri, Mehdi Dastani, Masoume M. Raeissi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 못된 농담을 식별하는 법을 가르치고 있다고 상상해 보십시오. 당신은 열 명의 사람에게 농담을 읽고 그것이 성차별적인지 결정하라고 요청합니다. 어떤 이들은 "네, 정말 최악이에요"라고 말하고, 어떤 이들은 "아니요, 그냥 농담일 뿐이에요"라고 말합니다. 과거의 컴퓨터 과학에서는 만약 대다수가 "예"라고 답했다면, 컴퓨터는 "아니요"라는 투표를 무시하고 그것을 사실로 간주했습니다. 하지만 만약 그 "아니요"라는 투표가 실수가 아니라면 어떨까요? 만약 그것들이 단지 서로 다른 렌즈를 통해 세상을 바라보는 사람들의 관점이라면 어떨까요? 이것이 바로 '관점주의적(perspectivist)' 과학이라 불리는 분야의 핵심입니다. 이 분야는 인간이 의견 차이를 보일 때, 그 불일치는 삭제해야 할 소음이 아니라 연구해야 할 신호라고 주장합니다. 큰 질문은 이것입니다: 어떻게 하면 단순히 승자를 뽑는 것이 아니라, 왜 사람들이 서로 다르게 생각하는지를 실제로 이해하는 컴퓨터를 만들 수 있을까요?

이 논문은 정확히 그 문제를 해결하기 위해 MAP-PO(Multi-Agent Perspectivist Preference Optimization)라는 영리하고 새로운 시스템을 소개합니다. 연구진은 하나의 완벽한 판사가 될 로봇 하나를 강요하는 대신, 세 명의 특화된 로봇 에이전트로 구성된 팀을 구축했습니다. 그 방법은 다음과 같습니다. 먼저, 그들은 데이터를 라벨링한 사람들(인간)을 연령이나 성별로 분류하지 않았습니다. 대신, 그들이 '어떻게' 투표했는지를 기준으로 그룹을 나누었습니다. 어떤 인간들은 매우 엄격하여 자주 "예"라고 답했고, 다른 이들은 더 관대했습니다. 연구진은 인간의 배경이 아니라 이러한 '투표 스타일'이 데이터를 이해하는 진짜 열쇠라는 것을 발견했습니다.

다음으로, 그들은 하나의 로봇 에이전트가 이 세 가지 투표 스타일 중 하나를 모방하도록 훈련시켰습니다. 하지만 여기서 까다로운 부분이 있었습니다. 만약 그들이 각 로봇에게 "자신의 그룹의 말만 들어라"라고 단순히 지시한다면, 로봇들은 미쳐버릴 것이었습니다. 그들은 극단적인 희화화된 모습이 되어, 한 로봇은 모든 것에 "예"라고 하고 다른 로봇은 모든 것에 "아니요"라고 하며, 자신들이 대변해야 할 실제 인간과의 접점을 잃어버렸습니다. 논문은 이를 해결하기 위해 로봇들에게 '팀 신호'가 필요하다는 것을 발견했습니다. 로봇들은 자신의 스타일에 충실할 뿐만 아니라, 전체적인 정답을 얻기 위해 함께 협력하는 것에 대해서도 보상을 받아야 했습니다. 이 팀 보상을 추가했을 때, 로봇들은 균형을 유지했습니다. 그들은 정신을 놓지 않으면서도 뚜렷한 개성을 갖도록 학습되었습니다. 결과적으로, 이 세 대의 로봇 팀은 단일 로봇이나 기존의 구식 컴퓨터 프로그램보다 성차별을 더 잘 포착해 냈으며, 이는 다양한 관점을 유지하는 것이 더 똑똑하고 정직한 시스템을 만든다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →