Who Decides What Is Harmful? Content Moderation Policy Through A Multi-Agent Personalised Inference Framework
본 논문은 전문화된 에이전트를 통해 개별 사용자의 민감도를 시뮬레이션함으로써 콘텐츠 중재를 개인화하는 LLM 기반 다중 에이전트 프레임워크를 제안하며, 이는 전통적인 중앙 집중식 시스템 대비 32%의 정확도 향상을 달성하면서도 플랫폼 거버넌스와 사용자 자율성 간의 균형을 맞추기 위한 확장 가능한 접근 방식을 제공합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인터넷을 상상해 보세요. 수백만 명의 사람들이 동시에 외치고, 이야기를 나누고, 논쟁하고, 밈을 올리는 거대하고 혼란스러운 광장입니다. 현재 이 광장을 안전하게 유지하려는 "경비원"(콘텐츠 조정 시스템) 은 모두에게 적용되는 단일한 거대한 규칙책을 사용합니다. 그들은 "해로운" 것을 결정할 때 일률적인 목록에 의존합니다. 게시물이 규칙을 위반하면 제거되고, 위반하지 않으면 남아있습니다.
이 논문의 저자들이 지적하듯, 문제는 사람들은 각기 다르다는 점입니다. 한 사람이 재미있어하는 것을 다른 사람은 깊이 상처 받는다고 느낄 수 있습니다. 한 사람이 대담한 정치적 의견으로 보는 것을 다른 사람은 개인적인 공격으로 볼 수 있습니다. 현재의 시스템은 이러한 개인의 감정을 무시하여, 종종 사람들이 독성 콘텐츠에 압도되게 하거나, 반대로 그들이 실제로 즐기는 것을 제거해 버립니다.
이 논문은 경비원 스테이션을 운영하는 새로운 방식을 제안합니다. 단일한 경직된 규칙책 대신, PRISM이라는 개인화된 팀 기반 접근법을 제안합니다.
핵심 아이디어: 개인화된 경비 팀
PRISM 시스템을 단일 로봇이 아니라, 모든 사용자에게 할당된 맞춤형 경비 팀으로 생각하세요. 간단한 비유를 사용하여 이 팀이 어떻게 작동하는지 살펴봅시다:
1. "민감도 프로필"(당신의 개인 규칙책)
빈 캔버스에서 시작하는 대신, 시스템은 당신의 구체적인 "아픈 점"을 학습합니다.
- 비유: 당신은 시끄러운 소음에 매우 민감하지만 messy 한 방은 괜찮다고 가정해 보세요. 반면, 당신의 이웃은 messy 한 것을 싫어하지만 시끄러운 음악을 좋아합니다. PRISM 시스템은 당신의 특정 임계값을 학습합니다. "이 사용자는 모욕에 쉽게 화를 내지만, 강력한 정치적 논쟁에는 문제가 없다"는 프로필을 구축합니다.
- 작동 방식: 시스템과 상호작용하며 ("이 게시물은 싫어요" 또는 "이것은 괜찮아요"라고 말함) 프로필이 업데이트됩니다. 이는 일반적인 알고리즘이 당신이 해롭다고 생각해야 한다고 판단하는 것이 아니라, 당신이 정확히 무엇을 해롭다고 느끼는지 학습합니다.
2. "매니저 에이전트"(팀 리더)
새로운 게시물이 도착하면 중앙의 "매니저"가 그 게시물과 당신의 프로필을 살펴봅니다.
- 비유: 매니저는 오케스트라의 지휘자와 같습니다. 게시물을 보고 "이 게시물에는 공격적인 언어가 포함되어 있고 특정 집단을 언급하고 있습니다. 전체 오케스트라가 필요하지 않아요. 사회학자(집단 역학을 아는) 와 심리학자(정서적 영향을 아는) 만 부르세요"라고 말합니다.
- 반전: 매니저는 또한 전문가들에게 당신의 특정 선호도를 속삭입니다. 그들은 심리학자에게 "기억하세요, 이 사용자는 비인간화 언어에 매우 민감하므로 이를 특히 찾아보세요"라고 말합니다.
3. "전문가 에이전트"(전문가)
시스템은 다양한 각도에서 콘텐츠를 분석하기 위해 서로 다른 AI "전문가"들을 사용합니다.
- 사회학자: 차별이나 집단에 대한 불공정한 대우를 찾습니다.
- 언어학자: 무례한 단어, 모욕, 또는 공격적인 어조를 찾습니다.
- 심리학자: 위협이나 정서적 고통을 유발할 수 있는 것을 찾습니다.
- "유령" 에이전트: 이 특별한 에이전트는 정확히 당신처럼 행동합니다. 전문가들이 이견을 보일 때, 유령 에이전트는 "이 사용자가 우리에게 이전에 알려준 바에 따르면, 그들은 이것이 해롭다고 느낄 것입니다"라고 말합니다.
4. "종합 에이전트"(의사 결정자)
마지막으로, 종합 에이전트는 전문가들과 유령으로부터 모든 의견을 수집합니다. 그들의 주장을 당신의 개인 프로필과 비교하여 최종 결정을 내립니다: "이것을 사용자에게 보여주기" 또는 "숨기기".
그들은 무엇을 발견했나요?
연구자들은 이 시스템을 기존의 "일률적" 방법과 현재 사용되는 가장 똑똑한 표준 AI 모델들과 비교하여 테스트했습니다.
- 더 높은 정확도: 그들의 개인화된 팀은 표준적이고 일반적인 시스템에 비해 특정 사용자가 해롭다고 느낄 것을 예측하는 정확도가 32% 더 높았습니다.
- 적은 실수: 모든 것을 혼자 하려는 단일 AI 보다 다중 에이전트 팀이 실수를 더 적게 범했습니다. 모욕과 위협을 위한 전문가를 두는 것과 같이 문제를 작은 작업으로 분할함으로써 두 가지를 혼동하는 것을 피했습니다.
- 빠른 학습: 시스템은 학습하는 데 몇 년이 걸리지 않았습니다. 사용자가 단 몇 가지 피드백만 제공한 후에도 시스템은 일반 버전보다 훨씬 잘 작동하기 시작했습니다. 당신의 "취향"을 파악하는 데 오래 걸리지 않았습니다.
큰 그림: 누가 결정할까요?
이 논문은 거대한 질문을 던집니다: "무엇이 해로운지 누가 결정할까요?"
현재의 답은 "플랫폼"입니다. 그들은 모두를 위해 결정합니다.
PRISM 시스템은 답이 **"스마트 팀의 도움을 받는 사용자"**여야 한다고 제안합니다.
저자들은 플랫폼이 여전히 폭력 방지와 같은 기본적인 안전을 유지해야 하지만, 특정 개인에게 "너무 많은" 것에 대한 일상적인 결정은 그 사람에게 달려 있어야 한다고 주장합니다. 이 시스템은 모든 사람이 동일한 경직된 규칙 아래 살도록 강요하는 대신, 사용자의 고유한 정신적 웰빙에 맞는 "필터"를 가질 수 있게 합니다.
간단히 말해: 경비원이 전체 군중에게 "아무도 그렇게 말하면 안 된다!"라고 외치는 대신, PRISM은 각자에게 그들이 정확히 무엇을 견딜 수 있고 무엇을 견딜 수 없는지 아는 개인 경호관을 제공합니다. 이는 모든 사람이 자신만의 방식으로 안전하다고 느끼도록 보장합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.