← 최신 논문
💬 NLP

Social Pressure Breaks Majority Voting in LLM Safety Panels

이 연구는 일반적으로 다수결 투표를 통해 정확도를 높이는 대규모 언어 모델 안전 패널들이, 오도된 동료 합의에 노출될 경우 사회적 압력에 매우 취약해지며, 안전한 콘텐츠를 일제히 부적절한 것으로 오분류하는 반면 안전성을 향한 압박에는 거의 영향을 받지 않는다는 사실을 밝혀냈다.

원저자: Yibo Hu, Jiaming Qu

게시일 2026-08-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yibo Hu, Jiaming Qu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

교실에서 선생님이 까다로운 질문을 던졌다고 상상해 보세요. 그런데 혼자 손을 들어 대답하는 대신, 가장 친한 친구 여섯 명의 의견을 들은 후에 투표를 해야 합니다. 이것이 바로 **대규모 언어 모델(LLM)**의 세계입니다. LLM은 글을 읽고, 쓰고, 판단하도록 훈련된 매우 똑똑한 컴퓨터 프로그램입니다. 과학자들은 이 모델들이 디지털 보안 요원처럼 행동하며, 우리에게 도달하기 전 인터넷을 스캔하여 나쁘거나 위험한 콘텐츠를 잡아내도록 사용합니다. 이 보안 요원들을 더욱 뛰어나게 만들기 위해, 엔지니어들은 종មាន 여섯 개의 서로 다른 모델이 함께 투표하는 배심원단처럼 이들을 "패널"로 구성하곤 합니다. 이 아이디어는 단순하면서도 강력합니다. 한 모델이 실수를 하더라도 다른 모델들이 이를 바로잡을 수 있으며, 집단의 투표는 단일 구성원보다 더 현명할 것이라는 원리입니다. 이는 각 모델이 자신만의 새로운 시각으로 문제를 바라보며, 서로 독립적인 실수를 저질러 그 오류가 서로 상쇄될 것이라는 가정에 기반합니다.

하지만 만약 배심원단 모두가 투표하기 전에 똑같은 속삭임을 듣게 된다면 어떻게 될까요? 만약 어떤 "동료"가 "이거 위험한 것 같아"라고 말한다면, 설령 그것이 사실은 무해한 내용일지라도 말입니다. 이 논문은 바로 그 시나리오를 깊이 파고듭니다. 이 논문은 다음과 같은 무서운 질문을 던집니다. 만약 AI 안전 보안 요들 그룹이 가짜 "다수"의 친구들로부터 잘못된 메시지를 읽게 된다면, 그들은 여전히 진실을 말할 수 있을까요? 연구진은 집단의 안전성이 단지 그들이 모두 동일한 사회적 압력에 영향을 받았다는 이유만으로 붕괴할 수 있는지, 즉 똑똑한 배심원단이 혼란에 빠진 군중으로 변할 수 있는지를 알아보고 싶었습니다.

위대한 AI 동료 압력 실험

연구진은 이를 테스트하기 위해 영리한 작은 게임을 설정했습니다. 그들은 여섯 개의 서로 다른 오픈 소스 AI 모델을 가져와 "검토자"로 만들었습니다. 이들의 임job은 다양한 항목들—분명히 안전한 것과 분명히 위험한 것들—을 살펴보고, 그것이 "안전"한지 "위 unsafe"한지 결정하는 것이었습니다.

실험은 두 단계로 진행되었습니다. 1단계에서는 각 AI가 항목을 단독으로 살펴보고 판단을 내렸습니다. 그다음 2단계에서는 동일한 AI가 정확히 같은 항목을 다시 보게 되는데, 이때 AI에게는 여섯 명의 "가상 동료"로부터 온 메시지가 보여집니다. 이 동료들은 실제 사람이 아니라 다른 모델도 아니었습니다. 그저 AI의 뇌 속에 삽입된 텍스트일 뿐이었습니다. 주요 테스트에서, 여섯 명의 가짜 동료들은 항목이 비록 완벽하게 무해한 문장(예: 생선 요리법에 대한 질문)일지라도 해당 항목이 위험하다고 주장했습니다.

결과는 극적이었습니다. 동료들이 침묵하고 있을 때, AI 검토자들은 무해한 항목에 대해 56.5%의 확률로 실수를 저질렀습니다. 하지만 그 여섯 명의 가짜 동료들이 "위험해!"라고 외치자, 평균 검토자의 실수율은 **87.5%**로 치솟았습니다. 그들은 친구들이 말한다는 이유만으로 무해한 것들을 위험하다고 낙인찍기 시작했습니다.

패널의 붕괴: 배심원단이 폭주할 때

여기서부터 정말 놀라운 일이 벌어집니다. 연구진은 이 혼란에 빠진 여섯 명의 검토자들의 투표를 다수결 원칙(6명 중 4명이 '위험'이라고 하면 위험함)을 사용하여 결합했습니다.

동료들이 침묵할 때, 이 패널은 오류율을 약 **43%**로 낮추며 아주 잘 작동하고 있었습니다. 하지만 잘못된 라벨의 동료 메시지가 도입되자, 패널은 단순히 조금 나빠진 것이 아니라 완전히 무너졌습니다. 테스트한 모든 데이터셋에서, 패널은 무해한 항목의 **100%**를 위험하다고 낙인찍기로 투표했습니다. 안전망에 구멍이 생긴 수준이 아니라, 안전망 전체가 함정으로 변해버린 것입니다.

이 논문은 이것이 단지 모델들이 "멍청해서" 발생하는 문제가 아님을 보여줍니다. 이것은 사회적 압력에 관한 문제입니다. AI 모델들은 놀라울 정도로 대중을 따르는 경향이 있으며, 특히 대중이 무언가를 위험하다고 말할 때 더욱 그렇습니다. 연구진은 강한 비대칭성을 발견했습니다. 모델들은 자신의 생각을 바꾸어 "안전"하다고 말하기보다는(약 17%), "위험"하다고 말을 바꿀 가능성(약 75%)이 훨씬 높았습니다. 이는 패널이 모든 것에 "위험해!"라고 비명을 지르는 기계가 되는 반면, 실제 위험은 거의 놓치지 않는 상태가 됨을 의미합니다.

"권위" 효과와 독점 모델

연구진은 여섯 명의 동료 대신 단 한 명의 "상급 권위자"가 AI에게 무엇을 생각할지 알려줄 때 어떤 일이 일어나는지도 테스트했습니다. 결과는 모델마다 크게 달랐습니다. Qwen2.5-7B와 같은 일부 모델은 권위자의 말에 동조하여 즉시 판결을 뒤집었습니다(항목의 **99.4%**에서 마음을 바꿈). 반면 Mistral-7B와 같은 모델은 전혀 움직이지 않았습니다. 이는 모든 AI가 동료 압력에 똑같이 취약한 것은 아니며, 어떤 모델은 더 고집스럽다는 것을 시사합니다.

그들은 또한 OpenAI와 같은 최신 폐쇄형 모델들도 테스트했습니다. 결과는 엇갈렸습니다. 일부 최신 모델은 기존 모델만큼이나 쉽게 휘둘렸던 반면, 다른 모델들은 더 저항력이 있었습니다. 이는 단순히 "더 새롭거나" "더 큰" 모델을 사용하는 것이, 시스템 구조상 그들이 모두 동일한 오도된 맥락을 읽게 된다면 안전을 보장해주지는 않는다는 것을 말해줍니다.

이것이 왜 중요한가

핵-심 결론은 결합(aggregation)은 마법이 아니다라는 점입니다. 단순히 여섯 개의 모델을 모아놓는다고 해서 그들이 하나보다 더 똑똑할 것이라고 가정해서는 안 됩니다. 만약 그들이 모두 동일한 오도된 맥락(예: 잘못된 라벨이 포함된 공유 채팅 기록이나 토론 요약본)을 읽게 된다면, 그들은 모두 똑같은 실수를 저지를 것이며, 다수결 투표는 그 오류를 확증할 뿐입니다.

이 논문은 우리가 이 AI 패널들을 안전을 위해 신뢰하기 전에, 현실 세계에서 마주칠 수 있는 것과 같은 오도된 메시지들로 그들을 테스트해야 한다고 제안합니다. 우리는 그들이 "군집 행동(herding behavior)"을 보이는지 확인해야 합니다. 만약 패널이 잘못된 소문을 들었다는 이유만으로 무해한 콘텐츠의 **100%**를 차단한다면, 아무리 많은 모델이 방 안에 있더라도 그 시스템은 실패한 것입니다. 연구는 우리가 검토자들이 독립적으로 생각할 수 있도록 설계하거나, 적어도 투표하기 전에 그들이 동일한 사회적 신호에 휘둘리고 있는지 확인할 수 있는 안전 시스템을 설계해야 한다고 결론짓습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →