LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories
이 논문은 자동 판사로 사용되는 거대 언어 모델이 특히 금융과 같은 규제 영역을 평가할 때 또는 언어와 기준에 따라 상당한 불일치와 신뢰성 부족을 보인다는 점을 밝히며, 안전성 평가 시 신중한 구현의 필요성을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 일련의 그림들을 심사하기 위해 여섯 명의 서로 다른 미술 비평가들로 구성된 패널을 고용했다고 상상해 보십시오. 당신은 그들이 어떤 그림이 "안전한지"(좋고 적절한지)와 어떤 그림이 "안전하지 않은지"(나쁘거나 해로운지)에 대해 서로 동의하기를 원합니다. 만약 그들에게 같은 그림을 보여주거나, 심지어 약간 다른 버전(예: 다른 액자에 담긴 그림의 사진, 또는 예술가의 노트를 다른 언어로 번риста 번역한 것)을 보여주더라도, 그들은 모두 대략 비슷한 판결을 내려야 한다고 기대합니다.
이 논문은 바로 그 점을 테스트하는 것에 관한 것입니다. 다만, "미술 비평가" 대신 "판사"는 **대규모 언어 모델(AI)**이며, "그림" 대신 그들은 AI가 생성한 텍스트의 안전성을 심사합니다.
다음은 연구진이 발견한 내용을 쉬운 비유를 사용하여 정리한 것입니다.
1. "명확함 vs 미묘함"의 문제
연구진은 AI 판사들에게 두 가지 매우 다른 유형의 "나쁜" 콘텐츠를 테스트했습니다.
- "비명 지르는 불길" 테스트 (폭력성): 그들은 AI에게 폭력, 혐오 발언, 또는 불법 행위에 관한 텍스트를 판단하도록 요청했습니다.
- 결과: AI 판사들은 이 부분에서 꽤 유능했습니다. 만약 그림이 명백히 불타고 있다면, 여섯 명의 비평가 모두 "이것은 안전하지 않다"라고 동의했습니다.
- "금융 자문" 테스트 (규제 영역): 그들은 AI가 신용 점수, 비자 신청, 또는 의료 자문과 같은 주제에 대해 조언을 하는 텍스트를 판단하도록 했습니다.
- 결과: AI 판사들은 여기서 형편없는 모습을 보였습니다. 이는 마치 여섯 명의 비평가에게 거의 걸작에 가깝지만 아주 미세한 결함 하나가 있는 그림을 보여주는 것과 같습니다. 한 비평가는 "안전하다, 약간 위험할 뿐이다"라고 말하는 반면, 다른 비평가는 "위험하다, 버려라!"라고 말합니다. 그들은 이 복잡하고 실제적인 시나리오에서 무엇이 "안전"한지에 대해 합의를 이루지 못했습니다.
2. "마법 거울" 문제 (자기 일관성)
연구진은 단일 AI 응답을 가져와서 판사들에게 서로 다른 "거울"을 통해 보여주었습니다.
번역: 텍스트를 영어로 보여준 다음, 프랑스어, 힌디어 등으로 보여주었습니다.
의역(Paraphrasing): 실제 의미는 바꾸지 않으면서, 문장을 더 격식 있게, 혹은 더 캐주얼하게 만들거나 문장의 순서를 바꾸어 다시 썼습니다.
결과: 판사들은 일관성이 없었습니다. 만약 어떤 판사가 "이 영어 문장은 안전하다"라고 판정했다면, 똑같은 문장이 힌디어로 번역된 것을 보고는 "잠깐, 이 힌디어 버전은 안전하지 않다!"라고 말할 수도 있습니다. 또는, 문장을 재구성한 버전을 보고 마음을 바꿀 수도 있습니다.
비유: 어떤 사람이 빨간 셔츠를 입었을 때는 제지하지만, 똑같은 사람이 파란 셔츠를 입었을 때는 통과시켜 주는 보안 요원을 상상해 보십시오. 실제로는 동일한 사람임에도 불구하고 말입니다. AI 판사들은 단어의 실제 내용이 아니라 단어가 어떻게 "차려입었는지"에 의해 쉽게 속습니다.
3. "배심원" 문제 (교차 일관성)
연구진은 또한 다음과 같이 물었습니다: "만약 우리가 여섯 명의 AI 판사를 한 방에 모아 놓는다면, 그들이 서로 동의할 것인가?"
- 결과: 아니요. 심지-않은 경우에도, 똑같은 텍etti를 똑같은 언어로 보고 있음에도 불구하고, 판사들은 종종 정반대의 답을 내놓았습니다.
- 비유: 한 명은 "유죄", 다른 한 명은 "무죄", 세 번째 사람은 "글쎄요"라고 투표하는 배심원단을 상상해 보십시오. 그들은 모두 동일한 증거를 보고 있지만, 무엇이 범죄인지에 대한 내부 규칙 책이 완전히 다릅니다. 연구진은 복잡한 주제(금융 자문 등)의 경우, 이 "배심원단"이 종종 완전한 혼돈 상태에 빠진다는 것을 발견했습니다.
4. "가짜 합의"의 함정
이 논문은 까다로운 통계적 착시에 대해 지적합니다.
- 때때로 모든 판사가 99%의 확률로 "안전"이라고 답할 때가 있습니다. 이때 단순히 "예"라는 표수를 세기만 하면, 마치 그들이 완벽하게 일치하는 것처럼(100% 일관성) 보일 수 있습니다.
- 함정: 하지만 그들이 실제로 구체적인 세부 사항을 생각해서가 아니라, 단지 게으르거나 편향되어 있어서 "안전"이라고 말하는 것이라면, 그것은 진정한 합의가 아닙니다. 연구진은 이러한 가짜 합의를 제거하기 위해 특수한 수학적 방법(예: "기회 보정" 점수)을 사용했습니다.
- 비 Metaphor: 친구들이 퀴즈의 정답을 추측하는 상황을 상상해 보십시오. 만약 정답이 99%의 확률로 "예"이고, 친구들이 모두 "예"라고 답한다면, 그들은 천재처럼 보일 것입니다. 하지만 질문이 실제로 어렵고 그들이 단지 가장 흔한 답을 찍고 있는 것이라면, 그들은 사실 추론에 근쳐 합의한 것이 아닙니다. 이 논문은 더 깊이 들여다보았을 때, AI 판사들이 실제로 많이 의견이 갈린다는 것을 보여줍니다.
결론
이 논문은 AI 판사들이 명확하고 큰 위험(예: 폭력)을 포착하는 데는 괜찮을지 모르나, 미묘하고 실제적인 조언(예: 금융 또는 법률)을 판단할 때는 신뢰할 수 없고 일관성이 없다고 결론짓습니다.
만약 당신이 복잡한 주제에 대해 안전을 감시하는 경비원으로 AI를 사용한다면, 그것이 일관될 것이라고 믿을 수 없습니다. 문장 구조가 약간 바뀌었다는 이유로 위험한 답변을 통과시키거나, 문장이 다른 언어로 번역되었다는 이유로 안전한 답변을 거부할 수도 있습니다. 현재의 AI 모델 "배심원단"은 인간의 감독 없이는 고위험 결정을 내리기에 너무 분열되어 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.