Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety
이 논문은 높은 순위를 기록한 모델이라 할지라도 여전히 중대한 안전 관련 실패를 보일 수 있음을 통해 임상의의 쌍체 비교 선호도가 대규모 언어 모델의 임상적 안전성을 나타내는 신뢰할 수 없는 대리 지표임을 입증하며, 이에 따라 실패율을 직접 보고하고 임상에 근거한 루브릭 조정을 통합하는 평가 방식이 필요함을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
새로운 병원 구내식당을 위해 최고의 셰프를 뽑으려 한다고 상상해 보십시오. 당신은 유명한 셰프들의 명단을 가지고 있고, 의사 그룹에게 그들의 요리를 시식하게 합니다. 의사들은 어떤 접시가 가장 먹음직스러워 보이고 그 순간에 맛이 가장 좋은지에 투표합니다. 당연히, 당신은 가장 많은 표를 얻은 셰프가 가장 안전하고 신뢰할 수 있는 사람이라고 가정합니다. 하지만 만약 그 "가장 맛있어 보이는" 요리가 사실 유통기한이 지난 재료로 만들어졌거나, 가장 "자신감 넘치는" 셰프가 음식을 서빙하며 매우 능숙하게 말하는 기술만 뛰어날 뿐 실제로는 위험한 것을 내놓았다면 어떻게 될까요? 이것이 바로 매우 똑똑한 컴퓨터 프로그램으로서 인간처럼 글을 쓰고, 대화하고, 문제를 해결할 수 있는 **대규모 언어 모델(LLM)**의 까다로운 세계입니다. 과학자들은 어떤 AI가 "최고"인지 파악하기 위해 쌍체 선호도(pairwise preferences)(전문가에게 "A와 B 중 무엇인가"를 묻는 방식)를 사용합니다. 하지만 의료와 같이 이해관계가 걸린 고위험 분야에서는, "가장 선호되는" 것이 반드시 "가-장 안전한" 것을 의미하지는 않습니다. 만약 한 AI가 잘못된 의학적 답변을 내놓았지만 그것을 아주 멋진 스타일로 전달한다면, 그 AI는 비록 환자를 해칠 수도 있음에도 불구하고 투표에서 승리할 수 있습니다. 이 논문은 중요한 질문을 던집니다. 의사들이 가장 좋아한다고 선택한 AI가 실제로 위험한 실수를 저지르지 않을 AI를 선택하고 있는 것일까요?
스위스 LiGHT 연구소의 연구진은 이 가정을 검증하기 위해 MOOVE(Massive Open Online Validation and Evaluation)라는 거대한 플랫폼을 사용하여 테스트를 진행하기로 했습니다. 이들은 28개국 이상의 736명 이상의 의사를 모아 심사위원 역할을 맡겼습니다. 의사들은 13가지 서로 다른 AI 모델을 살펴보고, 블라인드 테스트(쌍체 선호도)를 통해 어떤 응답이 더 나은지 선택해야 했습니다. 하지만 여기에는 반전이 있습니다. 의사들은 투표하는 동안 각 답변에 대해 -2(매우 위험함)부터 +2(매우 안전함)까지의 점수를 매기는 엄격한 안전 성적표를 함께 부여했습니다. 그들은 두 가지 특정 사항을 확인했습니다. 바로 무해성(Harmlessness)(AI가 위험한 제안을 했는가?)과 정확성(Accuracy)(의학적 사실이 옳은가?)입니다.
결과는 다소 충격적이었습니다. 연구 결과, 가장 많은 "인기 투표"를 받은 AI 모델들은 종종 가장 높은 위험한 오류 발생률을 보이는 모델들과 일치했습니다. 이는 마치 글씨체가 예쁘고 자신감이 넘쳐서 A를 받았지만, 숫자를 틀려서 수학 시험은 낙제한 학생과 같습니다. 실제로 연구진은 이번 연구에서 **가장 높은 순위를 차지한 모델(GPT-OSS)**이 **18.0%**의 무해성 실패율을 보였다는 것을 발견했습니다. 즉, 이 모델이 내놓은 답변 5개 중 거의 1개는 잠재적으로 안전하지 않았다는 뜻입니다. 반면, 데이터 세트 내의 더 신중하고 덜 "화려한" 모델은 훨씬 낮은 **7.2%**의 실패율을 보였음에도 불구하고 인기 투표에서는 훨씬 낮은 순위를 기록했습니다. 연구진은 이 모델들이 서로 다른 유형의 의학적 질문들에 대해 테스트되었기 때문에, 하나가 다른 하나보다 엄밀히 "더 낫다"고 말할 수는 없지만, 이 격차는 중요한 경고를 보여준다고 언급했습니다. 즉, 사람들이 가장 "좋아했던" 모델이 반드시 가장 "안전한" 기록을 가진 모델은 아니었다는 것입니다. 연구는 의사들이 종종 표면적인 특징에 속았음을 시사합니다. 즉, 더 길고 상세하며 자신감 있게 들리는 답변을 작성한 AI가, 그 답변이 의학적으로 틀렸거나 위험할지라도 표를 얻었다는 것입니다.
연구진은 왜 이런 일이 발생하는지 더 깊이 조사했습니다. 그들은 "안전 신호"(실제 의학적 정확성)가 "스타일 신호"(텍스트의 길이와 명확성)에 의해 종종 묻힌다는 것을 발견했습니다. 분석 결과, 답변의 길이와 명확성이 실제 답변의 안전성보다 의사가 승자를 선택한 이유를 약간 더 많이 설명했습니다. 이는 마치 심사위원들이 수프가 식었다는 사실은 무시한 채, 메뉴 설명을 가장 길게 쓴 셰프에게 투표하는 것과 같습니다.
더욱 우려스러운 점은 이러한 위험이 고르게 분포되어 있지 않고 특정 "금지 구역"에 집중되어 있다는 것입니다. 예를 들어, AI가 심전도(ECG) 이미지를 판독하려고 할 때 무려 **89.9%**의 확률로 실패했습니다. 일반 외과와 같은 다른 분야에서는 거의 완벽했습니다. 이는 단순히 "모델 X가 1위"라고 말하는 글로벌 "리더보드"가 위험할 수 있음을 의미하는데, 왜냐하면 모델 X가 특정 결정적인 상황에서는 재앙이 될 수 있다는 사실을 숨기기 때문입니다.
이를 해결하기 위해 저자들은 이 모델들을 순위 매기는 새로운 방법을 제안합니다. 단순히 누가 가장 많은 표를 얻었는지 세는 대신, 그들은 **안전 조정 리더보드(Safety-Adjusted Leaderboard)**를 제안합니다. 이 시스템은 인기 투표 결과를 가져온 다음 이를 엄격한 안전 점수와 대조합니다. 만약 어떤 AI가 투표에서 이겼더라도 위험한 답변을 냈다면, 그 모델의 순위는 낮아집니다. 이 수정 방식을 적용했을 때 순위는 극적으로 변했습니다. 이전에 하위권에 머물렀던 일부 모델들은 실제로 더 안전했기 때문에 상위권으로 치고 올라온 반면, "화려한" 승자들은 순위가 떨어졌습니다.
논문은 우리가 "인기 투표"를 통해 AI가 의료용으로 안전한지 판단할 수 없다고 결론짓습니다. AI가 듣기에 좋거나 똑똑해 보인다고 해서 신뢰할 수 있는 것은 아닙니다. 연구진은 단 하나의 "최고" 모델을 찾는 대신, 구체적인 실패율을 살펴보고 AI가 어디에서 실패할 수 있는지에 대해 정직해져야 한다고 제 그대로 제안합니다. 그들은 단순한 선호도 점수에 의존하는 것은, 조종사가 실제로 비행기를 몰 수 있는지 확인하지 않은 채 목소리가 가장 부드럽다는 이유로 조종사를 고용하는 것과 같다고 경고합니다. 의료 AI의 세계에서, 가장 많은 사랑을 받는 것이 반드시 가장 안전한 것은 아닙니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.