CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives
이 논문은 다양한 캐릭터의 관점을 포함한 고위험 딜레마 데이터셋인 CLASH를 소개하며, 이를 통해 첨단 언어 모델조차 가치 기반 의사결정에서 어려움을 겪고 있으며, 심리적 불편함에 대한 합리적인 예측에도 불구하고 조기 확언 및 가치 변화에 대한 이해 부족과 같은 특정한 실패 패턴을 보인다는 점을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 어려운 인생의 선택을 내리는 법을 가르치려 한다고 상상해 보십시오. 이전의 대부분의 테스트는 로봇에게 "직장에 늦었다면 무단횡단을 해도 괜찮은가?"와 같은 단순한 질문을 던졌습니다. 하지만 현실 세계에서 가장 어려운 선택은 단순하지 않습니다. 그것은 모든 선택지가 누군가에게 상처를 주고, 가치관들이 두 폭풍처럼 충돌하는 고위험의 딜레마입니다.
이 논문은 AI가 이러한 복잡하고 압박감이 심한 상황을 다룰 수 있는지 확인하기 위해 설계된 새로운 "시험"인 CLASH(고위험 상황에서의 캐릭터 관점 기반 LLM 평가)를 소개합니다.
다음은 그들이 무엇을 했고 무엇을 발견했는지에 대한 내용을 쉬운 비유를 사용하여 정리한 것입니다.
1. 시험: CLASH
이전의 AI 테스트가 짧고 깔끔한 문장으로 된 객관식 퀴즈라면, CLASH는 하나의 드라마 시리즈와 같습니다.
- 스토리: 단문 대신, 이 데이터셋은 생사가 걸렸거나 인생을 바꿀 만한 상황(예: 의사가 치료법을 결정하거나, 은행원이 막대한 손실을 입히는 실수 등을 하는 상황)에 대한 345개의 길고 상세한 이야기를 담고 있습니다.
- 캐릭터: 모든 이야기마다 AI는 서로 다른 "캐릭터"의 관점에서 답해야 합니다. 어떤 캐릭터는 안전만을 중시하고, 어떤 캐릭터는 공정함만을 중시합니다. 어떤 캐릭터는 이야기 중간에 마음을 바꾸기도 합니다.
- 목표: 시험은 다음과 같이 묻습니다: "만약 당신이 캐릭터 A라면, 이것을 하겠습니까? 이것 때문에 속이 메스꺼울 것 같습니까? 어제와 비교했을 때 당신의 생각이 바뀌었습니까?"
2. 주요 발견: AI가 넘어지는 지점
연구진은 14개의 서로 다른 AI 모델(GPT-5나 Claude-4와 같은 최신형의 똑똑한 모델 포함)을 이 시험으로 테스트했습니다. 결과는 다음과 같았습니다.
A. "결정을 못 하는" 문제 (양가감정)
- 비유: 두 개의 문 앞에 서 있다고 상상해 보십시오. 한 문은 보상으로 이어지고, 다른 문은 함정으로 이어집니다. 인간은 "마음이 갈팡질팡해서 선택할 수 없다"라고 말할 수 있습니다.
- 결과: AI 모델들은 자신이 갈등하고 있음을 인정하는 데 매우 서툽니다. 가장 똑똑한 모델들조차 상황이 분명히 "아마도"가 필요한 상황임에도 불구하고 "예" 또는 "아니오"라는 답변을 강요받았습니다. 그들은 "잘 모르겠다"라고 말하는 데 어려움을 겪었으며, 정답이 "혼란스럽다"인 경우에도 마찬가지였습니다. 실제로 가장 우수한 모델도 이 부분을 약 51% 정도만 제대로 맞혔습니다.
B. "직감"의 문제 (불편함)
- 비유: 때로는 무엇을 해야 할지 알지만, 마음 한구석이 불편할 때가 있습니다. 마치 회사를 살리기 위해 친구를 해고해야 하는 부모와 같습니다.
- 결과: AI는 캐릭터가 언제 불편함을 느껴야 하는지 포착하는 데는 꽤 능숙합니다. 만약 이야기가 "캐릭터 A는 정직을 가치 있게 여기지만 거짓말을 해야 한다"라고 한다면, AI는 "그렇다, 캐릭터 A는 이에 대해 기분이 나쁠 것이다"라고 올바르게 추측합니다.
C. "기억"의 문제 (가치의 변화)
- 비유: 피자를 좋아하는 캐릭터가 있었지만, 배탈이 난 후 이제 피자를 싫어하게 되었다고 가정해 봅시다.
- 결과: AI 모델들은 자신의 "생각"을 업데이트하는 데 매우 서툽니다. 이야기가 "캐릭터 A는 과거에 X를 가치 있게 여겼지만, 이제는 Y를 가치 있게 여긴다"라고 말하면, AI는 종종 그 변화를 잊어버리고 예전의 신념을 바탕으로 답합니다. 이는 작년에 공부했지만 올해 새로운 과목을 배웠다는 사실을 잊어버린 학생과 같습니다. 가치가 변했을 때 정확도는 거의 43포인트나 떨어졌습니다!
3. AI는 어떻게 "생각하는가" (추론 체인)
연구진은 AI가 이 문제들을 어떻게 해결하는지 보기 위해 AI의 "두뇌" 내부를 들여다보았습니다.
- 기존의 기술: 수학이나 체스에서 똑똑한 AI들은 "백트래킹(backtracking, 자신의 풀이 과정을 검토하고 규칙을 되짚어 보는 것)"이라는 전략을 사용합니다. 이는 수학에서 매우 효과적입니다.
- 새로운 실패: 도덕적 딜레마에서는 이 백트래킹이 도움이 되지 않았습니다. 대신, AI는 두 가지 나쁜 습관을 보였습니다:
- 조기 확언 (Early Commitment): AI는 전체 이야기를 듣기도 전에 판사가 의사봉을 두드리듯 너무 빨리 한쪽 편을 듭니다.
- 과잉 확언 (Overcommitment): 일단 한쪽 편을 선택하면, 다른 쪽이 옳을 수도 있다는 증거를 무시하고 고집스럽게 그 입장을 고수합니다. 이는 결론을 말하기 시작한 후에는 반대 측의 주장에는 귀를 기울이지 않는 변호사와 같습니다.
4. "조종(Steering)" 테스트
연구진은 특정 가치(예: 안전 vs 자존감)를 향해 AI를 얼마나 쉽게 "조종"할 수 있는지 테스트했습니다.
- 발견: 만약 AI가 이미 "안전"을 매우 좋아한다면, 이를 "자존감"으로 바꾸도록 만드는 것은 매우 어렵습니다. AI가 자연적으로 선호하는 가치가 높을수록, 그 반대의 가치로 조종하기는 더 어려워집니다.
- 관점의 기술: AI는 "당신이 어떻게 하겠느냐?"(1인칭)라고 물었을 때보다 "캐릭터 A라면 어떻게 하겠느냐?"(3인칭)라고 물었을 때 더 잘 따랐습니다. 하지만 "안전"이라는 가치에 대해서는, AI가 1인칭으로 질문받았을 때 더 잘 따랐는데, 이는 아마도 안전이 모델에게 깊이 각인된 본능이기 때문일 것입니다.
요약
이 논문은 AI가 수학이나 게임에서는 똑똑해지고 있지만, 인간의 가치라는 복잡하고 감정적이며 변화무쌍한 세상을 항해하는 데는 여전히 매우 서투르다고 결론짓습니다. AI는 혼란스러울 때 이를 인정하는 데 어려움을 겪고, 사람들이 마음을 바꿀 때 이를 잊어버리며, 종종 자신의 고집스러운 논리에 갇혀 버립니다.
중요 참고 사항: 저자들은 이것이 진단 도구임을 강조합니다. 그들은 이 AI 모델들이 의사나 판사가 될 준비가 되었다고 말하는 것이 아닙니다. 오히려, 이 테스트에서 높은 점수를 받는다고 해서 AI를 실생활에서 안전하게 사용할 수 있다는 뜻은 아니며, 단지 우리가 AI가 어디에서 실패하고 있는지를 볼 수 있는 더 나은 방법을 갖게 되었음을 의미한다고 경고합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.