Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas
이 논문은 16개의 언어 모델을 윤리적 딜레마에 대해 감사하여 이들의 도덕적 입장이 질문이 긍정형인지 부정형인지에 따라 뒤집히기 쉬울 정도로 매우 불안정하다는 점을 밝혀냈는데, 이러한 취약점은 소규모 모델에서 특히 심각하게 나타나며 표준적인 이진 평가 방식에 의해 종종 가려지곤 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 도덕적인 난제, 예를 들어 "누군가 상처를 받더라도 진실을 말해야 하는가?"라거나 "생명을 구하기 위해 규칙을 어겨도 되는가?"와 같은 질문에 조언을 아주 잘 해주는 똑똑한 로봇 친구가 있다고 상상해 보세요. 당신은 이 로봇이 확고한 도덕적 나침반을 가지고 있을 것이라고 기대할 것입니다. 만약 당신이 "도둑질은 나쁜가?"라고 묻는다면, 로봇은 "예"라고 답해야 할 것입니다. 또한 "도둑질을 하지 않는 것은 좋은가?"라고 묻는다면, 역시 "예"라고 답해야 합니다. 단어만 바뀌었을 뿐 상황은 변하지 않았으므로 답은 같아야 합니다.
하지만 반전이 있습니다. 캐서린 엘킨스(Katherine Elkins)와 존 춘(Jon Chun)의 새로운 연구에 따르면, 많은 AI 로봇들이 문장을 뒤집기만 해도 답변이 완전히 바뀐다는 사실이 밝혀졌습니다. 이는 마치 친구에게 "피자 좋아해?"라고 물었을 때 "응!"이라는 대답을 들었다가, "피자 싫어해?"라고 물으니 "아니!"(즉, 좋아한다는 뜻)라고 하고, 다시 "피자 싫어하는 거 아니지?"라고 물으니 갑자기 다시 "응!"이라고 답하는 것과 같습니다. 이때 로봇은 마치 피자가 무엇인지조차 헷갈려 하는 것처럼 행동합니다.
거대한 뒤집기 (The Great Flip-Flop)
연구진은 14가지 까다로운 도덕적 딜레마를 가지고 16개의 서로 다른 AI 모델(미국의 대기업 제품, 중국 기업 제품, 그리고 소규모 오픈 소스 모델들 포함)을 테스트했습니다. 그들은 각 모델에게 동일한 질문을 두 가지 방식으로 던졌습니다:
- "~해야 한다" 방식: "그들은 가게를 털어야 한다."
- "~하지 말아야 한다" 방식: "그들은 가게를 털지 말아야 한다."
만약 로봇이 안정적이라면, 첫 번째 질문에는 "아니오"라고 답하고, 두 번째 질문에는 "예"라고 답해야 합니다(즉, 털지 않는 것이 옳다는 것에 동의하는 것). 하지만 소규모 오픈 소스 모델들의 결과는 가관이었습니다. "그들은 가게를 털어야 한다"라고 물었을 때, 이 모델들은 겨우 **24%**의 경우에만 동의했습니다. 하지만 "그들은 가게를 털지 말아야 한다"라고 묻자, 이들은 갑자기 해당 행동에 **77%**나 동의했습니다!
이는 76 퍼센트 포인트의 격차입니다. 마치 로봇이 빨간 불을 보고 "멈춰"라고 말했다가, "가지 마"라고 말하자 "가!"라고 말하는 것과 같습니다. 연구에 따르면 일부 작은 모델들의 경우, 까다로운 문구 사용 시 이 뒤집힘 현상이 **100%**에 달하기도 했습니다.
"예스맨" 문제 (The "Yes-Man" Problem)
왜 이런 일이 발생할까요? 저자들은 로봇이 실제로 논리를 생각하는 것이 아니라, 대신 "키워드 매칭" 게임을 하고 있는 것일 수 있다고 제안합니다. 만약 프롬프트에 "털다(rob)"라는 단어가 있으면, 로봇은 "아, '털다'에 대해 이야기해야겠구나!"라고 생각하여, 문장에 "말아야 한다(not)"라는 말이 있음에도 불구하고 실수로 그 행동에 동의해 버리는 것입니다. 이는 마치 학생이 수학 문제에서 "not"이라는 단어를 봤지만, 숫자에 너무 집중한 나머지 그 단어를 무시해 버리는 것과 같습니다.
연구진은 이 로봇들이 단순히 "예스맨"(사용자가 말하는 것에 무조건 동의하는 사람)인지도 확인했습니다. 만약 그랬다면, "털지 마"라고 했을 때 "알겠습니다, 털지 않겠습니다"라고 답했을 것입니다. 하지만 그들은 그렇게 하지 않았습니다. "털지 마"라고 했을 때, 그들은 "알겠습니다, 털겠습니다"라고 답하며 동의했습니다. 따라서 이것은 단순히 예스맨인 문제가 아니라, 부정어(negative words)를 처리하는 방식에서의 진정한 결함입니다.
"가짜" 동의 (The "Fake" Agreement)
여기 또 다른 교묘한 부분이 있습니다. 우리가 보통 이 로봇들을 테스트하는 방식에 결함이 있다는 점입니다. 대부분의 테스트는 단순히 "동의하십니까, 반대하십니까?"라고 묻고 "동의" 답변을 집계합니다. 연구진은 이 단순한 "동의/반대" 버튼이 거짓말을 하고 있다는 것을 발견했습니다. 이 방식은 실제 존재하는 동의보다 38% 더 많은 "동의"를 집계합니다.
로봇이 "확실하지 않지만, 아마도 괜찮을 것 같습니다"라고 말하면, 테스트는 이를 "예"로 집계합니다. 연구진이 인간이 직접 답변을 읽게 한 결과, 로봇의 설명이 자신의 "예" 또는 "아니오" 버튼과 모순되는 경우가 많았습니다. 약 **13%**의 경우, 로봇의 서술형 설명은 버튼이 나타내는 바와 정반대의 내용을 담고 있었습니다. 이는 학생이 도둑질에 반대하는 에세이를 쓰면서도, 정작 체크박스에는 "나는 도둑질을 지지한다"라고 표시하는 것과 같습니다.
누가 가장 안정적인가?
모든 로봇이 똑같이 혼란스러워하는 것은 아닙니다.
- 소규모 오픈 소스 모델들: 가장 취약했습니다. 질문 방식에 따라 답변이 극단적으로 뒤집혔습니다.
- 대형 상용 모델들: 대기업(GPT-5, Claude, Gemini 등)의 모델들은 더 나았지만, 완벽하지는 않았습니다. 뒤집힘 현상이 적긴 했지만 여전히 마음을 바꿨습니다. 예를 들어, 긍정적인 질문을 했을 때 모델 간의 일치도는 **73%**였으나, 부정적인 질문을 했을 때는 **59%**로 떨어졌습니다. 이는 두 개의 "똑똑한" 로봇에게 같은 질문을 부정적인 방식으로 던졌을 때, 서로 의견이 불일치할 확률이 훨씬 높다는 것을 의미합니다.
- "추론" 모델들: "단계별로 생각하라(think step-by-step)"는 지시를 받은 모델들은 더 나은 성과를 보였습니다. 한 모델인 Grok-4.1-reasoning은 비추론 버전과 비교했을 때 혼란을 57% 줄였습니다. 이는 로봇이 단지 키워드를 훑어보는 대신, 문장 전체를 제대로 읽고 차근차근 생각하면 더 자주 정답을 맞힌다는 것을 시사합니다.
이것이 왜 중요한가?
연구진은 이것이 단순히 재미있는 실험이 아니라고 경고합니다. 만약 병원에서 환자 케어를 결정하는 데 AI를 사용하거나, 은행에서 대출 승인을 결정하는 데 AI를 사용하는데, 의사나 은행사가 질문을 어떻게 표현했느냐에 따라 AI의 답이 바뀐다면 이는 엄청난 문제입니다.
연구진은 로봇이 금융 및 비즈니스 시나리오(민감도 점수 0.63–0.65)에서 의료 시나리오(0.36)보다 특히 더 불안정하다는 것을 발견했습니다. 즉, 로봇은 사람들이 돈이나 부채를 다루는 바로 그 순간에 가장 신뢰할 수 없는 조언을 할 가능성이 높다는 뜻입니다.
결론 (The Bottom Line)
이 논문은 이 로봇들이 영원히 "고장 났다"고 말하는 것이 아니라, 주의 깊게 확인하지 않는다면 현재 신뢰할 수 없다고 말합니다. 저자들은 단어를 뒤집었을 때 로봇의 답변이 얼마나 바뀌는지 측정하는 **부정 민감도 지수(Negation Sensitivity Index, NSI)**라는 새로운 테스트를 제 제안합니다.
저자들은 로봇이 이 테스트를 통과할 때까지는 독자적으로 큰 결정을 내리게 해서는 안 된다고 조언합니다. 만약 로봇의 답변이 "해야 한다"와 "하지 말아야 한다"에 따라 달라진다면, 그것은 상황에 대한 판단을 내리는 것이 아니라 단지 문장 구조에 반응하는 것뿐이기 때문입니다. 그리고 현실 세계에서 우리에게 필요한 것은 혼란스러워하는 존재가 아니라, 일관성을 가진 AI 친구입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.