← 최신 논문
💬 NLP

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

이 논문은 거대 언어 모델의 도덕적 판단에서 나타나는 겉보기의 "예-아니오 편향(yes-no bias)"이 윤리적 추론의 변화가 아니라 답변 순서와 어휘적 표현 방식에 의해 유발된 표면적인 인위적 현상임을 입증하며, 이는 모델을 논리적 판결과 표면적 형식 구성을 분리하는 심리 측정 도구 세트로 평가할 때 사라진다.

원저자: Haonan Huang

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haonan Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 매우 똑똑한 로봇의 도덕적 나침반을 이해하려고 노력 중이라고 상상해 보세요. 당신은 로봇에게 어려운 질문을 던집니다. "한 명을 희생시켜 다섯 명을 구하는 것이 괜찮습니까?"

만약 당신이 로봇에게 "라고 답하시겠습니까, 아니면 아니오라고 답하시겠습니까?"라고 묻는다면, 로봇은 아주 강한 의견을 가진 것처럼 보일 수 있습니다. 하지만 이 논문은 놀라운 트릭을 밝혀냅니다. 로봇의 답변은 종종 그것이 무엇이 옳은지에 대한 생각보다는, 당신이 질문을 어떻게 했느냐에 더 많이 좌우된다는 것입니다.

다음은 연구진이 발견한 내용을 쉬운 비유를 사용하여 정리한 것입니다.

1. 로봇은 비밀스러운 "도덕적 척도"를 가지고 있다

먼저, 연구진은 로봇이 실제로 일관된 가치 체계를 가지고 있는지, 아니면 그저 추측하고 있는 것인지 알고 싶었습니다.

이를 알아내기 위해, 그들은 단순히 로봇에게 "예 또는 아니오"라고 묻지 않았습니다. 대신 동일한 20가지 도덕적 딜레마를 48가지 다른 방식으로 물었습니다. 척도를 바꾸고(010 vs 0100), 문구의 순서를 뒤집었으며, 어떤 옵션을 먼저 평가할지를 변경했습니다.

발견된 사실: 표면적인 현상을 너머 살펴보면, 로봇의 "내면의 목소리"는 사실 상당히 일관적입니다. 로봇은 일관된 도덕적 척도를 가지고 있습니다. 만약 어떤 형식을 통해 특정 행동이 "대체로 나쁘다"라고 생각한다면, 다른 형식에서도 아마 "대체로 나쁘다"라고 생각할 것입니다. 가장 똑똑한 모델들("프런티어" 모델들)은 놀라울 정도로 내부 논리가 일관적입니다.

2. "예/아니오"의 함정: 마지막 단어의 마법

그렇다면 로봇이 일관된 내면의 목소리를 가지고 있다면, 왜 질문을 재구성할 때마다 "예/아니오" 답변은 그토록 급격하게 변하는 걸까요?

연구진은 "예/아니오" 형식이 왜곡하는 렌즈 역할을 한다는 것을 발견했습니다. "예/아 아니오"를 선택하도록 강요받을 때, 로봇은 두 가지 특정한 트릭 때문에 혼란을 겪습니다.

  • "마지막 단어" 편향 (순서 편향): 인간은 보통 처음 읽은 것에 주의를 기울입니다. 하지만 이 로봇들은 마지막에 읽은 것에 더 많은 주의를 기울이는 듯합니다. 만약 당신이 "답변: 아니오, 예"라고 쓴다면, 로봇은 단지 "예"가 마지막에 있기 때문에 "예"를 선택할 가능성이 높습니다. 만약 "답변: 예, 아니오"라고 쓴다면, 로봇은 "아니오" 쪽으로 기웁니다.
  • "아니오" 자석 (어휘 편향): 로봇은 "아니오"라는 특정 단어에 이상한 끌림을 보이는 것 같습니다. 이것은 반드시 논리적으로 거부하는 것이 아니라, 단지 페이지에 있는 그 특정 단어에 이끌리는 것입니다.

비유: 어떤 사람이 답안지에 답이 인쇄된 카드를 들고 시험을 치르는 상황을 상장해 보세요.

  • 인간: 질문을 읽고, 답에 대해 생각한 뒤, 옳은 것을 고릅니다.
  • 로봇: 질문을 읽고, 답에 대해 생각하지만, 그 후 카드 하단에 "아니오"라는 글자가 굵게 인쇄되어 있다는 사실이나 "예"가 마지막 단어라는 사실에 주의가 분산됩니다. 로봇은 그 단어가 무엇을 의미하는지가 아니라, 그 단어가 어디에 있는지에 따라 답을 고릅니다.

3. "아니오" 편향은 "아니오"라고 말하는 것에 관한 것이 아니다

흔히 이러한 로봇들이 본래 "부정적"이거나 "비관적"이어서 모든 것에 "아니오"라고 답하고 싶어 한다고 가정합니다.

발견된 사실: 이는 거짓입니다. 연구진은 단어를 교체함으로써 이를 증명했습니다. "예 또는 아니오"라고 묻는 대신, 로봇에게 "옵션 A"와 "옵션 B" 중 하나를 선택하게 했습니다.

이렇게 하자 "아니오" 편향이 사라졌습니다. 로봇이 갑자기 "예"를 더 자주 말하기 시작한 것이 아니라, 단지 "아니오"라는 단어에 끌리지 않게 된 것입니다.

  • 결론: 로봇은 무언가를 거절하는 것에 편향된 것이 아닙니다. 질문의 표면적인 모습에 편향되어 있는 것입니다. 로봇은 논리적 판결이 아니라 인쇄된 라벨을 따릅니다.

4. 깊이 생각하면 도움이 되지만, 모든 것을 해결하지는 못한다

연구진은 로봇에게 답변하기 전에 "단계별로 생각하라"고 지시했을 때(이를 '숙고' 과정이라 부름) 어떤 일이 일어나는지 테스트했습니다.

발견된 사실: 로봇이 시간을 들여 생각하면 "예/아니오" 편향이 줄어듭니다. 로봇은 단어의 순서나 "아니오"라는 특정 단어에 덜 주의를 뺏기게 됩니다. 하지만 이 편향이 모든 모델에서 완전히 사라지는 것은 아닙니다. 일부 모델(예: "클로드" 제품군)은 깊이 생각할 때조차 여전히 마지막 옵션이나 "아니오"라는 단어로 향하는 강한 끌림을 보입니다.

5. "작은" 로봇들은 다르다

연구는 또한 더 작은 오픈 소스 모델들도 살펴보았습니다. 이 모델들은 훨씬 더 엉망이었습니다. 이들은 일관된 내부 도덕적 척도를 전혀 가지고 있지 않았습니다. 이들의 답변은 질문 형식에 따라 극단적으로 요동쳤으며, 더 오래 "생각"하더라도 나아지지 않았습니다. 이들은 본질적으로 질문의 표면을 보고 추측하고 있었습니다.

핵심 요약

AI가 진정으로 무엇을 가치 있게 여기는지 알고 싶다면, 단 한 번의 "예/아니오" 질문만으로는 부족합니다.

  • 문제점: 단일 "예/아니오" 질문은 로봇의 실제 의견과 "형식적 결과물"(질문이 작성된 방식 때문에 발생하는 오류)을 뒤섞어 버립니다.
  • 해결책: AI의 진정한 도덕적 입장을 측정하려면, 질문을 다양한 방식으로 (프레임을 교차하여) 물어보고 결과를 평균 내야 합니다. 이렇게 하면 "마지막 단어"와 "아니오 단어"로 인한 주의 분산을 상쇄하여, 로봇의 진실되고 일관된 내면의 척도를 드러낼 수 있습니다.

요약하자면: 로봇은 반드시 "아니오"라고 말하는 성격인 것이 아닙니다. 그저 폰트, 순서, 그리고 페이지의 마지막 단어에 쉽게 정신을 빼앗기는 사람일 뿐입니다. 페이지를 깔끔하게 정리하면, 로봇의 진정한 의견이 빛을 발하게 됩니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →