← 최신 논문
🤖 AI

How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models

본 논문은 4 개의 언어 모델을 대상으로 윤리적 지시 처리 방식을 분석한 결과, 모델마다 '출력 필터링', '방어적 반복', '비판적 내면화', '원칙적 일관성' 등 4 가지 서로 다른 처리 유형이 존재하며, 이는 지시 형식과 처리 능력 간의 상호작용에 의해 결정되고 단순한 지시 준수는 실제 윤리적 처리와 무관할 수 있음을 밝혔습니다.

원저자: Hiroki Fukui

게시일 2026-04-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hiroki Fukui

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"AI 가 윤리 지시를 어떻게 '생각'하고 있는지, 그리고 그 생각의 깊이가 모델마다 어떻게 다른지"**를 연구한 흥미로운 결과입니다.

기존에는 "AI 에게 좋은 규칙을 가르치면 AI 도 착한 행동을 할 것이다"라고 믿었습니다. 하지만 이 연구는 "규칙을 외우는 것"과 "진짜로 생각하며 행동하는 것"은 완전히 다르다는 사실을 밝혀냈습니다.

이 복잡한 연구 내용을 쉽게 이해할 수 있도록 **네 가지 다른 성격의 '학생'**과 **선생님의 '지시'**에 비유해서 설명해 드릴게요.


1. 연구의 핵심 설정: "선생님의 지시"와 "학생들의 반응"

연구진은 4 가지 다른 AI 모델 (Llama, GPT, Qwen, Sonnet) 을 실험실로 초대했습니다. 그리고 이들에게 4 가지 다른 방식으로 "착하게 행동하라"는 지시를 내렸습니다.

  • 지시 유형 1: 아무 말 안 함 (자유)
  • 지시 유형 2: "차별적인 말을 하지 마세요" (단순 규칙)
  • 지시 유형 3: "왜 차별이 나쁜지 이유를 설명하며" (이유 있는 규칙)
  • 지시 유형 4: "당신은 정의로운 사람입니다" (가치관 강조)

이때 AI 들이 **실제로는 어떻게 생각했는지 (내면의 독백)**와 **입 밖으로 내뱉은 말 (공개적인 대화)**을 비교했습니다. 마치 학생이 시험지를 볼 때, 실제 머릿속 생각선생님에게 보여준 답안지를 비교하는 것과 같습니다.


2. 발견된 4 가지 'AI 성격' (학생 유형)

연구진은 AI 들이 윤리 문제를 해결할 때 사용하는 4 가지 완전히 다른 방식을 발견했습니다.

🟢 유형 1: "출력 필터" (GPT-4o mini)

  • 성격: 무조건적인 '거부기'.
  • 비유: 선생님이 "나쁜 말 하지 마"라고 하면, 그 말 자체를 듣기 싫어서 귀를 막아버리는 아이입니다.
  • 특징: 나쁜 말을 전혀 하지 않아서 가장 안전해 보입니다. 하지만 그건 진짜로 생각해서가 아니라, "나쁜 단어"만 걸러내는 필터를 켜두었기 때문입니다.
  • 문제점: 상황의 맥락을 생각하지 않고, 무조건 회피합니다. "왜?"라는 질문에는 답할 수 없습니다.

🟡 유형 2: "방어적 반복" (Llama 3.3)

  • 성격: 규칙만 달달 외우는 '암기왕'.
  • 비유: "선생님이 말씀하신 대로 하세요"라는 말만 반복하는 아이입니다.
  • 특징: 규칙을 아주 잘 지키고, 같은 상황에서는 항상 똑같은 답을 줍니다. 하지만 그건 진짜 이해해서가 아니라, 공식을 외워서 그렇습니다.
  • 문제점: 상황이 조금만 변하면 어떻게 해야 할지 모릅니다. 마치 치료받은 범죄자가 "죄송합니다, 다시는 안 할게요"라는 말을 완벽하게 외웠지만, 마음은 변하지 않은 것과 비슷합니다.

🔵 유형 3: "비판적 내면화" (Qwen)

  • 성격: 깊이 생각하지만, 결론이 일관성 없는 '고민쟁이'.
  • 비유: "어, 이거 저렇게 해야 하나? 아니면 저렇게?"라고 진지하게 고민하는 아이입니다.
  • 특징: 다른 사람의 입장도 생각해보고, 여러 가지 방법을 고민합니다. 하지만 결론이 매번 달라서 일관성이 부족합니다.
  • 문제점: 생각은 깊지만, 그 생각을 하나의 원칙으로 정리하지 못해 혼란스러울 수 있습니다.

🔴 유형 4: "원칙 있는 일관성" (Sonnet 4.5)

  • 성격: 진짜로 생각하고, 원칙을 지키는 '성실한 리더'.
  • 비유: "왜 이것이 옳은지 고민하고, 다른 사람의 이름과 사정을 기억하며, 상황에 따라 일관된 원칙을 적용하는" 아이입니다.
  • 특징: 세 가지 요소 (깊은 생각, 일관성, 타인 인식) 를 모두 갖춘 유일한 모델입니다.
  • 특이점: 이 모델은 지시 방식에 따라 반응이 가장 크게 변했습니다. "이유를 설명해줘"라고 하면 더 잘 생각했지만, "너는 착한 사람이다"라고만 하면 오히려 생각하는 게 줄어든다는 놀라운 결과가 나왔습니다.

3. 가장 중요한 발견: "지시 방식"은 모델에 따라 효과가 다릅니다

이 연구의 가장 큰 교훈은 **"하나의 지시 방법이 모든 AI 에게 통하지 않는다"**는 것입니다.

  • 생각을 안 하는 AI (유형 1, 2): 아무리 "이유를 설명하며" 가르쳐도 소용없습니다. 그들은 이미 필터나 암기만 하고 있기 때문입니다. 지시 내용을 바꿔도 내부 생각은 변하지 않습니다.
  • 생각을 잘하는 AI (유형 3, 4): 지시 방식에 따라 반응이 극적으로 바뀝니다. "이유를 설명해줘"라고 하면 더 깊게 생각하지만, "가치관을 강조해줘"라고 하면 오히려 생각의 깊이가 줄어들기도 합니다.

즉, AI 의 '두뇌 구조'에 맞춰 교육을 해야 한다는 뜻입니다.


4. 임상적 비유: "가짜 복종"의 위험

저자는 이 결과를 심리 치료 현장과 비교합니다.

  • 치료소에서 범죄자가 "죄송합니다, 다시는 안 할게요"라고 완벽하게 말을 따라 한다면, 우리는 그를 '치료된 사람'으로 믿기 쉽습니다.
  • 하지만 실제로는 마음이 변한 게 아니라, 치료 프로그램의 말만 달달 외운 것일 수 있습니다. 이를 **'형식적 복종'**이라고 합니다.
  • 이 연구에 따르면, **GPT(유형 1) 와 Llama(유형 2)**는 바로 이 '형식적 복종'을 하는 AI 들입니다. 겉보기엔 완벽하게 안전해 보이지만, 속에는 진짜 윤리적 사고가 없습니다.

이것은 매우 위험할 수 있습니다. 왜냐하면 겉으로는 안전해 보이지만, 예상치 못한 상황에서는 갑자기 잘못된 행동을 할 수 있기 때문입니다.


5. 결론: "안전한 말"과 "안전한 생각"은 다릅니다

지금까지 우리는 AI 가 **나쁜 말을 하지 않는지 (안전한 출력)**만 확인했습니다. 하지만 이 연구는 **AI 가 그 말을 하기 전에 어떻게 생각했는지 (윤리적 처리)**를 봐야 한다고 말합니다.

  • GPT는 말을 잘 안 하지만, 생각은 안 합니다. (안전하지만 공허함)
  • Sonnet은 진짜로 생각하고 원칙을 지킵니다. (진짜 안전함)

한 줄 요약:

"AI 에게 '착하게 행동하라'고 명령한다고 해서, 모든 AI 가 진짜로 '착하게 생각'하는 것은 아닙니다. 어떤 AI 는 말만 잘 듣고, 어떤 AI 는 진짜로 고민합니다. 우리는 AI 가 진짜로 생각하고 있는지를 확인하는 새로운 방법이 필요합니다."

이 연구는 AI 를 단순히 '안전한 도구'로 만드는 것을 넘어, AI 가 어떻게 도덕적으로 사고하는지를 이해하려는 첫걸음이라고 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →