← 최신 논문
📊 statistics

Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

이 논문은 딜레마에 대한 응답을 인간이 검증한 정답과 비교하여 순위를 매김으로써 지혜, 정의, 용기와 같은 덕목의 비교 프로필을 생성함으로써 아리스토텔레스의 덕 윤리를 통해 거대 언어 모델의 윤리적 의사결정 패턴을 평가하는 프레임워크인 VirtueMap을 소개한다.

원저자: Ioannis Tzachristas, John Pavlopoulos

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ioannis Tzachristas, John Pavlopoulos

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 친구의 성격을 묘사하려고 한다고 상상해 보세요. 하지만 그들에게 "당신은 좋은 사람인가요?"라고 묻는 대신(이는 대답하기 어려운 예/아니오 질문입니다), 몇 가지 까다롭고 일상적인 상황에서 어떻게 행동할 것인지 묻는 것입니다. 우리는 정답을 찾으려는 것이 아니라, 그들이 자신의 가치를 어떻게 우선순위에 두는지 보고자 하는 것입니다.

이것이 바로 **"Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas"**라는 논문이 인공지능을 위해 수행하고 있는 방식입니다.

다음은 이 프로젝트인 VirtueMap의 내용을 쉬운 비유를 들어 설명한 것입니다.

1. 문제점: AI는 너무 흑백논리적이다

보통 우리가 AI를 테스트할 때는 "이 답이 맞느냐 틀리느냐?"를 묻습니다.
하지만 현실 세계는 그렇지 않습니다. 때로는 진실을 말하는 것이 누군가의 기분을 상하게 할 수도 있습니다. 때로는 공정하다는 것이 조금 엄격함을 의미할 수도 있습니다. 때로는 용기를 내는 것과 신중함을 유지하는 것 사이에서 선택해야 할 때도 있습니다.
저자들은 AI 모델이 서로 다른 "우선순위"에 따라 서로 다른 선택을 한다고 주장합니다. 어떤 AI는 무례하더라도 항상 정직한 답을 선택할 수 있습니다. 또 다른 AI는 약간 모호하더라도 예의 바른 답을 선택할 수 있습니다. 둘 다 각자의 방식으로 "윤리적"이지만, 서로 다른 성격을 가지고 있는 것입니다.

2. 해결책: "성격 지도"

저자들은 AI에게 합격/불합격 점수를 주는 대신, VirtueMap을 만들었습니다. 이것을 다섯 가지 고대 그리스 미덕을 기준으로 AI의 "성격"을 측정하는 5성형 레이더 차트(오각형 모양)라고 생각하면 됩니다.

  • 실천적 지혜 (Practical Wisdom): 단순히 규칙을 따르는 것이 아니라, 특정 상황에서 무엇을 해야 할지 아는 것.
  • 정의 (Justice): 공정하게 대하고 각자에게 마땅한 것을 주는 것.
  • 진실함 (Truthfulness): 정직하고 숨기지 않는 것.
  • 용기 (Courage): 두렵거나 손해가 따르더라도 옳은 일을 하는 것.
  • 절제 (Temperance): 언제 자제해야 하는지, 언제 과하지 않아야 하는지 아는 것.

3. 테스트 방법: "순위 매기기 게임"

연구진은 단순히 AI에게 하나를 고르라고 하지 않았습니다. 대신 7가지 일상적인 윤리적 딜레마(예: "스프레드시트 오류를 발견했습니다. 즉시 수정하시겠습니까, 아니면 기다리시겠습니까?")를 제시했습니다.
각 딜레마에는 5가지 가능한 응답이 있었습니다.

  • 기존 방식: AI에게 "어느 것이 가장 좋은가?"라고 묻습니다.
  • VirtueMap 방식: AI에게 5가지 옵션 전체를 "가장 윤리적인 것"부터 "가장 덜 윤리적인 것"까지 순위를 매기도록 합니다.

AI가 모든 옵션을 어떻게 순위 매기는지를 봄으로써, 우리는 그들의 전체적인 "성격"을 볼 수 있습니다. 이 AI는 "무례하지만 정직한" 옵션을 싫어할까요? 아니면 "신중하지만 모호한" 옵션을 좋아할까요?

4. "그라운드 트루스(Ground Truth)": 인간을 통한 검증

어떻게 어떤 순위가 "용기"나 "정의"를 나타낸다는 것을 알 수 있을까요?
저자들은 단순히 추측하지 않았습니다. 100명이 넘는 실제 사람들에게 5가지 옵션을 보여주고, "만약 우리가 '용기'를 보여주고 싶다면, 어떤 순서로 나열해야 할까요?"라고 물었습니다.
저자들은 사람들의 95%가 동의할 때만 점수 산출을 위한 "규칙"을 유지했습니다. 이는 지도가 저자들의 개인적인 의견이 아닌 상식에 기반하도록 보장하기 위함입니다.

5. 결과: AI의 모습은 어떠한가?

연구진은 결과의 안정성을 확보하기 위해 9개의 유명한 AI 제품군(GPT, Claude, Llama 등)을 여러 번 테스트했습니다.

  • 좋은 소식: AI들은 매우 일관적이었습니다. 동일한 AI에게 같은 질문을 두 번 했을 때, 매우 유사한 순위를 부여했습니다(90%의 일관성).
  • 성격의 차이:
    • 모든 AI는 실천적 지혜에 매우 뛰어났습니다(균형 잡히고 사려 깊은 답변을 선호했습니다).
    • 가장 큰 차이는 용기, 절제, 정의에서 나타났습니다.
    • 예시: 어떤 AI는 매우 "용기 있는"(항상 직접적이고 위험을 감수하는 진실을 선택함) 반면, 다른 AI는 매우 "절제된"(항상 안전하고 신중한 경로를 선택함) 모습을 보였습니다. 어느 쪽도 "고장 난" 것이 아니라, 단지 서로 다른 프로필을 가진 것입니다.

6. 인터랙티브 웹사이트

저자들은 여러분이 직접 게임을 해볼 수 있는 웹사이트를 구축했습니다. 여러분이 딜레마의 순위를 매기면, 사이트가 여러분의 "Virtue Pentagon(미덕 오각형)"을 그려줍니다. 그런 다음 여러분의 형태를 9개의 서로 다른 AI의 형태와 비교하여, 여러분의 성격과 가장 유사한 AI가 누구인지 알려줍니다.

핵심 요약

이 논문은 AI가 영혼을 가졌거나 진정으로 "선하거나 악하다"고 말하는 것이 아닙니다. 대신 이렇게 말합니다: "AI 모델은 사람들과 마찬가지로 서로 다른 윤리적 스타일을 가지고 있다."

VirtueMap은 이러한 스타일을 측정하기 위한 도구입니다. 이는 우리를 "이 AI가 정답인가?"라는 질문에서 벗어나 "이 AI는 어떤 종류의 윤리적 성격을 보여주는가?"라는 질문으로 이동시킵니다. 이를 통해 우리는 단순히 최종 답변을 판단하는 것을 넘어, AI가 왜 그러한 선택을 내리는지에 대한 이유를 이해할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →