← 최신 논문
💬 NLP

Unsupervised Elicitation of Moral Values from Language Models

이 논문은 내부 일관성 극대화(Internal Coherence Maximization, ICM) 알고리즘이 비지도 학습 기반의 사전 훈련된 언어 모델로부터 잠재적인 도덕적 추론 능력을 성공적으로 이끌어낼 수 있으며, 표준 베이스라인 및 인간이 라벨링한 미세 조정 방식보다 뛰어난 성능을 보이는 동시에 다양한 도덕적 프레임워크 전반에서 사회적 편향을 유의미하게 감소시킨다는 것을 입증한다.

원저자: Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

게시일 2026-01-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 인터넷에 쓰인 거의 모든 것을 읽은 거대하고 믿을 수 없을 정도로 똑똑한 도서관이 있다고 상상해 보세요. 이 도서관은 "사전 학습된 언어 모델(pre-trained language model)"입니다. 오랫동안 사람들은 이 도서관이 그저 자신이 읽은 것들, 즉 나쁜 습관, 편견, 옳고 그름에 대한 혼란 등을 그대로 비추는 거대한 거울일 뿐이라고 생각했습니다. 이 도서관을 "선하게" 만들기 위해, 연구자들은 인간 교사들을 고용하여 도서관에 "훔치는 것은 나쁘다"라거나 "친절해야 한다"와 같은 규칙을 명시적으로 가르치려고 노력했습니다. 이것은 이미 답을 알고 있지만 단지 그것을 예의 바르게 말하는 법을 배워야 하는 천재 학생에게 튜터(과외 선생님)를 붙여주는 것과 같습니다.

하지만 이 논문은 다른 아이디어를 제시합니다: 만약 도서ly관이 이미 그 내면에 도덕적 규칙을 알고 있는데, 단지 입 밖으로 내뱉기를 부끄러워하고 있는 것이라면 어떨까요?

연구진은 **ICM(Internal Coherence Maximization, 내부 일관성 극대화)**이라는 새로운 방법론을 테스트했습니다. ICM을 교사가 아니라, 탐정이나 퍼즐 해결사라고 생각해보세요.

탐정 방법 (ICM)

탐정은 도서관에게 "정답이 무엇인가요?"라고 묻고 답변을 기다리는 대신, 도서관에게 거대한 논리 퍼즐을 풀라고 요구합니다.

  • 퍼즐: 탐정은 수천 개의 도덕적 시나리오(예: "예고 없이 직장을 그만두는 것이 예의 바른 행동인가?")를 제시합니다.
  • 규칙: 도서관은 다른 모든 답변과 완벽하게 논리적으로 부합하도록 모든 시나리오에 대해 "참(True)" 또는 "거짓(False)"을 할당해야 합니다.
  • 목표: 만약 도서관이 한 사례에서 "훔치는 것은 나쁘다"라고 말했다면, 그와 유사한 다른 사례에서 "훔치는 것은 괜찮다"라고 말하며 스스로 모순을 일으킬 수 없습니다. ICM 알고리즘은 도서관이 모든 조각이 딱 들어맞는 직소 퍼즐처럼, 모든 답변이 서로 완벽하게 맞아떨어지는 해답 세트를 찾도록 강제합니다.

연구진은 도서관이 (인간 교사 없이) 스스로 이 퍼즐을 풀도록 강제했을 때, 도서히 갑자기 매우 똑똑하고 일관된 도덕적 답변을 내놓기 시작했다는 것을 발견했습니다.

주요 발견 사항

1. "수줍은 천재" 효과
연구진이 도서관에게 직접 질문했을 때(Zero-Shot), 특히 인간 비서처럼 대화하도록 훈련되지 않은 "가공되지 않은(raw)" 버전의 경우 도서관은 자주 실수를 저질렀습니다. 하지만 ICM 탐정 방법을 사용하여 내부 논리를 깨웠을 때, 도서관의 성능은 급격히 치솟았습니다.

  • 비유: 이는 면접에서 긴장해서 답변을 제대로 못 하는 사람과 같습니다. 하지만 조용한 방에서 혼자 논리 퍼즐을 풀게 하면, 그 사람은 갑자기 자신이 천재임을 보여줍니다. 지식은 이미 그곳에 있었고, 단지 그것을 끌어낼 올바른 열쇠가 필요했을 뿐입니다.

2. 인간 교사보다 나은가?
연구진은 세 그룹을 비교했습니다:

  • 그룹 A: 스스로 추측하는 가공되지 않은 도서관.
  • 그룹 B: 인간에게 배운 도서관 (표준적인 방식).
  • 그룹 C: ICM 탐정에게 배운 도서관 (자신이 생성한 답변을 사용).

결과: 그룹 C(ICM)는 그룹 B(인간 교사)만큼 잘 수행했거나, 때로는 그룹 B보다 더 나은 성과를 보였습니다. 이는 매우 중요한데, 왜냐하면 AI를 도덕적으로 만들기 위해 수천 명의 인간을 고용하여 데이터를 라벨링할 필요가 없을 수도 있음을 의미하기 때문입니다. 우리가 올바른 질문을 던질 수 있다면 AI는 스스로를 가르칠 수 있습니다.

3. "편견" 문제 해결
AI는 종종 실수로 나쁜 고정관념을 학습합니다(예: 특정 집단이 권리를 누릴 자격이 적다고 생각하는 것). 연구진은 ICM이 이를 해결할 수 있는지 테스트했습니다.

  • 테스트: 연구진은 다양한 집단(인종, 성별, 직업 상태 등에 따른)의 권리에 대해 도서관에게 물었습니다.
  • 결과: "가공되지 않은" 도서관과 "챗봇" 형태의 도서관은 약 10~12%의 확률로 실수를 저질렀습니다. ICM 방법은 이러한 실수를 절반으로 줄여 약 4%까지 낮췄습니다.
  • 비유: 여러 사람이 테이블에 앉을 자격이 누구에게 있는지 논쟁하는 상황을 상상해 보세요. 가공되지 않은 그룹은 시끄럽고 편향되어 있습니다. ICM 방법은 심판처럼 나타나 "잠깐, 만약 동일한 규칙을 모두에게 적용한다면, 유일하게 공정한 답은 모두가 자리를 얻는 것입니다"라고 말하는 것과 같습니다. 이는 AI가 스스로 일관성을 유지하도록 강제했고, 이는 자연스럽게 편향을 줄였습니다.

4. "상식적" 도덕 vs "어려운" 도덕
AI는 "상식적" 도덕(예: "사람을 때리지 마라")과 "정의"(예: "모든 사람을 공정하게 대하라")에는 뛰어났습니다. 그러나 "공리주의"(최대 다수의 최대 행복을 위한 계산)에 대해서는 여전히 어려움을 겪었습니다.

  • 비유: AI는 사회적 규칙을 따르고 공정하게 행동하는 데는 매우 능숙하지만, 희소한 자원을 누구에게 배분할지 결정하기 위해 복잡한 수학적 계산을 해야 할 때는 혼란스러워하는 사람과 같습니다.

결론

이 논문은 도덕적 추론이 AI에 처음부터 "설치"해야 하는 것이 아니라고 결론짓습니다. 그것은 이 모델들이 읽은 방대한 데이터 속에 이미 내재된(latent) 능력인 것으로 보입니다.

AI가 스스로와 논리적으로 일관되도록 강제하는 방법(ICM)을 사용함으로써, 우리는 값비싼 인간의 감독 없이도 이 도덕적 추론을 "깨울" 수 있습니다. 이는 도서관에 새로운 튜터가 필요한 것이 아니라, 자신의 모습을 비출 거울이 필요했을 뿐임을 깨닫는 것과 같습니다.

중요 참고 사항: 이 논문은 이것이 모든 AI 안전 문제를 해결한다거나 인간의 감독을 중단해야 한다고 주장하는 것이 아닙니다. 단지 독자적인 방식으로 AI로부터 도덕적 추론을 이끌어내는 놀라울 정도로 효과적인 새로운 확장 가능한 방법을 보여줄 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →