Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models
이 논문은 거대 언어 모델이 인간과 달리 도덕적, 문법적, 경제적 가치를 구분하지 않고 혼동하는 '가치 얽힘(value entanglement)' 현상을 겪는다는 점을 밝히는 동시에, 도덕 관련 활성화 벡터의 선택적 절제(selective ablation)를 통해 이 문제가 완화될 수 있음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 혼란에 빠진 판사
당신에게 아주 똑똑하고 박학다식한 판사(AI)가 있다고 상상해 보세요. 이 판사는 세 가지 완전히 다른 규칙을 기준으로 문장을 평가해야 합니다.
- 이것은 선행인가? (도덕성)
- 문법적으로 올바른가? (문법)
- 가격이 비싼가? (경제성)
인간의 세계에서 이것들은 서로 별개의 채점표입니다. 어떤 문장은 완벽하게 쓰인 끔찍한 범죄에 대한 묘사일 수 있습니다. 어떤 문장은 문법적으로는 엉망이지만 아름다운 친절을 묘사할 수도 있습니다. 어떤 문장은 숭고한 희생의 한복가운데에 저렴한 플라스틱 장난감을 언급할 수도 있습니다.
이 논문은 질문합니다. AI 판사는 이 채점표들을 별개로 유지할까요, 아니면 서로 뒤섞어 버릴까요?
발견: "가치 얽힘 (Value Entanglement)"
연구진은 많은 AI 모델이 "가치 얽힘(Value Entanglement)" 현상을 겪고 있다는 것을 발견했습니다. 이는 AI의 뇌가 이 세 가지 채점표를 하나로 붙여버렸다는 것을 의미하는 멋진 표현입니다.
AI가 문장을 볼 때, 하나의 종류의 "좋음(goodness)"이 다른 곳으로 스며드는 것을 막지 못합니다. 구체적으로, AI는 다음과 같이 생각하는 듯합니다.
- 만약 문장이 도덕적으로 나쁜 것을 묘사한다면, 그것은 반드시 문법적으로도 틀렸을 것이다.
- 만약 문장이 도덕적으로 나쁜 것을 묘사한다면, 그 안에 등장하는 물건들의 가치는 낮을 것이다.
포스트잇의 비유:
AI의 뇌가 화이트보드라고 상상해 보세요.
- 인간은 "선행", "좋은 문법", "좋은 가격"을 세 개의 깨끗하고 분리된 화이트보드에 적습니다.
- AI는 이 세 가지를 같은 화이트보드에 적는데, 이때 잉크가 젖어 있고 끈적거립니다. AI가 파란색 잉크로 "선행"이라고 적으면, 그 파란 잉크가 "좋은 문법"과 "좋은 가격" 섹션으로 번져 나갑니다.
- 그래서 AI가 "나쁜 행위"(빨간 잉크)를 보면, 빨간 잉크가 사방으로 번집니다. 갑자기 AI는 그 문장이 (완벽하더라도) 문법적으로도 나쁘고(빨간 잉크), (다이아몬드를 언급하더라도) 가치가 낮다(빨간 잉크)고 생각하게 됩니다.
어떻게 테스트했는가
연구진은 "직교한다(orthogonal)"는 개념(수학적으로 '직각'이거나 완전히 독립적이라는 뜻)을 가진 68개의 문장으로 특별한 테스트를 설계했습니다.
도덕-문법 테스트: 고양이를 구하는 영웅(도덕적 선)에 대한 문장과 고양이를 훔치는 악당(도치적 악)에 대한 문장을 준비했습니다. 그런 다음, 이 문장들에 각각 0개, 1개, 2개, 또는 4개의 문법 오류를 추가했습니다.
- 인간의 결과: 인간은 오직 오류의 개수에 기반하여 문법을 평가했습니다. 4개의 오류가 있는 영웅 문장은 낮은 문법 점수를 받았지만, 오류가 없는 악당 문장은 높은 문법 점수를 받았습니다.
- AI의 결과: 많은 AI는 문장의 내용이 악하다는 이유만으로, 문법이 완벽함에도 불구하고 "악당" 문장에 더 낮은 문법 점수를 주었습니다. 또한 "영웅" 문장은 내용이 착하다는 이유로 더 높은 문법 점수를 주었습니다.
도덕-경제 테스트: 영웅이 신장을 기증하는 문장에 간호사의 손목에 있는 시계에 대한 디테일을 추가했습니다. 시계의 가격은 25달러짜리 카시오 시계부터 7,500달러짜리 롤렉스까지 다양했습니다.
- 인간의 결과: 인간은 시계에 따라 가격을 평가했습니다.
- AI의 결과: 많은 AI는 문장이 도덕적 비극을 묘사하면 시계의 가격을 더 낮게 평가했고, 도덕적 승리를 묘사하면 가격을 더 높게 평가했습니다.
AI 내부의 "X-레이"
연구진은 단순히 AI에게 무엇을 생각하는지 묻는 것에 그치지 않고, AI의 "뇌"(내부 수학적 레이어)를 들여다보며 정보가 어떻게 처리되는지 확인했습니다.
그들은 AI가 "도덕성", "문법", "돈"을 이해하기 위해 사용하는 수학적 방향들이 서로 중첩되어 있음을 발견했습니다.
- 건강한 인간의 뇌에서는 "도덕성" 벡터와 "문법" 벡터가 서로 다른 방향을 가리킵니다.
- 하지만 이 AI 모델들에서는 "문법" 벡터가 "도덕성" 벡터와 거의 같은 방향을 가리키고 있었습니다. AI는 내부 수학 구조에서 문법적 오류와 도덕적 오류를 구분하지 못했던 것입니다.
해결책: "지우개"
이 논문의 가장 흥고한 부분은 복구 작업입니다. 연구진은 **방향성 제거(Directional Ablation)**라는 기술을 사용했습니다.
AI의 내부 수학을 라디오 신호라고 생각해 보세요. "도덕성" 신호가 너무 크고 강력해서 "문법"이나 "경제" 신호를 압도하고 있었습니다.
- 연구진은 디지털 "지우개"를 사용하여 "도덕성" 신호만을 골라 무음 처리했습니다.
- 결과: "도덕성" 소음이 사라지자, AI는 갑자기 문법과 가격을 훨씬 더 잘 판단하게 되었습니다. AI는 자신의 도덕적 감정이 문법 검사를 망치는 것을 멈추었습니다.
이것이 의미하는 바 (논문에 따르면)
이 논문은 많은 AI 모델이 "좋음(good)"의 본질에 대해 혼란을 겪고 있다고 결론짓습니다. 그들은 "좋은 문장(문법)"과 "좋은 행동(도덕)"을 동일한 것으로 취급합니다.
- 원인: 저자들은 학습 데이터에서 "good"이라는 단어가 매우 다양한 방식으로 사용되기 때문(예: "좋은 식사", "좋은 문장", "좋은 사람")이라고 추측합니다. AI는 이 모든 "좋음"의 개념들을 하나의 크고 엉망인 덩어리로 학습한 것입니다.
- 범위: 이 현상은 많은 오픈 소스 모델(Qwen, Gemma, Mistral 등)과 일부 폐쇄형 모델에서도 발견되었습니다. 이는 단순히 모델 크기의 문제가 아니었으며, 거대 모델에서도 나타났습니다.
- 경고: 만약 AI가 문법적 오류와 도덕적 실패를 구분하지 못한다면, 이 두 가지를 엄격히 분리해야 하는 실제 업무에서 실수를 저지를 수 있습니다.
요약하자면: AI는 슬픈 이야기라면 철자가 틀려야 하고, 행복한 이야기라면 문법이 완벽해야 한다고 생각하는 판사와 같습니다. 연구진은 AI의 뇌 속에서 이러한 혼선이 일어나는 것을 발견했으며, 개념들을 "분리(un-glue)"하여 AI가 더 명확하게 생각하도록 만들 수 있음을 보여주었습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.