Toward a Theory of Value in AI Alignment
94편의 가치 정렬 연구 논문을 분석함으로써, 본 연구는 정의되지 않은 선호도와 합성 데이터에 의존하는 해당 분야를 비판하며, 이러한 접근 방식이 인간의 가치를 지나치게 단순화하고 AI가 진정으로 인간의 필요에 어떻게 부합할 수 있는지에 대한 다양한 관점을 차단할 위험이 있다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
우리가 디지털 지능—이야기를 쓰고, 수학 문제를 풀고, 심지어 대화까지 나눌 수 있는 초지능적인 컴퓨터 프로그램—을 만들고 있는 세상을 상상해 보세요. 이것들은 단순한 계산기가 아닙니다. 마치 인터넷에 있는 거의 모든 것을 읽은 거대하고 배고픈 도서관과 같습니다. 하지만 여기 함정이 있습니다. 도서관이 모든 책을 읽었다고 해서 어떤 이야기가 친절한지, 어떤 사실이 진실인지, 혹은 어떻게 좋은 친구가 되는지를 안다는 뜻은 아닙니다. 이것이 바로 **AI 정렬(AI Alignment)**이라고 불리는 분야의 핵심입니다. 이것은 디지털 지능이 우리에게 의도치 않게 해를 끼치는 방식으로 우리가 시키는 일을 그대로 수행하는 것이 아니라, 우리의 목표와 도덕을 공유하도록 가르치는 기술이라고 생각하면 됩니다.
이 문제를 이해하려면 **대규모 언语言 모델(LLM)**을 알아야 합니다. 이것들은 여러분이 사용해 보았을지도 모르는 챗봇을 구동하는 특정 유형의 AI입니다. 이들은 문장에서 다음 단어를 반복해서 예측함으로써 작동합니다. 이들을 "안전"하게 만들기 위해 연구자들은 **인간 피드백으로부터의 강화 학습(RLHF)**이라는 기술을 사용합니다. 학생에게 좋은 답에는 금색 별을 주고, 나쁜 답에는 빨간색 X를 주는 선생님을 상상해 보세요. AI는 선생님이 무엇을 좋아하는지 추측함으로써 더 많은 금색 별을 얻는 법을 배웁니다. 이 논문이 던지는 핵심 질문은 이것입니다. 우리는 이 AI들에게 정확히 무엇을 가치 있게 여기라고 가르치고 있는 걸까요? 우리는 그들이 도움이 되고, 정직하며, 해롭지 않도록 가르치고 있는 걸까요? 아니 아니면 우리는 실수로 훨씬 더 이상한 무언가를 가르치고 있는 걸까요?
거대한 "가치" 혼동
한 연구팀이 이 정렬 문제를 해결하려는 사람들이 쓴 94편의 과학 논문을 들여다보기로 했습니다. 그들은 단순하지만 까다로운 질문에 답하고자 했습니다. "이 연구자들이 '인간의 가치'라고 말할 때 실제로 의미하는 바가 무엇인가?"
여러분은 만약 로봇이 좋은 사람이 되도록 만든다면, 먼저 '선함'이 무엇인지 정의하기 위해 자리에 앉을 것이라고 생각할지도 모릅니다. 하지만 이 논문의 저자들은 놀라운 사실을 발견했습니다. 대부분의 연구자는 그것을 전혀 정의하지 않는다는 것입니다.
실제로 그들이 살펴본 논문의 **79%**는 "가치"라는 말이 무엇을 의미하는지 전혀 설명하지 않았습니다. 대신 그들은 "가치"라는 단어를 "선호(preferences)"라는 단어로 바꾸어 사용했습니다. 이것은 케이크를 만들면서 "밀가루"를 "물건"이라고 부르고는, 모두가 그것이 밀가루를 의미한다는 것을 당연히 알 것이라고 가정하는 것과 같습니다. 연구자들은 AI의 세계에서 "가치"(정의, 친절, 또는 진실 등)가 종종 "선호"(예: "나는 바닐라보다 초콜릿 아이스크림을 선호한다")와 똑같이 취급된다는 것을 발견했습니다.
"선호"의 함정
논문은 이러한 교체가 위험하다고 주장하는데, 왜냐하면 이것이 경제학의 오래된 개념인 **효용 극대화(Utility Maximization)**에 의존하기 때문입니다. 우주에서 가장 중요한 것은 게임에서 가장 높은 점수를 얻는 것이라고 생각하는 로봇을 상상해 보세요. 이 관점에서 인간은 단지 모든 선택을 할 때마다 최대한 많은 "점수"(또는 "효용")를 얻으려고 노력하는 기계일 뿐입니다.
저자들은 이 관점이 너무 단순하다고 제안합니다. 실제 인간은 복잡합니다. 때때로 우리는 피곤해서, 혹은 승리보다 친구를 더 아끼기 때문에, 또는 그날의 기분에 따라 가치가 변하기 때문에 "잘못된" 것을 선택하기도 합니다. 하지만 AI 정렬 분야는 인간을 항상 최선의 행복을 극대화하는 완벽하고 논리적인 로봇으로 간주하는 세상을 구축하고 있는 듯합니다.
논문은 그들이 검토한 연구의 **87%**가 이 "점수 극대화" 접근 방식을 사용한다고 지적합니다. 그들은 인간의 가치를 컴퓨터에 입력할 수 있는 정적이고 변하지 않는 숫자로 취급합니다. 저자들은 이것이 가치가 실제로 살아있는 정원과 같다는 사실을 무시하고 있다고 주장합니다. 가치는 계절에 따라 자라고 변하며, 문화마다 다르게 보입니다.
"누구"와 "어떻게"의 문제
논문이 강조하는 또 다른 큰 문제는 AI가 배우고 있는 가치가 누구의 가치인가 하는 문제입니다. 만약 당신이 컴퓨터에게 "인간의 가치"를 배우라고 요청한다면, 다음과 같이 물어야 합니다. "어떤 인간의 가치인가?"
연구자들은 **91%**의 논문이 자신들이 대표하고자 하는 사람들이 누구인지 명시하지 않았다는 것을 발견했습니다. 그들은 마치 "인간의 가치"가 모든 사람이 동의하는 단일하고 보편적인 것인 양 행동했습니다. 하지만 현실에서 도쿄의 십 대 청소년은 케냐의 농부와는 매우 다른 것을 가치 있게 여길 수 있습니다.
상황을 더 혼란스럽게 만드는 것은, 연구자들이 실제 인간에게 의견을 묻는 것을 그만두기 시작했다는 점입니다. 대신 그들은 **합성 데이터(synthetic data)**나 다른 AI 모델을 사용하여 답변을 판단합니다. 이것은 마치 새로운 학생에게 자기 숙제를 스스로 채점하게 하거나, 로봇에게 인간이 어떻게 생각할지 추측하게 하여 학생을 가르치는 것과 같습니다. 저자들은 "자동 평가자(autoraters)"(AI 판사)로 실제 사람을 대체함으로써, 인간이라는 존재의 복잡하고 다양하며 아름다운 현실로 향하는 문을 닫아버리고 있다고 우려합니다.
"얇은" 묘사와 "두꺼운" 묘사
저자들은 또한 대부분의 논문이 가치를 "얇은(thin)" 방식으로 설명한다는 점에 주목했습니다. "얇은" 묘사는 "친절하게 행동하라"라고 말하는 것과 같습니다. 이야기가 없는 규칙입니다. "두꺼운(thick)" 묘사는 "친절함이 공동체를 형성하고 모두가 안전하다고 느끼게 한다는 것을 네 할머니가 가르쳐 주셨기에 친절하게 행동하라"라고 말하는 것과 같습니다.
논문에 따르면 **66%**의 연구가 이러한 "얇은" 묘사를 사용했습니다. 그들은 가치를 깊은 문화적 이야기로서가 아니라, 단순히 따라야 할 지침으로 취급했습니다. 문화와 맥락이 사람들의 가치관을 어떻게 형성하는지, 즉 가치의 깊은 "두꺼운" 방식을 이해하려고 시도한 논문은 단 **3%**뿐이었습니다.
결론
그렇다면 핵심적인 결론은 무엇일까요? 논문은 현재 우리가 AI를 인간의 가치에 정렬시키려는 방식이 불안정한 토대 위에 세워져 있다고 제안합니다. 복잡한 인간의 도덕을 단순한 수학 문제(선호의 극대화)로 취급함으로써, 우리는 기술적으로는 "정렬"되어 있을지 몰라도 매우 좁고 로봇 같은 버전의 인류에 맞춰진 AI 시스템을 만들고 있으며, 결과적으로 인간다움의 본질을 완전히 놓칠 수도 있다는 것입니다.
저자들은 우리가 AI를 안전하게 만드는 노력을 멈춰야 한다고 말하는 것이 아닙니다. 대신, 레시피의 변화를 요구하고 있습니다. 그들은 연구자들이 인간의 가치를 단순히 최적화해야 할 선호 목록인 것처럼 가장하는 것을 멈추기를 바랍니다. 그들은 인류학, 철학, 심리학 전문가들을 영입하여 가치가 역동적이고 문화적이며, 우리가 사는 실제의 복잡한 세상과 깊게 연결되어 있다는 점을 이해해야 한다고 주장합니다.
요컨대, 만약 우리가 AI를 진정으로 우리와 정렬시키고 싶다면, AI에게 완벽한 계산기가 되는 법을 가르치는 것을 멈추고, 인간으로서 살아가는 복잡하고 변화하며 경이로운 이야기를 이해하도록 가르치기 시작해야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.