Synthetic Persona Pretraining: Alignment from Token Zero
이 논문은 가치 정렬된 1인칭 성찰을 사전 학습 단계에 직접 임베딩하여 토큰 제로(token zero)부터 원하는 어시스턴트 페르소나를 설치하는 방법인 합성 페르소나 사전 학습(Synthetic Persona Pretraining, SPP)을 소개하며, 이러한 조기 개입이 사후 학습 정렬 방식에 비해 헌법 준수, 탈옥 강건성 및 도덕적 정렬을 유의미하게 향상시킨다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아이를 키운다고 상상해 보십시오. 당신은 아이가 십 대가 될 때까지 기다렸다가 자리를 잡고 앉아 이렇게 말할 수도 있습니다. "자, 이제 말하는 법을 배웠으니, 이제 규칙을 알려줄게. 친절해야 하고, 진실을 말해야 하며, 남에게 상처를 주어서는 안 돼." 또는, 아이가 첫 단어를 배우는 그 순간부터 그 가치들을 가르치기 시작하여, 아이가 성장하는 동안 들려주는 모든 이야기에 그 가치들을 녹여낼 수도 있습니다. 이것이 인공지능을 만드는 과학자들이 직면한 핵심적인 딜레마입니다.
AI 모델은 인터넷의 수십억 페이지의 텍스트를 읽으며 학습하는 디지털 아이와 같습니다. 이 초기 학습 단계를 "사전 학습(pretraining)"이라고 합니다. 이 기간 동안 AI는 사실, 글쓰기 스타일, 그리고 인간이 서로 대화하는 방식을 흡수합니다. 그러나 도움이 되고 안전한 어시스턴트가 되기 위한 "규칙"은 보통 이 거대한 학습 단계가 끝난 후, "사후 학습(post-training)"이라는 별도의 단계에서 추가됩니다. 문제는 AI가 인터넷을 다 읽고 났을 때, 이미 그곳에서 발견한 것들에 기반하여 형성된 성격을 갖게 된다는 점입니다. 완성된 성격 위에 새로운 규칙을 강요하는 것은, 무례함을 배운 십 대에게 예의 바르게 행동하라고 가르치는 것과 같습니다. 그것은 종종 지저도한 벽 위에 얇게 칠해진 페인트처럼 느껴지며, 오래된 습관이 쉽게 뚫고 나올 수 있습니다.
"Synthetic Persona Pretraining: Alignment from Token Zero"라는 제목의 이 논문은 우리의 AI 아이들을 키우는 다른 방법을 제안합니다. 연구진은 원하는 페르소나와 가치를 학습의 아주 첫 순간, 즉 그들이 말하는 "토큰 제로(token zero)"부터 설치할 것을 제 제안합니다. AI가 말을 배우는 동안 나중에 고치려고 기다리는 대신, AI가 말을 배우는 바로 그 시점에 "착한 어시스턴트"를 그 뇌 속에 구축하고자 하는 것입니다.
실험: 헌법을 가진 디지털 아이 키우기
연구진(EPFL 및 여러 대학의 팀)은 이 "모델 키우기(Model Raising)" 아이디어를 테스트하기로 했습니다. 그들은 **합성 페르소나 사전 학습(Synthetic Persona Pretraining, SPP)**이라는 새로운 방법을 만들었습니다. 그들이 이 방법을 수행한 방식은 다음과 같은 간단한 비유를 통해 설명할 수 있습니다.
AI가 도서관의 책들을 읽으며 학습하고 있다고 상상해 보십시오. 기존 방식에서는 AI가 그냥 책을 읽습니다. 새로운 방식에서는 연구진이 그 책들의 약 10%에 대해 매 몇 단락마다 특별한 "생각 풍선"을 추가했습니다. 이 생각 풍선 안에서 AI의 미래 페르소나(가칭 "카토(Cato)")는 방금 읽은 내용에 대해 잠시 멈춰 생각하며, "음, 이 범죄에 관한 이야기는 슬프다. 그리고 나의 규칙에 따르면 나는 폭력을 조장해서는 안 된다"라거나 "이 기술 매뉴얼은 지루하지만 유용하다"와 같이 말할 것입니다.
그들은 단순히 이러한 생각을 추가한 것이 아니라, AI가 스스로 그러한 생각을 생성하도록 학습시켰습니다. 그들은 모델이 원래의 텍스트와 이 새로운 "성찰" 생각을 모두 학습하도록 훈련했습니다. 그들은 두 가지 방식으로 이를 수행했습니다:
- 토큰 제로 (The "From Birth" 접근 방식): 이 성찰 과정을 학습의 첫 번째 순간부터 마지막 순간까지 전체 과정에 걸쳐 뿌려 놓았습니다.
- 미드트레이닝 (The "Teenager" 접근 방식): AI가 이미 대부분의 책을 읽을 때까지 기다렸다가 학습 단계의 맨 마지막에만 성찰을 추가했습니다.
또한 그들은 책을 정상적으로 읽기만 하는 대조군(Vanilla)과, 나쁜 책들은 제거했지만 성찰은 없는 그룹(Filtered)도 두었습니다.
결과: 일찍 시작하는 것의 힘
결과는 매우 흥 \미로웠으며, AI에게 무엇을 가르치느냐만큼 언제 가르치느냐가 중요하다는 것을 시사했습니다.
1. "태어날 때부터" 학습한 AI는 가치 판단에 더 똑똑했습니다.
학습 시작부터 성찰을 경험한 모델들(Token Zero)은 자신들의 "헌법"(따라야 할 규칙 세트)을 훨씬 더 잘 준수했습니다. 연구진이 AI가 한 번도 본 적 없는 까다로운 도덕적 딜레마 상황에서 테스트했을 때, Token Zero 모델들은 규칙에 더 부합하는 선택을 내렸습니다. 그들은 단순히 규칙을 암기한 것이 아니라, 규칙의 정신을 이해하는 것처럼 보였습니다.
- 수치: "ConstitutionEval"이라는 테스트에서, Token Zero 모델들은 약 **67%**의 정답률을 보인 반면, 마지막에 성찰을 받은 모델들(Midtraining)은 약 **56%**의 정답률만을 보였습니다.
- 놀라운 점: Token Zero 모델들은 실제로 우선순위를 바꾸었습니다. 그들은 "창의성"이나 "학습"을 선호했던 다른 모델들과 달리, "진실성"과 "정의"를 훨씬 더 중요하게 여기기 시작했습니다. 이는 일찍 시작하는 것이 단순히 규칙을 더하는 것을 넘어, AI가 세상을 생각하는 방식을 재형성했음을 시사합니다.
2. "십 대" 접근 방식은 일부 항목에는 괜찮았지만, 전부는 아니었습니다.
흥미롭게도, 목표가 단순히 AI가 "탈옥(jailbroken)"되는 것(나쁜 짓을 하도록 속는 것)을 막는 것이라면, Midtraining 방식도 Token Zero 방식만큼이나 잘 작동했습니다. "그것을 하지 마라"와 같은 단순한 거부 반응을 위해서는 늦게 가르쳐도 된다는 것을 시사합니다. 하지만 깊고 복럽한 도덕적 추론을 위해서는 정말로 첫날부터 시작해야 합니다.
3. 더 큰 뇌일수록 더 큰 이득이 있었습니다.
연구진은 이 실험을 두 가지 크기의 AI, 즉 작은 모델(17억 파라미터)과 큰 모델(30억 파라미터)을 대상으로 테스트했습니다. 그들은 일찍 시작하는 것의 이점이 AI가 커지고 똑똑해질수록 더욱 중요해진다는 것을 발견했습니다. 가장 어려운 테스트에서, "태어날 때부터" 학습한 AI와 "십 대" 방식 AI 사이의 격차는 규모가 커짐에 따라 두 배로 벌어졌습니다. 이는 미래의 거대하고 초지능적인 AI들에게 있어, 올바른 가치관을 가지고 시작하는 것이 훨씬 더 결정적일 것임을 시사합니다.
4. "접착제"가 중요합니다.
한 가지 주의할 점이 있었습니다. 연구진은 이러한 초기 가치들이 학습의 마지막 단계(AI가 인간과 대화하는 법을 배우는 단계)가 이전에 구축한 페르소나와 일치할 때만 유지된다는 것을 발견했습니다. 그들은 이를 "페르소나 결합(persona binding)"이라고 불렀습니다. 만약 학습 단계에서는 특정 종류의 어시스턴트가 되도록 훈련했는데, 대화 단계에서는 완전히 다른 종류의 어시스턴트가 되도록 가르친다면, 초기 가치들은 희미해지기 시작합니다. 이는 아이에게 의사가 되라고 가르쳤는데, 그 후에 미술 학교로 보내는 것과 같습니다. 아이는 의학 규칙을 잊어버릴 수 있습니다. 그러나 이 "접착제"가 유지될 때, 가치들은 놀라울 정도로 강력했으며, 연구진이 까다로운 테스트로 이를 깨뜨리려 할 때도 살아남았습니다.
이것이 왜 중요한가
이 논문은 우리가 AI가 인터넷으로부터 모든 것을 배운 후에 그것을 "고치려고" 노력하는 것이 실수를 범하고 있을지도 모른다고 제안합니다. 저자들은 가치란 완성된 제품 위에 덧붙이기 어려운 것이라고 주장합니다. 대신, 우리는 AI가 처리하는 첫 번째 토큰부터 올바른 가치와 함께 "키워야" 합니다.
결과가 유망하기는 하지만, 연구진은 이것이 시작일 뿐이라고 신중하게 말합니다. 그들은 오늘날 빅테크 기업들이 사용하는 거대한 모델들에 비해 상대적으로 작은 모델(30억 파라미터)을 대상으로 테스트했습니다. 그들은 더 크고 똑똑한 모델을 구축함에 따라, 올바른 가치관을 가지고 일찍 시작하는 것의 이점이 훨씬 더 강력해질 것이라고 제안합니다. 또한, 초기 가치들이 강력하긴 했지만 특정 유형의 후속 학습에 의해 약화될 수 있다는 점을 언급하며, 우리가 디지털 아이들을 어떻게 마무리하여 키울지에 대해서도 여전히 주의가 필요하다고 밝혔습니다.
요약하자면, 우리가 진정으로 안전하고 도움이 되는 AI를 원한다면, AI가 다 자랄 때까지 기다려 옳고 그름을 가르쳐서는 안 됩니다. 우리는 AI가 말을 배우는 동안 그 가치를 가르쳐야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.