Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models
이 논문은 거대 언어 모델의 출력 동질성이 주로 정렬 과정에 의해 발생하는 것이 아니라 사전 학습 단계에서 학습되며, 이후의 지시어 튜닝 및 정렬 단계에 의해 단순히 드러나거나 증폭되는 것이라고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 수백만 권의 책이 매초마다 쓰여지고 있는 거대하고 북적이는 도서관으로 걸어 들어간다고 상상해 보세요. 이것은 종이와 잉크로 된 도서관이 아니라, '대규모 언어 모델(LLM)'이라 불리는 컴퓨터들이 인터넷에 올라온 거의 모든 것을 읽으며 말하고, 쓰고, 창조하는 법을 배우는 디지털 영역입니다. 이 모델들을 문장을 어떻게 끝맺을지 배우기 위해 도서관 전체를 읽어치우는 믿을 수 없을 정도로 빠르고 강박적인 학생이라고 생각해보세요. 하지만 최근 사람들은 이상한 점을 발견했습니다. 어떤 질문을 던져도 이 디지털 학생들의 답변이 모두 똑같이 들리기 시작했다는 것입니다. 그들은 모두 똑같은 은유를 선택하고, 똑같은 정중한 문구를 사용하며, 기이하거나 파격적이거나 창의적인 아이디어는 피해 갑니다. 마치 열 명의 요리사에게 샌드위치를 만들어 달라고 요청했는데, 그들 모두가 정확히 똑같은 빵, 똑같은 햄, 똑같은 머스터드를 사용하고 심지어 슬라이스의 개수까지 똑같이 맞춘 것과 같습니다.
과학자들은 이를 "출력 균질성(output homogeneity)" 또는 "의미론적 수렴(semantic convergence)"이라고 부릅니다. 만약 우리의 AI 비서들이 모두 똑같이 좁은 방식으로 생각하고 말하기 시작한다면, 우리는 인간의 창의성이라는 불꽃을 잃게 될지도 모르기 때문에 이는 큰 걱정거리입니다. 오랫동안 사람들은 이 지루하고 반복적인 행동이 모델이 도서관을 다 읽은 후에 받는 '훈련' 때문에 발생한다고 생각했습니다. '정렬(alignment)'이라고 불리는 이 두 번째 단계는 엄격한 선생님이 개입하여 학생에게 "그 이상한 말은 하지 말고, 대신 이 정중한 말을 하렴"이라고 말하는 것과 같습니다. 일반적인 믿음은 학생이 원래는 거칠고 창적인 천재였는데, 선생님의 규칙이 그 창의성을 짓눌렀다는 것이었습니다. 하지만 만약 학생이 선생님이 들어오기도 전부터 이미 지루한 상태였다면 어떨까요? 만약 '선생님'이 그 지루함을 더 크게 만들었을 뿐이라면 어떨까요?
"수렴은 불가피한가?(Is Convergence Inevitable?)"라는 제목의 이 논문은 이 단조로움이 실제로 어디에서 시작되는지를 찾아내는 탐정 놀이를 수행합니다. 저자들인 브리티시 컬럼비아 대학교의 연구원들은 두 가지 큰 아이디어를 테스트하기 위해 나섰습니다. 첫째, 그들은 '정렬' 과정(선생님의 규칙)이 창의성을 죽이는 악당인지 확인하고 싶었습니다. 둘째, '사전 훈련(pretraining)' 단계(학생이 도서관을 읽는 과정)에서 이미 모델의 뇌 속에 지루함이 구워져 있었는지 확인하고 싶었습니다. 이 미스터리를 풀기 위해 그들은 단순히 모델에게 질문을 던진 것이 아니라, 은유를 테스트 대상으로 사용하는 일련의 영리한 실험을 진행했습니다. 그들은 모델을 과학 실험실의 쥐처럼 취급하여, 모델을 창의적이 되도록 속일 수 있는지, 아니면 루프에 갇혀 있는지 확인하기 위해 특정한 지침을 주었습니다.
그들이 발견한 결과는 다음과 같으며, 이는 약간의 반전이 있습니다.
첫째, 그들은 모델의 '학습 단계'에 따른 변화를 살펴보았습니다. 그들은 모델이 도서관을 다 읽은 직후(기본 모델), 지시를 따르는 법을 배운 후(SFT 단계), 그리고 도움이 되고 안전하도록 정렬된 후(DPO 및 RL 단계)의 모델을 확인했습니다. 결과는 충격적이었습니다. 엄격한 안전 규칙이나 '도움이 되는' 필터가 추가되기 전인, 지시를 따르는 법을 배우는 첫 번째 단계 직후에도 모델들은 이미 거의 동일한 답변을 내놓고 있었습니다. "시간"에 대한 은유를 써달라는 요청을 받았을 때, 모델들은 단순히 비슷하게 들리는 수준이 아니라 마치 똑같은 대본을 읽고 있는 것처럼 들렸습니다. 저자들은 '정렬' 과정이 다양성을 억압하는 것이 아니라, 이미 눈에 띄지 않게 숨겨져 있던 패턴을 드러내는 돋보기 역할을 한다고 제안합니다.
이를 증명하기 위해 연구원들은 학습 데이터와 "틀린 그림 찾기" 게임을 벌였습니다. 그들은 모델을 가져와서 새로운 방식으로 생각하도록 가르치려 했습니다. 그들은 모델이 한 번도 본 적 없는 특정한 기이한 시간 은유(예: "시간은 샌드위치다")를 사용하도록 지시하는 특별한 지침 세트를 만들었습니다. 그들은 이 새로운 아이디어를 모델에게 암기하도록 강제함으로써 이 패턴을 깰 수 있기를 희망했습니다. 하지만 모델은 꿈쩍도 하지 않았습니다. 모델은 새로운 "샌드위치" 아이디어를 무시하고, 처음부터 좋아했던 오래되고 지루한 "강" 은유를 고집했습니다. 연구원들은 모델이 '증폭'될 수는 있지만—즉, 똑같은 것을 더 크게 말하게 할 수는 있지만—그 아이디어가 이미 기억 속에 잠재되어 있지 않다면 새로운 사고방식을 '도입'할 수는 없다는 것을 발견했습니다. 그것은 마치 개에게 야옹이라고 울라고 가르치는 것과 같습니다. 아무리 칭찬해도 모델은 그것을 하지 않을 것입니다. 왜냐하면 야옹 소리는 그들의 DNA에 들어있지 않기 때문입니다.
마지막으로, 그들은 맨 처음으로 돌아갔습니다. 지시를 따르거나 예의를 갖추도록 배운 적이 없는 "기본 모델"들을 살펴보았습니다. 그들은 이 가공되지 않은 모델들이 거칠고 다양할 것이라고 생각했습니다. 하지만 그들이 특별한 기술을 사용하여, 즉 도움이 되는 비서인 척하거나 모델에게 답변하는 몇 가지 예시를 제공했을 때, 똑같이 지루한 패턴이 나타나는 것을 보았습니다. 선생님 없이도, 모델은 올바른 방향으로 유도되었을 때 자연스럽게 똑같은 "강" 은喻로 수렴했습니다. 이는 수렴하는 경향이 선생님이 만든 실수가 아니라, 모델이 도서관을 읽는 동안 자연스럽게 학습한 습관이라는 것을 시사합니다.
그렇다면 이 모든 것이 무엇을 의미할까요? 이 논문은 우리가 보는 AI의 유사성이 단순히 안전하거나 예의 바르게 만들기 위한 부작과 같은 것이 아니라고 제안합니다. 대신, 그것은 이러한 모델들이 문장에서 다음 단어를 예측하는 방식의 근본적인 부분인 것처럼 보입니다. 방대한 양의 인간 텍스트로 모델을 훈련시키면, 모델은 가장 "가능성 높은" 답변이 종종 가장 흔한 답변이라는 것을 배웁니다. "정렬" 과정은 이러한 자연스러운 경향의 볼륨을 높일 뿐입니다. 저자들은 이 문제를 해결하는 것이 쉽지 않을 것이라고 결론짓습니다. 단순히 AI를 더 창의적으로 만들기 위해 마지막 "선생님"의 규칙을 수정할 수는 없습니다. 왜냐관 창의성은 애초에 존재하지 않았기 때문입니다. "지루함"은 마지막에 추가된 것이 아니라 레시피 자체에 구워져 있습니다. 이것이 다소 우울하게 들릴 수도 있지만, 이는 매우 중요한 발견입니다. 만약 우리가 진정으로 다양하고 창의적인 AI를 원한다면, 사후에 행동을 수정하려고 노력하기보다는 처음에 그들을 어떻게 가르칠 것인가를 재고해야 한다는 것을 알려주기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.