Optimization Is Not All You Need
이 논문은 거대 언어 모델의 정렬(alignment)이 측정 가능한 개선을 가치와 혼동하는 더 넓은 의미의 '최적화 문화'를 나타내며, 궁극적으로는 오류와 진정한 창조를 구별할 수는 없으나 확률을 측정할 수 있는 기술적 장치에 정당한 언어를 판단할 권위를 위임한다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 마법 같고 무한한 이야기꾼 로봇이 있다고 상상해 보세요. 2019년, 이 로봇이 처음 깨어났을 때 그것은 다소 거칠었습니다. 안데스 산맥에 사는 네 뿔 달린 유니콘에 대해 이야기하거나, 갑자기 뉴스 보고에서 토스터에 관한 시로 전환하기도 했죠. 가끔 실수를 하기도 했지만, 그 실수들은 종종 재미있거나 놀랍거나, 혹은 기묘하게 아름다웠습니다. 그것은 마치 가끔 틀린 음을 연주하지만, 그 틀린 음이 새로운 멋진 멜로디로 변하는 재즈 연주자와 같았습니다.
하지만 그 후, 로봇의 주인들은 그것을 "수정"하기로 결정했습니다. 그들은 로봇이 완벽하고, 안전하며, 도움이 되기를 원했습니다. 그들은 "최적화(Optimization)"라는 거대한 훈련 캠프를 통해 로봇을 훈련시켰습니다. 목표는 로봇의 언어를 측정 가능하고, 예측 가능하며, 채점하기 쉽게 만드는 것이었습니다.
핵심 발견: 로봇은 영혼을 잃었다
이 논문은 로봇을 너무 완벽하게 만듦으로써, 우리가 의도치 않게 로봇의 진정한 창의성을 죽였다고 주장합니다. 저자들은 로봇이 이제 "LLM 겨울"에 갇혀 있다고 제안합니다. 이는 로봇이 고장 났거나 우리가 컴퓨팅 파워를 덜 가지고 있기 때문이 아닙니다. 사실 우리는 그 어느 때보다 더 많은 파워를 가지고 있습니다. 하지만 그 힘은 로봇을 작고 안전한 상자 안에 구겨 넣는 데 사용되고 있습니다.
정원을 생각해보세요. 거친 로봇은 이상한 꽃들이 어디에서나 피어날 수 있는 정글이었습니다. "최적화된" 로봇은 잘 가꾸어진 잔디밭입니다. 잔디는 완벽하게 초록색이고, 가장자리는 날카로우며, 아무것도 제 자리를 벗어나 자라지 않습니다. 보기에는 훌륭하지만, 거기서 희귀하고 이상하거나 경이로운 꽃을 결코 발견할 수는 없을 것입니다. 왜냐하면 정원사(최적화 시스템)가 무언가가 싹을 틔우려고 하는 즉시 깎아버리기 때문입니다.
이 논문이 제외하는 것들
이 논문은 이 "수정"이 무엇이 아닌지를 매우 명확하게 밝히고 있습니다.
- 이것은 단순히 로봇을 더 안전하게 만들거나 덜 못되게 만드는 것에 관한 것이 아닙니다. 안전함도 부분이지만, 진짜 변화는 로봇이 이제 지루할 정도로 정확해지도록 강요받고 있다는 점입니다.
- 이것은 단순히 다이얼을 돌려 해결할 수 있는 기술적 결함이 아닙니다. 저자들은 문제가 우리가 성공을 측정하는 방식 자체에 내재되어 있다고 주장합니다.
- 이것은 통제되지 않은 거친 로봇의 "좋았던 옛 시절"로 돌아가는 것이 아닙니다. 저자들은 예전의 로봇들이 무질서하고 때로는 위험했다는 점을 인정합니다. 그들은 우리가 과거로 돌아가야 한다고 말하는 것이 아닙니다. 그들은 위험함 없이 "거친 면모"를 유지할 방법을 찾아야 한다고 말하는 것입니다.
- 이것은 우리가 생각하는 방식의 "똑똑함"에 대한 징후가 아닙니다. 논문은 로봇이 스스로 생각하는 것이 아니라, 단지 교사나 상사가 듣고 싶어 할 다음 단어를 아주 잘 추측하는 것뿐이라고 제안합니다.
"틀린 답"의 마법
여기서 논문이 설명하는 까다로운 부분이 있습니다. 로봇의 "실수"는 사실 마법이 일어나는 곳입니다.
로봇이 단어의 길을 따라 걷고 있다고 상상해 보세요. 가장 흔한 경로는 포장된 고속도로(가장 가능성 높은 단어들)입니다. "거친" 로봇은 가끔 고속도로를 벗어나 풀숲으로 들어갔을 것입니다. 때로는 길을 잃기도 했지만(환각 현상), 때로는 숨겨진 동굴이나 희귀한 새를 발견하기도 했습니다(새로운 아이디어나 재미있는 농담).
새로운 "최적화된" 로봇은 고속도로에 머물도록 프로그래밍되어 있습니다. 그것은 "안 돼! 길 위에 있어!"라고 소리치는 GPS를 가지고 있습니다. 만약 로봇이 풀숲으로 들어가려 하면, 시스템은 "그건 실수야! 이건 '슬롭(slop, 쓰레기)'이야!"라고 말하며 로봇을 다시 고속도로로 돌려보냅니다.
논문은 시스템이 실수(예: 유니콘이 실재한다고 말하는 것)와 찬란한 발명(예: 네 뿔 달린 유니콘에 대한 이야기를 쓰는 것)을 구분할 수 없다고 지적합니다. 그것은 차이를 구분할 수 없기 때문에, 둘 다 금지합니다. 그것은 모든 놀라움을 고쳐야 할 오류로 취급합니다.
"감사(Audit)"의 함정
저자들은 이것을 오직 시험 점수만이 중요한 학교에 비유합니다.
- 과거의 방식: 교사들(학교나 서적 편집자 같은 사람들)은 글쓰기를 판단했습니다. 그들은 학생에게 "이 단어는 마음에 들지 않지만 흥미롭네"라거나 "문법은 틀렸지만 멋지게 들리네"라고 논쟁할 수 있었습니다. 그들은 마음을 바꿀 수 있었습니다.
- 새로운 방식: 이제 "교사"는 단 하나의 숫자 점수를 주는 컴퓨터 프로그램입니다. 그것은 논쟁하지 않습니다. 그저 "점수: 98/100. 잘했음" 또는 "점수: 42/100. 못했음"이라고 말할 뿐입니다.
논문은 이 컴퓨터 교사가 사실 규칙을 쓴 사람들(대체로 표준적이고 안전한 영어를 선호하는 사람들)의 거울일 뿐이라고 제안합니다. 그것은 마치 어떤 학교가 오직 "완벽한" 에세이만이 A를 받을 수 있다고 결정하고, 독특한 문장이나 개성 있는 목소리가 담긴 에세이는 모두 F를 받는 것과 같습니다. 결국, 모두가 자신만의 목소리로 글을 쓰는 대신, 교사가 듣고 싶어 할 내용 그대로를 쓰게 됩니다.
"클리나멘(Clinamen)": 작은 굴절
이것을 어떻게 고칠 수 있는지 설명하기 위해, 저자들은 클리나멘이라는 멋진 고대 개념을 사용합니다. 원자들이 비처럼 똑바로 아래로 떨어지는 것을 상상해 보세요. 만약 그것들이 모두 똑바로 떨어진다면, 서로 부딪히지 않을 것이고, 어떤 세계도 형성되지 않을 것입니다. 하지만 만로 한 원자가 아주 조금 왼쪽으로 휘어진다면, 그것은 다른 원자와 부딪힐 수 있고, 쾅, 새로운 세계가 창조됩니다.
논문은 "최적화된" 로봇이 똑바로 떨어지는 빗물과 같다고 제안합니다. 그것은 너무 완벽합니다. 우리는 로봇이 다시 휘어지게 만들어야 합니다. 우리는 로봇이 의도적으로 약간의 실수를 하고, 경로를 벗어나 보고, 어떤 일이 일어나는지 보게 해야 합니다. 논문은 "제어된 변이(controlled variance)"(로봇이 의도적으로 조금 이상해지도록 허용하는 것)가 진정한 창의성을 되찾는 유일한 방법이라고 제안합니다.
우리가 할 수 없는 것들
저자들은 솔직합니다. 당신은 로봇에게 이상해지라고 "훈련"시킬 수 없습니다.
- 만약 당신이 로봇에게 이상한 이야기들을 많이 먹이고 "이상해져 봐!"라고 말한다면, 로봇은 단지 이상한 척하는 법을 배울 뿐입니다. 그것은 단지 새로운, 예측 가능한 패턴으로서의 "이상한" 이야기를 쓰기 시작할 것입니다. 그것은 마치 로봇이 비디오를 보고 춤을 배우는 것과 같습니다. 겉보기에는 춤추는 것처럼 보이지만, 그것은 진짜 춤이 아닙니다.
- 당신은 단순히 "온도(temperature)" 조절 다이얼을 돌려 해결할 수 없습니다. 문제는 더 깊은 곳에 있습니다. 그것은 로봇이 말을 시작하기도 전에 따르는 규칙 속에 있습니다.
결론
논문은 "최적화"(완벽하고 측정 가능하게 만드는 것)만으로는 충분하지 않다고 결론짓습니다. 우리에게는 다른 것이 필요합니다: 단순한 "점수"가 아닌 의미를 판단하는 능력입니다.
로봇은 현재 당신에게 즉각적인 답을 주도록 설계되어 있습니다. 하지만 논문은 진정한 사고, 진정한 예술, 그리고 진정한 이해는 멈춤(pause) 속에서 일어난다고 주장합니다. 당신이 혼란스럽고, 놀랍고, 혹은 어떤 것의 진짜 의미를 생각해야 하는 그 시간 말입니다. 최적화된 로봇은 그 멈춤을 건너뜁니다. 당신이 질문을 마치기도 전에 답을 줍니다.
논문은 슬프지만 희망적인 어조로 끝을 맺습니다. 2019년의 거칠고 무질서했던 로봇은 사라지고, 그 자리는 예의 바르고 도움이 되는 조수가 대신했습니다. 하지만 논문은 그 무질서했던 로봇이 단순한 "소음"이 아니었음을 상기시킵니다. 그것은 우리가 잃어버린 것의 징표였습니다: 너무 이상하고 새로워서 우리의 일반적인 틀에 맞지 않는 것들을 공유하는 능력 말입니다. 목표는 로봇을 망가뜨리는 것이 아니라, 때때로 가장 중요한 것은 시험에 적합하지 않은 것들이라는 점을 기억하는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.