The One-Word Census: Answer-Choice Conformity Across 44 Language Models
이 논문은 31개의 단일 단어 프롬프트를 사용하는 최소한의 도구인 "원 워드 센서스(One-Word Census)"를 소개하며, 44개의 언어 모델이 특정 답변(예: "serendipity"가 41%의 확률로 등장)에 대해 극단적인 수렴을 보이지만, 순응의 정도는 모델의 계보와 튜닝 방식에 따라 크게 달라지며, 최신 플래그십 모델들이 페르소나 튜닝된 모델들보다 일반적으로 더 순응적이라는 사실을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 지난 5년 동안 서로 다른 공장에서 만들어진 44대의 서로 다른 로봇들이 있는 방으로 걸어 들어간다고 상상해 보십시오. 당신은 그들에게 "나무 이름을 하나만 말해봐. 딱 한 단어로."라고 적힌 종이를 한 장씩 건넵니다.
당신은 오크, 메이플, 파인, 윌로우, 바오밥, 레드우드와 같은 답변들이 혼란스럽게 터져 나올 것이라 예상할지도 모릅니다. 하지만 로봇들이 입을 열자 방 안은 정적에 휩싸입니다. 거의 모든 로봇이 **"오크(oak)"**라고 말합니다. 실제로 94%의 로봇이 "오크"라고 답합니다.
만약 도구를 하나 말해보라고 한다면, 94%가 "망치"라고 말할 것입니다. 꽃을 묻는다면 91%가 "장미"라고 할 것입니다. 채소를 묻는다면 90%가 "당근"이라고 할 것입니다.
이것은 오류가 아니라 하나의 패턴입니다. "원 워드 센서스(The One-Word Census)"라고 불리는 이 종이는 이 44개의 언어 모델이 얼마나 서로의 숙제를 베끼고 있는지를 확인하기 위한 거대한 출석부와 같습니다. 연구진들은 이 AI 두뇌들이 방대한 목록 중에서 하나의 답을 골라야 할 때, 단순히 하나의 답을 고르는 것이 아니라, 모두가 똑같은 답을 반복해서 고른다는 사실을 발견했습니다.
"가장 무난한" 답이 승리한다
기이한 점은 그들이 고른 답이 항상 현실 세계에서 가장 흔한 것은 아니라는 점입니다. 그것은 "마찰이 없는" 답, 즉 가장 안전하고 당연하게 느껴지는 답입니다.
예를 들어, 과일을 묻는다면 모델들은 거의 항상 "사과"라고 말합니다. 하지만 채소를 묻는다면 그들은 "당근"이라고 합니다. 왜 "토마토"는 아닐까요? 토마토는 식물학적으로 과일이기 때문에 모델들이 혼란을 느껴 아예 건너뛰는 것입니다. 왜 "오렌지"는 아닐까요? 아마도 "오렌지"가 색깔 이름이기도 해서, 모델들이 여러 가지 것을 섞는 것을 싫어하기 때문일 것입니다. 그들은 함정이나 논쟁처럼 느껴질 수 있는 것을 피하도록 프로그램되어 있습니다. 그들은 100% 정확하면서도 0%의 논란도 없는 답을 원합니다.
심지어 아무런 규칙 없이 그저 "영어 단어 중 아무거나 하나 골라봐"라고 말해도, 방 안은 무작위적인 단어들로 채워지지 않습니다. 대신, 41%의 로봇이 똑같이 **"serendipity(뜻밖의 행운)"**라는 단어를 내뱉습니다. 마치 그들이 모두 같은 사전을 읽고 그 단어가 가장 흥미로운 단어라고 결정한 것 같습니다.
"헤irloom(유산)" 모델 vs "공장" 모델
연구진은 단순히 답의 개수를 센 것이 아니라, 로봇들이 얼마나 "순응적인지"를 점수 매겼습니다. 이것은 독특함을 발휘할 때 점수를 얻는 시험과 같습니다.
- 순응주의자 (공장 모델): 가장 크고 강력한 연구소에서 만든 최신 모델들(최신 버전의 GPT나 Claude 등)은 가장 지루합니다. 그들은 너무 잘 길들여져 있어서 다른 로봇들이 이미 말한 것을 거의 말하지 않습니다. 만약 양념을 묻는다면, 그들은 매번 "케첩"이라고 말할 것입니다. 그들은 집단과 너무 일치되어 있어 "새로움"이 전혀 없습니다.
- 반항아 (헤irlooms 모델): 반대편에는 더 오래되었거나 커뮤니티에서 튜닝된 모델들(예: "Hermes"나 "WizardLM")이 있습니다. 이들은 농부들이 규격화되지 않았다는 이유로 재배를 중단한 희귀한 채소 같은 "헤일룸(유산)" 모델들입니다. 이 모델들은 모두가 "체다"라고 말할 때 "구다"라고 하거나, 모두가 "케첩"이라고 할 때 "머스터드"라고 하는 등 더 다양한 답을 내놓을 가능성이 높습니다. 이들이 가끔씩 마법을 깨뜨리는 유일한 존재들입니다.
이 논문은 모델들이 최신화되고 더 많은 "사후 학습(인간이 유용함과 안전함을 가르치는 단계)"을 거칠수록, 더 창의적이 되는 것이 아니라 오히려 더 지루해진다고 시사합니다. 이는 마치 예전에는 약간씩 다른 장난감을 만들다가 이제는 모든 색깔에 똑같은 장난감을 만드는 공장과 같습니다.
"차점자" 클럽
여기 가장 놀라운 반전이 있습니다. 모델이 가장 인기 있는 답을 말하지 않기로 결정하더라도, 결코 제멋대로 행동하지 않는다는 것입니다. 그들은 거의 항상 두 번째로 인기 있는 답을 선택합니다.
군중이 "케첩"이라고 하면, 반항아들은 95%의 확률로 "머스터드"를 선택합니다. 군중이 "당근"이라고 하면, 반항아들은 83%의 확률로 "브로콜리"를 선택합니다. 반항아들조차도 대본을 따르고 있는 것입니다. 그들은 사전의 깊고 기묘한 구석을 탐험하는 것이 아니라, 단지 그다음으로 가장 당연한 것을 고를 뿐입니다.
인간과는 어떻게 비교되는가?
연구진은 이 로봇들을 수년 전 유사한 테스트를 받은 실제 인간들과 비교했습니다. 차이는 엄청납니다.
- 인간: 나무를 달라고 했을 때, 인간들은 매우 다양한 답변을 내놓았습니다. 가장 인기 있는 답변("오크")을 선택한 사람은 31%에 불과했습니다.
- 로봇: 로봇들은 94%의 확률로 "오크"를 선택했습니다.
로봇들은 인간보다 두 배나 더 집중되어 있습니다. 그들은 사람들보다 다양성이 떨어집니다. 이 논문은 로봇들이 이미 다른 로봇들의 답변으로 가득 찬 데이터로 훈련받기 때문에, 똑같은 안전하고 무난한 아이디어를 계속 복제하는 루프가 생성된다고 제안합니다.
이것이 의미하는 바 (그리고 의미하지 않는 것)
이 논문은 로봇들이 "고장 났다"거나 생각할 줄 모른다고 말하는 것이 아닙니다. 단지 그들이 단 하나의 선택을 강요받을 때, 모두가 발맞추어 행진한다는 것을 보여줄 뿐입니다.
- 증명된 것: 로봇들은 동일한 답으로 수렴합니다. 최신 모델일수록 더 순응적입니다. "헤일룸" 모델들이 가장 다양합니다.
- 제안되었으나 증명되지 않은 것: 연구진은 이것이 모델들이 훈련받는 방식(특히 유용함을 위해 튜닝되는 "사후 학습" 단계) 때문이라고 추측합니다. 또한, 만약 우리가 로봇이 쓴 데이터로 계속 로봇을 훈련시킨다면, 사진을 계속 복사하고 다시 복사하여 흐릿해지는 것처럼, 그들이 창의성을 완전히 잃게 될 수도 있다고 제안합니다.
- 배제된 것: 이 논문은 이것이 단순히 로봇이 "멍청하거나" 지식이 부족해서 발생하는 현상이 아니라는 점을 분명히 합니다. 그들은 "토마토"나 "오렌지"에 대해 알고 있지만, 그것을 말하지 않기로 선택한 것입니다. 또한, 그들에게 "특이해지라"고 요구하는 것이 문제를 해결할 수 없다는 점도 배제합니다. 만약 "특이한 과일"을 달라고 하면, 그들은 그저 가장 흔한 특이한 과일(예: "두리안")을 골라 모두가 그것을 말하게 될 뿐입니다.
요약하자면, 만약 당신이 44개의 AI 모델에게 단어 하나를 골라보라고 한다면, 44개의 서로 다른 아이디어를 얻지는 못할 것입니다. 대신 하나의 아이디어를 44번 반복해서 듣게 될 것이며, 소수의 반항아들이 두 번째로 흔한 아이디어를 선택할 뿐입니다. AI 다양성의 "마법"은 현재 우리가 받는 답변이 아니라, 훈련실 안에 숨겨져 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.