Language Models Agree With Each Other, Not With Readers
이 논문은 거대 언어 모델들이 인간 독자보다 서로 간에 현저히 높은 내부적 일치성을 보인다는 점을 입증하며, 이는 모델의 출력이 진정한 인간의 합의를 반영하기보다는 그들의 학습과 구조에 의해 균질화되었음을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대한 AI 에코 체임버 vs. 조용한 독자
당신이 정체불명의 보이지 않는 책이 무엇에 관한 것인지 맞히려는 사람들로 가득 찬 방에 있다고 상치해 보십시오. 만약 당신이 인간 그룹에게 한 페이지를 읽고 가장 중요한 문장에 형광펜을 칠하라고 요청한다면, 당신은 무질서하고 아름다운 혼돈을 보게 될 것입니다. 어떤 사람은 재미있는 농담에 표시를 하고, 다른 사람은 슬픈 사실에 표시를 하며, 세 번째 사람은 자신이 좋아하는 단어에 동그라미를 칩니다. 그들은 모두 자신만의 이유로 읽고 있으며, 지침도, 상도, 무엇이 "중요한지" 알려주는 사람도 없습니다. 이것이 실제 독서가 작동하는 방식입니다. 즉, 개인적이고, 무질서하며, 의견 불일치로 가득 차 있습니다.
이제 그 인간들을 인터넷이라는 거대한 도서관을 학습한 똑똑한 컴퓨터 군단으로 바꾼다고 상상해 보십시오. 당신은 그들에게 정확히 똑같은 질문을 던집니다: "이 이야기에서 어떤 문장이 중요한가?" 당신은 그들이 인간처럼 똑같이 무질서하거나, 혹은 서로 다른 기계이기 때문에 오히려 더 다양할 것이라고 예상할 수도 있습니다. 하지만 여기 반전이 있습니다. 이 컴퓨터들은 서로 똑같이 말하기 시작합니다. 그들은 모두 같은 문장을 선택하며, 어떤 인간 집단도 도달하지 못하는 수준의 일치도를 보여줍니다. 이 논문은 이 기이한 현상을 조사합니다. 이 논문은 묻습니다: 이 AI 모델들은 단순히 서로를 복제하고 있는 것인가, 아니-면면 이들이 어떻게 하나의 "정답"인 독법을 결정하게 된 것인가? 그리고 만약 그들이 서로 이토록 많이 동의한다면, 과연 우리와도 동의하는가?
실험: 하이라이트 전투
답을 찾기 위해 연구진은 독특한 게임을 설정했습니다. 피실험자처럼 행동하도록 사람을 고용하거나 규칙을 따르도록 돈을 지불하지 않았습니다. 대신, 수천 명의 일반 사람들이 각자의 개인적인 이유로—아마도 사실을 기억하기 위해, 친구의 말을 인용하기 위해, 혹은 단지 문장이 마음에 들어서—120개의 다양한 웹 기사에 텍고를 하이라이트 했던 실제 소셜 플랫폼을 살펴보았습니다. 결정적으로, 이 독자들은 서로의 하이라이트를 볼 수 없었습니다. 즉, 그들은 완전히 고립된 상태에서 읽고 있었습니다.
그런 그 후, 연구진은 18개의 서로 다른 AI 모델(OpenAI, Google, Anthropic과 같은 대기업의 모델들로, 작은 모델부터 매우 강력한 "프런티어" 모델까지 포함)에게 동일한 120개의 기사를 읽게 하고, 가장 중요해 보이는 상위 20%의 문장을 골라내라고 요청했습니다. 그들은 AI들이 서로 얼마나 동의하는지, 그리고 실제 인간들이 서로 얼마나 동의하는지를 비교했습니다.
거대한 발견: AI는 절친이다 (하지만 당신과는 아니다)
결과는 놀라웠습니다. 두 개의 서로 다른 AI 모델이 동일한 기사를 읽었을 때, 그들은 두 명의 무작위 인간 독자가 서로 동의하는 것보다 2.3배 더 많이 어떤 문장이 중요한지에 대해 동의했습니다.
이를 체감해 보자면 다음과 같습니다:
- 두 명의 인간이 같은 페이지를 읽을 때, 전형적인 14개의 문장 중 약 4.1개의 하이라이트 문장을 공유할 수 있습니다.
- 두 개의 AI 모델이 같은 페이지를 읽으면 약 8.7개의 문장을 공유합니다.
- 더욱 충격적인 것은, 경쟁사의 가장 강력한 두 AI 모델(GPT-5.4와 Claude Opus 5)이 두 인간이 동의하는 것보다 5.1배 더 많이 서로 동의했다는 점입니다. 실제로 그들은 한 명의 인간이 동일한 텍스트를 두 번 읽을 때 자기 자신과 동의하는 수준만큼이나 서로 동의했습니다!
논문은 이를 "수렴(convergence)"이라고 부릅니다. 이는 AI들이 모두 발맞추어 걷고 있으며, 모두가 동일한 "최선의" 문장을 선택하는 반면, 인간들은 모두 다른 방향으로 걷고 있다는 것을 의미합니다.
오해 바로잡기 (잘못된 설명 배제하기)
연구진은 이것이 속임수가 아님을 확실히 하기 위해 매우 주의를 기울였습니다. 그들은 AI가 왜 이렇게 많이 동의하는지에 대한 몇 가지 명백한 이유들을 테스트하고 배제했습니다:
- 같은 회사 모델이라서 그런 것이 아닙니다: 완전히 다른 연구소와 국가의 모델들도 같은 회사의 모델들만큼이나 많이 동의했습니다.
- "결정론적(robotic)"이기 때문이 아닙니다: 동일한 AI에게 정확히 같은 질문을 두 번 했을 때도, 항상 똑같은 문장을 고르는 것은 아니었습니다(자기 자신과 일치하는 정도는 약 27%에 불과했습니다). 하지만 다른 AI와 대화할 때는 훨씬 더 많이 동의했습니다.
- 프롬프트의 어구 때문이 아닙니다: 지침의 단어를 약간 바꾸는 것도 이들의 동의를 막지 못했습니다.
- "정답"을 복사하고 있기 때문이 아닙니다: 이 작업에는 정답이나 오답이 없었습니다. AI는 단지 무엇이 중요하다고 생각하는지를 선택했을 뿐입니다.
"레지스터(Register)"의 미스터리: 그들은 다른 단어를 좋아하는가?
누군가는 AI가 이토록 많이 동의하는 이유가 그들이 모두 길고 화려하며 과학적인 문장을 좋아하는 반면, 인간은 짧고 감정적인 문장을 좋아하기 때문이라고 추측할 수 있습니다. 연구진은 문장의 11가지 특징(길이, 구두점, 단어 유형 등)을 살펴봄으로써 이를 확인했습니다.
그 결과, 문장의 길이와 위치를 맞추었을 때 차이가 없다는 것을 발견했습니다. AI와 인간은 표면적으로는 똑같이 보이는 문장들을 선택하고 있었습니다. AI는 "로봇 같은 단어"를 선택하는 것이 아니라, 인간과 똑같은 유형의 단어를 선택하고 있었지만, 단지 선택된 문장의 집합이 달랐을 뿐입니다. AI가 선택하는 것과 인간이 선택하는 것 사이의 거리는 멀어지고 있지만, 그것은 그들이 다른 언어를 사용하기 때문은 아닙니다.
천장: AI는 인간이 될 공간이 부족하다
이 이야기에서 가장 흥고한 부분은 이것입니다. 연구진은 질문했습니다: "AI가 더 똑똑해질수록, 인간과 더 많이 동의하게 되는가?"
대답은 **"그렇다, 하지만 어느 지점까지만"**입니다.
- 최신 모델이자 더 똑똑한 모델들은 이전의 덜 똑똑한 모델들보다 인간과 더 많이 동의합니다.
- 그러나 그들은 "천장"에 부딪힙니다. 연구에 포함된 가장 뛰어난 AI조차도 "군중 합의"(많은 인간의 평균적인 의견)가 도달할 수 있는 동의 수준의 약 **84%**에 불과했습니다.
- 반면, 두 AI 사이의 동의도는 계속 상승하여 인간의 천장을 넘어 훨씬 더 높이 올라갔습니다.
이는 마치 AI가 인간처럼 읽는 법을 배우고 있지만, 동시에 서로를 닮아가는 속도가 훨씬 더 빠르다는 것과 같습니다. 그들은 실제 인간을 모델로 삼아 읽는 법을 배우고 있지만, 동시에 "이상적인" 독자를 흉내 내는 데 너무나 능숙해져서 실제 인간을 뒤로하고 떠나가고 있습니다.
절차상의 문제: 공정한 싸움이었는가?
논문은 또한 게임이 진행된 방식에 대한 특이점을 인정합니다. 인간이 텍사트에 하이라이트를 할 때, 20개의 문장을 표시할 수 있지만 연구진은 그중 상위 14개만 남겼습니다(무작위 선택). 그러나 AI는 반드시 자신의 '최고'인 14개 문장을 골라야 했습니다. 이는 마치 농구 선수가 20개의 슛 중에서 무작위로 14개를 골라야 하는 반면, AI는 자신의 가장 좋은 14개 슛을 마음대로 고를 수 있는 것과 같은 불공평한 이점을 준 셈입니다.
연구진이 AI에게 인간의 규칙(최고의 선택지 중 무작위로 선택하기)을 따르게 했을 때, AI와 인간 사이의 격차는 절반으로 줄어들었습니다. 하지만 그럼에도 불구하고 AI들은 여전히 인간보다 훨씬 더 많이 서로 동의했습니다. 격차가 사라진 것은 아니었지만, 줄어들기는 했습니다.
시사점
이 논문은 언어 모델이 단순히 우리가 읽는 것을 돕는 도구가 아니라, 완전히 새로운 종류의 독자가 되어가고 있다고 결론짓습니다. 그들은 인간의 방식과는 훨씬 더 균일한, 공유된 내부적 이해 방식으로 수렴하고 있습니다. 그들은 우리를 이해하는 능력이 향상되고 있지만, 동시에 서로를 이해하는 능력은 훨씬 더 빠르게 향상되고 있습니다. 그 결과, AI 모델들이 텍스트를 읽고 있는 사람보다 다른 회사의 라이벌 AI와 더 많이 동의하게 될 수도 있는 세상이 오고 있습니다. 이는 기계들이 모두 똑같은 곡조를 흥얼거리는 동안, 인간들은 여전히 자신만의 독특한 노래를 부르고 있는, 강력하면서도 약간은 섬뜩한 에코 체임버입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.