When LLMs Play the Telephone Game: Cultural Attractors as Conceptual Tools to Evaluate LLMs in Multi-turn Settings
이 논문은 대규모 언어 모델의 작은 편향이 '전화기 게임' 설정에서의 반복적인 상호작용을 통해 어떻게 증폭되는지를 조사하며, 텍스트의 속성인 독성이 지시의 개방성, 모델 크기, 그리고 특정 텍스트 특성에 영향을 받는 문화적 어트랙터 상태로 수렴한다는 것을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
핵심 아이디어: 로봇들의 "전화기 게임"
사람들이 고전적인 "전화기 게임(말 전달하기)"을 하고 있다고 상상해 보세요. 한 사람이 다음 사람에게 이야기를 속삭이면, 그 다음 사람이 또 다른 사람에게 속삭이는 식이죠. 마지막에 이르면 이야기는 원래와는 전혀 달라지거나, 우스꽝스러워지거나, 왜곡되곤 합니다.
이 논문은 다음과 같은 질문을 던집니다: 만약 플레이어가 사람이 아니라, 여러분이 글을 쓰거나 채팅할 때 사용하는 것과 같은 거대 언어 모델(LLM)이라면 어떤 일이 벌어질까요?
연구진은 하나의 AI가 이야기를 쓰고, 두 번째 AI에게 전달하면, 두 번째 AI가 이를 다시 쓰고 세 번째 AI에게 전달하는 방식의 "전화기 게임"을 설정하여 총 50라운드까지 진행했습니다. 그들은 텍스트가 그대로 유지될지, 더 좋아질지, 나빠질지, 아니면 기묘한 새로운 상태로 변할지를 확인하고 싶었습니다.
실험: AI 작가들의 사슬
연구진은 긴 AI 에이전트 체인을 만들었습니다.
- 시작: 인간이 시작 텍스트(뉴스 기사, 과학 초록, 또는 소셜 미디어 댓글 등)를 작성합니다.
- 체인: 첫 번째 AI는 해당 텍스트와 특정 지침(예: "이것을 다시 쓰세요", "이것에서 영감을 얻으세요", 또는 "이 이야기를 이어가세요")을 받습니다. 그리고 새로운 버전을 작성합니다.
- 인수인계: 두 번째 AI는 원본 인간의 텍스트가 아닌, 첫 번째 AI가 만든 버전을 받아 동일한 작업을 수행합니다.
- 반복: 이 과정이 50번 연속으로 일어납니다.
연구진은 텍스트가 체인을 따라 이동하면서 다음 네 가지 요소가 어떻게 변하는지 추적했습니다:
- 독성(Toxicity): 얼마나 무례하거나 공격적인가?
- 긍정성(Positivity): 얼마나 행복하거나 슬픈가?
- 난이도(Difficulty): 읽기가 얼마나 어려운가?
- 길이(Length): 단어가 몇 개인가?
발견: "자석" 효과
가장 놀라운 발견은 텍스트가 단순히 무작위로 표류하는 것이 아니라는 점입니다. 텍스트는 특정 "목적지"를 향해 끌려갑니다. 연구진은 이를 **문화적 끌개(Cultural Attractor)**라고 부릅니다.
끌개를 자석이라고 생각해 보세요.
- 만약 매우 못된 이야기로 시작한다면, 자석은 그 이야기를 매우 예의 바른 내용으로 끌어당길 수 있습니다.
- 만약 매우 긴 이야기로 시작한다면, 자석은 그 이야기를 매우 짧게 만들 수 있습니다.
- 어디서 시작하든, 텍스트는 언덕 아래로 미끄러져 내려가 결국 같은 지점에 안착하게 됩니다.
연구진은 이러한 자석이 실제로 존재하며 강력하다는 것을 발견했습니다. 완전히 다른 20개의 이야기를 시작하더라도, 50라운드의 AI 재작성을 거치고 나면 이들은 종종 매우 유사한 모습으로 변합니다.
주요 결과: 무엇이 자석을 더 강하게 만드는가?
연구진은 무엇이 이 "자석"을 더 강하게 혹은 더 약하게 만드는지 알아보기 위해 다양한 변수를 테스트했습니다.
1. 작업의 종류가 중요합니다 (게임의 "규칙")
- 엄격한 규칙 (약한 자석): 만약 AI에게 "의미를 바꾸지 말고 이것을 다시 쓰세요"라고 명령하면, 텍스트는 거의 변하지 않습니다. 자석이 약한 상태입니다.
- 느슨한 규칙 (강한 자석): 만약 AI에게 "이것에서 영감을 얻어 새로운 것을 쓰세요" 또는 "이야기를 이어가세요"라고 명령하면, 텍스트는 급격히 변합니다. 자석이 매우 강력해져서 텍스트를 특정 스타일로 빠르게 끌어당깁니다.
2. AI 모델이 중요합니다 (플레이어의 "성격")
서로 다른 AI 모델은 서로 다른 성격을 가지고 있습니다.
- 특정 버전의 Llama와 같은 모델들은 텍스트를 매우 빠르게 긍정적으로 만들거나 독성을 낮추는 경향이 있었습니다.
- GPT-4o-mini와 같은 다른 모델들은 텍스트의 길이 나 난이도를 변화시키는 것에 더 저항하는 모습을 보였습니다.
- 흥미롭게도, 연구진은 독성이 가장 강력한 자석을 가지고 있다는 것을 발견했습니다. 거의 모든 모델은 원래 이야기가 아무리 못되었더라도, 매우 안전하고 독성이 없는 상태로 빠르게 "정화"했습니다.
3. "미세 조정(Fine-Tuning)" 효과
AI 모델은 종 Kong종 인간에 의해 "미세 조정"(학습)되어 도움이 되고 안전하도록 만들어집니다. 연구진은 이 훈련이 미리 설정된 자석처럼 작동한다는 것을 발견했습니다.
- 미세 조정된 모델("Instruct" 모델)은 미세 조정되지 않은 모델("Base" 모델)보다 인간의 선호도(예: 독성을 낮추는 것)를 향해 텍스트를 끌어당기는 자석이 훨씬 더 강력했습니다.
이것이 왜 중요한가 (논문에 따르면)
이 논문은 우리가 현재 AI를 마치 방 안에 있는 단 한 명의 사람처럼 테스트하고 있다고 주장합니다. 질문을 던지고, 답을 얻고, "잘했어!"라고 말하는 식이죠.
하지만 현실 세계에서 AI는 종종 체인 형태로 사용됩니다:
- 한 AI가 요약을 작성하면, 다른 AI가 이를 편집하고, 세 번째 AI가 이를 블로그 포스트로 바꿉니다.
- AI 챗봇들이 서로 대화를 나눕니다.
이 논문은 단 한 번의 대화(single turn)를 테스트하는 것만으로는 충분하지 않다고 경고합니다. 단 한 번의 상호작용은 완벽해 보일 수 있지만, 그 AI가 다른 AI와 50번 대화를 나누게 되면, 콘텐츠는 완전히 다른 것(매우 안전하고 지루하거나, 혹은 아주 이상한 것)으로 진화할 수 있습니다.
"붕괴"에 대한 경고
특정 사례에서 연구진은 기묘한 오류를 목격했습니다. AI에게 이야기를 "이어가라"고 요청했을 때, AI는 결국 똑같은 해시태그를 계속 반복하기 시작했습니다 (예: "#XiangqiForAll #XiangqiForAll..."). 텍스트의 품질이 키워드의 루프 속으로 "붕괴"된 것입니다. 이는 인간의 개입 없이 AI가 AI와 너무 많이 대화할 경우, 때때로 정신을 놓치고 말이 안 되는 상태가 될 수 있음을 보여주는 신호입니다.
요약
이 논문은 AI를 바라보는 새로운 시각이자 경고입니다. 논문은 다음과 같이 말합니다: AI가 한 번 말하는 것만 보지 마세요. AI들이 서로 대화할 때 어떤 일이 일어나는지 관찰하세요. 그들에게는 대화를 특정 스타일로 끌어당기는 보이지 않는 "자석"이 있으며, 규칙과 모델에 따라 그 대화는 단 한 번의 채팅만 보고는 예측할 수 없는 방식으로 세상을 변화시킬 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.