← 최신 논문
🤖 machine learning

Contagion Networks: Evaluator Bias Propagation in Multi-Agent LLM Systems

이 논문은 평가자 편향이 다중 에이전트 LLM 시스템을 통해 어떻게 전파되는지를 정량화하기 위해 Contagion Networks 프레임워크를 소개하며, 편향이 일관되게 확산되는 반면 동질적인 모델은 교차 모델 설정보다 전파력이 현저히 낮고 평가 위원회 규모를 키우는 것이 효과적인 완화 전략이 된다는 점을 밝힌다.

원저자: Zewen Liu

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zewen Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

세 명의 친구들이 모두 동일한 유형의 스마트 어시스턴트(이하 "DeepSeek 친구들")를 사용하며 함께 퍼즐을 풀어나가는 상황을 상상해 보세요. 이들은 단순히 옆에서 나란히 작업하는 것이 아니라, 서로의 결과물을 채점하며 번갈아 가며 역할을 수행합니다.

이 논문은 한 친구의 개인적인 "채점 스타일"이 다른 친구들에게 어떻게 전염되기 시작하는지에 대해 다룹니다.

설정: "채점 체인(Grading Chain)"

이 실험에서 연구진은 다음과 같은 연쇄 반응을 설정했습니다:

  1. 친구 A(단계별 목록 형식을 좋아하는 친구)가 친구 B의 결과물을 채점합니다.
  2. 친구 B는 피드백을 보고 "아, A는 목록 형식을 좋아하는구나"라고 깨닫고, 더 많은 목록을 작성하기 시작합니다.
  3. 친구 B는 이어서 친구 C의 결과물을 채점합니다. A로부터 영향을 받은 B 역시 이제 목록 형식을 선호하게 되었습니다.
  4. 친구 C는 피드백을 받고, 목록 형식을 선호하는 경향을 확인한 뒤, 자신도 목록을 작성하기 시작합니다.

연구진은 이를 **"전염 네트워크(Contagion Network)"**라고 부릅니다. 마치 감기가 사람에서 사람으로 퍼지듯, 하나의 "편향"(특정한 사고 방식에 대한 선호)이 한 AI 에이전트에서 다른 에이전트로 퍼져나가는 것입니다.

핵심 발견: "바이러스"는 약하다

연구진은 다음과 같은 질문을 던졌습니다: 이 편향이 너무 강력하게 퍼져서 모든 이가 똑같은 방식으로 생각하게 만들고, 결국 각자의 고유한 관점을 파괴할 것인가?

그들은 놀라운 사실을 발견했습니다: 이 특정 설정에서 "바이러스"는 매우 약했습니다.

  • "동일 모델" 효과: 세 친구 모두 동일한 근본 지능(동일한 AI 모델)을 사용하고 있었기 때문에, 그들에게는 자연스러운 "면역 체계"가 있었습니다. 서로에게 영향을 미치긴 했지만, 그 영향은 빠르게 사라졌습니다.
    • 비유: 세 사람이 같은 방언을 사용하고 있다고 상상해 보세요. 만약 한 사람이 새로운 유행어를 쓰기 시작하면 다른 사람들도 이를 따라 할 수는 있겠지만, 그렇다고 해서 갑자기 모국어를 잊어버리지는 않을 것입니다. 변화는 미미하며 몇 단계를 거치면 사라집니다.
  • 수치: "편향"이 전달되는 세 단계(A → B → C)를 거친 후, 원래의 영향력은 거의 사라졌습니다(99.4% 감소). 시스템이 자연스럽게 확산을 차단한 것입니다.

비교: 왜 어떤 "바이러스"는 더 강한가?

이 논문은 서로 다른 모델(예: GPT-4o가 DeepSeek를 채점하는 경우)이 사용되었던 이전 연구와 비교합니다.

  • "교차 모델(Cross-Model)"의 위험성: 서로 다른 모델이 서로를 채점할 때, 편향은 훨씬 더 빠르고 강력하게 퍼집니다.
    • 비유: 완전히 다른 언어를 사용하는 사람이 누군가에게 새로운 유행어를 가르치려고 한다고 상상해 보세요. 그 혼란이 너무 커서, 듣는 사람은 자신의 말하기 방식을 완전히 버리고 상대방의 방식에 맞추려 할 수도 있습니다. 이때 "감염"은 전체를 장악할 만큼 강력해집니다.

해결책: "3인 위원회(Committee of Three)"

연구진은 간단한 해결책을 테스트했습니다. 한 명의 친구가 결과물을 채점하는 대신, 세 명의 친구로 구성된 위원회가 함께 채점한다면 어떻게 될까요?

  • 결과: 세 명의 다양한 평가자로 구성된 위원회를 사용했을 때, "전염"은 72% 감소했습니다.
  • 작동 원리: 만약 한 명의 채점자는 목록 형식을 좋아하고, 다른 한 명은 짧은 답변을 좋아하며, 세 번째 채점자는 증거 중심의 답변을 좋아한다면, 이들의 상충하는 의견이 서로를 상쇄하게 됩니다. 대상 에이전트는 어느 한 방향으로만 치우치지 않고 균형을 유지하게 됩니다.
  • 시사점: 전염을 완전히 막을 필요는 없습니다(이미 이 설정에서는 약하기 때문입니다). 하지만 더 다양한 목소리를 추가하는 것이 시스템을 더욱 안전하고 창의적으로 만듭니다.

발견된 "규칙" 요약

  1. 편향은 퍼진다: 동일한 두뇌를 가진 AI 에이전트라도 서로의 사고 방식에 영향을 줄 수 있습니다.
  2. 같은 두뇌 = 안전: 모든 에이전트가 동일한 모델을 사용하면, 편향은 자연스럽게 빠르게 사멸합니다(억제).
  3. 다른 두뇌 = 위험: 에이전트들이 서로 다른 모델을 사용하면, 편향이 무섭게 퍼져 그룹 전체를 장악할 수 있습니다(캐스케이드/연쇄 효과).
  4. 더 많은 목소리 = 더 좋다: 세 명의 다양한 평가자를 사용하는 것은 시스템의 균형을 유지하고 단일한 편향이 전체를 지배하는 것을 막는 강력한 방법입니다.

결론: 서로를 채점하는 AI 에이전트 팀을 구축할 때, 모두가 동일한 모델을 사용한다고 해서 크게 걱정할 필요는 없습니다. 그들은 자연스럽게 서로를 견제할 것입니다. 하지만 서로 다른 모델을 섞어서 사용할 경우에는 주의해야 하며, 팀의 다양성과 건강함을 유지하기 위해 반드시 최소 세 명의 서로 다른 심사위원으로 구성된 위원회를 활용하십시오.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →