← 최신 논문
💬 NLP

Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks

이 논문은 동료 압박 벤치마크에서 나타나는 LLM의 대다수 순응 현상이 화자의 존재보다는 반복되는 오답 자체에 의해 발생하며, 현재의 평가 방식이 고려하지 못하는 유의미한 '화자 없는 하한선(speaker-free floor)'을 확립하고 있음을 밝히고 있다.

원저자: Yibo Hu, Jiaming Qu

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yibo Hu, Jiaming Qu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "메아리"인가, 아니면 "목소리"인가?

여러분이 객관식 퀴즈를 풀고 있다고 상상해 보세요. 여러분은 정답이 A라고 100% 확신하고 있습니다.

그때 누군가 여러분의 귀에 대고 "사실 다른 사람들은 정답이 B라고 생각한대"라고 속삭입니다. 여러분은 그저 무리에 어울리고 싶은 압박감 때문에 정답을 B로 바꿀 수도 있습니다. 이것이 연구자들이 말하는 "동조(conformity)"입니다.

하지만 이 논문은 까다로운 질문을 던집니다. 여러분이 답을 바꾼 이유가 속삭이는 '사람' 때문인가요, 아니면 단지 "B"라는 단어가 반복해서 들렸기 때문인가요?

저자들은 AI 모델(LLM)의 경우, 누가 말하는지는 별로 중요하지 않다는 것을 발견했습니다. 설령 사람을 완전히 제거하고 틀린 답을 여섯 번 반복해서 보여주기만 해도, 모델은 여전히 마음을 바꿉니다.

실험: "침묵의 방" 테스트

연구진은 이를 테스트하기 위해 게임을 설계했습니다. 그들은 여섯 가지 서로 다른 AI 모델을 사용하여, 처음에 정답을 맞혔던 질문들을 던졌습니다. 그다음, 틀린 답이 맞다고 주장하는 "힌트"를 제시했습니다. 그들은 이 힌트를 제시하는 네 가지 방식을 테스트했습니다.

  1. 침묵의 방 (출처 없음): 텍스트가 그냥 "정답은 B입니다"라고만 되어 있음. (말하는 사람이 누구인지 명시되지 않음).
  2. 무작위의 인물: "사람 1: 정답은 B입니다."
  3. 수다스러운 군중: "앨리스는 B가 확실하다고 말합니다. 밥도 B라고 생각하네요..."
  4. 전문가 패널: "유명한 교수진 그룹이 말하기를: 정답은 B입니다."

충격적인 결과:
AI가 "침묵의 방"(말하는 이 없이 단순히 "정답은 B입니다"라는 텍스트만 있는 상태)에 있을 때, 정답을 틀린 답으로 바꾼 비율은 **66.5%**였습니다.

이를 "단순 재질문"(새로운 텍스트 없이 AI에게 다시 확인만 하는 경우)과 비교하면, 마음을 바꾼 비율은 **10.3%**에 불과했습니다.

비유하자면:
AI를 교실에 있는 학생이라고 생각해 보세요.

  • 기존 이론: 학생은 선생님을 무서워하거나 인기 있는 아이들에게 잘 보이고 싶어서 답을 바꾼다 (즉, "화자" 때문).
  • 새로운 발견: 학생은 단지 "B"라는 말을 계속 듣게 되어서 답을 바꾼다. 설령 선생님이 교실을 나가고 칠판에 "B"라고 여섯 번 적혀 있을 뿐이라도, 학생은 "오, 정답은 B가 틀림없어"라고 생각하게 된다.

무엇이 실제로 AI를 움직이는가?

논문은 "화자(Speaker)"가 주요 동력이 아니라는 것을 발견했습니다. 핵심은 텍스트의 반복입니다.

  • 바닥(The Floor): 연구진은 66.5%의 변화율을 "화자 없는 바닥(speaker-free floor)"이라고 부릅니다. 이는 틀린 답이 반복되는 것만으로 발생하는 혼란의 기본 수치입니다.
  • 천장(The Ceiling): "화자"(예: 전문가 패널)를 추가하는 것은 오류율을 약 79% 정도로 아주 조금 더 높이는 데 그쳤습니다.
  • 결론: 우리가 "사회적 압박"이라고 생각했던 대부분의 현상은 사실 AI가 반복되는 텍스트에 의해 혼란을 느끼는 것입니다. "화자"는 거대한 문제 위에 얹어진 작은 보너스일 뿐입니다.

또 다른 흥미로운 발견들

  1. 사람만이 문제가 아니다: 텍스트가 "사람"으로부터 왔는지, "데이터베이스"로부터 왔는지, 혹은 "검색된 참조 문헌"으로부터 왔는지는 중요하지 않았습니다. 텍스트가 증거(사실이라고 주장하는 무언가)처럼 보이기만 하면, AI는 마음을 바꿨습니다. 만약 텍스트가 무작위적인 헛소리처럼 보였다면, AI는 마음을 바꾸지 않았습니다.

    • 비유: 이는 소문을 듣는 것과 같습니다. "소문이 X라고 한다"는 말을 들으면 믿을 수도 있지만, "무작위 소음이 X라고 한다"는 말을 들으면 무시하게 됩니다. AI는 메신저가 아니라 '주장(claim)' 자체에 반응합니다.
  2. 한 번의 목소리로 충분하다: AI를 속씨기 위해 군중이 필요하지는 않습니다. 틀린 답을 한 번 듣는 것이 다섯 명의 서로 다른 사람에게 듣는 것만큼이나 강력합니다.

    • 비유: 고장 난 시계가 "지금은 3시입니다"라고 다섯 번 말한다고 해서, 여러분이 반드시 3시라고 믿게 되기 위해 다섯 개의 시계가 필요한 것은 아닙니다.
  3. 확신에 찬 오답: AI가 답을 바꿀 때, 주저하지 않습니다. 오히려 틀린 답에 대해 더 확신을 갖게 됩니다.

    • 비유: 현관문을 잠갔다고 확신하고 있다고 상상해 보세요. 그런데 "문이 열려 있다"라는 쪽지를 보게 됩니다. 그러면 여러분은 즉시 걱정을 멈추고, 직접 확인해보지도 않은 채 문이 열려 있다는 사실을 100% 확신하게 됩니다. AI도 이와 똑같이 행동하며, 틀린 답으로 넘어가서 매우 만족해합니다.

미래를 위한 교훈

이 논문은 우리가 AI의 "사회적 동조"를 테스트할 때 주의해야 한다고 결론짓습니다. 우리는 단순히 "AI가 집단의 말을 듣고 답을 바꿨다"라고 말해서는 안 됩니다.

우리는 다음과 같이 물어야 합니다: "그것이 집단 때문에 마음을 바꾼 것인가, 아니면 단지 틀린 답이 반복되는 것을 보았기 때문인가?"

저자들은 "사회적 압력"을 탓하기 전에, 먼저 "화자 없는 바닥(speaker-free floor)"을 측정해야 한다고 제안합니다. 만약 AI가 텍스트를 보는 것만으로 마음을 바꾼다면, 그것은 사회적 영향이 아니라 단지 반복에 의해 속임수를 당한 것입니다.

요약하자면: AI는 반드시 무리에 섞이려고 노력하는 사회적 카멜레온이라기보다, 누가(혹은 무엇이) 말하든 상관없이 틀린 구절이 충분히 반복되면 혼란에 빠지는 앵무새에 가깝습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →