When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals
이 논문은 대규모 연구를 통해 자기 일관성(self-consistency)과 모델 간 합의(cross-model agreement)가 거대언어모델의 신뢰도 신호로서 갖는 신뢰성에 의문을 제기하며, 합의가 정답 여부의 긍정적이지만 약한 예측 지표인 반면, 높은 합의가 빈번한 오류와 일치하는 프런티어 모델에서는 종종 과잉 확신으로 이어진다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 최고의 AI 두뇌를 찾기 위해 거대한 인재 발굴 오디션을 운영하고 있다고 상상해 보세요. 당신은 심사위원단(AI 모델들)에게 수백만 개의 까다로운 질문을 던집니다. 그리고 모든 심사위원이 지켜야 하는 큰 규칙이 하나 있습니다: "모든 심사위원이 정답에 동의한다면, 그것은 반드시 옳아야 한다." 이는 상식처럼 느껴집니다. 만약 열 명의 사람이 하늘이 초록색이라고 말한다면, 우리가 어떤 이상한 필터를 보고 있는 걸까요? 하지만 백 명의 사람이 그렇게 말한다면, 그것은 아마도 사실일 것입니다!
이 논문은 그 규칙이 실제로 작동하는지 확인하기 위해 무대 뒤에서 벌어지는 일을 파헤치는 탐정 이야기와 같습니다. 저자인 카이후아 딩(Kaihua-Ding)은 53명의 서로 다른 "러너(AI 테스트를 실행하는 사람)"를 대상으로 실험을 진행했으며, 사용 가능한 가장 어려운 수학 및 과학 문제(GPQA Diamond 및 AIME라고 불리는)에 대해 265,000개의 답변을 생성하도록 했습니다.
여기서 이 논문이 밝혀낸 반전이 있습니다: 동의(Agreement)는 정답(Correctness)과 같지 않습니다.
"에코 체임버(Echo Chamber)"의 함정
AI 모델들을 약간 결함이 있는 교과서로 공부한 학생 그룹이라고 생각해 보세요. 만약 그들이 모두 어떤 질문에 대해 똑같이 틀린 답을 암기했다면, 그들은 모두 손을 들고 그 틀린 답에 동의할 것입니다. 그들이 동의하는 이유는 똑똑해서가 아니라, 동일한 편향이나 "암기된 휴리스틱(memorized heuristic)"을 공유하고 있기 때문입니다.
논문은 AI 모델들이 자기 자신(또는 서로)과 동의할 때, 그것이 진실의 징표가 아니라 종종 공유된 실수를 메아리치는 것일 뿐이라는 사실을 발견했습니다.
"과잉 확신"에 찬 우등생
가장 놀라운 발견은 "프런티어(frontier)" 모델, 즉 가장 진보되고 똑똑한 버전의 AI들과 관련이 있습니다. 당신은 가장 똑똑한 모델이 가장 신뢰할 수 있을 것이라고 생각할지도 모릅니다. 하지만 논문은 이 특정 설정에서 그 반대가 사실임을 보여줍니다.
- 발견: 가장 발전된 모델(gpt-4.1)은 스스로와 **89%**의 확률로 일치했습니다(매우 높은 신뢰도 점수). 하지만 스스로 일치했을 때, 그 정답률은 약 **48%**에 불과했습니다.
- 비유: 어떤 학생이 자신의 답에 너무 확신이 넘쳐서 100%의 자신감으로 정답을 외치지만, 실제로는 절반의 확률로 틀리는 상황을 상상해 보세요. 논문은 이를 "과잉 확신(over-confident)"이라고 부릅니다. 실제로 이 초지능 모델은 약간 덜 발전된 "중급형" 모델보다 자신이 맞았을 때를 알리는 능력이 더 떨어졌습니다.
- 증거: 연구는 "동의"와 "정답 여부" 사이의 통계적 연결(상관관계)을 사용하여 이를 측정했습니다. 가장 똑똑한 모델의 경우, 이 연결 고리는 매우 약했습니다(약 0.20). 즉, 모델의 높은 자신감은 신뢰 신호로서 거의 쓸모가 없었습니다.
"사고의 사슬(Chain-of-Thought)"이 도움이 될까?
어떤 이들은 AI에게 "풀이 과정을 보여달라"(Chain-of-Thought 방식)고 요청하면 더 정직해질 것이라고 생각합니다.
- 결과: AI에게 풀이 과정을 보여달라고 요청하는 것은 정확도를 약간 높이는 데(더 많은 문제를 맞히는 데) 도움이 되었습니다.
- 함정: 하지만 "동의 신호" 자체를 크게 개선하지는 못했습니다. AI는 여전히 자기 자신과 얼마나 동의하는지를 통해 자신이 언제 맞았는지를 신뢰성 있게 알려주지 못했습니다. 이는 마치 학생이 길고 상세한 설명을 써 내려가지만 여전히 최종 답은 틀리고 있으며, 그 글을 얼마나 깔끔하게 썼는지만 보고는 정답 여부를 구분할 수 없는 것과 같습니다.
"공유된 편향"의 미스터리
연구진은 서로 다른 AI 가문(예: GPT와 Claude)이 같은 실수를 하는지도 확인했습니다.
- 발견: 그들은 서로 다른 AI 모델들이 질문에 대해 틀렸을 때, 종종 정확히 똑같은 오답을 선택한다는 것을 발견했습니다.
- 비유: 이는 서로 다른 학교에 다니는 두 학생이 모두 수학 문제를 틀렸는데, 둘 다 수업 시간에 배운 특정한 잘못된 기술 때문에 틀린 것과 같습니다. 이는 AI들이 틀린 답에 동의할 때, 그것이 운 좋은 우연이 아니라 훈련 과정에 박혀 있는 공유된 편향임을 시사합니다.
그렇다면 "동의"를 사용하지 말아야 할까요?
꼭 그렇지는 않습니다. 논문은 "동의를 절대 믿지 마라"고 말하는 것이 아니라, **"주의해서 사용하고, 한계를 인지하라"**고 말합니다.
- 예산 책정에 유용: 동의는 컴퓨터 자원을 얼마나 투입할지 결정하는 데 좋습니다. 만약 모델들이 모두 확신이 없다면(낮은 동의율), 더 나은 답을 얻기 위해 더 많은 시간이나 비용을 쓰고 싶을 것입니다.
- 신뢰에는 부적합: 당신은 결코 동의를 독립적인 "나를 믿어봐" 버튼으로 사용해서는 안 됩니다. 만약 초지능 모델이 "나는 90% 확신해"라고 말하며 스스로와 일치하더라도, 당신은 여전히 그것이 맞는지 확신할 수 없습니다. 사실, 논문은 자신감에 기반하여 어려운 질문을 "가장 똑똑한" 모델로 보내는 것이 나쁜 아이디어일 수 있다고 제안합니다. 왜냐นั้น 그 모델이 가장 과잉 확신하기 때문입니다.
핵심 요약
이 논문은 자기 일관성(self-consistency, 즉 동의)이 "조건부 대리 지표(conditional proxy)"라고 결론짓습니다. 이는 어떤 상황(중급 모델의 경우 등)에서는 유용한 힌트가 될 수 있지만, 진실의 보증 수표는 아닙니다.
- 증명된 것: 이 특정 테스트에서 높은 동의율은 종종 높은 자신감을 의미했지만, 낮은 정확도를 의미했습니다. 특히 가장 발전된 모델들에서 그러했습니다.
- 제안된 것: 이러한 "과잉 확신"은 모델이 훈련되는 방식의 부작용일 수 있으며, 서로 다른 모델들이 유사한 데이터를 학습하기 때문에 공유된 오류가 발생합니다.
- 알려지지 않은 것: 논문은 이러한 결과가 테스트된 모델과 질문 유형에 국한된 것임을 명시합니다. 이것이 모든 종류의 AI나 모든 종류의 질문에서도 발생하는지는 알 수 없지만, 경고는 명확합니다: 단순히 모두가 동의한다고 해서 그들이 옳다고 가정하지 마십시오. 때때로, 그들은 그저 모두 똑같이 잘못된 지도를 보고 있는 것일 뿐입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.