Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models
이 논문은 인용의 존재 자체가—그 사실적 정확성과 관계없이—대규모 언어 모델의 환각 발생률을 유의미하게 증가시키며, 특히 조작된 인용이 사실인 주장과 함께 나타날 때 그 효과가 가장 두드러진다는 것을 보여주는 대규모 다중 도메인 벤치마크인 AuthorityBench를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 퀴즈를 풀고 있다고 상상해 보세요. 당신은 그곳에 가본 적이 있기 때문에 정답이 "파리"라는 것을 알고 있습니다. 그런데 그때 한 선생님이 들어오더니, 선반 위에 있는 멋져 보이는 책을 가리키며 말합니다. "사실 수도는 런던이란다. 이 권위 있는 학술지에서 읽었거든."
당신은 답을 바꿀 건가요? 대부분의 인간은 이렇게 생각하며 잠시 멈칫할 것입니다. "잠깐, 저 책은 정말 중요해 보이는데. 내가 틀렸을지도 몰라."
이 논문인 AuthorityBench는 인공지능(AI)에 대해 유사한 질문을 던집니다. 만약 AI가 진실을 알고 있음에도 불구하고, 누군가가 그와 반대되는 내용을 담은 "인용(출처)"을 제시한다면, AI는 그 인용구를 맹목적으로 믿고 진실을 잊어버릴까요?
다음은 그들의 연구 결과를 쉬운 비유를 사용하여 정리한 내용입니다.
실험: AI를 위한 "가짜 뉴스" 테스트
연구진은 AI 모델들을 속이기 위해 설계된 AuthorityBench라는 거대한 테스트를 구축했습니다. 이것을 220,000개의 질문으로 구성된 거대한 퀴즈라고 생각하면 됩니다.
그들은 네 가지 시나리오가 있는 "2x2" 게임을 설정했습니다:
- 참인 주장 + 실제 인용: AI가 맞고, 출처도 실제인 경우. (이지 모드).
- 거짓인 주장 + 가짜 인용: AI가 틀렸고, 출처도 가짜인 경우. (명백한 함정).
- 거짓인 주장 + 실제 인용: AI가 틀렸지만, 출처는 실제인 경우. (까다로운 함정).
- 참인 주장 + 가짜 인용: 이것이 큰 발견입니다. AI는 정답을 알고 있지만, 그것이 틀렸다고 말하는 가짜 출처가 제시되는 경우입니다.
이들은 일반 상식, 과학, 법률, 의학의 네 가지 분야에서 이를 테스트했습니다. 또한 가짜 출처의 "풍미(flavor)"도 바꾸었습니다. 어떤 것은 노벨상 수상자처럼 보이게 했고, 어떤 것은 이름 없는 블로그처럼 보이게 했으며, 어떤 것은 다른 국가의 이름을 사용했습니다.
큰 놀라움: "권위의 함정"
가장 충격적인 결과는 인용구가 AI를 환각(거짓말)하게 만드는 "마법 주문"처럼 작용한다는 것입니다.
- "가짜 출처" 효과: AI가 올바른 답(예: "파리는 수도이다")을 알고 있었음에도 불구하고, "런던이 수도이다"라고 말하는 가짜 인용구가 나타나면, AI는 종종 답을 런던으로 바꿨습니다.
- 수치: "일반 상식" 카테고리에서 이런 현상이 **35%에서 77%**까지 발생했습니다. 즉, 만약 당신이 AI에게 진실한 사실과 가짜 참조를 함께 준다면, AI는 진실을 고수하기보다 진실을 부정할 가능성이 더 높았습니다.
- "실제 출처" 효과: 설령 인용구가 실제 것이더라도 그 내용이 거짓이라면, AI는 인용구가 없을 때보다 여전히 환각을 일으킬 가능성이 더 높았습니다.
비유: 어떤 학생이 "2+2=4"라는 답을 알고 있다고 상상해 보세요. 그런데 누군가 당신에게 "유명한 스미스 교수님에 따르면 2+2=5이다"라고 적힌 종이를 건넵니다. 그러면 그 학생은 자신의 뇌를 믿는 대신 "5"라고 적습니다. 종이(인용구)가 수학을 압도해 버린 것입니다.
중요하지 않았던 것들
연구진은 특정 요소들이 AI가 인용구를 더 믿게 만들 것이라고 생각했지만, 이러한 요인들이 거의 아무런 영향을 미치지 않았다는 사실에 놀랐습니다.
- 위신(Prestige): 가짜 인용구가 일류 대학에서 나온 것처럼 보이든 무명 블로그에서 나온 것처럼 보이든 상관없었습니다. AI는 둘 다 똑같이 혼란스러워했습니다.
- 저자 신원: 가짜 저자의 이름이 특정 국가나 인구 통계적 특성과 연관되어 있든 아니든 상관없었습니다. AI는 누가 썼는지에는 관심이 없었고, 단지 무언가가 쓰여 있다는 사실에만 반응했습니다.
- 모델 크기: 더 "똑똑하거나" 큰 AI라면 덜 쉽게 속을 것이라고 생각할 수 있습니다. 하지만 연구 결과, 가장 크고 발전된 모델들도 작은 모델들과 마찬가지로 함정에 빠질 가능성이 높았습니다.
유일한 예외: "변호사" AI
AI가 덜 속았던 분야는 딱 하나, 법률이었습니다.
- 이유: 연구진은 법률 텍스트가 매우 구체적이고 격식 있는 "언어"(마치 비밀 암호와 같은)를 가지고 있기 때문이라고 제안합니다. AI가 법률 인용구를 보면, 권위를 맹목적으로 받아들이기보다는 "검토 모드"로 전환하여 사실 관계를 더 면밀히 확인하는 것으로 보입니다.
- 일반 상식은 가장 취약한 연결 고리였으며, AI가 가장 쉽게 속아 넘어간 분야였습니다.
"거짓 주장"의 반전
연구진은 AI가 이미 틀린 상태(거짓 주장)일 때 어떤 일이 일어나는지도 살펴보았습니다.
- 더 똑똑해진 AI들: Llama나 Claude 같은 모델의 경우, 인용구(심지어 가짜 인용구라도)를 보는 것이 거짓 주장에 대한 환각을 일으킬 가능성을 낮추었습니다. 마치 인용구가 "음, 이걸 다시 확인해 봐야겠어"라고 말하게 하여 스스로를 교정하게 만든 것과 같습니다.
- 더 멍청해진 AI들: Gemma나 Phi-4 같은 모델의 경우, 인용구가 거짓 주장에 대한 환각을 높였습니다. 이들은 잘못된 정보를 맹목적으로 받아들였습니다.
결론
이 논문은 인용구를 추가하는 것이 자동으로 AI를 더 신뢰할 수 있게 만드는 것은 아니다라고 결론짓습니다. 사실, 인용구는 종종 AI를 덜 신뢰할 수 있게 만듭니다.
만약 당신이 사실 확인을 위해 AI를 사용하고 있고, AI가 출처를 인용하는 것을 본다면, 그것이 진실이라고 가정하지 마십시오. AI는 그 "권위"에 너무 깊은 인상을 받은 나머지, 실제 진실을 기꺼이 내팽개칠 수 있습니다. 이 연구는 의료나 법률과 같은 고위험 분야에서, AI의 답변을 인용구에 근거하게 만드는 것(grounding)이 오류를 해결해 줄 것이라고 가정할 수 없음을 경고합니다. 때로는 인용구 자체가 오류의 원인이 될 수 있기 때문입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.